1931 บทความวารสาร ยุคทฤษฎีเบื้องต้น
Gödel, K. · Monatshefte für Mathematik und Physik 38(1): 173–198
พิสูจน์ว่าระบบรูปนัยที่สอดคล้องกันและแสดงเลขคณิตได้ย่อมมีข้อความที่เป็นจริงแต่พิสูจน์ไม่ได้ อันเป็นการวางขอบเขตที่ต่อมาใช้กรอบคำถามว่าการคำนวณและการให้เหตุผลด้วยเครื่องตัดสินสิ่งใดได้บ้าง
1936 บทความวารสาร ยุคทฤษฎีเบื้องต้น
A. M. Turing · Proceedings of the London Mathematical Society s2-42(1): 230–265
บทความนำเสนอเครื่องทัวริงแบบสากลและพิสูจน์ว่าปัญหา Entscheidungsproblem เป็นปัญหาที่ตัดสินไม่ได้จึงวางรากฐานทางทฤษฎีของวิทยาการคอมพิวเตอร์
1936 บทความวารสาร ยุคทฤษฎีเบื้องต้น
Church, A. · American Journal of Mathematics 58(2): 345
นิยามความคำนวณได้อย่างมีผลด้วยแคลคูลัสแลมบ์ดา และแสดงปัญหาที่ไม่มีกระบวนวิธีใดตัดสินได้ นับเป็นการไปถึงขอบเขตของการคำนวณโดยเป็นอิสระจากทัวริง
1943 บทความวารสาร ยุคทฤษฎีเบื้องต้น
W. S. McCulloch, W. Pitts · Bulletin of Mathematical Biophysics 5(4): 115–133
บทความจำลองกิจกรรมของเซลล์ประสาทด้วยตรรกะเชิงประพจน์จึงเป็นทฤษฎีทางคณิตศาสตร์ชิ้นแรกของโครงข่ายประสาทเทียม
1948 บทความวารสาร ยุคทฤษฎีเบื้องต้น
C. E. Shannon · Bell System Technical Journal 27(3): 379–423; 27(4): 623–656
บทความนิยามแนวคิดเอนโทรปีของสารสนเทศและความจุของช่องสัญญาณอันเป็นรากฐานของทฤษฎีสารสนเทศและฐานความน่าจะเป็นที่ปัญญาประดิษฐ์ใช้อ้างอิงในภายหลัง
1950 บทความวารสาร ยุคทฤษฎีเบื้องต้น
A. M. Turing · Mind LIX(236): 433–460
บทความเสนอเกมเลียนแบบ (ทัวริงเทสต์) เป็นนิยามเชิงปฏิบัติการของปัญญาของเครื่องจักรซึ่งกำหนดกรอบคำถามเรื่องปัญญาประดิษฐ์ไปอีกเจ็ดทศวรรษ
1955 บทความวารสาร ยุคทฤษฎีเบื้องต้น
J. McCarthy, M. L. Minsky, N. Rochester, C. E. Shannon · Dartmouth College, 1955; republished in AI Magazine 27(4): 12–14 (2006)
บทความบัญญัติศัพท์ “artificial intelligence” และวางแผนงานวิจัยที่สถาปนาปัญญาประดิษฐ์ให้เป็นสาขาวิชาการ
1956 บทความวารสาร กำเนิดปัญญาประดิษฐ์
A. Newell, H. A. Simon · IRE Transactions on Information Theory IT-2(3): 61–79
บทความนำเสนอโปรแกรมให้เหตุผลเชิงฮิวริสติกชิ้นแรกซึ่งแสดงว่าเครื่องจักรสามารถเลียนแบบยุทธศาสตร์การแก้ปัญหาของมนุษย์และริเริ่มแนวคิด “ระบบประมวลผลสารสนเทศเชิงซ้อน”
1958 บทความวารสาร กำเนิดปัญญาประดิษฐ์
Newell, A., Shaw, J. C., Simon, H. A. · Psychological Review 65(3): 151–166
อธิบายการแก้ปัญหาของมนุษย์ว่าเป็นการค้นหาเชิงฮิวริสติกในปริภูมิของสถานะเชิงสัญลักษณ์ อันเป็นคำอธิบายที่รองรับ General Problem Solver และมุมมองว่าจิตคือการประมวลสารสนเทศ
1958 บทความวารสาร กำเนิดปัญญาประดิษฐ์
F. Rosenblatt · Psychological Review 65(6): 386–408
บทความนำเสนอเซลล์ประสาทแบบเชิงเส้นพร้อมค่าเขตที่ฝึกได้เป็นชิ้นแรกอันเป็นจุดเริ่มต้นของสาย connectionism ที่นำไปสู่การเรียนรู้เชิงลึกสมัยใหม่
1958 บทความประชุมวิชาการ กำเนิดปัญญาประดิษฐ์
J. McCarthy · Proceedings of the Symposium on Mechanisation of Thought Processes (NPL Teddington), 75–91. London: HMSO
บทความเสนอแนวคิด “advice taker” ซึ่งเป็นโปรแกรมที่สามารถอนุมานผลจากคลังความรู้เชิงสามัญสำนึกที่จัดรูปแบบอย่างเป็นทางการจึงวางรากฐานเชิงแนวคิดของการแทนความรู้และการให้เหตุผล
1959 บทความวารสาร กำเนิดปัญญาประดิษฐ์
A. L. Samuel · IBM Journal of Research and Development 3(3): 210–229
บทความสาธิตโปรแกรมหมากฮอสที่พัฒนาตนเองผ่านการเล่นกับตนเองนับเป็นการบุกเบิกศึกษาการเรียนรู้ของเครื่องและการพัฒนาตนเองแบบอัลฟา-เบตา
1959 บทความวารสาร กำเนิดปัญญาประดิษฐ์
Gelernter, H. · Information and Control 2(1): 80–89
Gelernter พิจารณาว่าเครื่องจักรจะจัดการระบบรูปนัยที่ภาคแสดงมีความสมมาตรสูงได้อย่างมีประสิทธิภาพอย่างไร และเสนอทฤษฎีบทกับกฎว่าด้วยสมมาตรเชิงวากยสัมพันธ์เป็นคำตอบ งานนี้อยู่คู่กับเครื่องพิสูจน์ทฤษฎีบทเรขาคณิตที่เขากำลังสร้างที่ IBM ซึ่งพิสูจน์ทฤษฎีบทเรขาคณิตระนาบแบบยุคลิดข้อแรกได้เมื่อต้นฤดูใบไม้ผลิ ปี 1959
1960 บทความประชุมวิชาการ กำเนิดปัญญาประดิษฐ์
B. Widrow, M. E. Hoff · IRE WESCON Convention Record, Part 4, 96–104
บทความนำเสนอกฎ LMS (Adaline) ซึ่งเป็นกฎการเรียนรู้แบบลงกราเดียนต์ที่ใช้กันแพร่หลายเป็นครั้งแรกสำหรับโครงข่ายเชิงเส้นแบบปรับตัว
1960 บทความวารสาร กำเนิดปัญญาประดิษฐ์
McCarthy, J. · Communications of the ACM 3(4): 184–195
เสนอนิพจน์เชิงสัญลักษณ์ ฟังก์ชันเวียนเกิดบนนิพจน์เหล่านั้น และ eval ที่ทำให้ภาษาตีความตัวเองได้ อันเป็นแบบที่กลายมาเป็น Lisp และเป็นภาษาทำงานของปัญญาประดิษฐ์เชิงสัญลักษณ์
1961 รายงานทางเทคนิค กำเนิดปัญญาประดิษฐ์
Rosenblatt, F. · Cornell Aeronautical Laboratory technical report (DTIC AD0256582)
รวบรวมงานเรื่องเพอร์เซปตรอนให้เป็นทฤษฎีที่สมบูรณ์ว่าด้วยโครงข่ายความน่าจะเป็นแบบหลายชั้น พร้อมระบุทั้งสิ่งที่เครื่องเช่นนี้เรียนรู้ได้และจุดที่รูปแบบชั้นเดียวไปต่อไม่ได้
1966 บทความวารสาร กำเนิดปัญญาประดิษฐ์
Weizenbaum, J. · Communications of the ACM 9(1): 36–45
สร้างโปรแกรมที่ดูราวกับสนทนาได้ด้วยการจับคู่แบบรูปและกฎการเขียนใหม่ โดยผู้เขียนชี้ทันทีว่าความเข้าใจที่ผู้อ่านยกให้โปรแกรมนั้นมากเกินกว่าที่มันมีจริง
1982 บทความวารสาร ยุคมืดของปัญญาประดิษฐ์
J. J. Hopfield · Proceedings of the National Academy of Sciences 79(8): 2554–2558
บทความนำเสนอโครงข่ายความจำเชื่อมโยงของ Hopfield ซึ่งเชื่อมโยงการคำนวณเชิงประสาทเข้ากับภูมิทัศน์พลังงานของฟิสิกส์เชิงสถิติและฟื้นความสนใจในโครงข่ายประสาทระหว่างช่วงฤดูหนาวของปัญญาประดิษฐ์ยุคแรก
1982 บทความวารสาร ยุคมืดของปัญญาประดิษฐ์
McDermott, J. · Artificial Intelligence 19(1): 39–88
บันทึกระบบกฎการผลิตที่จัดโครงแบบคำสั่งซื้อคอมพิวเตอร์ของ DEC ทุกวัน นับเป็นระบบผู้เชี่ยวชาญไม่กี่ระบบที่ยืนอยู่ได้ในการใช้งานจริงประจำวันและคิดผลตอบแทนออกมาได้
1986 บทความวารสาร ยุคมืดของปัญญาประดิษฐ์
J. Pearl · Artificial Intelligence 29(3): 241–288
บทความจัดระบบการดำเนินการหลอมรวมแพร่กระจายและจัดโครงสร้างบนโครงข่ายความเชื่อจึงวางรากฐานเชิงขั้นตอนวิธีสำหรับการอนุมานใน Bayesian network
1986 บทความวารสาร ยุคมืดของปัญญาประดิษฐ์
D. E. Rumelhart, G. E. Hinton, R. J. Williams · Nature 323(6088): 533–536
บทความเผยแพร่ขั้นตอนวิธี back-propagation สำหรับฝึกโครงข่ายประสาทหลายชั้นทำให้การเรียนรู้เชิงลึกเชิงปฏิบัติเป็นไปได้
1988 บทความวารสาร ยุคมืดของปัญญาประดิษฐ์
R. S. Sutton · Machine Learning 3(1): 9–44
บทความจัดระบบการเรียนรู้แบบ temporal-difference (TD) จึงกลายเป็นหนึ่งในขั้นตอนวิธีหลักที่อยู่เบื้องหลังการเรียนรู้แบบเสริมกำลังสมัยใหม่
1990 บทความวารสาร ยุคมืดของปัญญาประดิษฐ์
J. L. Elman · Cognitive Science 14(2): 179–211
บทความนำเสนอโครงข่ายวนซ้ำอย่างง่ายของ Elman ซึ่งแสดงว่าโครงข่ายประสาทสามารถเรียนรู้โครงสร้างเชิงเวลาและเปิดทางให้แบบจำลองลำดับในภายหลัง
1995 บทความวารสาร ยุคฟื้นตัว
C. Cortes, V. Vapnik · Machine Learning 20(3): 273–297
บทความนำเสนอซัพพอร์ตเวกเตอร์แมชชีนแบบ soft-margin ซึ่งเป็นตัวจำแนกแบบขอบเขตสูงสุดที่กลายเป็นแบบแผนและกำหนดทิศทางการเรียนรู้ของเครื่องในช่วงคริสต์ทศวรรษ 1990
1997 บทความวารสาร ยุคฟื้นตัว
S. Hochreiter, J. Schmidhuber · Neural Computation 9(8): 1735–1780
นำเสนอสถาปัตยกรรม LSTM ดั้งเดิมที่ใช้เซลล์ความจำพร้อมประตูรับเข้าและส่งออก ส่วนประตูลืมที่ใช้เป็นมาตรฐานในปัจจุบันถูกเพิ่มภายหลังโดย Gers, Schmidhuber และ Cummins
1998 บทความวารสาร ยุคฟื้นตัว
Y. LeCun, L. Bottou, Y. Bengio, P. Haffner · Proceedings of the IEEE 86(11): 2278–2324
บทความนำเสนอ LeNet-5 ซึ่งเป็นโครงข่ายประสาทแบบคอนโวลูชันต้นแบบที่ทำการรู้จำตัวเลขเขียนด้วยมือได้ในระดับใช้งานจริงและสถาปนาแม่แบบของ CNN
2006 บทความวารสาร ยุคฟื้นตัว
G. E. Hinton, R. R. Salakhutdinov · Science 313(5786): 504–507
บทความนำเสนอออโตเอนโคเดอร์เชิงลึกที่สร้างข้อมูลมิติสูงขึ้นมาใหม่ได้เที่ยงตรงกว่า PCA มากจึงจุดประกายแรกของการฟื้นคืนของการเรียนรู้เชิงลึก
2006 บทความวารสาร ยุคฟื้นตัว
G. E. Hinton, S. Osindero, Y.-W. Teh · Neural Computation 18(7): 1527–1554
บทความนำเสนอ deep belief network ที่ฝึกด้วยขั้นตอนวิธีแบบ greedy ทีละชั้นซึ่งแสดงเป็นครั้งแรกว่าแบบจำลองเชิงลึกสามารถฝึกได้อย่างมีประสิทธิภาพ
2009 บทความประชุมวิชาการ ยุคฟื้นตัว
Raina, R., Madhavan, A., Ng, A. Y. · Proceedings of the 26th Annual International Conference on Machine Learning (ICML 2009): 873–880
ย้ายการฝึกแบบจำลองเชิงลึกแบบไม่มีผู้สอนไปยังหน่วยประมวลผลกราฟิกจนเร็วขึ้นระดับเท่าตัวหลายสิบ ทำให้เส้นทางฮาร์ดแวร์ที่การเรียนรู้เชิงลึกใช้ขยายขนาดในทศวรรษถัดมากลายเป็นเรื่องปกติ
2013 บทความประชุมวิชาการ ยุคฟื้นตัว
V. Mnih, K. Kavukcuoglu, D. Silver, A. Graves, I. Antonoglou, D. Wierstra, M. Riedmiller · NeurIPS 2013 Deep Learning Workshop (arXiv:1312.5602)
บทความผสาน Q-learning เข้ากับโครงข่ายคอนโวลูชันเพื่อเล่นเกม Atari จากพิกเซลดิบได้ในระดับมนุษย์จึงเป็นจุดกำเนิดของการเรียนรู้เสริมกำลังเชิงลึก
2013 บทความประชุมวิชาการ ยุคฟื้นตัว
T. Mikolov, K. Chen, G. Corrado, J. Dean · ICLR 2013 Workshop (arXiv:1301.3781)
บทความนำเสนอสถาปัตยกรรม skip-gram และ CBOW ที่สร้างเวกเตอร์ฝังคำแบบหนาแน่นจึงเปิดยุคของเวกเตอร์แทนคำที่ฝึกล่วงหน้า
2013 บทความประชุมวิชาการ ยุคฟื้นตัว
D. P. Kingma, M. Welling · ICLR 2014 (arXiv:1312.6114)
บทความนำเสนอ variational autoencoder ซึ่งผสานการอนุมานแบบแวริเอชันเข้ากับการสร้างแบบจำลองเชิงลึกและจัดให้มีแบบจำลองตัวแปรแฝงเชิงลึกแพร่หลายเป็นครั้งแรก
2014 บทความประชุมวิชาการ ยุคฟื้นตัว
D. Bahdanau, K. Cho, Y. Bengio · ICLR 2015 (arXiv:1409.0473)
บทความนำเสนอ attention แบบบวก (Bahdanau) สำหรับการแปลด้วยโครงข่ายประสาทแสดงว่าการจัดแนวแบบนุ่มช่วยให้ดีโค้เดอร์มุ่งไปยังโทเคนต้นทางที่เกี่ยวข้องและจุดประกาย Transformer โดยตรง
2014 บทความประชุมวิชาการ ยุคฟื้นตัว
I. Goodfellow, J. Pouget-Abadie, M. Mirza, B. Xu, D. Warde-Farley, S. Ozair, A. Courville, Y. Bengio · NeurIPS 2014 (arXiv:1406.2661)
บทความจัดการสร้างแบบจำลองเชิงกำเนิดในรูปเกมมินแมกซ์สองผู้เล่นระหว่างเครื่องกำเนิดกับเครื่องจำแนกจึงเปิดตระกูลใหม่ของแบบจำลองเชิงกำเนิดโดยปริยาย
2014 บทความวารสาร ยุคฟื้นตัว
N. Srivastava, G. E. Hinton, A. Krizhevsky, I. Sutskever, R. Salakhutdinov · Journal of Machine Learning Research 15(56): 1929–1958
บทความนำเสนอ dropout ซึ่งเป็นเทคนิคสม่ำเสรอเชิงสุ่มอย่างง่ายที่กลายเป็นค่าตั้งต้นในไปป์ไลน์การฝึกการเรียนรู้เชิงลึก
2015 บทความประชุมวิชาการ ยุคฟื้นตัว
S. Ioffe, C. Szegedy · ICML 2015 (arXiv:1502.03167)
บทความนำเสนอ batch normalization ซึ่งปรับอินพุตของชั้นให้เป็นมาตรฐานข้ามมินิแบตช์เพื่อทำให้การฝึกโครงข่ายเชิงลึกมีเสถียรภาพและเร็วขึ้นอย่างมาก
2015 พรีพรินต์ ยุคฟื้นตัว
Sohl-Dickstein, J., Weiss, E. A., Maheswaranathan, N., Ganguli, S. · arXiv:1503.03585
วางการสร้างแบบจำลองเชิงกำเนิดให้เป็นการย้อนกระบวนการเติมสัญญาณรบกวนทีละขั้น อันเป็นรูปแบบที่แบบจำลองการแพร่รุ่นหลังตั้งอยู่บนนั้น
2015 บทความประชุมวิชาการ ยุคฟื้นตัว
K. He, X. Zhang, S. Ren, J. Sun · CVPR 2016 (arXiv:1512.03385)
บทความนำเสนอการเชื่อมต่อแบบเรซิดวลที่ทำให้โครงข่ายที่ลึกหลายร้อยชั้นสามารถฝึกได้อย่างมีประสิทธิภาพและชนะ ImageNet 2015 อย่างขาดลอย
2016 บทความวารสาร ยุคฟื้นตัว
Sennrich, R., Haddow, B., Birch, A. · Proceedings of ACL 2016: 1715–1725 (arXiv:1508.07909)
ตัดคำเป็นหน่วยย่อยที่ได้จากความถี่ ทำให้คลังคำขนาดคงที่สะกดอะไรก็ได้ อันเป็นวิธีตัดคำที่แบบจำลองภาษารุ่นหลังส่วนใหญ่รับช่วงต่อ
2016 บทความประชุมวิชาการ ยุคฟื้นตัว
Han, S., Mao, H., Dally, W. J. · ICLR 2016 (arXiv:1510.00149)
รวมการตัดกิ่ง การควอนไทซ์ระหว่างฝึก และการเข้ารหัสฮัฟฟ์แมนไว้ในกระบวนการเดียว ย่อขนาดโครงข่ายลงราวสิบเท่าโดยแทบไม่เสียความแม่นยำ นับเป็นการชี้แต่เนิ่น ๆ ว่าความละเอียดเชิงตัวเลขคือตัวแปรของการออกแบบ
2016 บทความประชุมวิชาการ ยุคฟื้นตัว
A. van den Oord, S. Dieleman, H. Zen, K. Simonyan, O. Vinyals, A. Graves, N. Kalchbrenner, A. Senior, K. Kavukcuoglu · NeurIPS 2016 (arXiv:1609.03499)
บทความนำเสนอแบบจำลองออโตรีเกรสซีฟเชิงคอนโวลูชันแบบขยายเชิงสาเหตุที่สร้างสัญญาณเสียงดิบจึงยกระดับความเป็นธรรมชาติของการสังเคราะห์เสียงพูดขึ้นอย่างมาก
2017 พรีพรินต์ ยุคฟื้นตัว
J. Schulman, F. Wolski, P. Dhariwal, A. Radford, O. Klimov · arXiv:1707.06347
บทความนำเสนอ PPO ซึ่งเป็นวิธีลงกราเดียนต์นโยบายอันดับหนึ่งที่เรียบง่ายและเสถียรและกลายเป็นขั้นตอนวิธีเพิ่มประสิทธิภาพนโยบายมาตรฐานในการเรียนรู้เสริมกำลังสมัยใหม่
2017 พรีพรินต์ ยุคฟื้นตัว
Shazeer, N. et al. · arXiv:1701.06538
ส่งแต่ละโทเคนไปยังผู้เชี่ยวชาญเพียงไม่กี่ตัวจากจำนวนมาก ทำให้จำนวนพารามิเตอร์ของโครงข่ายเติบโตได้ไกลเกินกว่าการคำนวณที่ใช้กับอินพุตหนึ่ง ๆ
2017 บทความประชุมวิชาการ ยุคฟื้นตัว
A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, L. Kaiser, I. Polosukhin · NeurIPS 2017 (arXiv:1706.03762)
บทความนำเสนอ Transformer ซึ่งเป็นสถาปัตยกรรมที่ใช้ attention ล้วนและละทิ้งการวนซ้ำและการคอนโวลูชันจึงเหนือกว่าคุณภาพการแปลงลำดับเดิมขณะฝึกในเวลาเพียงเสี้ยวหนึ่ง
2018 บทความวารสาร ยุคฟื้นตัว
Kudo, T., Richardson, J. · EMNLP 2018, System Demonstrations: 66–71 (arXiv:1808.06226)
ฝึกตัวตัดคำระดับหน่วยย่อยจากข้อความดิบโดยตรงโดยไม่ต้องตัดคำล่วงหน้าตามภาษาใดภาษาหนึ่ง ทำให้กระบวนการเดียวกันใช้ได้กับภาษาที่ไม่เว้นวรรคระหว่างคำ
2018 บทความประชุมวิชาการ ยุคฟื้นตัว
J. Devlin, M.-W. Chang, K. Lee, K. Toutanova · NAACL 2019 (arXiv:1810.04805)
บทความนำเสนอ Transformer แบบสองทิศทางที่ฝึกล่วงหน้าด้วย masked language modeling และ next-sentence prediction จึงสถาปนาเกณฑ์วัดใหม่ทั่วเกณฑ์ NLP
2019 บทความวารสาร ยุคฟื้นตัว
C. Raffel, N. Shazeer, A. Roberts, K. Lee, S. Narang, M. Matena, Y. Zhou, W. Li, P. J. Liu · Journal of Machine Learning Research 21(140): 1–67 (arXiv:1910.10683)
บทความหลอมรวมทุกงาน NLP ในฐานะข้อความ-สู่-ข้อความและตัดทอนตัวเลือกการเรียนรู้แบบถ่ายโอนอย่างเป็นระบบจึงสถาปนาสูตรอ้างอิงสำหรับแบบจำลองที่ฝึกล่วงหน้าขนาดใหญ่
2020 บทความประชุมวิชาการ ยุค LLM
J. Ho, A. Jain, P. Abbeel · NeurIPS 2020 (arXiv:2006.11239)
บทความจัดรูปแบบ diffusion ใหม่เป็นวัตถุประสงค์การฝึกแบบแวริเอชันขจัดสัญญาณรบกวนจึงคืนคุณภาพการสร้างภาพสู่ระดับ state-of-the-art และเปิดยุคของแบบจำลอง diffusion
2021 บทความวารสาร ยุค LLM
Narayanan, D. et al. · SC 2021: 1–15 (arXiv:2104.04473)
ประกอบการขนานเชิงเทนเซอร์ เชิงสายงาน และเชิงข้อมูลเข้าเป็นตารางเดียว พร้อมวัดอัตราการประมวลผลของการฝึกแบบจำลองภาษาบนจีพียูนับพันตัว
2021 พรีพรินต์ ยุค LLM
Hu, E. J. et al. · arXiv:2106.09685
ตรึงน้ำหนักที่ฝึกไว้ล่วงหน้าแล้วฝึกเมทริกซ์อันดับต่ำคู่หนึ่งแทน ทำให้ต้นทุนการปรับแบบจำลองขนาดใหญ่เหลือเพียงเศษเสี้ยวของการปรับละเอียดทั้งตัว
2021 บทความประชุมวิชาการ ยุค LLM
A. Ramesh, M. Pavlov, G. Goh, S. Gray, C. Voss, A. Radford, M. Chen, I. Sutskever · ICML 2021 (arXiv:2102.12092)
บทความแสดงว่า Transformer ออโตรีเกรสซีฟขนาด 12B พารามิเตอร์สามารถสร้างภาพที่หลากหลายและมีความเที่ยงตรงสูงจากคำบรรยายข้อความโดยตรงจึงจุดประกายงานวิจัยด้านข้อความสู่ภาพ
2021 บทความประชุมวิชาการ ยุค LLM
A. Radford, J. W. Kim, C. Hallacy, A. Ramesh, G. Goh, S. Agarwal, G. Sastry, A. Askell, P. Mishkin, J. Clark, G. Krueger, I. Sutskever · ICML 2021 (arXiv:2103.00020)
บทความฝึกตัวเข้ารหัสภาพบนคู่ภาพ-ข้อความขนาดเว็บเพื่อให้จำแนกภาพแบบ zero-shot ได้แข็งแกร่งจึงจัดหอคอยภาพให้กับระบบหลายรู้สึกจำนวนมากในภายหลัง
2021 พรีพรินต์ ยุค LLM
Chen, M. et al. · arXiv:2107.03374
เสนอแบบจำลอง GPT ที่ปรับละเอียดด้วยโค้ดพร้อมชุดวัดผลที่ให้คะแนนตามความถูกต้องเชิงหน้าที่ ทำให้การเขียนโปรแกรมกลายเป็นความสามารถที่วัดได้แทนที่จะเป็นเพียงแนวหนึ่งของการกำเนิดข้อความ พร้อมอภิปรายผลด้านความปลอดภัยและแรงงานไปด้วย
2021 บทความประชุมวิชาการ ยุค LLM
R. Rombach, A. Blattmann, D. Lorenz, P. Esser, B. Ommer · CVPR 2022 (arXiv:2112.10752)
บทความย้ายกระบวนการ diffusion เข้าสู่ปริภูมิแฝงเชิงการรับรู้จึงทำให้การสร้างภาพจากข้อความความละเอียดสูงทำได้บน GPU ระดับผู้บริโภคและทำให้การสังเคราะห์ภาพเป็นประชาธิปไตย
2022 บทความประชุมวิชาการ ยุค LLM
J. Wei, X. Wang, D. Schuurmans, M. Bosma, B. Ichter, F. Xia, E. H. Chi, Q. V. Le, D. Zhou · NeurIPS 2022 (arXiv:2201.11903)
บทความแสดงว่าการกระตุ้นให้แบบจำลองภาษาสร้างขั้นตอนการให้เหตุผลกลางทำให้สมรรถนะบนเกณฑ์การให้เหตุผลเชิงคำนวณสามัญสำนึกและสัญลักษณ์ดีขึ้นอย่างมาก
2022 บทความประชุมวิชาการ ยุค LLM
L. Ouyang, J. Wu, X. Jiang, D. Almeida, C. L. Wainwright, P. Mishkin, C. Zhang, S. Agarwal, K. Slama, A. Ray, J. Schulman, J. Hilton, F. Kelton, L. Miller, M. Simens, A. Askell, P. Welinder, P. Christiano, J. Leike, R. Lowe · NeurIPS 2022 (arXiv:2203.02155)
บทความประยุกต์ reinforcement learning from human feedback ขนาดใหญ่เพื่อจัดแนวผลลัพธ์ของ GPT-3 กับเจตนาของมนุษย์จึงสถาปนา RLHF เป็นสูตรการจัดแนวมาตรฐาน
2022 รายงานทางเทคนิค ยุค LLM
Yuntao Bai et al. · Anthropic Technical Report 2022 (arXiv:2212.08073)
บทความนำเสนอ RLAIF ซึ่งแบบจำลองวิพากษ์และปรับปรุงผลลัพธ์ของตนเองตามรัฐธรรมนูญที่เขียนไว้จึงลดการพึ่งพาป้ายอันตรายจากมนุษย์ในการจัดแนว
2023 รายงานทางเทคนิค ยุค LLM
H. Touvron, T. Lavril, G. Izacard, X. Martinet, M.-A. Lachaux, T. Lacroix, B. Rozière, N. Goyal, E. Hambro, F. Azhar, A. Rodriguez, A. Joulin, E. Grave, G. Lample · Meta AI Technical Report 2023 (arXiv:2302.13971)
บทความเปิดตัวตระกูล LLaMA ของแบบจำลองพื้นฐานแบบเปิดแสดงว่าแบบจำลองที่มีขนาดค่อนข้างเล็กแต่ฝึกดีสามารถทัดเทียมแบบจำลองปิดที่ใหญ่กว่ามากจึงเร่งกระแสน้ำหนักเปิด
2023 บทความวารสาร ยุค LLM
Wang, L. et al. · Frontiers of Computer Science 18(6), 2024 (arXiv:2308.11432)
จัดระเบียบงานเรื่องเอเจนต์ที่กระจัดกระจายให้เป็นสามสาย คือการสร้าง การประเมิน และการประยุกต์ นับเป็นจุดที่คำนี้เปลี่ยนจากการรวมกันของวิธีปฏิบัติมาเป็นสาขาวิจัยหนึ่ง
2023 พรีพรินต์ ยุค LLM
Dettmers, T. et al. · arXiv:2305.14314
ส่งค่าความชันย้อนกลับผ่านแบบจำลองฐานที่ควอนไทซ์เป็น 4 บิตไปยังตัวปรับอันดับต่ำ ทำให้การปรับละเอียดแบบจำลองขนาดใหญ่อยู่ในวิสัยของจีพียูเพียงตัวเดียว
2023 บทความประชุมวิชาการ ยุค LLM
Frantar, E., Ashkboos, S., Hoefler, T., Alistarh, D. · ICLR 2023 (arXiv:2210.17323)
ควอนไทซ์น้ำหนักของแบบจำลองภาษาขนาดใหญ่หลังการฝึก ทีละชั้นและในรอบเดียว ทำให้ให้บริการที่ความละเอียดต่ำลงได้โดยไม่ต้องฝึกใหม่
2023 บทความประชุมวิชาการ ยุค LLM
Leviathan, Y., Kalman, M., Matias, Y. · ICML 2023 (arXiv:2211.17192)
ให้แบบจำลองร่างขนาดเล็กเสนอโทเคนหลายตัวแล้วให้แบบจำลองเป้าหมายตรวจสอบพร้อมกัน ลดเวลาหน่วงโดยไม่เปลี่ยนการแจกแจงของผลลัพธ์
2023 บทความวารสาร ยุค LLM
Kwon, W. et al. · SOSP 2023: 611–626 (arXiv:2309.06180)
จัดการแคชของกลไกความสนใจเป็นหน้าขนาดคงที่อย่างที่ระบบปฏิบัติการจัดการหน่วยความจำ ทำให้เครื่องบริการรับคำขอพร้อมกันได้มากขึ้นมากโดยไม่ต้องกันพื้นที่เผื่อกรณีเลวร้ายที่สุดให้ทุกคำขอ
2023 พรีพรินต์ ยุค LLM
Gu, A. และ Dao, T. · arXiv:2312.00752
นำเสนอ Mamba สถาปัตยกรรมเชิงปริภูมิสถานะเชิงเลือกที่เทียบเท่าหรือเหนือกว่า Transformer attention บนภาษาและมอดัลลิตี้อื่น ๆ ด้วยความซับซ้อนเชิงเวลาเชิงเส้น — เป็นหนึ่งในสถาปัตยกรรมหลัง Transformer ที่ทรงอิทธิพลที่สุดของปี 2023