1931 журнальная статья Ранняя теория
Gödel, K. · Monatshefte für Mathematik und Physik 38(1): 173–198
Доказывает, что всякая непротиворечивая формальная система, способная выразить арифметику, содержит истинные утверждения, которые она не может доказать, и задаёт предел, в котором позже обсуждается, что способны решать вычисление и машинный вывод.
1936 журнальная статья Ранняя теория
Turing, A. M. · Proceedings of the London Mathematical Society s2-42(1): 230–265
В работе вводится универсальная машина Тьюринга и доказывается неразрешимость проблемы разрешения, что закладывает теоретические основы информатики.
1936 журнальная статья Ранняя теория
Church, A. · American Journal of Mathematics 58(2): 345
Определяет эффективную вычислимость через λ-исчисление и предъявляет задачу, которую не может решить ни одна такая процедура, достигая пределов вычисления независимо от Тьюринга.
1943 журнальная статья Ранняя теория
McCulloch, W. S. & Pitts, W. · Bulletin of Mathematical Biophysics 5(4): 115–133
Нервная активность моделируется средствами пропозициональной логики, что даёт первую математическую теорию искусственных нейронных сетей.
1948 журнальная статья Ранняя теория
Shannon, C. E. · Bell System Technical Journal 27(3): 379–423; 27(4): 623–656
В работе определяются информационная энтропия и пропускная способность канала, что закладывает основы теории информации и задаёт вероятностный аппарат, впоследствии используемый в ИИ.
1950 журнальная статья Ранняя теория
Turing, A. M. · Mind LIX(236): 433–460
Предложена игра в имитацию (тест Тьюринга) как операциональное определение машинного интеллекта, задающее постановку вопроса об ИИ на следующие семьдесят лет.
1955 журнальная статья Ранняя теория
McCarthy, J., Minsky, M. L., Rochester, N. & Shannon, C. E. · Dartmouth College, 1955; republished in AI Magazine 27(4): 12–14 (2006)
Введён термин «искусственный интеллект» и сформулирована исследовательская программа, положившая начало ИИ как академической дисциплине.
1956 журнальная статья Рождение ИИ
Newell, A. & Simon, H. A. · IRE Transactions on Information Theory IT-2(3): 61–79
Реализована первая программа эвристического вывода, демонстрирующая способность машин воспроизводить стратегии решения задач, свойственные человеку, и вводящая понятие «сложной системы обработки информации».
1958 журнальная статья Рождение ИИ
Newell, A., Shaw, J. C., Simon, H. A. · Psychological Review 65(3): 151–166
Описывает решение задач человеком как эвристический поиск в пространстве символьных состояний — разбор, на котором держатся General Problem Solver и информационный взгляд на мышление.
1958 журнальная статья Рождение ИИ
Rosenblatt, F. · Psychological Review 65(6): 386–408
Введён первый обучаемый линейно-пороговый нейрон, положивший начало коннекционистской линии, ведущей к современному глубокому обучению.
1958 материалы конференции Рождение ИИ
McCarthy, J. · Proceedings of the Symposium on Mechanisation of Thought Processes (NPL Teddington), 75–91. London: HMSO
Предложен концепт «советчика» (advice taker) — программы, способной делать выводы на основе формализованного запаса знаний здравого смысла, что закладывает концептуальную основу представления знаний и рассуждений.
1959 журнальная статья Рождение ИИ
Samuel, A. L. · IBM Journal of Research and Development 3(3): 210–229
Продемонстрирована программа игры в шашки, совершенствующая свою игру посредством самообучения, что положило начало изучению машинного обучения и самоусовершенствования в стиле альфа-бета.
1959 журнальная статья Рождение ИИ
Gelernter, H. · Information and Control 2(1): 80–89
Гелернтер рассматривает, как машина может эффективно работать с формальными системами, предикаты которых обладают высокой симметрией, и в качестве решения формулирует теорему и правило синтаксической симметрии. Работа идёт рядом с геометрической доказательной машиной, которую он тогда строил в IBM и которая ранней весной 1959 года доказала свою первую теорему евклидовой планиметрии.
1960 материалы конференции Рождение ИИ
Widrow, B., Hoff, M. E. · IRE WESCON Convention Record, Part 4, 96–104
Введено правило LMS (Adaline) — первый широко используемый метод градиентного обучения адаптивных линейных сетей.
1960 журнальная статья Рождение ИИ
McCarthy, J. · Communications of the ACM 3(4): 184–195
Вводит символьные выражения, рекурсивные функции над ними и тот самый eval, который позволяет языку истолковывать себя, — замысел, ставший Lisp и рабочим языком символьного искусственного интеллекта.
1961 технический отчёт Рождение ИИ
Rosenblatt, F. · Cornell Aeronautical Laboratory technical report (DTIC AD0256582)
Сводит работы о перцептроне в целостную теорию слоистых вероятностных сетей, указывая и на то, чему такие машины способны научиться, и на то, где заканчивается однослойная форма.
1966 журнальная статья Рождение ИИ
Weizenbaum, J. · Communications of the ACM 9(1): 36–45
Строит из сопоставления образцов и правил переписывания программу, которая кажется собеседником, и автор тут же указывает, сколько понимания читатели ей приписывают, хотя его нет.
1982 журнальная статья Зима ИИ
Hopfield, J. J. · Proceedings of the National Academy of Sciences 79(8): 2554–2558
Введена ассоциативно-памятная сеть Хопфилда, связывающая нейровычисления с энергетическими ландшафтами статистической физики и возродившая интерес к нейронным сетям в период ранней «зимы ИИ».
1982 журнальная статья Зима ИИ
McDermott, J. · Artificial Intelligence 19(1): 39–88
Описывает продукционную систему, ежедневно конфигурировавшую заказы вычислительных машин DEC, — одну из немногих экспертных систем, выдержавших повседневную эксплуатацию и поддающихся экономическому счёту.
1986 журнальная статья Зима ИИ
Pearl, J. · Artificial Intelligence 29(3): 241–288
Систематизированы операции слияния, распространения и структурирования в сетях доверия, что заложило алгоритмические основы вывода в байесовских сетях.
1986 журнальная статья Зима ИИ
Rumelhart, D. E., Hinton, G. E., Williams, R. J. · Nature 323(6088): 533–536
Алгоритм обратного распространения ошибок получил широкое распространение для обучения многослойных нейронных сетей, сделав практически возможным глубокое обучение.
1988 журнальная статья Зима ИИ
Sutton, R. S. · Machine Learning 3(1): 9–44
Систематизирован метод обучения с временными разностями (TD), ставший одним из ключевых алгоритмов современного обучения с подкреплением.
1990 журнальная статья Зима ИИ
Elman, J. L. · Cognitive Science 14(2): 179–211
Введена простая рекуррентная сеть Элмана, показывающая, что нейронные сети способны выявлять временную структуру данных и прокладывающая путь к последующим последовательным моделям.
1995 журнальная статья Возрождение
Cortes, C., Vapnik, V. · Machine Learning 20(3): 273–297
Введён метод опорных векторов с мягким зазором — канонический максимизирующий зазор классификатор, определивший облик машинного обучения 1990-х годов.
1997 журнальная статья Возрождение
Hochreiter, S., Schmidhuber, J. · Neural Computation 9(8): 1735–1780
Представлена исходная LSTM с ячейками памяти и входными и выходными вентилями; ставший стандартным вентиль забывания позднее добавили Gers, Schmidhuber и Cummins.
1998 журнальная статья Возрождение
LeCun, Y., Bottou, L., Bengio, Y., Haffner, P. · Proceedings of the IEEE 86(11): 2278–2324
Введена LeNet-5 — каноническая свёрточная нейронная сеть, достигающая промышленного качества распознавания рукописных цифр и устанавливающая шаблон CNN.
2006 журнальная статья Возрождение
Geoffrey E. Hinton, Ruslan R. Salakhutdinov · Science 313(5786): 504–507
Введён глубокий автокодировщик, восстанавливающий высокоразмерные данные значительно точнее, чем метод главных компонент, что зажгло первую искру возрождения глубокого обучения.
2006 журнальная статья Возрождение
Geoffrey E. Hinton, Simon Osindero, Yee-Whye Teh · Neural Computation 18(7): 1527–1554
Введены глубокие сети доверия, обучаемые жадным послойным алгоритмом, впервые продемонстрировавшим возможность эффективного обучения глубоких моделей.
2009 материалы конференции Возрождение
Raina, R., Madhavan, A., Ng, A. Y. · Proceedings of the 26th Annual International Conference on Machine Learning (ICML 2009): 873–880
Переносит обучение глубоких моделей без учителя на графические процессоры с ускорением на порядок и делает обычным тот аппаратный путь, по которому глубокое обучение росло следующее десятилетие.
2013 материалы конференции Возрождение
Volodymyr Mnih, Koray Kavukcuoglu, David Silver, Alex Graves, Ioannis Antonoglou, Daan Wierstra, Martin Riedmiller · NeurIPS 2013 Deep Learning Workshop (arXiv:1312.5602)
Объединение Q-обучения со свёрточной сетью позволяет играть в игры Atari по сырым пикселям на уровне человека, что положило начало глубокому обучению с подкреплением.
2013 материалы конференции Возрождение
Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean · ICLR 2013 Workshop (arXiv:1301.3781)
Введены архитектуры skip-gram и CBOW, порождающие плотные векторные представления слов, что открыло эпоху предобученных векторных вложений.
2013 материалы конференции Возрождение
Diederik P. Kingma, Max Welling · ICLR 2014 (arXiv:1312.6114)
Введён вариационный автокодировщик, объединяющий вариационный вывод с глубоким генеративным моделированием и ставший первой широко принятой глубокой моделью со скрытыми переменными.
2014 материалы конференции Возрождение
Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio · ICLR 2015 (arXiv:1409.0473)
Введено аддитивное внимание (Bahdanau attention) для нейронного машинного перевода, демонстрирующее, что мягкое выравнивание позволяет декодеру фокусироваться на релевантных токенах источника и непосредственно вдохновившее архитектуру Transformer.
2014 материалы конференции Возрождение
Ian J. Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, Yoshua Bengio · NeurIPS 2014 (arXiv:1406.2661)
Генеративное моделирование представлено как антагонистическая игра двух игроков — генератора и дискриминатора, что открыло новое семейство имплицитных генеративных моделей.
2014 журнальная статья Возрождение
Nitish Srivastava, Geoffrey E. Hinton, Alex Krizhevsky, Ilya Sutskever, Ruslan Salakhutdinov · Journal of Machine Learning Research 15(56): 1929–1958
Введён dropout — простой стохастический метод регуляризации, ставший стандартным элементом конвейеров обучения глубоких сетей.
2015 материалы конференции Возрождение
Sergey Ioffe, Christian Szegedy · ICML 2015 (arXiv:1502.03167)
Введена пакетная нормализация, выравнивающая входы слоя по мини-батчу и стабилизирующая и значительно ускоряющая обучение глубоких сетей.
2015 препринт Возрождение
Sohl-Dickstein, J., Weiss, E. A., Maheswaranathan, N., Ganguli, S. · arXiv:1503.03585
Формулирует порождающее моделирование как обращение постепенного зашумления — та самая формулировка, на которой стоят позднейшие диффузионные модели.
2015 материалы конференции Возрождение
Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun · CVPR 2016 (arXiv:1512.03385)
Введены остаточные связи, позволяющие эффективно обучать сети глубиной в сотни слоёв и обеспечившие крупную победу ResNet на конкурсе ImageNet 2015.
2016 журнальная статья Возрождение
Sennrich, R., Haddow, B., Birch, A. · Proceedings of ACL 2016: 1715–1725 (arXiv:1508.07909)
Делит слова на подсловные единицы, выведенные из частот, так что фиксированный словарь способен записать что угодно, — схема сегментации, унаследованная большинством последующих языковых моделей.
2016 материалы конференции Возрождение
Han, S., Mao, H., Dally, W. J. · ICLR 2016 (arXiv:1510.00149)
Объединяет отсечение, обучаемое квантование и код Хаффмана в один конвейер, который уменьшает сеть на порядок почти без потери точности, рано заявляя, что числовая точность — переменная проектирования.
2016 материалы конференции Возрождение
Aäron van den Oord, Sander Dieleman, Heiga Zen, Karen Simonyan, Oriol Vinyals, Alex Graves, Nal Kalchbrenner, Andrew Senior, Koray Kavukcuoglu · NeurIPS 2016 (arXiv:1609.03499)
Введена авторегрессионная модель на основе расширенных причинных свёрток, генерирующая сырые формы звукового сигнала, что значительно повысило естественность синтеза речи.
2017 препринт Возрождение
John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, Oleg Klimov · arXiv:1707.06347
Введён алгоритм PPO — простой и устойчивый метод градиента политики первого порядка, ставший стандартным алгоритмом оптимизации политики в современном обучении с подкреплением.
2017 препринт Возрождение
Shazeer, N. et al. · arXiv:1701.06538
Направляет каждый токен лишь к нескольким экспертам из многих, позволяя числу параметров сети расти далеко за пределы вычислений, затрачиваемых на один вход.
2017 материалы конференции Возрождение
Vaswani et al. · NeurIPS 2017 (arXiv:1706.03762)
Введена архитектура Transformer, целиком построенная на механизме внимания, отказавшаяся от рекуррентности и свёрток и превзошедшая прежние модели по качеству при значительно меньших затратах на обучение.
2018 журнальная статья Возрождение
Kudo, T., Richardson, J. · EMNLP 2018, System Demonstrations: 66–71 (arXiv:1808.06226)
Обучает подсловный токенизатор прямо на сыром тексте без языкозависимой предсегментации, так что один и тот же конвейер годится для языков, не разделяющих слова пробелами.
2018 материалы конференции Возрождение
Devlin et al. · NAACL 2019 (arXiv:1810.04805)
Предложен двунаправленный Transformer, предобученный на задачах маскированного языкового моделирования и предсказания следующего предложения, установивший новый уровень качества на широком спектре NLP-бенчмарков.
2019 журнальная статья Возрождение
Raffel et al. · Journal of Machine Learning Research 21(140): 1–67 (arXiv:1910.10683)
Все задачи NLP сведены к формату «текст-в-текст», что позволяет систематически исследовать выбор архитектуры и стратегий обучения и формирует эталонный рецепт для крупномасштабного предобучения.
2020 материалы конференции Эра больших языковых моделей
Ho, Jain, Abbeel · NeurIPS 2020 (arXiv:2006.11239)
Диффузия переформулирована как задача шумоподавления с вариационным обучением, что вернуло генерацию изображений на передовой уровень качества и открыло эпоху диффузионных моделей.
2021 журнальная статья Эра больших языковых моделей
Narayanan, D. et al. · SC 2021: 1–15 (arXiv:2104.04473)
Соединяет тензорный, конвейерный и данный параллелизм в одно расписание и измеряет пропускную способность обучения языковой модели на тысячах GPU.
2021 препринт Эра больших языковых моделей
Hu, E. J. et al. · arXiv:2106.09685
Замораживает предобученные веса и обучает вместо них пару низкоранговых матриц, снижая стоимость адаптации большой модели до малой доли полного дообучения.
2021 материалы конференции Эра больших языковых моделей
Ramesh et al. · ICML 2021 (arXiv:2102.12092)
Продемонстрировано, что авторегрессионный Transformer с 12 миллиардами параметров способен генерировать разнообразные и высококачественные изображения непосредственно по текстовым подписям, что дало импульс исследованиям text-to-image.
2021 материалы конференции Эра больших языковых моделей
Radford et al. · ICML 2021 (arXiv:2103.00020)
Кодировщики изображений обучены на веб-масштабных парах «изображение-текст» и обеспечивают мощную zero-shot классификацию изображений, формируя визуальную башню для многих последующих мультимодальных систем.
2021 препринт Эра больших языковых моделей
Chen, M. et al. · arXiv:2107.03374
Представляет модель GPT, дообученную на коде, вместе с набором задач, оцениваемых по функциональной правильности, превращая программирование из жанра порождения текста в измеримую способность и обсуждая последствия для безопасности и труда.
2021 материалы конференции Эра больших языковых моделей
Rombach et al. · CVPR 2022 (arXiv:2112.10752)
Процесс диффузии перенесён в перцептивное латентное пространство, что позволяет выполнять высококачественную генерацию изображений по тексту на потребительских GPU и демократизирует синтез изображений.
2022 материалы конференции Эра больших языковых моделей
Wei et al. · NeurIPS 2022 (arXiv:2201.11903)
Показано, что побуждение языковой модели генерировать промежуточные шаги рассуждения резко повышает качество на бенчмарках арифметического, здравого и символического рассуждений.
2022 материалы конференции Эра больших языковых моделей
Ouyang et al. · NeurIPS 2022 (arXiv:2203.02155)
Обучение с подкреплением на основе обратной связи от человека (RLHF) применено в крупном масштабе для согласования результатов GPT-3 с намерениями человека, что закрепило RLHF как канонический рецепт выравнивания.
2022 технический отчёт Эра больших языковых моделей
Bai et al. · Anthropic Technical Report 2022 (arXiv:2212.08073)
Предложен метод RLAIF, в котором модель критикует и пересматривает собственные ответы в соответствии с «конституцией», что снижает зависимость от человеческой разметки в задачах выравнивания.
2023 технический отчёт Эра больших языковых моделей
Touvron et al. · Meta AI Technical Report 2023 (arXiv:2302.13971)
Представлено семейство открытых базовых моделей LLaMA, демонстрирующее, что сравнительно небольшие, но хорошо обученные модели способны конкурировать со значительно более крупными закрытыми моделями, что ускорило движение открытых весов.
2023 журнальная статья Эра больших языковых моделей
Wang, L. et al. · Frontiers of Computer Science 18(6), 2024 (arXiv:2308.11432)
Упорядочивает разрозненные работы об агентах по построению, оценке и применению и отмечает момент, когда термин из набора практик становится областью исследований.
2023 препринт Эра больших языковых моделей
Dettmers, T. et al. · arXiv:2305.14314
Проводит градиенты через базовую модель, квантованную до 4 бит, в низкоранговые адаптеры и делает дообучение большой модели посильным для одного GPU.
2023 материалы конференции Эра больших языковых моделей
Frantar, E., Ashkboos, S., Hoefler, T., Alistarh, D. · ICLR 2023 (arXiv:2210.17323)
Квантует веса большой языковой модели после обучения, послойно и за один проход, так что её можно обслуживать с меньшей точностью без переобучения.
2023 материалы конференции Эра больших языковых моделей
Leviathan, Y., Kalman, M., Matias, Y. · ICML 2023 (arXiv:2211.17192)
Поручает небольшой черновой модели предлагать сразу несколько токенов, которые целевая модель проверяет параллельно, снижая задержку и не меняя распределение выхода.
2023 журнальная статья Эра больших языковых моделей
Kwon, W. et al. · SOSP 2023: 611–626 (arXiv:2309.06180)
Управляет кэшем внимания страницами постоянного размера — так, как операционная система управляет памятью, — и потому сервер держит куда больше одновременных запросов, не резервируя худший случай для каждого.
2023 препринт Эра больших языковых моделей
Gu, A. и Dao, T. · arXiv:2312.00752
Представлена Mamba — архитектура с селективным пространством состояний, достигающая или превосходящая внимание Transformer на языке и других модальностях при линейной временной сложности — одна из самых влиятельных пост-Transformer архитектур 2023 года.