1931 article de revue Théorie Primitive
Gödel, K. · Monatshefte für Mathematik und Physik 38(1): 173–198
Démontre que tout système formel cohérent capable d’exprimer l’arithmétique contient des énoncés vrais qu’il ne peut prouver, posant la limite qui encadrera plus tard ce que le calcul et le raisonnement machine peuvent trancher.
1936 article de revue Théorie Primitive
Alan M. Turing · Proceedings of the London Mathematical Society s2-42(1): 230–265
Introduit la machine de Turing universelle et démontre l’indécidabilité de l’Entscheidungsproblem, fondant ainsi les bases théoriques de l’informatique.
1936 article de revue Théorie Primitive
Church, A. · American Journal of Mathematics 58(2): 345
Définit la calculabilité effective au moyen du λ-calcul et exhibe un problème qu’aucune procédure de ce genre ne peut décider, atteignant les limites du calcul indépendamment de Turing.
1943 article de revue Théorie Primitive
Warren S. McCulloch, Walter Pitts · Bulletin of Mathematical Biophysics 5(4): 115–133
Modélise l’activité neuronale par la logique propositionnelle, fournissant la première théorie mathématique des réseaux de neurones artificiels.
1948 article de revue Théorie Primitive
Claude E. Shannon · Bell System Technical Journal 27(3): 379–423; 27(4): 623–656
Définit l’entropie informationnelle et la capacité d’un canal, fondant la théorie de l’information et offrant les fondements probabilistes qui irrigueront ensuite l’IA.
1950 article de revue Théorie Primitive
Alan M. Turing · Mind LIX(236): 433–460
Propose le jeu de l’imitation (test de Turing) comme définition opérationnelle de l’intelligence machine, posant la question de l’IA pour les soixante-dix années à venir.
1955 article de revue Théorie Primitive
John McCarthy, Marvin L. Minsky, Nathaniel Rochester, Claude E. Shannon · Dartmouth College, 1955; republished in AI Magazine 27(4): 12–14 (2006)
Forge le terme « intelligence artificielle » et définit le programme de recherche qui institue l’IA comme discipline académique.
1956 article de revue Naissance de l'IA
Allen Newell, Herbert A. Simon · IRE Transactions on Information Theory IT-2(3): 61–79
Implémente le premier programme de raisonnement heuristique, démontrant qu’une machine peut imiter les stratégies humaines de résolution de problèmes et introduisant la notion de « système complexe de traitement de l’information ».
1958 article de revue Naissance de l'IA
Newell, A., Shaw, J. C., Simon, H. A. · Psychological Review 65(3): 151–166
Décrit la résolution humaine de problèmes comme une recherche heuristique dans un espace d’états symboliques, l’analyse qui sous-tend le General Problem Solver et la conception de l’esprit comme traitement de l’information.
1958 article de revue Naissance de l'IA
Frank Rosenblatt · Psychological Review 65(6): 386–408
Introduit le premier neurone linéaire à seuil entraînable, fondant la lignée connexionniste qui mènera à l’apprentissage profond moderne.
1958 article de conférence Naissance de l'IA
John McCarthy · Proceedings of the Symposium on Mechanisation of Thought Processes (NPL Teddington), 75–91. London: HMSO
Propose l’« advice taker », un programme capable de tirer des conclusions à partir d’un réservoir formel de connaissances de sens commun, jetant les bases conceptuelles de la représentation des connaissances et du raisonnement.
1959 article de revue Naissance de l'IA
Arthur L. Samuel · IBM Journal of Research and Development 3(3): 210–229
Démontre qu’un programme de dames s’améliore par auto-affrontement, pionnier de l’étude de l’apprentissage automatique et de l’auto-amélioration de style alpha-bêta.
1959 article de revue Naissance de l'IA
Gelernter, H. · Information and Control 2(1): 80–89
Gelernter traite de la manière dont une machine peut manipuler efficacement des systèmes formels dont les prédicats présentent une forte symétrie, et énonce en réponse un théorème et une règle de symétrie syntaxique. Ce travail accompagne la machine à démontrer des théorèmes de géométrie qu’il construisait alors chez IBM, laquelle démontra au début du printemps 1959 son premier théorème de géométrie plane euclidienne.
1960 article de conférence Naissance de l'IA
Bernard Widrow, Marcian E. Hoff · IRE WESCON Convention Record, Part 4, 96–104
Introduit la règle LMS (Adaline), première règle d’apprentissage largement répandue par descente de gradient pour les réseaux linéaires adaptatifs.
1960 article de revue Naissance de l'IA
McCarthy, J. · Communications of the ACM 3(4): 184–195
Introduit les expressions symboliques, les fonctions récursives sur celles-ci et l’eval qui permet à un langage de s’interpréter lui-même, une conception devenue Lisp et le langage de travail de l’IA symbolique.
1961 rapport technique Naissance de l'IA
Rosenblatt, F. · Cornell Aeronautical Laboratory technical report (DTIC AD0256582)
Rassemble les travaux sur le perceptron en une théorie complète des réseaux probabilistes en couches, énonçant à la fois ce que de telles machines peuvent apprendre et où la forme à une seule couche s’arrête.
1966 article de revue Naissance de l'IA
Weizenbaum, J. · Communications of the ACM 9(1): 36–45
Construit un programme apparemment conversationnel à partir de correspondances de motifs et de règles de réécriture, son auteur soulignant aussitôt la compréhension que les lecteurs lui prêtent et qu’il n’a pas.
1982 article de revue Hiver de l'IA
John J. Hopfield · Proceedings of the National Academy of Sciences 79(8): 2554–2558
Introduit le réseau de mémoire associative de Hopfield, reliant le calcul neuronal aux paysages d’énergie de la physique statistique et ravivant l’intérêt pour les réseaux de neurones au cœur du premier hiver de l’IA.
1982 article de revue Hiver de l'IA
McDermott, J. · Artificial Intelligence 19(1): 39–88
Documente un système à règles de production qui configurait chaque jour les commandes d’ordinateurs de DEC, l’un des rares systèmes experts à avoir tenu en production courante et dont le rendement était chiffrable.
1986 article de revue Hiver de l'IA
Judea Pearl · Artificial Intelligence 29(3): 241–288
Systématise les opérations de fusion, propagation et structuration sur les réseaux de croyance, fournissant les fondations algorithmiques de l’inférence dans les réseaux bayésiens.
1986 article de revue Hiver de l'IA
David E. Rumelhart, Geoffrey E. Hinton, Ronald J. Williams · Nature 323(6088): 533–536
Vulgarise l’algorithme de rétropropagation pour l’entraînement des réseaux de neurones multicouches, rendant l’apprentissage profond pratiquement réalisable.
1988 article de revue Hiver de l'IA
Richard S. Sutton · Machine Learning 3(1): 9–44
Systématise l’apprentissage par différences temporelles (TD), qui devient l’un des algorithmes cardinaux de l’apprentissage par renforcement moderne.
1990 article de revue Hiver de l'IA
Jeffrey L. Elman · Cognitive Science 14(2): 179–211
Introduit le réseau récurrent simple d’Elman, montrant qu’un réseau de neurones peut apprendre une structure temporelle et ouvrant la voie aux futurs modèles de séquences.
1995 article de revue Le Renouveau
Corinna Cortes, Vladimir Vapnik · Machine Learning 20(3): 273–297
Introduit la machine à vecteurs de support à marge souple, classificateur canonique à marge maximale qui a défini une grande partie de l’apprentissage automatique des années 1990.
1997 article de revue Le Renouveau
Sepp Hochreiter, Jürgen Schmidhuber · Neural Computation 9(8): 1735–1780
Présente le LSTM original avec cellules mémoire, portes d’entrée et de sortie ; la porte d’oubli aujourd’hui standard fut ajoutée plus tard par Gers, Schmidhuber et Cummins.
1998 article de revue Le Renouveau
Yann LeCun, Léon Bottou, Yoshua Bengio, Patrick Haffner · Proceedings of the IEEE 86(11): 2278–2324
Introduit LeNet-5, réseau convolutif canonique qui atteint une reconnaissance de chiffres manuscrits de qualité industrielle et établit la matrice des CNN.
2006 article de revue Le Renouveau
Geoffrey E. Hinton, Ruslan R. Salakhutdinov · Science 313(5786): 504–507
Introduit un autoencodeur profond qui reconstruit des données de haute dimension bien plus fidèlement que la PCA, allumant la première étincelle du renouveau de l’apprentissage profond.
2006 article de revue Le Renouveau
Geoffrey E. Hinton, Simon Osindero, Yee-Whye Teh · Neural Computation 18(7): 1527–1554
Introduit les réseaux de croyance profonds entraînés par un algorithme glouton couche par couche, démontrant pour la première fois qu’un modèle profond peut être entraîné efficacement.
2009 article de conférence Le Renouveau
Raina, R., Madhavan, A., Ng, A. Y. · Proceedings of the 26th Annual International Conference on Machine Learning (ICML 2009): 873–880
Porte l’entraînement de modèles profonds non supervisés sur processeurs graphiques avec des gains d’un ordre de grandeur, banalisant la voie matérielle sur laquelle l’apprentissage profond passera à l’échelle la décennie suivante.
2013 article de conférence Le Renouveau
Volodymyr Mnih, Koray Kavukcuoglu, David Silver, Alex Graves, Ioannis Antonoglou, Daan Wierstra, Martin Riedmiller · NeurIPS 2013 Deep Learning Workshop (arXiv:1312.5602)
Combine le Q-learning avec un réseau convolutif pour jouer à des jeux Atari à partir des pixels bruts à un niveau humain, fondant l’apprentissage par renforcement profond.
2013 article de conférence Le Renouveau
Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean · ICLR 2013 Workshop (arXiv:1301.3781)
Introduit les architectures skip-gram et CBOW qui produisent des plongements de mots denses, lançant l’ère des vecteurs lexicaux pré-entraînés.
2013 article de conférence Le Renouveau
Diederik P. Kingma, Max Welling · ICLR 2014 (arXiv:1312.6114)
Introduit l’autoencodeur variationnel, conjuguant inférence variationnelle et modélisation générative profonde, et offrant le premier modèle à variables latentes profondes largement adopté.
2014 article de conférence Le Renouveau
Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio · ICLR 2015 (arXiv:1409.0473)
Introduit l’attention additive (Bahdanau) pour la traduction automatique neuronale, montrant qu’un alignement souple permet au décodeur de se concentrer sur les jetons source pertinents et inspirant directement le Transformer.
2014 article de conférence Le Renouveau
Ian J. Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, Yoshua Bengio · NeurIPS 2014 (arXiv:1406.2661)
Pose la modélisation générative comme un jeu min-max à deux joueurs entre un générateur et un discriminateur, inaugurant une nouvelle famille de modèles génératifs implicites.
2014 article de revue Le Renouveau
Nitish Srivastava, Geoffrey E. Hinton, Alex Krizhevsky, Ilya Sutskever, Ruslan Salakhutdinov · Journal of Machine Learning Research 15(56): 1929–1958
Introduit le dropout, technique stochastique simple de régularisation qui devient un réflexe par défaut dans les pipelines d’entraînement en apprentissage profond.
2015 article de conférence Le Renouveau
Sergey Ioffe, Christian Szegedy · ICML 2015 (arXiv:1502.03167)
Introduit la normalisation par lots, qui normalise les entrées d’une couche sur un mini-lot afin de stabiliser et d’accélérer considérablement l’entraînement des réseaux profonds.
2015 prépublication Le Renouveau
Sohl-Dickstein, J., Weiss, E. A., Maheswaranathan, N., Ganguli, S. · arXiv:1503.03585
Formule la modélisation générative comme l’inversion d’un processus de bruitage progressif, la formulation sur laquelle reposent les modèles de diffusion ultérieurs.
2015 article de conférence Le Renouveau
Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun · CVPR 2016 (arXiv:1512.03385)
Introduit les connexions résiduelles, permettant d’entraîner efficacement des réseaux de plusieurs centaines de couches et remportant ImageNet 2015 avec une marge importante.
2016 article de revue Le Renouveau
Sennrich, R., Haddow, B., Birch, A. · Proceedings of ACL 2016: 1715–1725 (arXiv:1508.07909)
Découpe les mots en unités de sous-mots dérivées des fréquences, si bien qu’un vocabulaire fixe peut tout épeler, schéma de segmentation dont la plupart des modèles de langue ultérieurs ont hérité.
2016 article de conférence Le Renouveau
Han, S., Mao, H., Dally, W. J. · ICLR 2016 (arXiv:1510.00149)
Réunit élagage, quantification apprise et codage de Huffman en une seule chaîne qui réduit un réseau d’un ordre de grandeur sans guère perdre en exactitude, énonçant tôt que la précision numérique est une variable de conception.
2016 article de conférence Le Renouveau
Aäron van den Oord, Sander Dieleman, Heiga Zen, Karen Simonyan, Oriol Vinyals, Alex Graves, Nal Kalchbrenner, Andrew Senior, Koray Kavukcuoglu · NeurIPS 2016 (arXiv:1609.03499)
Introduit un modèle autorégressif convolutif causal dilaté générant des formes d’onde audio brutes, améliorant spectaculairement le naturel de la synthèse vocale.
2017 prépublication Le Renouveau
John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, Oleg Klimov · arXiv:1707.06347
Introduit PPO, méthode de gradient de politique du premier ordre, simple et stable, qui devient l’algorithme d’optimisation de politique par défaut de l’apprentissage par renforcement moderne.
2017 prépublication Le Renouveau
Shazeer, N. et al. · arXiv:1701.06538
Achemine chaque jeton vers quelques experts seulement parmi beaucoup, ce qui laisse le nombre de paramètres d’un réseau croître bien au-delà du calcul dépensé pour une entrée donnée.
2017 article de conférence Le Renouveau
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin · NeurIPS 2017 (arXiv:1706.03762)
Introduit le Transformer, architecture purement fondée sur l’attention qui délaisse récurrence et convolutions et surpasse la qualité antérieure de transduction de séquences en ne mobilisant qu’une fraction du temps d’entraînement.
2018 article de revue Le Renouveau
Kudo, T., Richardson, J. · EMNLP 2018, System Demonstrations: 66–71 (arXiv:1808.06226)
Apprend un segmenteur en sous-mots directement à partir du texte brut, sans pré-segmentation propre à une langue, si bien qu’une même chaîne convient aux langues qui ne séparent pas les mots par des espaces.
2018 article de conférence Le Renouveau
Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova · NAACL 2019 (arXiv:1810.04805)
Introduit un Transformer bidirectionnel pré-entraîné par modélisation de langage masquée et prédiction de la phrase suivante, établissant un nouvel état de l’art sur les benchmarks de TAL.
2019 article de revue Le Renouveau
Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, Peter J. Liu · Journal of Machine Learning Research 21(140): 1–67 (arXiv:1910.10683)
Reformule chaque tâche de TAL sous la forme texte-à-texte, compare systématiquement les choix de transfert et établit une recette de référence pour les modèles pré-entraînés à grande échelle.
2020 article de conférence L'Ère des LLM
Jonathan Ho, Ajay Jain, Pieter Abbeel · NeurIPS 2020 (arXiv:2006.11239)
Reformule la diffusion comme un objectif d’entraînement variationnel de débruitage, rétablissant la qualité de la génération d’images à l’état de l’art et inaugurant l’ère des modèles de diffusion.
2021 article de revue L'Ère des LLM
Narayanan, D. et al. · SC 2021: 1–15 (arXiv:2104.04473)
Compose parallélisme de tenseurs, de pipeline et de données en un seul ordonnancement et mesure le débit d’entraînement d’un modèle de langue sur des milliers de GPU.
2021 prépublication L'Ère des LLM
Hu, E. J. et al. · arXiv:2106.09685
Gèle les poids préentraînés et entraîne à la place une paire de matrices de faible rang, ramenant le coût d’adaptation d’un grand modèle à une fraction du réglage fin complet.
2021 article de conférence L'Ère des LLM
Aditya Ramesh, Mikhail Pavlov, Gabriel Goh, Scott Gray, Chelsea Voss, Alec Radford, Mark Chen, Ilya Sutskever · ICML 2021 (arXiv:2102.12092)
Montre qu’un Transformer autorégressif de 12 milliards de paramètres peut générer des images diversifiées et de haute fidélité directement à partir de légendes textuelles, déclenchant l’essor de la recherche texte-à-image.
2021 article de conférence L'Ère des LLM
Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, Ilya Sutskever · ICML 2021 (arXiv:2103.00020)
Entraîne des encodeurs d’image sur des paires image-texte à l’échelle du web pour obtenir une solide classification d’images en zéro-shot, fournissant la tour visuelle de nombreux systèmes multimodaux ultérieurs.
2021 prépublication L'Ère des LLM
Chen, M. et al. · arXiv:2107.03374
Présente un modèle GPT affiné sur du code ainsi qu’un jeu d’épreuves noté sur la correction fonctionnelle, faisant de la programmation une capacité mesurable plutôt qu’un genre de génération de texte, et en discute les effets sur la sûreté et le travail.
2021 article de conférence L'Ère des LLM
Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, Björn Ommer · CVPR 2022 (arXiv:2112.10752)
Transfère la diffusion dans un espace latent perceptuel, permettant la génération texte-à-image haute résolution sur GPU grand public et démocratisant la synthèse d’images.
2022 article de conférence L'Ère des LLM
Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed H. Chi, Quoc V. Le, Denny Zhou · NeurIPS 2022 (arXiv:2201.11903)
Montre qu’inviter un modèle de langage à produire des étapes de raisonnement intermédiaires améliore considérablement ses performances sur des benchmarks de raisonnement arithmétique, de sens commun et symbolique.
2022 article de conférence L'Ère des LLM
Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, Paul Christiano, Jan Leike, Ryan Lowe · NeurIPS 2022 (arXiv:2203.02155)
Applique l’apprentissage par renforcement à partir de retours humains à grande échelle pour aligner les sorties de GPT-3 sur l’intention humaine, établissant la RLHF comme recette canonique d’alignement.
2022 rapport technique L'Ère des LLM
Yuntao Bai et al. · Anthropic Technical Report 2022 (arXiv:2212.08073)
Introduit la RLAIF, dans laquelle un modèle critique et révise ses propres sorties au regard d’une constitution écrite, réduisant le recours aux annotations humaines de nuisibilité pour l’alignement.
2023 rapport technique L'Ère des LLM
Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, Aurelien Rodriguez, Armand Joulin, Edouard Grave, Guillaume Lample · Meta AI Technical Report 2023 (arXiv:2302.13971)
Publie la famille LLaMA de modèles de fondation ouverts, montrant que des modèles relativement petits et bien entraînés peuvent rivaliser avec des modèles fermés bien plus grands, accélérant le mouvement des poids ouverts.
2023 article de revue L'Ère des LLM
Wang, L. et al. · Frontiers of Computer Science 18(6), 2024 (arXiv:2308.11432)
Ordonne des travaux épars sur les agents selon la construction, l’évaluation et l’application, et marque le moment où le terme passe d’un assortiment de pratiques à un domaine constitué.
2023 prépublication L'Ère des LLM
Dettmers, T. et al. · arXiv:2305.14314
Rétropropage à travers un modèle de base quantifié sur 4 bits vers des adaptateurs de faible rang, mettant le réglage fin d’un grand modèle à la portée d’un seul GPU.
2023 article de conférence L'Ère des LLM
Frantar, E., Ashkboos, S., Hoefler, T., Alistarh, D. · ICLR 2023 (arXiv:2210.17323)
Quantifie les poids d’un grand modèle de langue après l’entraînement, couche par couche et en une seule passe, de sorte qu’il puisse être servi à moindre précision sans réentraînement.
2023 article de conférence L'Ère des LLM
Leviathan, Y., Kalman, M., Matias, Y. · ICML 2023 (arXiv:2211.17192)
Fait proposer plusieurs jetons par un petit modèle brouillon que le modèle cible vérifie en parallèle, réduisant la latence sans changer la distribution de sortie.
2023 article de revue L'Ère des LLM
Kwon, W. et al. · SOSP 2023: 611–626 (arXiv:2309.06180)
Gère le cache d’attention en pages de taille fixe comme un système d’exploitation gère la mémoire, si bien qu’un serveur tient bien plus de requêtes simultanées sans réserver le pire cas pour chacune.
2023 prépublication L'Ère des LLM
Gu, A. et Dao, T. · arXiv:2312.00752
Propose Mamba, une architecture à espace d’état sélectif qui égale ou dépasse l’attention Transformer sur le langage et d’autres modalités avec une complexité temporelle linéaire — l’une des architectures post-Transformer les plus influentes de 2023.