1931 artículo de revista Teoría Temprana
Gödel, K. · Monatshefte für Mathematik und Physik 38(1): 173–198
Demuestra que todo sistema formal consistente capaz de expresar la aritmética contiene enunciados verdaderos que no puede probar, fijando el límite que más tarde enmarcaría lo que el cálculo y el razonamiento mecánico pueden decidir.
1936 artículo de revista Teoría Temprana
Alan M. Turing · Proceedings of the London Mathematical Society s2-42(1): 230–265
Introduce la máquina de Turing universal y demuestra la indecidibilidad del Entscheidungsproblem, sentando las bases teóricas de la ciencia de la computación.
1936 artículo de revista Teoría Temprana
Church, A. · American Journal of Mathematics 58(2): 345
Define la calculabilidad efectiva mediante el λ-cálculo y exhibe un problema que ningún procedimiento de ese tipo puede decidir, alcanzando los límites del cálculo con independencia de Turing.
1943 artículo de revista Teoría Temprana
Warren S. McCulloch, Walter Pitts · Bulletin of Mathematical Biophysics 5(4): 115–133
Modela la actividad neural mediante lógica proposicional, ofreciendo la primera teoría matemática de las redes neuronales artificiales.
1948 artículo de revista Teoría Temprana
Claude E. Shannon · Bell System Technical Journal 27(3): 379–423; 27(4): 623–656
Define la entropía de la información y la capacidad del canal, fundando la teoría de la información y proporcionando los fundamentos probabilísticos que la IA adoptaría más tarde.
1950 artículo de revista Teoría Temprana
A. M. Turing · Mind LIX(236): 433–460
Propone el juego de la imitación (prueba de Turing) como definición operativa de la inteligencia de las máquinas, encuadrando la pregunta sobre la IA durante los setenta años siguientes.
1955 artículo de revista Teoría Temprana
John McCarthy, Marvin L. Minsky, Nathaniel Rochester, Claude E. Shannon · Dartmouth College, 1955; republished in AI Magazine 27(4): 12–14 (2006)
Acuña el término «inteligencia artificial» y propone la agenda de investigación que fundó la IA como disciplina académica.
1956 artículo de revista Nacimiento de la IA
Allen Newell, Herbert A. Simon · IRE Transactions on Information Theory IT-2(3): 61–79
Implementa el primer programa de razonamiento heurístico, demostrando que las máquinas pueden imitar estrategias humanas de resolución de problemas e introduciendo el concepto de «sistema complejo de procesamiento de información».
1958 artículo de revista Nacimiento de la IA
Newell, A., Shaw, J. C., Simon, H. A. · Psychological Review 65(3): 151–166
Describe la resolución humana de problemas como búsqueda heurística en un espacio de estados simbólicos, el análisis que sustenta el General Problem Solver y la concepción de la mente como procesamiento de información.
1958 artículo de revista Nacimiento de la IA
Frank Rosenblatt · Psychological Review 65(6): 386–408
Introduce la primera neurona lineal con umbral entrenable, fundando la línea conexionista que conduce al aprendizaje profundo moderno.
1958 artículo de conferencia Nacimiento de la IA
John McCarthy · Proceedings of the Symposium on Mechanisation of Thought Processes (NPL Teddington), 75–91. London: HMSO
Propone el «advice taker», un programa capaz de extraer conclusiones a partir de un depósito formal de conocimiento de sentido común, sentando las bases conceptuales de la representación y el razonamiento.
1959 artículo de revista Nacimiento de la IA
Arthur L. Samuel · IBM Journal of Research and Development 3(3): 210–229
Demuestra un programa de damas que mejora mediante auto-juego, siendo pionero en el estudio del aprendizaje automático y del auto-mejora estilo alfa-beta.
1959 artículo de revista Nacimiento de la IA
Gelernter, H. · Information and Control 2(1): 80–89
Gelernter aborda cómo una máquina puede manipular con eficiencia sistemas formales cuyos predicados presentan una fuerte simetría, y enuncia como solución un teorema y una regla de simetría sintáctica. El trabajo acompaña a la máquina de demostración de teoremas de geometría que construía entonces en IBM, la cual a comienzos de la primavera de 1959 demostró su primer teorema de geometría plana euclidiana.
1960 artículo de conferencia Nacimiento de la IA
Bernard Widrow, Marcian E. Hoff · IRE WESCON Convention Record, Part 4, 96–104
Introduce la regla LMS (Adaline), la primera regla de aprendizaje por descenso de gradiente ampliamente utilizada para redes lineales adaptativas.
1960 artículo de revista Nacimiento de la IA
McCarthy, J. · Communications of the ACM 3(4): 184–195
Introduce las expresiones simbólicas, las funciones recursivas sobre ellas y el eval que permite a un lenguaje interpretarse a sí mismo, el diseño que se convirtió en Lisp y en la lengua de trabajo de la IA simbólica.
1961 informe técnico Nacimiento de la IA
Rosenblatt, F. · Cornell Aeronautical Laboratory technical report (DTIC AD0256582)
Reúne el trabajo sobre el perceptrón en una teoría completa de las redes probabilísticas por capas, enunciando qué pueden aprender tales máquinas y dónde se detiene la forma de una sola capa.
1966 artículo de revista Nacimiento de la IA
Weizenbaum, J. · Communications of the ACM 9(1): 36–45
Construye un programa aparentemente conversacional a partir de coincidencia de patrones y reglas de reescritura, y su autor señala de inmediato cuánta comprensión le atribuyen los lectores sin que la tenga.
1982 artículo de revista Invierno de la IA
John J. Hopfield · Proceedings of the National Academy of Sciences 79(8): 2554–2558
Introduce la red de memoria asociativa de Hopfield, vinculando el cómputo neuronal con los paisajes de energía de la física estadística y reavivando el interés por las redes neuronales durante el inicio del invierno de la IA.
1982 artículo de revista Invierno de la IA
McDermott, J. · Artificial Intelligence 19(1): 39–88
Documenta un sistema de reglas de producción que configuraba a diario los pedidos de computadoras de DEC, uno de los pocos sistemas expertos que resistió el uso corriente y cuyo rendimiento podía calcularse.
1986 artículo de revista Invierno de la IA
Judea Pearl · Artificial Intelligence 29(3): 241–288
Sistematiza las operaciones de fusión, propagación y estructuración en redes de creencia, proporcionando los fundamentos algorítmicos de la inferencia en redes bayesianas.
1986 artículo de revista Invierno de la IA
David E. Rumelhart, Geoffrey E. Hinton, Ronald J. Williams · Nature 323(6088): 533–536
Populariza el algoritmo de retropropagación para entrenar redes neuronales multicapa, haciendo posible el aprendizaje profundo práctico.
1988 artículo de revista Invierno de la IA
Richard S. Sutton · Machine Learning 3(1): 9–44
Sistematiza el aprendizaje por diferencias temporales (TD), convirtiéndose en uno de los algoritmos centrales del aprendizaje por refuerzo moderno.
1990 artículo de revista Invierno de la IA
Jeffrey L. Elman · Cognitive Science 14(2): 179–211
Introduce la red recurrente simple de Elman, mostrando que las redes neuronales pueden aprender estructura temporal y abriendo el camino a los modelos de secuencias posteriores.
1995 artículo de revista El Renacimiento
Corinna Cortes, Vladimir Vapnik · Machine Learning 20(3): 273–297
Introduce la máquina de vectores de soporte con margen blando, el clasificador canónico de margen máximo que definió gran parte del aprendizaje automático de los años noventa.
1997 artículo de revista El Renacimiento
Sepp Hochreiter, Jürgen Schmidhuber · Neural Computation 9(8): 1735–1780
Introduce la LSTM original con celdas de memoria y compuertas de entrada y salida; la compuerta de olvido hoy estándar fue añadida después por Gers, Schmidhuber y Cummins.
1998 artículo de revista El Renacimiento
Yann LeCun, Léon Bottou, Yoshua Bengio, Patrick Haffner · Proceedings of the IEEE 86(11): 2278–2324
Introduce LeNet-5, la red neuronal convolutiva canónica que alcanza reconocimiento de dígitos manuscritos de calidad productiva y establece la plantilla de las CNN.
2006 artículo de revista El Renacimiento
Geoffrey E. Hinton, Ruslan R. Salakhutdinov · Science 313(5786): 504–507
Introduce un autocodificador profundo que reconstruye datos de alta dimensión con una fidelidad muy superior a PCA, encendiendo la primera chispa de la revitalización del aprendizaje profundo.
2006 artículo de revista El Renacimiento
Geoffrey E. Hinton, Simon Osindero, Yee-Whye Teh · Neural Computation 18(7): 1527–1554
Introduce las redes de creencia profundas entrenadas mediante un algoritmo codicioso capa a capa, demostrando por primera vez que los modelos profundos pueden entrenarse eficazmente.
2009 artículo de conferencia El Renacimiento
Raina, R., Madhavan, A., Ng, A. Y. · Proceedings of the 26th Annual International Conference on Machine Learning (ICML 2009): 873–880
Traslada el entrenamiento de modelos profundos no supervisados a procesadores gráficos con aceleraciones de un orden de magnitud, y vuelve habitual la vía de hardware por la que el aprendizaje profundo escaló en la década siguiente.
2013 artículo de conferencia El Renacimiento
Volodymyr Mnih, Koray Kavukcuoglu, David Silver, Alex Graves, Ioannis Antonoglou, Daan Wierstra, Martin Riedmiller · NeurIPS 2013 Deep Learning Workshop (arXiv:1312.5602)
Combina Q-learning con una red convolutiva para jugar a juegos de Atari a partir de píxeles brutos con rendimiento humano, fundando el aprendizaje por refuerzo profundo.
2013 artículo de conferencia El Renacimiento
Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean · ICLR 2013 Workshop (arXiv:1301.3781)
Introduce las arquitecturas skip-gram y CBOW que producen embeddings densos de palabras, inaugurando la era de los vectores de palabras preentrenados.
2013 artículo de conferencia El Renacimiento
Diederik P. Kingma, Max Welling · ICLR 2014 (arXiv:1312.6114)
Introduce el autoencoder variacional, combinando la inferencia variacional con el modelado generativo profundo y aportando el primer modelo profundo de variables latentes ampliamente adoptado.
2014 artículo de conferencia El Renacimiento
Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio · ICLR 2015 (arXiv:1409.0473)
Introduce la atención aditiva (Bahdanau) para la traducción automática neuronal, demostrando que el alineamiento suave permite al decodificador enfocarse en los tokens relevantes de la fuente e inspirando directamente el Transformer.
2014 artículo de conferencia El Renacimiento
Ian J. Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, Yoshua Bengio · NeurIPS 2014 (arXiv:1406.2661)
Enmarca el modelado generativo como un juego de suma mínima entre un generador y un discriminador, dando inicio a una nueva familia de modelos generativos implícitos.
2014 artículo de revista El Renacimiento
Nitish Srivastava, Geoffrey Hinton, Alex Krizhevsky, Ilya Sutskever, Ruslan Salakhutdinov · Journal of Machine Learning Research 15(56): 1929–1958
Introduce dropout, una técnica sencilla de regularización estocástica que se convierte en un elemento estándar de los pipelines de entrenamiento de aprendizaje profundo.
2015 artículo de conferencia El Renacimiento
Sergey Ioffe, Christian Szegedy · ICML 2015 (arXiv:1502.03167)
Introduce la normalización por lotes, normalizando las entradas de capa en cada minibatch para estabilizar y acelerar drásticamente el entrenamiento de redes profundas.
2015 preprint El Renacimiento
Sohl-Dickstein, J., Weiss, E. A., Maheswaranathan, N., Ganguli, S. · arXiv:1503.03585
Formula el modelado generativo como la inversión de un proceso de ruido gradual, la formulación sobre la que se apoyan los modelos de difusión posteriores.
2015 artículo de conferencia El Renacimiento
Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun · CVPR 2016 (arXiv:1512.03385)
Introduce las conexiones residuales, permitiendo entrenar eficazmente redes de cientos de capas y ganando ImageNet 2015 por un amplio margen.
2016 artículo de revista El Renacimiento
Sennrich, R., Haddow, B., Birch, A. · Proceedings of ACL 2016: 1715–1725 (arXiv:1508.07909)
Divide las palabras en unidades de subpalabra derivadas de las frecuencias, de modo que un vocabulario fijo pueda deletrear cualquier cosa, el esquema de segmentación que heredaron la mayoría de los modelos de lenguaje posteriores.
2016 artículo de conferencia El Renacimiento
Han, S., Mao, H., Dally, W. J. · ICLR 2016 (arXiv:1510.00149)
Reúne poda, cuantización entrenada y codificación de Huffman en una sola cadena que reduce una red en un orden de magnitud casi sin pérdida de exactitud, y afirma pronto que la precisión numérica es una variable de diseño.
2016 artículo de conferencia El Renacimiento
Aäron van den Oord, Sander Dieleman, Heiga Zen, Karen Simonyan, Oriol Vinyals, Alex Graves, Nal Kalchbrenner, Andrew Senior, Koray Kavukcuoglu · NeurIPS 2016 (arXiv:1609.03499)
Introduce un modelo autorregresivo convolutivo causal dilatado que genera formas de onda de audio en crudo, mejorando notablemente la naturalidad de la síntesis de voz.
2017 preprint El Renacimiento
John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, Oleg Klimov · arXiv:1707.06347
Introduce PPO, un método de gradiente de política de primer orden simple y estable que se convierte en el algoritmo de optimización de política por defecto en el aprendizaje por refuerzo moderno.
2017 preprint El Renacimiento
Shazeer, N. et al. · arXiv:1701.06538
Encamina cada token solo hacia unos pocos expertos entre muchos, y deja que el número de parámetros de una red crezca mucho más allá del cálculo gastado en una sola entrada.
2017 artículo de conferencia El Renacimiento
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin · NeurIPS 2017 (arXiv:1706.03762)
Introduce el Transformer, una arquitectura basada únicamente en atención que prescinde de recurrencia y convoluciones y supera la calidad previa en transducción de secuencias con una fracción del tiempo de entrenamiento.
2018 artículo de revista El Renacimiento
Kudo, T., Richardson, J. · EMNLP 2018, System Demonstrations: 66–71 (arXiv:1808.06226)
Entrena un segmentador de subpalabras directamente a partir de texto en bruto, sin presegmentación propia de una lengua, de modo que la misma cadena sirva para lenguas que no separan palabras con espacios.
2018 artículo de conferencia El Renacimiento
Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova · NAACL 2019 (arXiv:1810.04805)
Introduce un Transformer bidireccional preentrenado con modelado de lenguaje enmascarado y predicción de la siguiente oración, estableciendo un nuevo estado del arte en los benchmarks de PLN.
2019 artículo de revista El Renacimiento
Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, Peter J. Liu · Journal of Machine Learning Research 21(140): 1–67 (arXiv:1910.10683)
Reformula toda tarea de PLN como una conversión texto a texto, realiza ablaciones sistemáticas de las decisiones de aprendizaje por transferencia y establece una receta de referencia para modelos preentrenados a gran escala.
2020 artículo de conferencia La Era de los LLM
Jonathan Ho, Ajay Jain, Pieter Abbeel · NeurIPS 2020 (arXiv:2006.11239)
Reformula la difusión como un objetivo variacional de entrenamiento por eliminación de ruido, restaurando la calidad de la generación de imágenes al estado del arte e inaugurando la era de los modelos de difusión.
2021 artículo de revista La Era de los LLM
Narayanan, D. et al. · SC 2021: 1–15 (arXiv:2104.04473)
Compone paralelismo de tensores, de tubería y de datos en una sola planificación y mide el rendimiento del entrenamiento de un modelo de lenguaje en miles de GPU.
2021 preprint La Era de los LLM
Hu, E. J. et al. · arXiv:2106.09685
Congela los pesos preentrenados y entrena en su lugar un par de matrices de rango bajo, reduciendo el coste de adaptar un modelo grande a una fracción del ajuste fino completo.
2021 artículo de conferencia La Era de los LLM
Aditya Ramesh, Mikhail Pavlov, Gabriel Goh, Scott Gray, Chelsea Voss, Alec Radford, Mark Chen, Ilya Sutskever · ICML 2021 (arXiv:2102.12092)
Demuestra que un Transformer autorregresivo de 12B parámetros puede generar imágenes diversas y de alta fidelidad directamente a partir de descripciones textuales, encendiendo la investigación en texto a imagen.
2021 artículo de conferencia La Era de los LLM
Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, Ilya Sutskever · ICML 2021 (arXiv:2103.00020)
Entrena codificadores de imagen sobre pares imagen-texto a escala web para lograr una sólida clasificación zero-shot de imágenes, proporcionando la torre visual para muchos sistemas multimodales posteriores.
2021 preprint La Era de los LLM
Chen, M. et al. · arXiv:2107.03374
Presenta un modelo GPT afinado en código junto con un banco de pruebas puntuado por corrección funcional, convirtiendo la programación en una capacidad medible en lugar de un género de generación de texto, y discute sus efectos sobre la seguridad y el trabajo.
2021 artículo de conferencia La Era de los LLM
Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, Björn Ommer · CVPR 2022 (arXiv:2112.10752)
Traslada la difusión a un espacio latente perceptual, permitiendo la generación de imágenes de alta resolución a partir de texto en GPUs de consumo y democratizando la síntesis de imágenes.
2022 artículo de conferencia La Era de los LLM
Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed H. Chi, Quoc V. Le, Denny Zhou · NeurIPS 2022 (arXiv:2201.11903)
Muestra que inducir al modelo de lenguaje a generar pasos intermedios de razonamiento mejora notablemente su rendimiento en benchmarks de razonamiento aritmético, de sentido común y simbólico.
2022 artículo de conferencia La Era de los LLM
Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, Paul Christiano, Jan Leike, Ryan Lowe · NeurIPS 2022 (arXiv:2203.02155)
Aplica el aprendizaje por refuerzo con retroalimentación humana a escala para alinear las salidas de GPT-3 con la intención humana, consolidando RLHF como receta canónica de alineación.
2022 informe técnico La Era de los LLM
Yuntao Bai et al. · Anthropic Technical Report 2022 (arXiv:2212.08073)
Introduce RLAIF, en el que un modelo critica y revisa sus propias salidas frente a una constitución escrita, reduciendo la dependencia de etiquetas humanas de daño para la alineación.
2023 informe técnico La Era de los LLM
Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, Aurelien Rodriguez, Armand Joulin, Edouard Grave, Guillaume Lample · Meta AI Technical Report 2023 (arXiv:2302.13971)
Publica la familia LLaMA de modelos fundacionales abiertos, mostrando que modelos relativamente pequeños y bien entrenados pueden rivalizar con otros mucho mayores y cerrados, acelerando el movimiento de pesos abiertos.
2023 artículo de revista La Era de los LLM
Wang, L. et al. · Frontiers of Computer Science 18(6), 2024 (arXiv:2308.11432)
Ordena trabajos dispersos sobre agentes según construcción, evaluación y aplicación, y marca el momento en que el término pasa de un conjunto de prácticas a un campo de investigación.
2023 preprint La Era de los LLM
Dettmers, T. et al. · arXiv:2305.14314
Retropropaga a través de un modelo base cuantizado a 4 bits hacia adaptadores de rango bajo, y pone el ajuste fino de un modelo grande al alcance de una sola GPU.
2023 artículo de conferencia La Era de los LLM
Frantar, E., Ashkboos, S., Hoefler, T., Alistarh, D. · ICLR 2023 (arXiv:2210.17323)
Cuantiza los pesos de un gran modelo de lenguaje tras el entrenamiento, capa por capa y en una sola pasada, de modo que pueda servirse con menor precisión sin reentrenarlo.
2023 artículo de conferencia La Era de los LLM
Leviathan, Y., Kalman, M., Matias, Y. · ICML 2023 (arXiv:2211.17192)
Hace que un pequeño modelo borrador proponga varios tokens que el modelo objetivo verifica en paralelo, reduciendo la latencia sin alterar la distribución de salida.
2023 artículo de revista La Era de los LLM
Kwon, W. et al. · SOSP 2023: 611–626 (arXiv:2309.06180)
Gestiona la caché de atención en páginas de tamaño fijo como un sistema operativo gestiona la memoria, de modo que un servidor sostiene muchas más peticiones simultáneas sin reservar el peor caso para cada una.
2023 preprint La Era de los LLM
Gu, A. y Dao, T. · arXiv:2312.00752
Presenta Mamba, una arquitectura de espacio de estado selectivo que iguala o supera la atención Transformer en lenguaje y otras modalidades con complejidad temporal lineal — una de las arquitecturas post-Transformer más influyentes de 2023.