1931 artigo de periódico Teoria Inicial
Gödel, K. · Monatshefte für Mathematik und Physik 38(1): 173–198
Demonstra que qualquer sistema formal consistente capaz de exprimir a aritmética contém enunciados verdadeiros que não pode provar, fixando o limite que viria a enquadrar o que o cálculo e o raciocínio mecânico conseguem decidir.
1936 artigo de periódico Teoria Inicial
A. M. Turing · Proceedings of the London Mathematical Society s2-42(1): 230–265
Introduz a máquina de Turing universal e demonstra que o Entscheidungsproblem é indecidível, lançando as bases teóricas da ciência da computação.
1936 artigo de periódico Teoria Inicial
Church, A. · American Journal of Mathematics 58(2): 345
Define a calculabilidade efetiva através do λ-cálculo e exibe um problema que nenhum procedimento desse tipo consegue decidir, alcançando os limites do cálculo independentemente de Turing.
1943 artigo de periódico Teoria Inicial
W. S. McCulloch, W. Pitts · Bulletin of Mathematical Biophysics 5(4): 115–133
Modela a atividade neural como lógica proposicional, oferecendo a primeira teoria matemática das redes neurais artificiais.
1948 artigo de periódico Teoria Inicial
C. E. Shannon · Bell System Technical Journal 27(3): 379–423; 27(4): 623–656
Define entropia informacional e capacidade de canal, fundando a teoria da informação e fornecendo as bases probabilísticas amplamente utilizadas em IA.
1950 artigo de periódico Teoria Inicial
A. M. Turing · Mind LIX(236): 433–460
Propõe o jogo da imitação (teste de Turing) como definição operacional de inteligência de máquina, enquadrando a questão da IA para os setenta anos seguintes.
1955 artigo de periódico Teoria Inicial
J. McCarthy, M. L. Minsky, N. Rochester, C. E. Shannon · Dartmouth College, 1955; republished in AI Magazine 27(4): 12–14 (2006)
Cunhou o termo «inteligência artificial» e propôs a agenda de pesquisa que fundou a IA como disciplina acadêmica.
1956 artigo de periódico Nascimento da IA
A. Newell, H. A. Simon · IRE Transactions on Information Theory IT-2(3): 61–79
Implementa o primeiro programa de raciocínio heurístico, demonstrando que máquinas podem imitar estratégias humanas de resolução de problemas e introduzindo o conceito de «sistema complexo de processamento de informação».
1958 artigo de periódico Nascimento da IA
Newell, A., Shaw, J. C., Simon, H. A. · Psychological Review 65(3): 151–166
Descreve a resolução humana de problemas como busca heurística num espaço de estados simbólicos, a análise que sustenta o General Problem Solver e a visão da mente como processamento de informação.
1958 artigo de periódico Nascimento da IA
F. Rosenblatt · Psychological Review 65(6): 386–408
Introduz o primeiro neurônio linear de limiar treinável, fundando a linhagem conexionista que conduz ao aprendizado profundo moderno.
1958 artigo de conferência Nascimento da IA
J. McCarthy · Proceedings of the Symposium on Mechanisation of Thought Processes (NPL Teddington), 75–91. London: HMSO
Propõe o «advice taker», um programa capaz de tirar conclusões a partir de um repositório formal de conhecimento de senso comum, lançando as bases conceituais da representação de conhecimento e do raciocínio.
1959 artigo de periódico Nascimento da IA
A. L. Samuel · IBM Journal of Research and Development 3(3): 210–229
Demonstra um programa de damas que melhora por meio de autoaprendizagem, inaugurando o estudo do aprendizado de máquina e do aprimoramento autônomo em estilo alfa-beta.
1959 artigo de periódico Nascimento da IA
Gelernter, H. · Information and Control 2(1): 80–89
Gelernter trata de como uma máquina pode manipular eficientemente sistemas formais cujos predicados apresentam forte simetria, e enuncia como solução um teorema e uma regra de simetria sintática. O trabalho acompanha a máquina de demonstração de teoremas de geometria que então construía na IBM, a qual, no início da primavera de 1959, demonstrou o seu primeiro teorema de geometria plana euclidiana.
1960 artigo de conferência Nascimento da IA
B. Widrow, M. E. Hoff · IRE WESCON Convention Record, Part 4, 96–104
Introduz a regra LMS (Adaline), a primeira regra de aprendizado por descida de gradiente amplamente utilizada para o treinamento de redes lineares adaptativas.
1960 artigo de periódico Nascimento da IA
McCarthy, J. · Communications of the ACM 3(4): 184–195
Introduz as expressões simbólicas, as funções recursivas sobre elas e o eval que permite a uma linguagem interpretar-se a si própria, o desenho que se tornou Lisp e a língua de trabalho da IA simbólica.
1961 relatório técnico Nascimento da IA
Rosenblatt, F. · Cornell Aeronautical Laboratory technical report (DTIC AD0256582)
Reúne o trabalho sobre o perceptrão numa teoria completa das redes probabilísticas em camadas, enunciando o que tais máquinas conseguem aprender e onde a forma de camada única para.
1966 artigo de periódico Nascimento da IA
Weizenbaum, J. · Communications of the ACM 9(1): 36–45
Constrói um programa aparentemente conversacional a partir de correspondência de padrões e regras de reescrita, e o autor assinala de imediato quanta compreensão os leitores lhe atribuem sem que a tenha.
1982 artigo de periódico Inverno da IA
J. J. Hopfield · Proceedings of the National Academy of Sciences 79(8): 2554–2558
Introduz a rede de memória associativa de Hopfield, vinculando a computação neural às paisagens de energia da física estatística e reavivando o interesse por redes neurais durante o início do inverno da IA.
1982 artigo de periódico Inverno da IA
McDermott, J. · Artificial Intelligence 19(1): 39–88
Documenta um sistema de regras de produção que configurava diariamente encomendas de computadores da DEC, um dos poucos sistemas periciais que resistiu ao uso corrente e cujo retorno era calculável.
1986 artigo de periódico Inverno da IA
J. Pearl · Artificial Intelligence 29(3): 241–288
Sistematiza operações de fusão, propagação e estruturação em redes de crença, fornecendo os fundamentos algorítmicos da inferência em redes bayesianas.
1986 artigo de periódico Inverno da IA
D. E. Rumelhart, G. E. Hinton, R. J. Williams · Nature 323(6088): 533–536
Populariza o algoritmo de retropropagação para o treinamento de redes neurais com múltiplas camadas, tornando possível o aprendizado profundo em escala prática.
1988 artigo de periódico Inverno da IA
R. S. Sutton · Machine Learning 3(1): 9–44
Sistematiza o aprendizado por diferença temporal (TD), tornando-se um dos algoritmos centrais do aprendizado por reforço moderno.
1990 artigo de periódico Inverno da IA
J. L. Elman · Cognitive Science 14(2): 179–211
Introduz a rede recorrente simples de Elman, evidenciando que redes neurais podem aprender estrutura temporal e abrindo caminho para os modelos de sequência posteriores.
1995 artigo de periódico O Renascimento
C. Cortes, V. Vapnik · Machine Learning 20(3): 273–297
Introduz a máquina de vetores de suporte de margem suave, classificador canônico de margem máxima que definiu grande parte do aprendizado de máquina na década de 1990.
1997 artigo de periódico O Renascimento
S. Hochreiter, J. Schmidhuber · Neural Computation 9(8): 1735–1780
Apresenta a LSTM original com células de memória e portões de entrada e saída; o portão de esquecimento hoje padrão foi introduzido depois por Gers, Schmidhuber e Cummins.
1998 artigo de periódico O Renascimento
Y. LeCun, L. Bottou, Y. Bengio, P. Haffner · Proceedings of the IEEE 86(11): 2278–2324
Introduz a LeNet-5, rede neural convolucional canônica que atinge reconhecimento de dígitos manuscritos em qualidade de produção e estabelece o paradigma de CNN.
2006 artigo de periódico O Renascimento
G. E. Hinton, R. R. Salakhutdinov · Science 313(5786): 504–507
Introduz um autoencoder profundo que reconstroi dados de alta dimensionalidade com fidelidade muito superior à do PCA, acendendo a primeira centelha da retomada do aprendizado profundo.
2006 artigo de periódico O Renascimento
G. E. Hinton, S. Osindero, Y.-W. Teh · Neural Computation 18(7): 1527–1554
Introduz redes de crença profundas treinadas com um algoritmo guloso camada a camada, demonstrando pela primeira vez que modelos profundos podem ser treinados de forma eficaz.
2009 artigo de conferência O Renascimento
Raina, R., Madhavan, A., Ng, A. Y. · Proceedings of the 26th Annual International Conference on Machine Learning (ICML 2009): 873–880
Transfere o treino de modelos profundos não supervisionados para processadores gráficos com ganhos de uma ordem de grandeza, tornando corrente o caminho de hardware pelo qual a aprendizagem profunda escalou na década seguinte.
2013 artigo de conferência O Renascimento
V. Mnih, K. Kavukcuoglu, D. Silver, A. Graves, I. Antonoglou, D. Wierstra, M. Riedmiller · NeurIPS 2013 Deep Learning Workshop (arXiv:1312.5602)
Combina Q-learning com uma rede convolucional para jogar jogos de Atari a partir de pixels brutos com desempenho humano, fundando o aprendizado por reforço profundo.
2013 artigo de conferência O Renascimento
T. Mikolov, K. Chen, G. Corrado, J. Dean · ICLR 2013 Workshop (arXiv:1301.3781)
Introduz as arquiteturas skip-gram e CBOW que produzem embeddings densos de palavras, inaugurando a era dos vetores de palavras pré-treinados.
2013 artigo de conferência O Renascimento
D. P. Kingma, M. Welling · ICLR 2014 (arXiv:1312.6114)
Introduz o autoencoder variacional, combinando inferência variacional com modelagem generativa profunda e fornecendo o primeiro modelo profundo de variáveis latentes amplamente adotado.
2014 artigo de conferência O Renascimento
D. Bahdanau, K. Cho, Y. Bengio · ICLR 2015 (arXiv:1409.0473)
Introduz a atenção aditiva (Bahdanau) para tradução automática neural, demonstrando que o alinhamento suave permite ao decodificador focar nos tokens relevantes da fonte e inspirando diretamente o Transformer.
2014 artigo de conferência O Renascimento
I. J. Goodfellow, J. Pouget-Abadie, M. Mirza, B. Xu, D. Warde-Farley, S. Ozair, A. Courville, Y. Bengio · NeurIPS 2014 (arXiv:1406.2661)
Formula a modelagem generativa como um jogo de soma zero entre um gerador e um discriminador, inaugurando uma nova família de modelos generativos implícitos.
2014 artigo de periódico O Renascimento
N. Srivastava, G. E. Hinton, A. Krizhevsky, I. Sutskever, R. Salakhutdinov · Journal of Machine Learning Research 15(56): 1929–1958
Introduz o dropout, técnica simples de regularização estocástica que se torna um padrão nos pipelines de treinamento de aprendizado profundo.
2015 artigo de conferência O Renascimento
S. Ioffe, C. Szegedy · ICML 2015 (arXiv:1502.03167)
Introduz a normalização em lote, que normaliza as entradas de uma camada ao longo de um mini-batch para estabilizar e acelerar drasticamente o treinamento de redes profundas.
2015 preprint O Renascimento
Sohl-Dickstein, J., Weiss, E. A., Maheswaranathan, N., Ganguli, S. · arXiv:1503.03585
Formula a modelação generativa como a inversão de um processo de ruído gradual, a formulação em que assentam os modelos de difusão posteriores.
2015 artigo de conferência O Renascimento
K. He, X. Zhang, S. Ren, J. Sun · CVPR 2016 (arXiv:1512.03385)
Introduz conexões residuais, permitindo o treinamento efetivo de redes com centenas de camadas e vencendo a ImageNet 2015 por larga margem.
2016 artigo de periódico O Renascimento
Sennrich, R., Haddow, B., Birch, A. · Proceedings of ACL 2016: 1715–1725 (arXiv:1508.07909)
Divide as palavras em unidades de subpalavra derivadas das frequências, de modo que um vocabulário fixo consiga soletrar tudo, o esquema de segmentação herdado pela maioria dos modelos de linguagem posteriores.
2016 artigo de conferência O Renascimento
Han, S., Mao, H., Dally, W. J. · ICLR 2016 (arXiv:1510.00149)
Reúne poda, quantização treinada e codificação de Huffman numa só cadeia que encolhe uma rede numa ordem de grandeza quase sem perda de exatidão, afirmando cedo que a precisão numérica é uma variável de projeto.
2016 artigo de conferência O Renascimento
A. van den Oord, S. Dieleman, H. Zen, K. Simonyan, O. Vinyals, A. Graves, N. Kalchbrenner, A. Senior, K. Kavukcuoglu · NeurIPS 2016 (arXiv:1609.03499)
Introduz um modelo autorregressivo convolucional causal dilatado que gera formas de onda de áudio brutas, melhorando drasticamente a naturalidade da síntese de voz.
2017 preprint O Renascimento
J. Schulman, F. Wolski, P. Dhariwal, A. Radford, O. Klimov · arXiv:1707.06347
Introduz o PPO, método de gradiente de política de primeira ordem, simples e estável, que se torna o algoritmo padrão de otimização de políticas no aprendizado por reforço moderno.
2017 preprint O Renascimento
Shazeer, N. et al. · arXiv:1701.06538
Encaminha cada token apenas para alguns peritos entre muitos, deixando o número de parâmetros de uma rede crescer muito além do cálculo gasto com uma única entrada.
2017 artigo de conferência O Renascimento
A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, Ł. Kaiser, I. Polosukhin · NeurIPS 2017 (arXiv:1706.03762)
Introduz o Transformer, arquitetura exclusivamente baseada em atenção que abandona recorrência e convoluções e supera a qualidade prévia em transdução de sequências com uma fração do tempo de treinamento.
2018 artigo de periódico O Renascimento
Kudo, T., Richardson, J. · EMNLP 2018, System Demonstrations: 66–71 (arXiv:1808.06226)
Treina um segmentador de subpalavras diretamente a partir de texto bruto, sem pré-segmentação específica de uma língua, de modo que a mesma cadeia sirva línguas que não separam palavras por espaços.
2018 artigo de conferência O Renascimento
J. Devlin, M.-W. Chang, K. Lee, K. Toutanova · NAACL 2019 (arXiv:1810.04805)
Introduz um Transformer bidirecional pré-treinado com modelagem de linguagem mascarada e predição de próxima sentença, estabelecendo um novo estado da arte em benchmarks de PLN.
2019 artigo de periódico O Renascimento
C. Raffel, N. Shazeer, A. Roberts, K. Lee, S. Narang, M. Matena, Y. Zhou, W. Li, P. J. Liu · Journal of Machine Learning Research 21(140): 1–67 (arXiv:1910.10683)
Reformula toda tarefa de PLN como conversão texto-a-texto, ablata sistematicamente escolhas de transferência e estabelece uma receita de referência para modelos pré-treinados em larga escala.
2020 artigo de conferência A Era dos LLMs
J. Ho, A. Jain, P. Abbeel · NeurIPS 2020 (arXiv:2006.11239)
Reformula a difusão como um objetivo variacional de remoção de ruído, restaurando o estado da arte em geração de imagens e inaugurando a era dos modelos de difusão.
2021 artigo de periódico A Era dos LLMs
Narayanan, D. et al. · SC 2021: 1–15 (arXiv:2104.04473)
Compõe paralelismo de tensores, de pipeline e de dados num único escalonamento e mede o débito do treino de um modelo de linguagem em milhares de GPU.
2021 preprint A Era dos LLMs
Hu, E. J. et al. · arXiv:2106.09685
Congela os pesos pré-treinados e treina em vez disso um par de matrizes de posto reduzido, baixando o custo de adaptar um modelo grande a uma fração do ajuste fino completo.
2021 artigo de conferência A Era dos LLMs
A. Ramesh, M. Pavlov, G. Goh, S. Gray, C. Voss, A. Radford, M. Chen, I. Sutskever · ICML 2021 (arXiv:2102.12092)
Demonstra que um Transformer autorregressivo com 12 bilhões de parâmetros pode gerar imagens diversificadas e de alta fidelidade diretamente a partir de descrições textuais, acendendo a pesquisa em texto-para-imagem.
2021 artigo de conferência A Era dos LLMs
A. Radford, J. W. Kim, C. Hallacy, A. Ramesh, G. Goh, S. Agarwal, G. Sastry, A. Askell, P. Mishkin, J. Clark, G. Krueger, I. Sutskever · ICML 2021 (arXiv:2103.00020)
Treina codificadores de imagem em pares imagem-texto em escala web para obter classificação de imagens zero-shot robusta, fornecendo a torre visual para diversos sistemas multimodais posteriores.
2021 preprint A Era dos LLMs
Chen, M. et al. · arXiv:2107.03374
Apresenta um modelo GPT afinado em código junto com um conjunto de provas avaliado pela correção funcional, tornando a programação uma capacidade mensurável em vez de um género de geração de texto, e discute os seus efeitos na segurança e no trabalho.
2021 artigo de conferência A Era dos LLMs
R. Rombach, A. Blattmann, D. Lorenz, P. Esser, B. Ommer · CVPR 2022 (arXiv:2112.10752)
Transporta a difusão para um espaço latente perceptual, viabilizando a geração de imagens em alta resolução texto-para-imagem em GPUs de consumo e democratizando a síntese de imagens.
2022 artigo de conferência A Era dos LLMs
J. Wei, X. Wang, D. Schuurmans, M. Bosma, B. Ichter, F. Xia, E. H. Chi, Q. V. Le, D. Zhou · NeurIPS 2022 (arXiv:2201.11903)
Mostra que induzir um modelo de linguagem a gerar etapas intermediárias de raciocínio melhora drasticamente seu desempenho em benchmarks de aritmética, senso comum e raciocínio simbólico.
2022 artigo de conferência A Era dos LLMs
L. Ouyang, J. Wu, X. Jiang, D. Almeida, C. L. Wainwright, P. Mishkin, C. Zhang, S. Agarwal, K. Slama, A. Ray, J. Schulman, J. Hilton, F. Kelton, L. Miller, M. Simens, A. Askell, P. Welinder, P. Christiano, J. Leike, R. Lowe · NeurIPS 2022 (arXiv:2203.02155)
Aplica aprendizado por reforço com feedback humano em escala para alinhar as saídas do GPT-3 à intenção humana, estabelecendo o RLHF como a receita canônica de alinhamento.
2022 relatório técnico A Era dos LLMs
Yuntao Bai et al. · Anthropic Technical Report 2022 (arXiv:2212.08073)
Introduz o RLAIF, no qual um modelo critica e revisa suas próprias saídas à luz de uma constituição escrita, reduzindo a dependência de rótulos humanos de nocividade para alinhamento.
2023 relatório técnico A Era dos LLMs
H. Touvron, T. Lavril, G. Izacard, X. Martinet, M.-A. Lachaux, T. Lacroix, B. Rozière, N. Goyal, E. Hambro, F. Azhar, A. Rodriguez, A. Joulin, E. Grave, G. Lample · Meta AI Technical Report 2023 (arXiv:2302.13971)
Disponibiliza a família LLaMA de modelos fundacionais abertos, mostrando que modelos relativamente pequenos e bem treinados podem rivalizar com modelos fechados muito maiores, acelerando o movimento de pesos abertos.
2023 artigo de periódico A Era dos LLMs
Wang, L. et al. · Frontiers of Computer Science 18(6), 2024 (arXiv:2308.11432)
Ordena trabalhos dispersos sobre agentes segundo construção, avaliação e aplicação, marcando o momento em que o termo passa de um conjunto de práticas a um campo de investigação.
2023 preprint A Era dos LLMs
Dettmers, T. et al. · arXiv:2305.14314
Retropropaga através de um modelo base quantizado a 4 bits para adaptadores de posto reduzido, pondo o ajuste fino de um modelo grande ao alcance de uma única GPU.
2023 artigo de conferência A Era dos LLMs
Frantar, E., Ashkboos, S., Hoefler, T., Alistarh, D. · ICLR 2023 (arXiv:2210.17323)
Quantiza os pesos de um grande modelo de linguagem depois do treino, camada a camada e numa única passagem, para que possa ser servido com menor precisão sem voltar a treinar.
2023 artigo de conferência A Era dos LLMs
Leviathan, Y., Kalman, M., Matias, Y. · ICML 2023 (arXiv:2211.17192)
Faz um pequeno modelo de rascunho propor vários tokens que o modelo alvo verifica em paralelo, reduzindo a latência sem alterar a distribuição de saída.
2023 artigo de periódico A Era dos LLMs
Kwon, W. et al. · SOSP 2023: 611–626 (arXiv:2309.06180)
Gere a cache de atenção em páginas de tamanho fixo como um sistema operativo gere a memória, de modo que um servidor sustenta muitos mais pedidos simultâneos sem reservar o pior caso para cada um.
2023 preprint A Era dos LLMs
Gu, A. e Dao, T. · arXiv:2312.00752
Apresenta o Mamba, uma arquitetura de espaço de estado seletivo que iguala ou supera a atenção Transformer em linguagem e outras modalidades com complexidade temporal linear — uma das arquiteturas pós-Transformer mais influentes de 2023.