1931 Zeitschriftenartikel Frühe Theorie
Gödel, K. · Monatshefte für Mathematik und Physik 38(1): 173–198
Zeigt, dass jedes widerspruchsfreie formale System, das die Arithmetik ausdrücken kann, wahre Sätze enthält, die es nicht beweisen kann, und setzt damit die Grenze, an der sich später die Reichweite von Berechnung und maschinellem Schließen bemisst.
1936 Zeitschriftenartikel Frühe Theorie
Alan M. Turing · Proceedings of the London Mathematical Society s2-42(1): 230–265
Einführung der universellen Turingmaschine und Unentscheidbarkeitsbeweis des Entscheidungsproblems, wodurch die theoretischen Grundlagen der Informatik gelegt werden.
1936 Zeitschriftenartikel Frühe Theorie
Church, A. · American Journal of Mathematics 58(2): 345
Definiert effektive Berechenbarkeit über den λ-Kalkül und zeigt ein Problem, das kein solches Verfahren entscheiden kann, und erreicht damit unabhängig von Turing die Grenzen der Berechnung.
1943 Zeitschriftenartikel Frühe Theorie
Warren S. McCulloch, Walter Pitts · Bulletin of Mathematical Biophysics 5(4): 115–133
Modellierung neuronaler Aktivität als Aussagenlogik und damit Vorlage der ersten mathematischen Theorie künstlicher neuronaler Netze.
1948 Zeitschriftenartikel Frühe Theorie
Claude E. Shannon · Bell System Technical Journal 27(3): 379–423; 27(4): 623–656
Definition der Informationsentropie und der Kanalkapazität, wodurch die Informationstheorie begründet und die probabilistischen Grundlagen für die spätere KI gelegt werden.
1950 Zeitschriftenartikel Frühe Theorie
Alan M. Turing · Mind LIX(236): 433–460
Vorschlag des Imitationsspiels (Turing-Test) als operationale Definition maschineller Intelligenz, wodurch die Fragestellung der KI für die folgenden sieben Jahrzehnte geprägt wird.
1955 Zeitschriftenartikel Frühe Theorie
John McCarthy, Marvin L. Minsky, Nathaniel Rochester, Claude E. Shannon · Dartmouth College, 1955; republished in AI Magazine 27(4): 12–14 (2006)
Prägung des Begriffs ’artificial intelligence’ und Entwurf einer Forschungsagenda, die die KI als akademische Disziplin begründet.
1956 Zeitschriftenartikel Geburt der KI
Allen Newell, Herbert A. Simon · IRE Transactions on Information Theory IT-2(3): 61–79
Implementierung des ersten heuristischen Schlussfolgerungsprogramms, das zeigt, dass Maschinen menschliche Problemlösungsstrategien nachahmen können, und Einführung des Konzepts eines ’complex information processing system’.
1958 Zeitschriftenartikel Geburt der KI
Newell, A., Shaw, J. C., Simon, H. A. · Psychological Review 65(3): 151–166
Beschreibt menschliches Problemlösen als heuristische Suche in einem Raum symbolischer Zustände und liefert damit die Grundlage des General Problem Solver und der informationsverarbeitenden Auffassung des Geistes.
1958 Zeitschriftenartikel Geburt der KI
Frank Rosenblatt · Psychological Review 65(6): 386–408
Einführung des ersten trainierbaren Linear-Schwellenwert-Neurons, das die konnektionistische Linie begründet, die zum modernen Deep Learning führt.
1958 Konferenzbeitrag Geburt der KI
John McCarthy · Proceedings of the Symposium on Mechanisation of Thought Processes (NPL Teddington), 75–91. London: HMSO
Vorschlag des ’advice taker’, eines Programms, das aus einem formalen Reservoir von Allgemeinwissen Schlüsse ziehen kann, und damit konzeptionelle Grundlegung von Wissensrepräsentation und Schlussfolgern.
1959 Zeitschriftenartikel Geburt der KI
Arthur L. Samuel · IBM Journal of Research and Development 3(3): 210–229
Demonstration eines Dame-Programms, das sich durch Eigenpartien verbessert, und damit Pionierarbeit für die Erforschung des maschinellen Lernens und der selbstbezogenen Verbesserung im Alpha-Beta-Stil.
1959 Zeitschriftenartikel Geburt der KI
Gelernter, H. · Information and Control 2(1): 80–89
Gelernter behandelt, wie eine Maschine formale Systeme mit stark symmetrischen Prädikaten effizient bearbeiten kann, und gibt dafür einen Satz und eine Regel der syntaktischen Symmetrie an. Die Arbeit steht neben der Geometrie-Beweismaschine, die er zur selben Zeit bei IBM baute und die im frühen Frühjahr 1959 ihren ersten Satz der euklidischen ebenen Geometrie bewies.
1960 Konferenzbeitrag Geburt der KI
Bernard Widrow, Marcian E. Hoff · IRE WESCON Convention Record, Part 4, 96–104
Einführung der LMS-Regel (Adaline), der ersten weitverbreiteten Gradientenabstiegs-Lernregel für adaptive lineare Netze.
1960 Zeitschriftenartikel Geburt der KI
McCarthy, J. · Communications of the ACM 3(4): 184–195
Führt symbolische Ausdrücke, rekursive Funktionen über ihnen und jenes eval ein, das eine Sprache sich selbst auslegen lässt — der Entwurf, aus dem Lisp und die Arbeitssprache der symbolischen KI wurden.
1961 technischer Bericht Geburt der KI
Rosenblatt, F. · Cornell Aeronautical Laboratory technical report (DTIC AD0256582)
Fasst die Perzeptron-Arbeiten zu einer vollständigen Theorie geschichteter probabilistischer Netze zusammen und sagt sowohl, was solche Maschinen lernen können, als auch, wo die einschichtige Form endet.
1966 Zeitschriftenartikel Geburt der KI
Weizenbaum, J. · Communications of the ACM 9(1): 36–45
Baut aus Mustervergleich und Ersetzungsregeln ein scheinbar gesprächsfähiges Programm, und sein Autor weist sogleich darauf hin, wie viel Verständnis die Leserschaft ihm zuschreibt, das es nicht besitzt.
1982 Zeitschriftenartikel KI-Winter
John J. Hopfield · Proceedings of the National Academy of Sciences 79(8): 2554–2558
Einführung des assoziativen Hopfield-Speichernetzes, das neuronale Berechnung mit den Energielandschaften der statistischen Physik verknüpft und während des frühen KI-Winters das Interesse an neuronalen Netzen neu belebt.
1982 Zeitschriftenartikel KI-Winter
McDermott, J. · Artificial Intelligence 19(1): 39–88
Dokumentiert ein Produktionsregelsystem, das täglich DEC-Rechnerbestellungen konfigurierte — eines der wenigen Expertensysteme, das den laufenden Betrieb überstand und dessen Nutzen sich beziffern ließ.
1986 Zeitschriftenartikel KI-Winter
Judea Pearl · Artificial Intelligence 29(3): 241–288
Systematisierung der Operationen Fusion, Propagation und Strukturierung in Belief Networks, wodurch die algorithmischen Grundlagen der Inferenz in Bayesschen Netzen gelegt werden.
1986 Zeitschriftenartikel KI-Winter
David E. Rumelhart, Geoffrey E. Hinton, Ronald J. Williams · Nature 323(6088): 533–536
Popularisierung des Backpropagation-Algorithmus zum Training mehrschichtiger neuronaler Netze, wodurch praktisches Deep Learning ermöglicht wird.
1988 Zeitschriftenartikel KI-Winter
Richard S. Sutton · Machine Learning 3(1): 9–44
Systematisierung des Temporal-Difference-Lernens (TD-Lernen), das zu einem der Kernalgorithmen des modernen Reinforcement Learning wird.
1990 Zeitschriftenartikel KI-Winter
Jeffrey L. Elman · Cognitive Science 14(2): 179–211
Einführung des einfachen rekurrenten Elman-Netzes, das zeigt, dass neuronale Netze zeitliche Strukturen lernen können, und damit Wegbereitung für spätere Sequenzmodelle.
1995 Zeitschriftenartikel Die Wiederbelebung
Corinna Cortes, Vladimir Vapnik · Machine Learning 20(3): 273–297
Einführung der Soft-Margin-Support-Vector-Machine, des kanonischen Maximum-Margin-Klassifikators, der das maschinelle Lernen der 1990er Jahre maßgeblich prägte.
1997 Zeitschriftenartikel Die Wiederbelebung
Sepp Hochreiter, Jürgen Schmidhuber · Neural Computation 9(8): 1735–1780
Führt die ursprüngliche LSTM-Architektur mit Speicherzellen sowie Ein- und Ausgabegattern ein; das heute übliche Vergessensgatter kam später durch Gers, Schmidhuber und Cummins hinzu.
1998 Zeitschriftenartikel Die Wiederbelebung
Yann LeCun, Léon Bottou, Yoshua Bengio, Patrick Haffner · Proceedings of the IEEE 86(11): 2278–2324
Einführung von LeNet-5, des kanonischen faltenden neuronalen Netzes, das eine produktionsreife Handschrifterkennung erreicht und die CNN-Blaupause etabliert.
2006 Zeitschriftenartikel Die Wiederbelebung
Geoffrey E. Hinton, Ruslan R. Salakhutdinov · Science 313(5786): 504–507
Einführung eines tiefen Autoencoders, der hochdimensionale Daten weitaus getreuer als PCA rekonstruiert und damit den ersten Funken der Deep-Learning-Renaissance entzündet.
2006 Zeitschriftenartikel Die Wiederbelebung
Geoffrey E. Hinton, Simon Osindero, Yee-Whye Teh · Neural Computation 18(7): 1527–1554
Einführung von Deep Belief Networks, die mit einem gierigen schichtweisen Algorithmus trainiert werden, und damit erstmaliger Nachweis, dass tiefe Modelle effektiv trainiert werden können.
2009 Konferenzbeitrag Die Wiederbelebung
Raina, R., Madhavan, A., Ng, A. Y. · Proceedings of the 26th Annual International Conference on Machine Learning (ICML 2009): 873–880
Verlagert das Training tiefer unüberwachter Modelle auf Grafikprozessoren mit Beschleunigungen um Größenordnungen und macht damit den Hardwareweg selbstverständlich, auf dem das Deep Learning im folgenden Jahrzehnt skalierte.
2013 Konferenzbeitrag Die Wiederbelebung
Volodymyr Mnih, Koray Kavukcuoglu, David Silver, Alex Graves, Ioannis Antonoglou, Daan Wierstra, Martin Riedmiller · NeurIPS 2013 Deep Learning Workshop (arXiv:1312.5602)
Kombination von Q-Learning mit einem faltenden Netz zu Atari-Spielen aus rohen Pixeln auf menschlichem Niveau, wodurch Deep Reinforcement Learning begründet wird.
2013 Konferenzbeitrag Die Wiederbelebung
Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean · ICLR 2013 Workshop (arXiv:1301.3781)
Einführung der Skip-Gram- und CBOW-Architekturen, die dichte Wort-Embeddings erzeugen, und damit Eröffnung der Ära vortrainierter Wortvektoren.
2013 Konferenzbeitrag Die Wiederbelebung
Diederik P. Kingma, Max Welling · ICLR 2014 (arXiv:1312.6114)
Einführung des Variational Autoencoder, der variationale Inferenz mit tiefen generativen Modellen verbindet und das erste weitverbreitete tiefe Latent-Variablen-Modell liefert.
2014 Konferenzbeitrag Die Wiederbelebung
Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio · ICLR 2015 (arXiv:1409.0473)
Einführung additiver (Bahdanau-)Aufmerksamkeit für die neuronale maschinelle Übersetzung, die zeigt, dass weiche Ausrichtung es Decodern erlaubt, relevante Quelltokens zu fokussieren, und unmittelbar den Transformer inspiriert.
2014 Konferenzbeitrag Die Wiederbelebung
Ian J. Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, Yoshua Bengio · NeurIPS 2014 (arXiv:1406.2661)
Formulierung generativer Modellierung als Zwei-Spieler-Min-Max-Spiel zwischen Generator und Diskriminator, wodurch eine neue Familie impliziter generativer Modelle begründet wird.
2014 Zeitschriftenartikel Die Wiederbelebung
Nitish Srivastava, Geoffrey E. Hinton, Alex Krizhevsky, Ilya Sutskever, Ruslan Salakhutdinov · Journal of Machine Learning Research 15(56): 1929–1958
Einführung von Dropout, einer einfachen stochastischen Regularisierungstechnik, die zum Standard in Deep-Learning-Trainingspipelines wird.
2015 Konferenzbeitrag Die Wiederbelebung
Sergey Ioffe, Christian Szegedy · ICML 2015 (arXiv:1502.03167)
Einführung der Batch-Normalisierung, die Schichteingaben über eine Minibatch hinweg normiert und so das Training tiefer Netze stabilisiert und drastisch beschleunigt.
2015 Preprint Die Wiederbelebung
Sohl-Dickstein, J., Weiss, E. A., Maheswaranathan, N., Ganguli, S. · arXiv:1503.03585
Formuliert generatives Modellieren als Umkehrung eines schrittweisen Verrauschens — die Formulierung, auf der die späteren Diffusionsmodelle beruhen.
2015 Konferenzbeitrag Die Wiederbelebung
Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun · CVPR 2016 (arXiv:1512.03385)
Einführung residualer Verbindungen, die ein effektives Training hunderte Schichten tiefer Netze ermöglichen, und Gewinn von ImageNet 2015 mit großem Vorsprung.
2016 Zeitschriftenartikel Die Wiederbelebung
Sennrich, R., Haddow, B., Birch, A. · Proceedings of ACL 2016: 1715–1725 (arXiv:1508.07909)
Zerlegt Wörter in häufigkeitsbasierte Teilworteinheiten, sodass ein festes Vokabular alles buchstabieren kann — das Segmentierungsverfahren, das die meisten späteren Sprachmodelle übernahmen.
2016 Konferenzbeitrag Die Wiederbelebung
Han, S., Mao, H., Dally, W. J. · ICLR 2016 (arXiv:1510.00149)
Vereint Beschneiden, trainierte Quantisierung und Huffman-Codierung zu einer Kette, die ein Netz um eine Größenordnung verkleinert, fast ohne Genauigkeit einzubüßen, und hält früh fest, dass numerische Genauigkeit eine Entwurfsgröße ist.
2016 Konferenzbeitrag Die Wiederbelebung
Aäron van den Oord, Sander Dieleman, Heiga Zen, Karen Simonyan, Oriol Vinyals, Alex Graves, Nal Kalchbrenner, Andrew Senior, Koray Kavukcuoglu · NeurIPS 2016 (arXiv:1609.03499)
Einführung eines autoregressiven Modells mit dilatierten kausalen Faltungen, das rohe Audio-Wellenformen erzeugt und die Natürlichkeit von Text-to-Speech deutlich verbessert.
2017 Preprint Die Wiederbelebung
John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, Oleg Klimov · arXiv:1707.06347
Einführung von PPO, einer einfachen und stabilen Policy-Gradient-Methode erster Ordnung, die zum Standardverfahren der Policy-Optimierung im modernen Reinforcement Learning wird.
2017 Preprint Die Wiederbelebung
Shazeer, N. et al. · arXiv:1701.06538
Leitet jedes Token nur zu wenigen von vielen Experten und lässt so die Parameterzahl eines Netzes weit über den Rechenaufwand für eine einzelne Eingabe hinauswachsen.
2017 Konferenzbeitrag Die Wiederbelebung
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin · NeurIPS 2017 (arXiv:1706.03762)
Einführung des Transformer, einer rein auf Aufmerksamkeit basierenden Architektur, die auf Rekurrenz und Faltungen verzichtet und Sequenztransduktionsaufgaben in einem Bruchteil der Zeit mit höherer Qualität als bisherige Verfahren löst.
2018 Zeitschriftenartikel Die Wiederbelebung
Kudo, T., Richardson, J. · EMNLP 2018, System Demonstrations: 66–71 (arXiv:1808.06226)
Lernt einen Teilwort-Segmentierer unmittelbar aus Rohtext ohne sprachspezifische Vorsegmentierung, sodass dieselbe Verarbeitungskette auch für Sprachen taugt, die Wörter nicht durch Leerzeichen trennen.
2018 Konferenzbeitrag Die Wiederbelebung
Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova · NAACL 2019 (arXiv:1810.04805)
Einführung eines bidirektionalen Transformer, der mit Masked Language Modeling und Next-Sentence-Prediction vortrainiert wird und einen neuen Stand der Technik über zahlreiche NLP-Benchmarks hinweg etabliert.
2019 Zeitschriftenartikel Die Wiederbelebung
Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, Peter J. Liu · Journal of Machine Learning Research 21(140): 1–67 (arXiv:1910.10683)
Formulierung sämtlicher NLP-Aufgaben als Text-zu-Text-Problem, systematische Ablationsstudien zu Transfer-Learning-Entscheidungen und Etablierung eines Referenzrezepts für großskalige vortrainierte Modelle.
2020 Konferenzbeitrag Das LLM-Zeitalter
Jonathan Ho, Ajay Jain, Pieter Abbeel · NeurIPS 2020 (arXiv:2006.11239)
Neuformulierung der Diffusion als variationales Entrauschungs-Trainingsziel, wodurch die Bildgenerierungsqualität auf den Stand der Technik zurückgeführt und die Ära der Diffusionsmodelle eingeläutet wird.
2021 Zeitschriftenartikel Das LLM-Zeitalter
Narayanan, D. et al. · SC 2021: 1–15 (arXiv:2104.04473)
Fügt Tensor-, Pipeline- und Datenparallelität zu einem einzigen Ablaufplan zusammen und misst den Durchsatz beim Training eines Sprachmodells über Tausende von GPUs.
2021 Preprint Das LLM-Zeitalter
Hu, E. J. et al. · arXiv:2106.09685
Friert die vortrainierten Gewichte ein und trainiert stattdessen ein Paar niedrigrangiger Matrizen, was die Anpassung eines großen Modells auf einen Bruchteil des vollständigen Feintunings verbilligt.
2021 Konferenzbeitrag Das LLM-Zeitalter
Aditya Ramesh, Mikhail Pavlov, Gabriel Goh, Scott Gray, Chelsea Voss, Alec Radford, Mark Chen, Ilya Sutskever · ICML 2021 (arXiv:2102.12092)
Nachweis, dass ein 12-Milliarden-Parameter-Transformer als autoregressives Modell aus Textbeschreibungen vielfältige, hochauflösende Bilder erzeugen kann, und damit Initialzündung der Text-zu-Bild-Forschung.
2021 Konferenzbeitrag Das LLM-Zeitalter
Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, Ilya Sutskever · ICML 2021 (arXiv:2103.00020)
Training von Bild-Encodern auf web-skaligen Bild-Text-Paaren, wodurch starke Zero-Shot-Bildklassifikation erreicht und der visuelle Tower für viele spätere multimodale Systeme bereitgestellt wird.
2021 Preprint Das LLM-Zeitalter
Chen, M. et al. · arXiv:2107.03374
Stellt ein auf Code nachtrainiertes GPT-Modell samt einem an funktionaler Korrektheit gemessenen Prüfsatz vor, macht Programmieren damit von einer Textgattung zu einer messbaren Fähigkeit und erörtert zugleich Sicherheits- und Arbeitsfolgen.
2021 Konferenzbeitrag Das LLM-Zeitalter
Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, Björn Ommer · CVPR 2022 (arXiv:2112.10752)
Verlagerung der Diffusion in einen perzeptuellen Latent-Raum, wodurch hochauflösende Text-zu-Bild-Generierung auf Consumer-GPUs ermöglicht und die Bildsynthese demokratisiert wird.
2022 Konferenzbeitrag Das LLM-Zeitalter
Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed H. Chi, Quoc V. Le, Denny Zhou · NeurIPS 2022 (arXiv:2201.11903)
Nachweis, dass die Aufforderung an ein Sprachmodell, Zwischenschritte der Schlussfolgerung zu generieren, die Leistung in Benchmarks zu arithmetischem, Allgemeinwissen- und symbolischem Reasoning deutlich verbessert.
2022 Konferenzbeitrag Das LLM-Zeitalter
Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, Paul Christiano, Jan Leike, Ryan Lowe · NeurIPS 2022 (arXiv:2203.02155)
Anwendung von Reinforcement Learning from Human Feedback (RLHF) im großen Maßstab, um die Ausgaben von GPT-3 an menschliche Absichten anzupassen, und damit Etablierung von RLHF als kanonisches Alignment-Rezept.
2022 technischer Bericht Das LLM-Zeitalter
Yuntao Bai et al. · Anthropic Technical Report 2022 (arXiv:2212.08073)
Einführung von RLAIF, bei dem ein Modell seine eigenen Ausgaben anhand einer schriftlichen Verfassung kritisiert und überarbeitet, wodurch die Abhängigkeit von menschlichen Schadenslabels für das Alignment verringert wird.
2023 technischer Bericht Das LLM-Zeitalter
Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, Aurelien Rodriguez, Armand Joulin, Edouard Grave, Guillaume Lample · Meta AI Technical Report 2023 (arXiv:2302.13971)
Veröffentlichung der LLaMA-Familie offener Basismodelle, die zeigt, dass relativ kleine, gut trainierte Modelle mit deutlich größeren geschlossenen Modellen konkurrieren können, und damit Beschleunigung der Open-Weights-Bewegung.
2023 Zeitschriftenartikel Das LLM-Zeitalter
Wang, L. et al. · Frontiers of Computer Science 18(6), 2024 (arXiv:2308.11432)
Ordnet verstreute Arbeiten zu Agenten nach Konstruktion, Bewertung und Anwendung und markiert den Punkt, an dem der Begriff von einer Sammlung von Praktiken zu einem Feld wird.
2023 Preprint Das LLM-Zeitalter
Dettmers, T. et al. · arXiv:2305.14314
Leitet Gradienten durch ein auf 4 Bit quantisiertes Basismodell in niedrigrangige Adapter zurück und bringt damit das Feintuning eines großen Modells in die Reichweite einer einzelnen GPU.
2023 Konferenzbeitrag Das LLM-Zeitalter
Frantar, E., Ashkboos, S., Hoefler, T., Alistarh, D. · ICLR 2023 (arXiv:2210.17323)
Quantisiert die Gewichte eines großen Sprachmodells nach dem Training schichtweise in einem einzigen Durchgang, sodass es ohne Nachtraining mit geringerer Genauigkeit ausgeliefert werden kann.
2023 Konferenzbeitrag Das LLM-Zeitalter
Leviathan, Y., Kalman, M., Matias, Y. · ICML 2023 (arXiv:2211.17192)
Lässt ein kleines Entwurfsmodell mehrere Token vorschlagen, die das Zielmodell parallel prüft, und senkt so die Latenz, ohne die Ausgabeverteilung zu verändern.
2023 Zeitschriftenartikel Das LLM-Zeitalter
Kwon, W. et al. · SOSP 2023: 611–626 (arXiv:2309.06180)
Verwaltet den Attention-Cache in Seiten fester Größe, wie ein Betriebssystem den Speicher verwaltet, sodass ein Server weit mehr gleichzeitige Anfragen hält, ohne für jede den schlimmsten Fall zu reservieren.
2023 Preprint Das LLM-Zeitalter
Gu, A. und Dao, T. · arXiv:2312.00752
Stellt Mamba vor, eine selektive Zustandsraum-Architektur, die Transformer-Attention bei Sprache und anderen Modalitäten mit linearer Zeitkomplexität erreicht oder übertrifft — eine der einflussreichsten Post-Transformer-Architekturen des Jahres 2023.