0.2. Geschichte der LLMs
Viele sind mit ChatGPT in diese Geschichte eingestiegen. Das war Ende 2022, und es fühlte sich an wie ein Anfang. Es war ein Anfang für die Nutzung — nicht für die Modelle. Darunter lag eine Architektur von 2017, eine generative Linie ab 2018 und ein Forschungsfeld, das schon nachschlug und handelte, bevor der Chatbot öffentlich war. Die Geschichte ist deshalb keine Treppe aus großen Schritten, sondern überlappende Linien.
Vor dem Transformer war Sprachmodellierung möglich, aber unbequem. Statistische n-Gramme sahen nur ein kurzes lokales Fenster. Rekurrente Netze konnten längere Sequenzen, ließen sich aber schlecht parallel trainieren; die Aufmerksamkeit, die Bahdanau, Cho und Bengio 2014 (extern)
fürs Übersetzen einführten, klebte noch an diesem Flaschenhals. 2017 streichen Vaswani und Kollegen bei Google die Recurrence ganz. Attention Is All You Need (extern)
beschreibt ein Netz nur aus Attention: den Transformer. Er lässt sich parallel trainieren, skaliert, und wird die gemeinsame Architekturfamilie hinter GPT, BERT, Llama, Claude und Gemini.
2018 zeigt OpenAI, was ein Transformer kann, wenn man ihn nur in eine Richtung laufen lässt. GPT (extern)
wird unüberwacht auf Text vortrainiert und danach auf Aufgaben feinabgestimmt: ein Decoder-only-Modell, links nach rechts, dieselbe Kernoperation wie unter Was sind LLMs — das nächste Stück Text. Auf dieser Linie sitzt später ChatGPT. Im selben Jahr erscheint bei Google BERT (extern)
: ein bidirektionaler Encoder für Sprachverständnis, kein GPT-artiges Weiterschreiben. Dieselbe Architekturfamilie, eine andere Gabel.
GPT-2 (2019, extern)
zeigt Zero-Shot: Übersetzung, Fragen, Zusammenfassung — ohne extra Aufgabentraining, nur weil das Modell gelernt hat, Text fortzusetzen. GPT-3 (2020, extern)
treibt dasselbe auf 175 Milliarden Parameter und nennt es In-Context Learning: die Aufgabe steht im Prompt, die Gewichte bleiben stehen. Das Paper nennt gleichzeitig die Schwächen, die später jeder kennt: erfundene Fakten, Datenlecks, unsichere Wahrheit.
Im selben Jahr 2020, in dem GPT-3 erscheint, beschreiben Lewis und Kollegen bei Facebook AI Retrieval-Augmented Generation. RAG (extern)
koppelt ein generatives Modell an einen durchsuchbaren Index: parametrisches Gedächtnis in den Gewichten, nicht-parametrisches Gedächtnis im Index. Google hatte denselben Gedanken wenige Monate zuvor unter dem Namen REALM (extern)
ins Pretraining geholt. Die Pointe ist nicht, dass Detailwissen nicht mehr trainiert werden muss. Die Pointe ist, dass sich Wissen im Index austauschen lässt, ohne das Netz neu zu trainieren — im Original: Wissen könne „directly revised and expanded“ werden. Der Index im RAG-Paper ist ein Wikipedia-Stand vom Dezember 2018, kein Live-Web.
Was im Index steht, ist so aktuell wie der Index. Live wird es, wenn das Modell eine Suchmaschine bedient. WebGPT (Dezember 2021, extern)
feint GPT-3 so, dass es in einer textbasierten Browser-Umgebung Befehle ausgibt: suchen, in der Seite finden, zitieren, wiederholen, bis eine Antwort mit Quellen dasteht. Das ist Nachschlagen und ein Loop aus Aktion und Beobachtung — beides vor dem ChatGPT-Launch.
Anfang 2022 zeigen Wei und Kollegen bei Google, dass große Modelle besser rechnen und schließen, wenn der Prompt Zwischengründe enthält: Chain-of-Thought (extern)
. Das zerlegt die Aufgabe — aber nur im erzeugten Text, ohne Werkzeug, ohne Beobachtung aus der Welt. ReAct (Oktober 2022, extern)
flicht beides ineinander: Gedanke, Aktion, Beobachtung. Chain-of-Thought allein, so das Paper, sei „not grounded in the external world“. Der belastbare Agent in dieser Geschichte ist zuerst ein Modell in genau diesem Loop — nicht mehrere Agenten.
Was im November 2022 öffentlich wird, ist nicht die erste Fähigkeit zum Nachschlagen oder Handeln. Es ist ein Dialogprodukt. InstructGPT (extern)
richtet Modelle mit Demonstrationen und menschlichem Feedback (RLHF) darauf aus, Anweisungen zu folgen; ein 1,3-Milliarden-Modell wurde von Labelern gegenüber dem 175-Milliarden-GPT-3 bevorzugt. ChatGPT (30. November 2022, extern)
ist der Geschwisterstand davon fürs Gespräch: nachfragen, Fehler einräumen, unangemessene Bitten ablehnen. Der Launch-Text verspricht das. Er verspricht keinen Browser und keine Plugins.
Im Februar 2023 legt Meta LLaMA (extern)
als offene Gewichte vor; LLaMA-13B schlägt GPT-3 mit 175 Milliarden Parametern auf vielen Benchmarks. Am 14. März erscheinen GPT-4 (extern)
und Claude (extern)
am selben Kalendertag. Ab hier ist die Frontier ein Feld, kein einzelnes Labor.
Neun Tage nach GPT-4 macht OpenAI aus Nachschlagen und Handeln ein Produkt: ChatGPT-Plugins (23. März 2023, extern)
mit Browser und Retrieval; im Juni folgt Function Calling (extern)
— dasselbe Muster wie bei den Plugins, als JSON-Schnittstelle für Entwickler. Das ist nicht eine neue Architektur. Es ist der Loop von WebGPT und ReAct in der API.
Im September 2024 veröffentlicht OpenAI o1 (extern)
: ein Modell, das vor der sichtbaren Antwort eine (versteckte) Gedankenkette erzeugt, trainiert mit Verstärkungslernen. Das ist Chain-of-Thought, aber nicht als Prompttrick, sondern als trainierte Fähigkeit; die Leistung steigt, wenn man ihm mehr Denkzeit gibt. Der Launch ist ausdrücklich früh: kein Web-Browsing, kein Function Calling. o1 ist kein Agenten-Release. Es ist die Linie „Denken im Text“, härter gemacht.
Wenige Wochen nach o1 zeigt Anthropic, dass der Loop nicht an JSON-Tools endet: Computer Use (Oktober 2024, extern)
sieht den Bildschirm, bewegt den Cursor, klickt, tippt — stundenlange UI-Aktionen, immer noch ein Modell. MCP (November 2024, extern)
ist die Steckerleiste dazu: ein offener Standard, über den Assistenten Daten und Werkzeuge anbinden. Das ist Infrastruktur, keine neue Modellklasse.
NoteBis hierher hängt die Geschichte an Papers und Lab-Blogs. Was folgt, skizziert, wie sich dieselben Linien 2025 und 2026 zeigen — ohne Vollständigkeit, ohne Benchmark-Schlacht, ohne jede Versionsnummer.
2025 macht langes Denken zur Massenware. DeepSeek-R1 (Januar 2025, extern)
legt offene Gewichte und einen Bericht vor; die Behauptung ist o1-nahes Reasoning per RL, nicht der Ursprung dieser Linie. Gemini 2.5 (extern)
nennt Google ein Thinking-Modell. Claude 4 (Mai 2025, extern)
ist hybrid — schnelle Antwort oder längeres Nachdenken — und das Nachdenken darf Werkzeuge nutzen. Die Trennung, mit der o1 startete, hält so nicht. GPT-5 (August 2025, extern)
zieht Chat-Modell und Reasoning in ein System, das selbst entscheidet, wann es länger nachdenkt.
Zugleich wird der Tool-Loop zum Entwicklerprodukt: Claude Code in Terminal und IDE; OpenAI Codex (Mai 2025, extern)
als Cloud-Agent an Repositories. Llama 4 (April 2025, extern)
hält die Linie offener Gewichte. Die Produktnamen rasen weiter. Die Linien tun es nicht.
Ein LLM setzt Text fort. Das hat sich in dieser Geschichte nicht geändert. Was sich geändert hat, ist, woraus es fortsetzen darf: aus den Gewichten, aus einem Index, aus einer Suchseite, aus einem Werkzeugergebnis, aus einer langen Gedankenkette. ChatGPT war der Moment, an dem das für viele sichtbar wurde. Die Linien darunter liefen schon, und sie laufen weiter. Wer die Arbeitsweise nachlesen will, findet sie unter Was sind LLMs.
Die Aussagen oben stützen sich auf Originalarbeiten und First-Party-Texte der Labore, nicht auf sekundäre Historiografien. Die meisten Quellen sind Englisch.
NoteWer nur wenige Quellen lesen will: den Transformer, GPT-3, RAG, ReAct, den ChatGPT-Launch und o1. Der Rest vertieft einzelne Linien.
-
Bahdanau, Cho, Bengio: Neural Machine Translation by Jointly Learning to Align and Translate (2014) (extern)
Aufmerksamkeit als Alignment beim Übersetzen — noch an Encoder-Decoder mit Recurrence gebunden. -
Vaswani et al.: Attention Is All You Need (2017) (extern)
Der Transformer: nur Attention, parallel trainierbar. Die gemeinsame Architekturfamilie der späteren Modelle.
-
OpenAI: Improving Language Understanding by Generative Pre-Training (GPT, 2018) (extern)
Decoder-only, links nach rechts, Pretraining dann Fine-Tuning. Die Linie, auf der ChatGPT sitzt. -
Devlin et al.: BERT (2018) (extern)
Die andere Gabel: bidirektionaler Encoder für Sprachverständnis, kein GPT-artiges Weiterschreiben. -
OpenAI: Better language models and their implications (GPT-2, 2019) (extern)
Zero-Shot: aus der einen Vorhersageaufgabe werden mehrere Sprachleistungen sichtbar. -
Brown et al.: Language Models are Few-Shot Learners (GPT-3, 2020) (extern)
In-Context Learning bei 175 Milliarden Parametern. Das Paper nennt Halluzinationen und Datenlecks bereits selbst.
-
Guu et al.: REALM (2020) (extern)
Retrieval während des Pretrainings. Wissen nicht nur implizit in den Gewichten. -
Lewis et al.: Retrieval-Augmented Generation (RAG, 2020) (extern)
Parametrisches plus nicht-parametrisches Gedächtnis. Index austauschbar; der Original-Index ist Wikipedia 2018, kein Live-Web. -
OpenAI: WebGPT (2021) (extern)
GPT-3 steuert einen textbasierten Browser. Live-Suche und Aktions-Loop vor ChatGPT. -
Wei et al.: Chain-of-Thought Prompting (2022) (extern)
Zwischengründe im Prompt. Mehrschritt nur im erzeugten Text, ohne Welt. -
Yao et al.: ReAct (2022) (extern)
Gedanke, Aktion, Beobachtung. Chain-of-Thought allein sei „not grounded in the external world“.
-
OpenAI: Aligning language models to follow instructions (InstructGPT, 2022) (extern)
RLHF: Anweisungen folgen. Das Ausrichtungsrezept hinter ChatGPT. -
OpenAI: Introducing ChatGPT (30. November 2022) (extern)
Der Produktsprung. Dialog, kein Browser, keine Plugins in diesem Text. -
Meta: Introducing LLaMA (2023) (extern)
Offene Gewichte. LLaMA-13B gegen GPT-3 175B auf vielen Benchmarks. -
OpenAI: GPT-4 (14. März 2023) (extern)
Frontier-Modell, multimodal. Erscheint am selben Tag wie Claude. -
Anthropic: Introducing Claude (14. März 2023) (extern)
Das andere Labor am selben Kalendertag. -
OpenAI: ChatGPT plugins (23. März 2023) (extern)
Browser und Retrieval als Produkt. Motiviert unter anderem durch WebGPT. -
OpenAI: Function calling (13. Juni 2023) (extern)
Derselbe Loop als JSON-Schnittstelle für Entwickler.
-
OpenAI: Learning to reason with LLMs (o1, 2024) (extern)
Trainiertes Chain-of-Thought, Test-Time-Compute. Launch ohne Browsing und Function Calling. -
Anthropic: Computer use (22. Oktober 2024) (extern)
Ein Modell bedient die GUI. Immer noch ein Loop, größerer Hebel. -
Anthropic: Model Context Protocol (25. November 2024) (extern)
Offener Standard für Daten und Tools. Infrastruktur, keine neue Modellklasse.
-
DeepSeek: DeepSeek-R1 Release (20. Januar 2025) (extern)
· arXiv:2501.12948 (extern)
Offene Reasoning-Gewichte, RL. Nicht der Ursprung von o1, aber der Moment, an dem die Linie nicht mehr nur hinter einer Paywall sitzt. -
Google: Gemini 2.5 (März 2025) (extern)
Thinking-Modell, langer Kontext. -
Meta: Llama 4 (5. April 2025) (extern)
Offene Gewichte bleiben eine Linie. Mixture-of-Experts, multimodal. -
OpenAI: Introducing Codex (16. Mai 2025) (extern)
Cloud-Software-Agent am Repository. Der Tool-Loop als Entwicklerprodukt. -
Anthropic: Introducing Claude 4 (22. Mai 2025) (extern)
Hybrid: schnell oder längeres Denken; Thinking mit Tool Use. Claude Code allgemein verfügbar. -
OpenAI: Introducing GPT-5 (7. August 2025) (extern)
Chat und Reasoning in einem System, das selbst entscheidet, wann es länger nachdenkt.