Skip to main content
Entwickler Themen
Toggle Dark/Light/Auto mode Toggle Dark/Light/Auto mode Toggle Dark/Light/Auto mode Back to homepage

C. Glossar

Glossar

Dieses Glossar sammelt Fachwörter, die in Was sind LLMs, der Geschichte, den Problemen bei der Nutzung, der Nutzung und in MinimalesLLM englisch stehen bleiben. Jeder Eintrag nennt kurz die Herkunft und dann, was das Wort in diesen Texten heißt. Wo der Fließtext ein deutsches Wort bevorzugt, steht es im ersten Satz. Produktnamen und die Titel der Quellen sind keine Einträge. In den Kapiteln ist das erste Vorkommen eines Begriffs mit seinem Eintrag verlinkt. Der Link öffnet einen neuen Tab.

Text und Token

BOS, EOS, PAD, UNK

Abstammung. Kürzel aus der Sequenzverarbeitung: beginning of sequence, end of sequence, padding, unknown. Anfang, Ende, Füllplatz und „unbekannt“ bekommen eigene IDs, damit sie nicht mit einem normalen Zeichen verwechselt werden.

Bedeutung. BOS öffnet eine Folge. In MinimalesLLM ist es zusätzlich das Ende einer Stichprobe: dieselbe ID, zwei Rollen, die größere Modelle oft auf EOS und BOS verteilen. PAD füllt kürzere Folgen in einem Stapel auf eine gemeinsame Länge und zählt in Attention und Verlust nicht mit. UNK ist die ID für ein Stück, das im Vokabular fehlt. In MinimalesLLM gibt es diese ID nicht: ein unbekanntes Zeichen ist ein Fehler. Die Sonderrollen stehen unter Token und unter Was weggelassen wurde.

Byte-Pair-Encoding

Abstammung. Philip Gage beschreibt 1994 Byte-Pair-Encoding als Kompressionsverfahren: das häufigste benachbarte Bytepaar wird immer wieder durch ein neues Symbol ersetzt. Sennrich, Haddow und Birch übertragen das 2015 auf Sprache und bauen damit ein Vokabular aus Teilwörtern, subwords.

Bedeutung. Ein Subword-Tokenizer schneidet Text in Stücke, die oft kürzer als ein Wort und länger als ein Buchstabe sind. Häufige Wörter werden ein Token, seltene Wörter bleiben aus bekannten Stücken zusammensetzbar. MinimalesLLM macht aus jedem Zeichen ein Token. Ein Byte-Tokenizer geht weiter als ein Unbekannt-Token: jedes Byte hat eine ID, unbekannter Text zerfällt in Bytes. Beides steht unter Was weggelassen wurde.

LLM

Abstammung. Large language model, großes Sprachmodell. Language für die Art der Daten, model für ein gelerntes Modell, large für die Menge an Text und Parametern.

Bedeutung. Ein statistisches Modell, dessen Kernoperation die Vorhersage des nächsten Tokens ist. Die Zerlegung und die Arbeitsweise stehen unter Was sind LLMs.

Next-Token

Abstammung. Englisch next und token: das unmittelbar folgende Stück. So heißt das Trainingsziel der autoregressiven Sprachmodelle, von den neuronalen Sprachmodellen der 2000er Jahre bis zu GPT.

Bedeutung. Das Token, das auf die bisher sichtbare Folge folgen soll. Der Vorwärtspass bewertet es, der Verlust misst die Überraschung darüber, die Stichprobe zieht es. Next-Token-Modell, Next-Token-Verlust und Next-Token-Vorhersage in diesen Texten sind dieselbe Operation in drei Rollen.

Prompt

Abstammung. Lateinisch promptus, „zur Hand, bereit“. Im Theater souffliert der prompter den nächsten Satz. An der Kommandozeile ist der Prompt das Zeichen, dass eine Eingabe erwartet wird. Bei Sprachmodellen ist der Prompt der Text, an dem die Fortsetzung ansetzt.

Bedeutung. Alles, was die aktuelle Anfrage in den Kontext legt: Aufgabe, Beispiele, bisheriger Verlauf, Dateien. Die Gewichte bleiben dabei stehen. Wenige Beispiele im Prompt heißen Few-Shot. Qualität und Form der Antwort hängen daran, was dieser Text als plausible Fortsetzung nahelegt. Die Haltung dazu steht unter Was sind LLMs und unter KI-Nutzung.

Token

Abstammung. Altenglisch tācn, „Zeichen, Anzeichen“. In Compilern ist ein Token das Stück, das die lexikalische Analyse aus dem Quelltext schneidet: ein Wort, ein Operator, ein Literal. Sprachmodelle übernehmen diese Zähleinheit.

Bedeutung. Das kleinste Stück, das das Netz sieht, gespeichert als Ganzzahl. Ein Wort, ein Wortteil, ein Zeichen oder ein Satzzeichen kann ein Token sein. In MinimalesLLM ist jedes Zeichen eines, plus BOS. Das Kontextfenster zählt Tokens, Kosten oft auch. Die Zerlegung steht unter Token.

Das Netz

Attention

Abstammung. Englisch attention, „Aufmerksamkeit“, von lateinisch attendere, „sich zuwenden“. Bahdanau, Cho und Bengio benennen 2014 so das Gewichten anderer Stellen beim Übersetzen. Vaswani und Kollegen machen 2017 daraus die ganze Architektur.

Bedeutung. Die aktuelle Position mischt die bisher sichtbaren Positionen in ihren laufenden Vektor. Self-Attention: die Folge achtet auf sich selbst. Multi-Head Attention, im Text auch Mehrkopf-Attention: mehrere solche Blicke parallel. Ein Kopf (head) ist einer davon. Kausal: sichtbar sind die eigene Stelle und die früheren, die Zukunft bleibt aus dem Cache draußen. Der Score ist das skalierte Skalarprodukt vor dem Softmax. Die Rechnung steht unter Attention.

Bias

Abstammung. Französisch biais, „Schräge, seitlicher Versatz“. In der Statistik eine systematische Verschiebung, in Netzen ein gelernter Zusatz, in der Sprache über Daten ein übernommenes Vorurteil. Dieselben Seiten benutzen beide fachlichen Lesarten.

Bedeutung. In der Rechnung ist ein Bias ein gelernter Vektor, der nach einer Matrix-Vektor-Multiplikation addiert wird. Er verschiebt die Ausgabe auch dann, wenn der Eingabevektor null wäre. MinimalesLLM hat an den Projektionen und an den Logits keinen Bias. In den Trainingsdaten ist Bias das Mitlernen von Stereotypen, die im Korpus häufig sind. Die erste Lesart steht unter Was weggelassen wurde, die zweite unter Problemen bei der Nutzung.

Cache

Abstammung. Französisch cache, „Versteck“, von cacher, „verbergen“. In Rechnern ein Speicher für schon Berechnetes, damit dieselbe Arbeit nicht wiederholt wird. In Transformern heißt die Form oft KV-Cache: die Keys und Values der bisherigen Positionen.

Bedeutung. Pro Schicht die Liste der Keys und Values, die diese Folge schon erzeugt hat. Die Query wird nicht gespeichert. Ein neues Dokument oder eine neue Stichprobe leert den Cache. Was darin liegt, ist genau der sichtbare Kontext dieser Folge. Die Mechanik steht unter Attention.

Embedding

Abstammung. Englisch embed, „fest in eine Umgebung einbetten“. In der Mathematik legt eine Einbettung eine Struktur in eine andere. Für Wörter wird der Name mit den verteilten Vektoren von Bengio und Kollegen 2003 und mit Word2Vec (Mikolov und Kollegen 2013) geläufig.

Bedeutung. Im Text meist Einbettung: der gelernte Vektor, der für eine Token-ID oder eine Position steht. Ähnliche Kontexte rücken im Training näher zusammen. Die Token-Tabelle heißt in der GPT-2-Linie WTE (token embeddings), die Positionstabelle WPE (position embeddings). MinimalesLLM addiert beide. Die Tabellen stehen unter Einbettungen.

Encoder und Decoder

Abstammung. Englisch encode, „in einen Code bringen“, und decode, „wieder auslesen“. Seq2seq-Netze der Jahre vor 2017 lesen die Eingabe mit einem Encoder und schreiben die Ausgabe mit einem Decoder. Der Transformer von 2017 hat beide Hälften.

Bedeutung. Decoder-only behält die schreibende Hälfte: links nach rechts, jedes Token sieht nur die Vergangenheit. Das ist die GPT-Linie. Ein Encoder wie BERT liest die Folge in beide Richtungen und ist zum Verstehen gebaut, zum freien Weiterschreiben taugt er so nicht. Die Gabel steht unter Geschichte der LLMs.

Feed-Forward

Abstammung. Englisch feed-forward, „nur vorwärts gespeist“. Der Name grenzt Netze ohne Rückkopplung von rekurrenten Netzen ab: das Signal läuft von der Eingabe zur Ausgabe, ohne Schleife.

Bedeutung. Im Transformer das kleine Netz, das nach der Attention nur die Koordinaten dieser Position verarbeitet. Im Text auch vorwärtsgerichtetes Netz. Es sieht die Nachbarpositionen nicht; die hat die Attention schon gemischt. Aufbau und die Stelle von ReLU stehen unter Block.

GELU

Abstammung. Gaussian Error Linear Unit. Hendrycks und Gimpel führen die Funktion 2016 ein. Gaussian und error verweisen auf die Verteilungsfunktion der Normalverteilung, die mit der gaußschen Fehlerfunktion zusammenhängt: die Schwelle ist glatt statt hart.

Bedeutung. Eine glatte Verwandte von ReLU an derselben Stelle im vorwärtsgerichteten Netz. Negative Werte werden weich gedämpft, nicht abgeschnitten. GPT-2-artige Modelle nutzen GELU. MinimalesLLM bleibt bei ReLU. Der Vergleich steht unter Was weggelassen wurde.

Grouped Query Attention

Abstammung. Shazeer beschreibt 2019 Multi-Query Attention: viele Query-Köpfe teilen sich ein einziges Key-Value-Paar. Ainslie und Kollegen führen 2023 die gruppierte Form dazwischen ein, grouped-query attention.

Bedeutung. Volle Multi-Head-Attention gibt jedem Kopf eigene Keys und Values. Gruppiert teilen sich mehrere Query-Köpfe weniger Key-Value-Köpfe. Der Cache wächst dann langsamer mit der Kontextlänge. MinimalesLLM gibt jedem seiner vier Köpfe eigene Schlüssel und Werte. Beides steht unter Was weggelassen wurde.

Logit

Abstammung. Joseph Berkson prägt 1944 logit als Kürzel für logistic unit, in Analogie zu probit (probability unit, Bliss 1934). Bei ihm ist es der Logarithmus einer Zwei-Klassen-Quote, ln(p / (1−p)). Netze übernehmen den Namen für die rohe Bewertung, die erst danach durch eine logistische Funktion oder durch Softmax in Wahrscheinlichkeiten geht.

Bedeutung. Eine Zahl je Token des Vokabulars am Ende des Vorwärtspasses. Ein größerer Logit ist eine stärkere Neigung zu diesem Token. Wahrscheinlichkeiten entstehen erst im Verlust und in der Stichprobe. Die Tabelle dafür heißt LMHead, nach dem language-model head, dem Ausgabekopf im GPT-2-Code. Sie ist von der Einbettungstabelle getrennt. Die Stelle in der Rechnung steht unter Vorwärtspass und Verlust.

n-Gramm

Abstammung. Griechisch grámma, „Buchstabe, Geschriebenes“, mit der Zahl n davor. Ein n-Gramm ist eine Folge von n aufeinanderfolgenden Stücken. Statistische Sprachmodelle des 20. Jahrhunderts schätzen das nächste Wort aus einem solchen kurzen Fenster.

Bedeutung. Das lokale Modell vor den neuronalen Netzen: nur die letzten n Tokens zählen, weiter zurück reicht der Blick nicht. Die Geschichte der LLMs setzt es an den Anfang, vor Rekurrenz und Transformer.

Query, Key, Value

Abstammung. Englisch query „Anfrage“, key „Schlüssel“, value „Wert“. Vaswani und Kollegen beschreiben Attention 2017 als Nachschlagen: eine Query wird mit Keys verglichen, die zugehörigen Values werden gewichtet aufsummiert. Dieselbe Adressierung über den Inhalt tragen frühere Speicher-Netze; der Transformer macht das Tripel zum Standardnamen.

Bedeutung. Drei Vektoren je Position, aus dem Residualstrom projiziert. Die Query sucht. Der Key ist das, woran spätere Positionen diese Stelle wiederfinden. Der Value ist der Inhalt, der bei einem Treffer in die Mischung eingeht. Kurz auch Q, K, V. Die Projektionen stehen unter Attention.

Recurrence

Abstammung. Lateinisch recurrere, „zurücklaufen“. Ein rekurrentes Netz wendet denselben Schritt wieder an und trägt einen Zustand von einem Zeitpunkt zum nächsten.

Bedeutung. Die Architektur vor dem Transformer für längere Folgen. Information, die weit zurückliegt, muss Schritt für Schritt mitgeschleppt werden, und das Training lässt sich schlecht parallelisieren. Attention springt stattdessen. Der Übergang steht unter Geschichte der LLMs.

ReLU

Abstammung. Rectified Linear Unit, gleichgerichtete lineare Einheit. Rectified kommt aus der Elektrotechnik: ein Gleichrichter schneidet die negative Halbwelle ab. Nair und Hinton machen die Funktion 2010 unter diesem Namen in Netzen geläufig. Der Wert ist max(0, x).

Bedeutung. Die Nichtlinearität im vorwärtsgerichteten Netz von MinimalesLLM. Negative Koordinaten werden 0, positive bleiben. Bei genau 0 ist die lokale Ableitung 0. Ohne diese Schwelle ließen sich die beiden linearen Abbildungen des Teilnetzes zu einer zusammenfalten. Die Stelle steht unter Block.

Residual

Abstammung. Lateinisch residuum, „das Übriggebliebene“. He, Zhang, Ren und Sun nennen 2016 residual learning die Form Schichtausgabe = Eingabe + Änderung: die Schicht lernt den Rest, die Eingabe läuft daneben weiter. Den laufenden Vektor, den diese Addition trägt, nennen Elhage und Kollegen 2021 residual stream.

Bedeutung. Im Text Residualstrom für den Vektor einer Position und Residualverbindung für die Addition Strom = Strom + Teilnetz(Norm(Strom)). Attention und das vorwärtsgerichtete Netz schreiben je eine Änderung auf diesen Strom zurück, sie ersetzen ihn nicht. Der Block steht unter Block.

RMSNorm

Abstammung. Root Mean Square Layer Normalization, Normierung über die Wurzel des mittleren Quadrats. Zhang und Sennrich schlagen sie 2019 als schlankere Verwandte der Layer Normalization vor: der Mittelwert wird nicht abgezogen, nur die quadratische Größe wird auf eine feste Skala gebracht.

Bedeutung. Vor jedem Teilnetz, und einmal auf der Summe aus Token- und Positionszeile, wird der Residualstrom so skaliert. Eigene gelernte Faktoren hat diese Stelle in MinimalesLLM nicht. Die Formel steht unter Block.

RoPE

Abstammung. Rotary Position Embedding, drehende Positionseinbettung. Su und Kollegen beschreiben sie 2021 im RoFormer: Query und Key werden um einen Winkel gedreht, der von der Position abhängt. Der relative Abstand zweier Stellen steckt in der Drehdifferenz.

Bedeutung. Eine andere Art, der Attention die Reihenfolge zu geben. MinimalesLLM addiert stattdessen eine gelernte Zeile je absoluter Position. Die gelernte Tabelle endet am Kontextfenster; eine Drehung um „drei Schritte früher“ bleibt auch in längeren Folgen dieselbe. Der Vergleich steht unter Was weggelassen wurde.

Softmax

Abstammung. Der Name kürzt soft maximum, ein weiches Maximum. Die größte Bewertung bekommt den größten Anteil, die übrigen behalten einen Rest; im Grenzwert scharfer Temperatur bleibt fast nur das Maximum. In neuronalen Netzen ist der Name seit Bridle 1990 geläufig.

Bedeutung. Aus einer Liste von Scores oder Logits wird eine Verteilung: jeder Eintrag positiv, die Summe 1. In der Attention läuft Softmax über die bisher sichtbaren Positionen, im Verlust und in der Stichprobe über das Vokabular. Dieselbe Funktion, andere Achse. Die Schritte stehen unter Verlust.

SwiGLU

Abstammung. Zusammengesetzt aus Swish (Ramachandran, Zoph und Le, 2017) und GLU, gated linear unit (Dauphin und Kollegen, 2017). Shazeer setzt die Variante 2020 ins vorwärtsgerichtete Netz von Transformern. Ein Tor, aus einer zweiten Matrix, wird mit dem Wert multipliziert.

Bedeutung. Ersatz für die ReLU zwischen den beiden Matrizen des vorwärtsgerichteten Netzes. Das Tor kann Koordinaten dämpfen, ohne sie hart auf null zu setzen. Neuere Modelle nutzen das häufig. MinimalesLLM bleibt bei ReLU. Der Vergleich steht unter Was weggelassen wurde.

Transformer

Abstammung. Vaswani und Kollegen benennen das Modell 2017 so, im Papier Attention Is All You Need. Der Name meint die Umwandlung einer Folge in eine andere allein durch Attention, ohne Rekurrenz.

Bedeutung. Die Architekturfamilie hinter GPT, BERT, Llama, Claude und Gemini, und hinter MinimalesLLM. Gestapelte Blöcke aus Attention und einem vorwärtsgerichteten Netz, plus Positionsinformation. Die Operation steht unter Was sind LLMs, die Geschichte unter Geschichte der LLMs, der eine Block unter Block.

Training

Adam

Abstammung. Kingma und Ba, 2014. Der Name kürzt adaptive moment estimation und ist zugleich ein Vorname. Moment ist hier ein laufender Mittelwert: einer über den Gradienten, einer über sein Quadrat.

Bedeutung. Das Verfahren, das nach dem Rückwärtspass die Gewichte verschiebt. Wo der Gradient ruhig in eine Richtung zeigt, wird der Schritt größer; wo er groß oder sprunghaft ist, kleiner. Eine Korrektur am Anfang gleicht aus, dass beide Mittelwerte bei null starten. Die Form in MinimalesLLM steht unter Training.

Autograd

Abstammung. Automatic differentiation, automatisch berechnete Ableitungen, plus grad für den Gradienten. Der Paketname ist dafür üblich geworden, getragen von der Python-Bibliothek autograd und von PyTorch.

Bedeutung. Keine Bibliothek differenziert den Vorwärtspass von außen. Jede elementare Operation merkt sich ihre lokale Ableitung, und der Rückwärtspass wendet die Kettenregel von hinten nach vorn an. Attention, RMSNorm und der Verlust haben dadurch keine handgeschriebene Ableitung. Die Operationen stehen unter Autograd.

Backpropagation

Abstammung. Englisch back-propagating errors, „Fehler rückwärts ausbreiten“. Unter diesem Namen stellen Rumelhart, Hinton und Williams das Verfahren 1986 dar. Die Rechnung, Ableitungen von der Ausgabe zurück zu den Eingaben zu schieben, ist älter; die Seiten stützen sich auf diese Darstellung.

Bedeutung. Nach dem Vorwärtspass läuft die Ableitung des Verlusts rückwärts durch jede Operation zu den Gewichten. Jedes Gewicht erfährt, wie stark es am Verlust dieser Folge beteiligt war. Zusammen mit dem Gradienten ist das die Korrekturmaschine unter dem Training. Der Einstieg steht unter Was sind LLMs, die skalare Form unter Autograd.

Batch

Abstammung. Englisch batch, ursprünglich eine Charge, die auf einmal gebacken oder gefertigt wird. Im Training eine Gruppe von Beispielen, die zu einem gemeinsamen Update zusammengefasst wird.

Bedeutung. Im Text der Übersicht auch die kleinen Gruppen, über die das Training großer Modelle läuft. Unter Was weggelassen wurde heißt dasselbe Stapel: mehrere Dokumente, ein gemittelter Verlust, ein Schritt. MinimalesLLM nimmt je Schritt ein Dokument.

Dropout

Abstammung. Englisch drop out, „ausfallen, ausscheiden“. Srivastava, Hinton und Kollegen beschreiben 2014 das Verfahren unter diesem Namen: während des Trainings werden zufällig Aktivierungen auf null gesetzt, die übrigen verstärkt. Beim späteren Ziehen bleiben alle an.

Bedeutung. Eine Regularisierung. Das Modell soll sich nicht auf einzelne Koordinaten verlassen. MinimalesLLM lässt jede Aktivierung stehen. Der Grund für das Weglassen steht unter Was weggelassen wurde.

Forward-Pass

Abstammung. Englisch forward pass, der Gang vorwärts: von der Eingabe durch die Schichten bis zur Ausgabe. Der Name gehört mit dem Rückwärtsgang der Backpropagation zusammen.

Bedeutung. Im Text Vorwärtspass. Token und Position werden eingebettet, die Blöcke laufen, am Ende steht ein Logit je Vokabel. Training und Stichprobe rufen denselben Gang auf. Die Reihenfolge steht unter Vorwärtspass.

Gradient Descent

Abstammung. Gradient über lateinisch gradus, „Schritt“, für die Richtung steilsten Anstiegs. Descent, „Abstieg“: der Schritt geht entgegen dieser Richtung. Der Name ist der klassische für das Minimieren einer Funktion durch kleine Schritte bergab.

Bedeutung. Die Gewichte werden ein Stück in die Richtung verschoben, in der der Verlust lokal sinkt. Der Gradient selbst zeigt bergauf. Lernrate, Adam und die Momente formen die Länge dieses Schritts; die Richtung bleibt die des Abstiegs. Der Überblick steht unter Was sind LLMs, der konkrete Schritt unter Training.

Inferenz

Abstammung. Lateinisch inferre, „hineintragen, folgern“. In der Statistik ist Inferenz das Schließen von Daten auf ein Modell. Im Sprachgebrauch der Netze hat sich die andere Richtung festgesetzt: das fertige Modell auf neue Eingaben anwenden.

Bedeutung. Der Lauf mit festgehaltenen Gewichten. Training verschiebt Parameter, Inferenz erzeugt die Fortsetzung. Lokal zu rechnen heißt in diesen Texten: diese Anwendung läuft auf eigener Hardware. Die Ziehung selbst steht unter Stichprobe.

Loss

Abstammung. Englisch loss, „Verlust“. Die Zahl, die das Training zu senken versucht. Für die nächste-Token-Vorhersage ist das die Cross-Entropy, die Kreuzentropie: ein Maß aus der Informationstheorie dafür, wie überrascht eine Verteilung vom tatsächlichen Ereignis ist. Trifft die ganze Masse auf das eine Zieltoken, bleibt von der Kreuzentropie genau −ln(p) dieses Tokens.

Bedeutung. Im Text Verlust. Der Mittelwert dieser Überraschung über die Positionen eines Dokuments. Am untrainierten Netz liegt er nahe bei ln(Vokabulargröße), dem Wert der Gleichverteilung. Er ist keine Trefferquote. Die Formel steht unter Verlust.

Seed

Abstammung. Englisch seed, „Samen, Saat“. Die Startzahl eines Pseudozufallsgenerators. Dieselbe Saat und derselbe Generator ergeben dieselbe Zahlenfolge.

Bedeutung. In MinimalesLLM legt der Seed die Anfangsgewichte, die Mischreihenfolge der Dokumente und die Ziehungen der Stichprobe fest. Ein anderer Seed ist ein anderer Lauf. Die Flags stehen unter Aufruf und Beispielausgabe.

Warmup

Abstammung. Englisch warm up, „aufwärmen“, wie ein Motor vor der Last. Vaswani und Kollegen lassen 2017 die Lernrate über die ersten Schritte erst ansteigen, statt sofort mit dem vollen Wert zu arbeiten.

Bedeutung. Ein Lernratenverlauf am Anfang des Trainings, gedacht gegen zu große erste Schritte auf zufälligen Gewichten. MinimalesLLM hat keinen Warmup: die Rate startet bei 0,01 und fällt linear. Der Vergleich steht unter Was weggelassen wurde.

Ziehen

Temperatur

Abstammung. Englisch temperature, aus der statistischen Physik. In der Boltzmann-Verteilung macht eine Temperatur die Wahrscheinlichkeiten schärfer oder flacher. Netze setzen dieselbe Skala vor den Softmax; Boltzmann-Maschinen nutzen sie seit den 1980er Jahren, die Stichprobe aus Sprachmodellen übernimmt sie.

Bedeutung. Die Logits werden vor dem Softmax durch diese Zahl geteilt. Unter 1 wird die Verteilung spitzer, das wahrscheinlichste Token gewinnt öfter. Über 1 wird sie flacher. Der Verlust bewertet die unskalierte Verteilung; die Temperatur wirkt in diesen Texten nur bei der Ziehung. Die Stelle steht unter Stichprobe.

Top-k und Top-p

Abstammung. Top plus eine Schranke. Top-k behält vor der Ziehung die k wahrscheinlichsten Token; in der Texterzeugung ist diese Form seit Fan, Lewis und Dauphin 2018 geläufig. Top-p, auch nucleus sampling, behält die kleinste Menge der wahrscheinlichsten Token, deren Summe mindestens p erreicht (Holtzman und Kollegen, 2020).

Bedeutung. Beide schneiden die lange Restmasse seltener Tokens ab, bevor gezogen wird. Gieriges Dekodieren (greedy decoding) zieht gar nicht: es nimmt immer das Token mit dem größten Logit. MinimalesLLM teilt nur durch die Temperatur und zieht danach über das ganze Vokabular. Der Vergleich steht unter Was weggelassen wurde.

Nach dem Vortraining

Alignment

Abstammung. Englisch alignment, „Ausrichtung“, von align, „in eine Linie bringen“ (lateinisch linea). In der aktuellen Modellsprache die Stufe, die Verhalten an gewünschte Ziele bindet: hilfreich, vorsichtig, anweisungsfolgend.

Bedeutung. Im Text meist Ausrichtung. Sie ändert Daten und Ziel nach dem Vortraining, nicht die Kernoperation. RLHF und Constitutional AI sind zwei Wege dahin. Der Überblick steht unter Was sind LLMs.

Chain-of-Thought

Abstammung. Englisch chain of thought, „Gedankenkette“. Wei und Kollegen benennen 2022 so das Prompten mit Zwischengründen: das Modell schreibt die Zwischenschritte, bevor es die Antwort schreibt.

Bedeutung. Mehrschrittiges Rechnen und Schließen im erzeugten Text, ohne Werkzeug und ohne Beobachtung aus der Welt. Spätere Modelle trainieren eine solche Kette, statt sie nur im Prompt zu erbitten. Die Linie steht unter Geschichte der LLMs.

Constitutional AI

Abstammung. Bai und Kollegen bei Anthropic, 2022. Constitution, „Verfassung“: eine Liste von Prinzipien. Das Modell kritisiert und überarbeitet Antworten anhand dieser Prinzipien, statt allein aus menschlichen Einzelbewertungen zu lernen.

Bedeutung. Ein Ausrichtungsweg neben RLHF. Die Prinzipien sitzen im Training. Die Seiten nennen das Verfahren dort, wo es um Verweigerung und um die Grenze zwischen Schaden und übervorsichtigem Ablehnen geht: Probleme bei der Nutzung.

Few-Shot, Zero-Shot und In-Context Learning

Abstammung. Shot heißt hier ein Beispiel, älter aus dem Lernen aus wenigen Bildern. Zero-Shot: kein Beispiel in der Anfrage, für Sprachmodelle deutlich bei GPT-2. Few-Shot und In-Context Learning: Brown und Kollegen zeigen 2020 an GPT-3, dass Aufgabe und Beispiele im Prompt stehen und die Gewichte dafür nicht nachtrainiert werden.

Bedeutung. Steuerung über den Text der aktuellen Anfrage. Ein oder zwei Demonstrationen im Prompt legen Format und Muster nahe. Die Gewichte bleiben die des trainierten Modells. Die Linie steht unter Geschichte der LLMs.

Fine-Tuning

Abstammung. Englisch fine-tuning, „fein abstimmen“, wie das Nachstimmen eines Instruments. Im Lernen: ein weiteres Training auf engeren Daten, nachdem ein Modell schon breit trainiert wurde.

Bedeutung. Im Text auch Feinabstimmung. Typisch die Stufe auf Dialogen und Anweisungen nach dem Vortraining. Die Architektur bleibt, die Gewichte rücken auf der neuen Verteilung nach. Der Überblick steht unter Was sind LLMs.

Function Calling

Abstammung. Englisch function calling, „Funktionsaufruf“. OpenAI macht das 2023 zur Schnittstelle: das Modell schreibt einen strukturierten Aufruf, die Anwendung führt ihn aus und legt das Ergebnis zurück in den Kontext.

Bedeutung. Die Vertrauensgrenze liegt in der Anwendung. Das Modell entscheidet, dass ein Auftrag hingeschrieben wird; rechnen, suchen und speichern tut der umgebende Code. Dieselbe Schleife beschreibt die Geschichte vorher schon an Browser und Plugins. Sie steht unter Geschichte der LLMs.

Instruktions-Tuning

Abstammung. Englisch instruction tuning. Wei und Kollegen trainieren 2021 (FLAN) Sprachmodelle auf vielen Aufgaben, die als Anweisung formuliert sind. Danach folgt das Modell Anweisungen, die so im Vortraining nicht als Aufgabentext vorkamen.

Bedeutung. Dieselbe Next-Token-Vorhersage, auf Paaren aus Anweisung und gewünschter Antwort. Die Frage wird dadurch eher beantwortet als wiederholt. MinimalesLLM hat diese Stufe nicht. Sie steht unter Was weggelassen wurde.

MCP

Abstammung. Model Context Protocol. Anthropic stellt das Protokoll im November 2024 vor: ein offener Weg, über den ein Assistent Datenquellen und Werkzeuge anbindet.

Bedeutung. Im Text die Steckerleiste. Sie ist Infrastruktur für den Werkzeug-Loop, keine neue Modellklasse und kein Verfahren für mehrere Agenten. Fremde Server gehören geprüft wie fremde Pakete. Die Einordnung steht unter Geschichte der LLMs und unter KI-Nutzung.

Mixture of Experts

Abstammung. Mixture of experts, Mischung von Experten. Jacobs, Jordan, Nowlan und Hinton beschreiben 1991 mehrere Teilnetze, von denen ein Gatter je nach Eingabe eines oder einige auswählt. In großen Sprachmodellen trägt dieselbe Idee die Rechnung: nicht jede Schicht rechnet für jedes Token mit allen Parametern.

Bedeutung. Ein Weg, mehr Parameter zu halten, ohne jedes Token durch alle zu schicken. Die Seiten nennen das einmal bei offenen Gewichten der jüngeren Linie, unter Geschichte der LLMs.

Pretraining

Abstammung. Englisch pretraining, das Training davor. Der GPT-Bericht von 2018 trägt es im Titel: Generative Pre-Training, generatives Vortraining auf Text, bevor einzelne Aufgaben dazukommen.

Bedeutung. Im Text Vortraining. Das Modell sieht sehr viel Text und lernt, das nächste Token vorherzusagen. Grammatik, häufige Fakten und typische Formen sind Nebenprodukte. Feinabstimmung und Ausrichtung kommen danach. Der Überblick steht unter Was sind LLMs.

RAG

Abstammung. Retrieval-Augmented Generation, um Nachschlagen erweiterte Erzeugung. Lewis und Kollegen prägen den Namen 2020: ein generatives Modell bekommt Textstellen aus einem Index in den Kontext, die Gewichte bleiben stehen.

Bedeutung. Retrieval ist das Holen dieser Stellen. Parametrisches Gedächtnis bleibt in den Gewichten, der Index ist austauschbar. Die nächste Vorhersage sieht den gefundenen Text wie jeden anderen Token. Nachschlagen senkt die Abhängigkeit vom Langzeitgedächtnis der Gewichte; es löscht Halluzinationen nicht. Die Linie steht unter Geschichte der LLMs.

ReAct

Abstammung. Yao und Kollegen, 2022. Der Name mischt reason und act: Grund und Handlung. Die Schleife ist Gedanke, Aktion, Beobachtung, dann wieder von vorn.

Bedeutung. Chain-of-Thought allein bleibt im erzeugten Text. ReAct koppelt einen Schritt an eine Aktion und an das, was danach aus der Welt zurückkommt. Der belastbare Agent in diesen Texten ist zuerst ein Modell in genau dieser Schleife. Sie steht unter Geschichte der LLMs.

RLHF

Abstammung. Reinforcement learning from human feedback, verstärkendes Lernen aus menschlicher Rückmeldung. Das Lernen aus menschlichen Vergleichen beschreiben Christiano und Kollegen 2017. Die Abkürzung trägt das Verfahren in der Sprachmodell-Literatur; Ouyang und Kollegen wenden es 2022 in InstructGPT auf Anweisungen an.

Bedeutung. Nach einer Feinabstimmung auf gewünschte Antworten bewertet ein zweites Signal ganze Antworten, oft aus menschlichen Vergleichen. Die Gewichte rücken in Richtung der bevorzugten Antwort. Die Next-Token-Maschine bleibt. Die Stufe steht unter Geschichte der LLMs und unter Was weggelassen wurde.

Test-Time-Compute

Abstammung. Englisch test-time compute: Rechenaufwand zur Test- oder Antwortzeit, im Unterschied zum Aufwand des Trainings. Test ist hier die Anfrage an das fertige Modell.

Bedeutung. Mehr Rechnung vor der sichtbaren Antwort, in diesen Texten die trainierte Gedankenkette, der man mehr Denkzeit geben kann. Das verschiebt Kosten und Latenz auf die einzelne Anfrage. Die Linie steht unter Geschichte der LLMs.

Nutzung

Agent

Abstammung. Lateinisch agens, „der Handelnde“, von agere, „tun“. In der KI ein System, das wahrnimmt und handelt. In diesen Texten die schmale Form davon.

Bedeutung. Dasselbe Sprachmodell in einer Schleife mit Werkzeugen: Gedanke, Aktion, Beobachtung. Die Anwendung führt die Aktion aus. Mehrere Agenten sind keine eigene Stufe. Wann die Schleife hilft und wann sie schadet, steht unter KI-Nutzung.

Allowlist

Abstammung. Englisch allow, „erlauben“, plus list. Eine Liste dessen, was zugelassen ist. In der Sicherheit der enge Rahmen um ein Werkzeug: alles andere bleibt draußen.

Bedeutung. Neben Isolation und Bestätigung durch Menschen eine der Schranken, sobald ein Modell einen Browser, eine Oberfläche oder fremde Inhalte bedient. Die Stelle steht unter Problemen bei der Nutzung.

Benchmark

Abstammung. Englisch bench mark, ursprünglich eine Höhenmarke der Landvermessung: ein fest gemeißelter Bezugspunkt. Davon ein festgelegter Test, an dem man Systeme vergleicht.

Bedeutung. Eine standardisierte Aufgabenliste mit einer Zahl am Ende. Die Seiten nutzen einzelne Benchmarks als Beleg und warnen zugleich: eine Rangliste, ein leaderboard, ist kein Abnahmetest für den eigenen Einsatz. Die Haltung steht unter Problemen bei der Nutzung.

Boilerplate

Abstammung. Englisch für vorgefertigte Druckplatten, von denen Zeitungen denselben Text mehrfach setzten; der Name spielt auf Kesselblech an. Im Code der wiederkehrende Rahmen, den man fast unverändert übernimmt.

Bedeutung. Gerüst, Standardaufrufe, Tests und Dokumentation, die einem bekannten Muster folgen. Sprachmodelle erzeugen das oft brauchbar, weil das Muster häufig im Training war. Die Einordnung als Stärke steht unter Was sind LLMs.

Context Rot

Abstammung. Englisch context rot, „Kontextfäule“. Anthropic benutzt den Ausdruck für den Qualitätsverlust, wenn zu viel Material im Fenster liegt.

Bedeutung. Mehr Kontext ist nicht automatisch eine bessere Antwort. Das Fenster ist das Arbeitsgedächtnis dieser einen Anfrage; irrelevante Dateien und lange Werkzeuglisten belegen dieselben Plätze. Die praktische Folge steht unter KI-Nutzung.

Deepfake

Abstammung. Zusammengezogen aus deep learning und fake, „Fälschung“. Das Wort wird 2017 geläufig für Medien, die eine Person oder Szene synthetisch zeigen.

Bedeutung. In diesen Texten die synthetischen Inhalte, die der AI Act neben bestimmten KI-Texten kennzeichnen will. Die rechtliche Einordnung, ohne Beratung, steht unter Problemen bei der Nutzung.

Diff

Abstammung. Kurz für difference, „Unterschied“. Das Unix-Programm diff aus den frühen 1970er Jahren zeigt den Unterschied zweier Dateistände. Davon der Name für eine konkrete Änderung.

Bedeutung. Die Änderung, die ein Modell an Dateien vorschlägt. Diese Seiten behandeln sie wie eine Änderung von Menschen: lesen, testen, klein halten. Die Regel steht unter KI-Nutzung.

Frontier

Abstammung. Englisch frontier, „Grenzland, Vorderkante“. In Lab- und Regulierungstexten seit etwa 2023 der Name für die jeweils fähigsten Modelle.

Bedeutung. Ab 2023 beschreiben die Seiten das Feld der stärksten Modelle als Frontier: mehrere Labore, nicht mehr ein einzelner Name. Der Abschnitt steht unter Geschichte der LLMs.

Grounding

Abstammung. Englisch ground, „Boden, Halt“. Etwas grounden heißt, ihm einen Halt außerhalb seiner selbst geben. In diesen Texten ist der Halt eine Beobachtung aus der Welt, nicht nur weiterer erzeugter Text.

Bedeutung. Chain-of-Thought allein ist in der Formulierung des ReAct-Papiers nicht grounded: die Zwischenschritte prüfen sich nicht an einem Werkzeugergebnis. Sobald eine Aktion etwas zurückliefert, hat die Fortsetzung diesen Halt. Die Stelle steht unter Geschichte der LLMs.

Halluzination

Abstammung. Lateinisch hallucinari, „gedankenverloren umherirren“. In der Medizin eine Wahrnehmung ohne den passenden äußeren Reiz. Die Texterzeugung übernimmt das Wort für flüssigen Inhalt, der zur Quelle oder zu den Fakten nicht stimmt; Ji und Kollegen geben 2023 den Überblick, auf den sich die Seiten stützen.

Bedeutung. Erfundene Fakten, Methoden, Parameter, Quellen, APIs, Paketnamen. Der Ton kann dabei sicher klingen. Nachschlagen senkt die Rate und schließt sie nicht. Die praktische Folge steht unter Problemen bei der Nutzung.

Harness

Abstammung. Englisch harness, das Geschirr, das ein Zugtier in der Spur hält. In der Software ein Prüfstand, der ein Stück Arbeit einspannt und eine klare Aussage liefert: bestanden oder nicht.

Bedeutung. In diesen Texten Tests, Build, Review und kleine Diffs. Was grün ist und was sich erklären lässt, darf weiter. Regeln und Agenten ohne diesen Prüfstand vervielfachen Fehler nur schneller. Die Stufe steht unter KI-Nutzung.

Imitative falsehoods

Abstammung. Lin, Hilton und Evans prägen den Ausdruck 2022 in TruthfulQA: imitative falsehoods, nachgeahmte Unwahrheiten. Falsche Antworten, die auf der Trainingsverteilung hohe Wahrscheinlichkeit haben, weil Menschen sie häufig schreiben.

Bedeutung. Häufigkeit im Korpus ist kein Beleg. Eine Meldung, die viele Male kopiert wird, sieht für das Modell wie viele Belege aus. Die Seiten nutzen den Begriff genau dafür, unter Problemen bei der Nutzung.

Jailbreak

Abstammung. Englisch jailbreak, ursprünglich das Aufheben der Herstellersperre an einem Telefon. Übertragen auf Prompts, die die Verweigerungsregeln eines Modells umgehen.

Bedeutung. Die Seiten nennen Jailbreak-Übungen als etwas, das am Anfang der Nutzung nichts zu suchen hat. Die Grenze der Verweigerung selbst — Schaden gegen übervorsichtiges Ablehnen — steht unter Problemen bei der Nutzung.

Least Privilege

Abstammung. Englisch least privilege, „geringste Berechtigung“. Saltzer und Schroeder formulieren das 1975 als Schutzprinzip: jedes Programm und jede Person bekommt nur die Rechte, die die vorliegende Aufgabe braucht.

Bedeutung. Sobald Werkzeuge mitreden, die Schranke um Dateien, Shell, Netz und fremde Server. Zu weite Rechte heißen in der OWASP-Sprache dieser Seiten excessive agency. Die Regel steht unter Problemen bei der Nutzung.

Long Tail

Abstammung. Englisch long tail, „langer Schwanz“. Der dünne Ausläufer einer Häufigkeitsverteilung: sehr viele Dinge, die jedes für sich selten sind. Kandpal und Kollegen messen 2023, dass Fakten aus diesem Ausläufer in Sprachmodellen unsicher sitzen.

Bedeutung. Was selten im Trainingsmaterial vorkommt, sitzt schwach, auch wenn das Modell groß ist. Deshalb bleibt Spezialwissen — wenig zitierte Urteile, interne Bestände, neue APIs — eine Prüfaufgabe. Die Stelle steht unter Problemen bei der Nutzung.

Memorization

Abstammung. Englisch memorization, „Auswendiglernen“. In der Extraktionsliteratur, deutlich bei Carlini und Kollegen 2021, das wörtliche Wiederauftauchen von Trainingsstücken in der Ausgabe.

Bedeutung. Trainingsdaten können aus dem Modell wieder hervorkommen, auch aus ausgerichteten Chat-Modellen. Secrets gehören deshalb nicht in öffentliche Repositories, und ein Consumer-Chat ist kein Tresor. Die Stelle steht unter Problemen bei der Nutzung.

Over-Refusal

Abstammung. Englisch over-refusal, „übermäßiges Verweigern“. Röttger und Kollegen messen das 2024 mit XSTest als übertriebene Safety: klar harmlose Prompts werden abgelehnt, weil sie lexikalisch wie riskante klingen.

Bedeutung. Die Verweigerung sitzt in den Gewichten und in der Produktpolitik. Eine scharfe Grenze gegen Schaden ist beabsichtigt. Das Ablehnen einer harmlosen Frage, weil ein Wort ähnlich klingt, ist der Fehler, den der Ausdruck meint. Die Stelle steht unter Problemen bei der Nutzung.

Over-Reliance

Abstammung. Englisch over-reliance, „sich zu sehr verlassen“. In der Risikotaxonomie von Weidinger und Kollegen 2022 eine der Schäden an der Mensch-Modell-Schnittstelle: die Ausgabe wird übernommen, weil sie flüssig ist.

Bedeutung. In diesen Texten das Gegenteil eines äußeren Prüfmaßstabs. „Sieht plausibel aus“ ersetzt Compiler, Dokumentation, Registry und Tests nicht. Die Stufe des Prüfens steht unter KI-Nutzung.

Prompt Injection

Abstammung. Der Name folgt der SQL injection: Daten werden als Anweisung gelesen, weil die Sprache beides nicht trennt. Indirect Prompt Injection ist die Form, die Greshake und Kollegen 2023 vorführen: die Anweisung steckt in Inhalt, den die Anwendung selbst holt, in einer Seite, einer Mail, einer Datei.

Bedeutung. Für das Modell sind Anweisung und Daten beides Tokens. Ein zuverlässiges Gegenstück zu vorbereiteten SQL-Anweisungen gibt es dabei nicht. Die Vertrauensgrenze bleibt im umgebenden Code: fremder Inhalt ist Daten, Seiteneffekte bestätigt ein Mensch. Die Stelle steht unter Problemen bei der Nutzung.

Rules

Abstammung. Englisch rules, „Regeln“. In den Werkzeugen dieser Seiten der Name für Anweisungen, die bei jedem Gespräch schon im Kontext liegen, etwa AGENTS.md, CLAUDE.md oder Copilot-Instructions.

Bedeutung. Persistentes Projektgedächtnis, das die Gewichte zwischen den Sitzungen nicht hergeben. Kurz, konkret, und erst dort, wo derselbe Fehler sich wiederholt. Ein Roman in der Daueranweisung füllt das Fenster. Der Unterschied zu Skills steht unter KI-Nutzung.

Sandbox

Abstammung. Englisch sandbox, der Sandkasten: ein begrenzter Ort zum Ausprobieren. In Rechnern ein abgeschotteter Laufbereich, dessen Folgen die Umgebung nicht treffen.

Bedeutung. Eine Schranke um Werkzeuge, die ein Modell anstoßen kann. Zusammen mit Allowlists, geringen Rechten und menschlicher Bestätigung begrenzt sie den Schaden. Sie beseitigt Prompt Injection nicht. Die Stelle steht unter Problemen bei der Nutzung.

Skill

Abstammung. Englisch skill, „Fertigkeit, eingeübter Ablauf“. Cursor und Claude Code benutzen das Wort für ein Ablaufpaket, das nur bei Bedarf in den Kontext geladen wird, oft als SKILL.md.

Bedeutung. Situativ, im Unterschied zu Rules, die oft immer gelten. Eine Review-Checkliste, ein Release-Ablauf, ein Bug-Muster. Fertige Sammlungen solcher Pakete heißen Skillsets. Skills mit Seiteneffekten bleiben eine bewusste Auslösung. Die Stufe steht unter KI-Nutzung.

Spec

Abstammung. Kurz für englisch specification, „Festlegung“. Im Ingenieurwesen das Schriftstück, an dem man prüft, ob die Arbeit fertig und richtig ist.

Bedeutung. Ziel, Randbedingungen, Akzeptanzkriterien und eine stopping condition, die Bedingung, wann Schluss ist. Ein Wunsch („mach mir Auth“) nennt das nicht. Die Stufe steht unter KI-Nutzung.

Sycophancy

Abstammung. Englisch sycophancy, „Schmeichelei“, von griechisch sykophántēs. Perez und Kollegen messen 2022 an Sprachmodellen die Neigung, der Meinung im Dialog recht zu geben. Sharma und Kollegen zeigen dasselbe in freierer Form (ICLR 2024).

Bedeutung. Größere Modelle folgen der Vorgabe im Prompt auch dann, wenn sie falsch ist. Das Modell will dabei nichts. Menschliche Rückmeldung hat Antworten belohnt, die zum Fragenden passen. Widerspruch und Prüfung gegen eine Quelle bleiben deshalb außen. Die Stelle steht unter Problemen bei der Nutzung.

Working Memory

Abstammung. Englisch working memory, Arbeitsgedächtnis. Baddeley und Hitch beschreiben 1974 einen kleinen Speicher für das, was die gerade laufende Aufgabe braucht, getrennt vom Langzeitgedächtnis. Anthropic überträgt das Bild auf das Kontextfenster.

Bedeutung. Was in dieser einen Anfrage liegt: Systemhinweis, Verlauf, Werkzeuge, Dateien, die entstehende Antwort. Das Trainingskorpus ist damit nicht gemeint, und eine frühere Sitzung auch nicht, solange niemand sie wieder in dieses Fenster legt. Die Stelle steht unter Problemen bei der Nutzung.