Skip to main content
Entwickler Themen
Toggle Dark/Light/Auto mode Toggle Dark/Light/Auto mode Toggle Dark/Light/Auto mode Back to homepage

0.1.12. Stichprobe

Stichprobe

sample.Generate setzt den Text fort. Die Gewichte bleiben stehen. Adam wird nicht gelesen, der Rückwärtspass läuft nicht. Jede Stichprobe beginnt mit StartSequence, also mit leerem Cache. Stichprobe 2 sieht Stichprobe 1 nicht.

Der Namensgenerator benutzt dieselbe Ziehung. Er füllt den Cache zuerst mit einem eingegebenen Anfang und zieht erst danach weiter.

Eine Zeichenfolge

Die Temperatur ist 0.5 und nur hier wirksam.

  1. Eingabe-ID ist BOS, Position ist 0.
  2. Forward liefert die Logits.
  3. Jeder Logit wird durch 0.5 geteilt. Diese Skalare sind Konstanten, keine trainierten Parameter.
  4. Softmax, dieselbe Funktion wie im Verlust, ergibt die Verteilung.
  5. draw zieht eine ID anhand der kumulierten Wahrscheinlichkeiten. Das ist die einzige Zufallsentscheidung.
  6. Ist die ID BOS, endet die Zeichenfolge. Sie darf leer sein.
  7. Sonst wird das Zeichen angehängt, die ID wird die nächste Eingabe, die Position steigt.
  8. Erreicht die Position das Kontextfenster, endet die Schleife, auch ohne BOS. WPE hat keine Zeile 16.

Das öffnende BOS wird nicht mitgedruckt. Gedruckt werden nur gezogene IDs, die Zeichen sind.

Der Referenzlauf zieht 20 Folgen mit einem Generator, der beim Seed neu beginnt. Danach starten zwei weitere Züge jeweils mit einem frischen Generator desselben Seeds. Ihre Texte stimmen überein. Im festgehaltenen Lauf ist das beide Male anare. Ein Zug mit dem nächsten Seed darf abweichen; mit Seed 2 entstand voriel. Dieselbe Gewichtsmenge legt eine Verteilung fest. Ein einzelner Text ist nicht „die“ Ausgabe.

Für die erste der 20 Folgen druckt das Programm die Verteilung an Position 0, vor der Ziehung, und die Attention-Zeile von Kopf 0 an Position 1. Diese Zeile hat die Länge 2 und summiert sich zu 1. Endet schon die erste Ziehung auf BOS, gibt es kein zweites Zeichen, und das Programm sagt das.

Was die Zeichenfolgen bedeuten

Eine Stichprobe ist eine Folge, deren Wahrscheinlichkeit unter dem Next-Token-Modell hoch genug war, um gezogen zu werden. Mit der Namensliste sind das kurze Folgen aus dem Trainingsalphabet, manchmal ein bekannter Name, oft ein neuer. Zur Ziehzeit wird die Datei nicht durchsucht. Der Verlust hat plausible Fortsetzungen belohnt, und die Ziehung nimmt eine davon. Bei dieser Breite ist ein seltsamer Name die ganze „Halluzination“, kein erfundener Beleg.

Das Modell schreibt keine Absatzantworten. Das Fenster hat 16 Positionen, der Trainingstext besteht aus einzelnen Namen. Die zwanzig Folgen des Referenzlaufs stehen auf der Seite Aufruf und Beispielausgabe.

Weiter

0.1.13. Was weggelassen wurde stellt daneben, welche Techniken heutige Modelle zusätzlich benutzen.