Begriffe vorab
- Token: kleinste Texteinheit des Modells – ein Wort, Wortteil oder Satzzeichen.
- Kontextfenster: die Menge an Token, die das Modell in einem Aufruf gleichzeitig berücksichtigen kann.
- Halluzination: eine flüssig formulierte, aber falsche oder erfundene Aussage.
- Temperatur: Parameter, der steuert, wie zufällig die nächste Wortwahl ausfällt.
Token
Ein Sprachmodell verarbeitet Text nicht als Wörter, sondern als Token: Wortteile, Wörter oder Satzzeichen. Länge und Kosten werden in Token gemessen.
Kontextfenster
Das Kontextfenster ist die Menge an Text, die das Modell auf einmal berücksichtigen kann: Anweisungen, bisheriger Verlauf, hochgeladene Dokumente und die Antwort. Passt etwas nicht mehr hinein, muss es gekürzt oder zusammengefasst werden.
Kein Gedächtnis zwischen Aufrufen
Ohne zusätzliche Funktionen „erinnert“ sich das Modell nur an das, was im aktuellen Kontext steht.
Halluzinationen
Modelle können plausibel klingende, aber falsche Aussagen erzeugen, etwa erfundene Quellen, Zahlen oder Funktionsnamen. Gegenmittel: Quellen mitliefern, Belege verlangen, Antworten gegenprüfen und dem Modell erlauben zu sagen „Das weiß ich nicht“.
Nicht-Determinismus
Dieselbe Frage kann unterschiedlich beantwortet werden. Parameter wie die Temperatur steuern, wie variabel die Antworten sind.
Wie eine Antwort entsteht
Das Modell erzeugt Text Token für Token. Für jede Position berechnet es eine Wahrscheinlichkeitsverteilung über mögliche nächste Token und wählt daraus eines; dieses wird angehängt, und der Vorgang wiederholt sich. Eine niedrige Temperatur bevorzugt die wahrscheinlichsten Token und macht Antworten gleichförmiger, eine höhere erlaubt mehr Abwechslung. Deshalb liefert dieselbe Frage nicht immer denselben Wortlaut.
Was im Kontextfenster steht
Zum Kontext gehören die Systemanweisung, der bisherige Gesprächsverlauf, hochgeladene Dokumente und die bereits erzeugte Antwort. Wird ein Gespräch sehr lang, kann Wichtiges aus frühen Teilen schlechter berücksichtigt werden oder ganz herausfallen. Nützlich sind dann kurze Zusammenfassungen zwischendurch oder ein neues Gespräch mit den wesentlichen Informationen vorneweg.
Warum Halluzinationen entstehen
Das Training belohnt sprachlich passende Fortsetzungen, nicht automatisch wahre. Fehlt dem Modell Wissen, kann es trotzdem eine plausible Antwort formen – etwa eine nicht existierende Quelle mit echt klingendem Titel. Risiken steigen bei seltenen Fakten, genauen Zahlen, Zitaten und Fragen, die eine falsche Annahme enthalten.
Was dagegen hilft
- Quellen oder Text mitliefern und „antworte nur anhand dieses Textes“ verlangen.
- Belege mit Fundstelle einfordern und stichprobenartig prüfen.
- Dem Modell ausdrücklich erlauben zu sagen, dass es etwas nicht weiß.
Ein Beispiel für Token: Das deutsche Wort „Barrierefreiheit“ wird oft in mehrere Wortteile zerlegt. Deshalb entspricht ein Token nur grob einem Wort – für Schätzungen rechnet man im Deutschen meist mit mehr Token pro Wort als im Englischen.
Zum Selbermachen: Halluzinationen erkennen
- Stelle eine Frage zu einer kleinen, aber überprüfbaren Tatsache aus deinem Fachgebiet.
- Bitte um eine Quellenangabe und prüfe, ob die Quelle existiert.
- Wiederhole dieselbe Frage mehrmals und beobachte, ob sich die Antworten unterscheiden.
- Stelle die Frage noch einmal mit mitgeliefertem Originaltext und vergleiche.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
- Vaswani et al. – „Attention Is All You Need“ (NeurIPS, 2017), Grundlage heutiger Sprachmodelle
- Anthropic – Claude Docs, Abschnitt „Glossary“ (Token, Kontextfenster; docs.anthropic.com) (allgemeine Referenz, nicht Zeile für Zeile geprüft)