Begriffe vorab
- Annotation: das Kennzeichnen von Texten mit der gewünschten Antwort durch Menschen.
- Klassifikation: Zuordnung zu einer Kategorie.
- Sequenzmarkierung: jedem Token eine Kategorie zuweisen, wie bei NER.
Named Entity Recognition (NER)
NER erkennt und klassifiziert benannte Entitäten in einem Text, etwa Personen, Organisationen, Orte oder Daten – wichtig z. B., um aus Nachrichtenartikeln automatisch strukturierte Information zu extrahieren.
Sentiment-Analyse
Sentiment-Analyse schätzt die emotionale Ausrichtung eines Textes, oft als positiv/negativ/neutral oder als feinere Skala. Sie wird u. a. zur automatisierten Auswertung von Produktbewertungen oder Social-Media-Beiträgen eingesetzt. Herausfordernd sind Ironie, Sarkasmus und Verneinungen, die die tatsächliche Stimmung gegenüber der wörtlichen Bedeutung umkehren können.
Maschinelle Übersetzung
Frühe Systeme nutzten regelbasierte oder statistische Verfahren; moderne neuronale maschinelle Übersetzung (NMT) setzt auf Encoder-Decoder-Architekturen (häufig Transformer-basiert), die einen Satz in der Ausgangssprache zunächst in eine interne Repräsentation kodieren und daraus dann den Zieltext erzeugen.
Frage-Antwort-Systeme und Zusammenfassung
Question Answering (QA) liefert zu einer Frage eine Antwort, entweder durch Extraktion einer Textstelle aus einem gegebenen Dokument (extraktives QA) oder durch freie Formulierung (generatives QA). Automatische Textzusammenfassung unterscheidet analog zwischen extraktiven Verfahren, die vorhandene Sätze auswählen und zusammenstellen, und abstraktiven Verfahren, die neue, kürzere Formulierungen generieren.
Viele dieser Aufgaben werden heute von einem einzigen, vielseitigen vortrainierten Sprachmodell übernommen, statt von separaten, aufgabenspezifisch trainierten Systemen – ein direkter Effekt des Pretraining/Fine-Tuning-Musters aus der vorigen Lektion.
Ein Beispiel für NER
Im Satz „Anna Schmidt reiste am 3. Mai nach Wien“ markiert ein NER-System „Anna Schmidt“ als Person, „3. Mai“ als Datum und „Wien“ als Ort. Daraus lassen sich Datenbankeinträge erzeugen, etwa aus Pressemitteilungen automatisch Veranstaltungen extrahieren.
Wie sich Aufgaben unterscheiden
- Klassifikation: ein Label pro Text (Sentiment, Thema).
- Sequenzmarkierung: ein Label pro Token (NER, POS).
- Generierung: Text als Ausgabe (Übersetzung, Zusammenfassung, Antwort).
Woran es in der Praxis hängt
Für überwachte Aufgaben braucht man annotierte Daten, und Annotation ist teuer und nicht immer eindeutig: Zwei Personen können denselben Satz unterschiedlich bewerten. Große Sprachmodelle können viele Aufgaben mit wenigen Beispielen im Prompt erledigen, ersetzen aber nicht die Prüfung auf echten Daten.
Zum Selbermachen: eine Aufgabe zuordnen
- Nimm fünf Anwendungen aus dem Alltag (Spam-Filter, Übersetzungs-App, Sprachassistent, Suchmaschine, Rechtschreibprüfung).
- Ordne jede einer der Aufgabentypen zu: Klassifikation, Sequenzmarkierung oder Generierung.
- Überlege, welche Annotation du für das Training bräuchtest.
- Beurteile, wo ein Fehler besonders folgenreich wäre.
Wie man die richtige Aufgabe wählt
Am Anfang steht die Frage, welche Entscheidung oder Handlung die Ausgabe unterstützen soll. Eine Kundenservice-Abteilung möchte Anfragen automatisch an das passende Team leiten – das ist Klassifikation. Eine Rechtsabteilung möchte Vertragsparteien und Fristen extrahieren – das ist Sequenzmarkierung. Eine Redaktion möchte Entwürfe – das ist Generierung. Die Aufgabe bestimmt Daten, Metrik und Risiken.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
- Dan Jurafsky, James H. Martin – „Speech and Language Processing“, Kapitel zu Information Extraction, maschineller Übersetzung und Frage-Antwort-Systemen (allgemeine Referenz, nicht Zeile für Zeile geprüft)