Informatik

Text als Daten: Tokenisierung

Bevor ein Sprachmodell Text verarbeiten kann, muss der Text in kleine Einheiten zerlegt werden — die Tokens. Dieser Schritt heißt Tokenisierung.

Was ist ein Token?

Ein Token kann ein Wort, ein Zeichen oder ein Wortteil sein. Die einfachste Form der Tokenisierung zerlegt einen Text in Wörter anhand von Leerzeichen.

Tokenisierung ist der Prozess, Text in einzelne verarbeitbare Einheiten (Tokens) zu zerlegen. Ein Token kann ein Wort, ein Zeichen oder ein Teilwort sein. Die Wahl der Tokenisierung bestimmt, was das Modell als „Einheit" sieht.

Ein einfacher Tokenizer

Bevor du das Programm ausführst: Wie viele Tokens hat der Text „Der Apfel ist süß und rot"? Zähle die Wörter.

a) Führe das Programm aus und vergleiche mit deiner Zählung.

b) Was passiert bei einem Text mit doppelten Leerzeichen, z.B. „Der Apfel ist süß"?

c) Ändere den Text so, dass ein Satzzeichen am Ende steht: „Der Apfel ist süß." Was passiert mit dem Punkt?

Tipp zu b)

Zwischen zwei Leerzeichen steht eine Zeichenkette — nämlich die leere. Zähle in der Ausgabe nach, wie viele Tokens herauskommen, und schau dir an, wie die zusätzlichen aussehen.

Tipp zu c)

split(" ") zerlegt nur an Leerzeichen. Der Punkt bleibt am letzten Token hängen: „süß." statt „süß" und „.". Das ist ein Problem, das echte Tokenizer lösen müssen.

Lösung. Erfrage das Passwort bei deiner Lehrkraft.

Tokenisierung ist der erste Schritt jedes Sprachmodells. Die einfache Wort-Tokenisierung an Leerzeichen ist ein Anfang, aber sie hat Grenzen: Satzzeichen bleiben hängen, und zusammengesetzte Wörter werden nicht getrennt. Echte LLMs nutzen komplexere Tokenisierer, die Wörter weiter in Silben oder Zeichen zerlegen.

Tokenisieren und sehen, was herauskommt

Diese Komponente zerlegt den Text genauso wie dein Programm, nämlich mit split(" "). Ein steht für ein leeres Token.

a) Wie viele Tokens zählt die Komponente? Klicke danach in das Textfeld und setze zwischen die Wörter jeweils ein zweites Leerzeichen. Was passiert mit der Anzahl — und woher kommen die ∅?

b) Schreibe einen Punkt an das Ende. Sieh dir das letzte Token an: Wie heißt es jetzt?

c) Schreibe zusätzlich „der Apfel ist süß" klein dahinter. Wie viele verschiedene Tokens zählt die Komponente nun? Wie viele wären es, wenn Groß- und Kleinschreibung egal wären?

d) Setze den Haken bei Satzzeichen abtrennen und klein schreiben. Prüfe deine Antworten zu a) bis c) noch einmal.

Tipp zu c)

Die Zeile unter den Tokens nennt beide Zahlen: wie viele Tokens es insgesamt sind und wie viele davon verschieden. Die zweite Zahl ist die Größe des Vokabulars.


Selbsttest

Text als Daten: Tokenisierung

Teilbare URL erstellen

Abschnitte auswählen