Token
Ein Token ist die kleinste Einheit, die ein Sprachmodell verarbeitet — je nach Verfahren ein Wort, ein Wortteil oder ein einzelnes Zeichen.
Das Zerlegen eines Textes in Tokens heißt Tokenisierung und ist der erste Schritt jedes Sprachmodells. Eine einfache Zerlegung an Leerzeichen lässt Satzzeichen am Wort hängen, sodass „süß" und „süß." für das Modell zwei völlig verschiedene Einheiten sind. Echte LLMs zerlegen deshalb in häufige Teilstücke.