Was ist ein Token?
Ein Token ist das Stück Text, in das ein Sprachmodell alles zerlegt, bevor es rechnet. Meist ist es kürzer als ein Wort und länger als ein Buchstabe — eine Silbe, eine Endung, ein Satzzeichen. Modelle sehen keine Wörter und keine Buchstaben. Sie sehen Tokens.
Am schnellsten versteht man es, wenn man zusieht. Dasselbe Wortpaar, einmal deutsch, einmal englisch, zerlegt von der Kodierung o200k_base:
Künstliche␣Intelligenz6 Tokensartificial␣intelligence3 TokensZwei Wörter mit derselben Bedeutung, fast gleich lang — und das deutsche kostet doppelt so viel. Der Grund ist keine Absicht: Die Zerlegung wird auf einem Textbestand gelernt, in dem Englisch überwiegt. Häufige englische Wörter bekommen ein eigenes Token, deutsche Zusammensetzungen zerfallen in Bruchstücke — K, ünst,liche.
Was Deutsch kostet
Zehn Begriffspaare, jeweils dieselbe Bedeutung. Gemessen, nicht geschätzt:
| deutsch | Tok. | englisch | Tok. |
|---|---|---|---|
| Künstliche Intelligenz | 6 | artificial intelligence | 3 |
| Sprachmodell | 3 | language model | 2 |
| Datenschutz | 2 | data protection | 2 |
| Rechenleistung | 3 | computing power | 3 |
| Bilderzeugung | 4 | image generation | 2 |
| Verschlüsselung | 4 | encryption | 2 |
| Nutzungsbedingungen | 4 | terms of use | 3 |
| Bundesausbildungsförderungsgesetz | 8 | federal education support act | 5 |
| Geschwindigkeitsbegrenzung | 6 | speed limit | 2 |
| Wahrscheinlichkeitsverteilung | 6 | probability distribution | 3 |
Faktor 1,7 — derselbe Gedanke kostet auf Deutsch etwa siebzig Prozent mehr Tokens. Wer ein Modell auf Deutsch nutzt, zahlt mehr, wartet länger und stößt früher an die Grenze des Kontextfensters.
Wo ich mich fast vermessen hätte
Der erste Versuch nahm nicht Begriffspaare, sondern den ganzen Bestand dieser Seite — 28 deutsche gegen 172 englische Schlagzeilen. Ergebnis: Deutsch schnitt besser ab — 4.03 Zeichen je Token gegen 3.67. Das Gegenteil der Wahrheit.
Der Fehler steckt im Vergleich, nicht in der Messung: Die deutschen Schlagzeilen waren im Schnitt deutlich länger und behandelten andere Themen. Wer zwei Haufen misst, die sich in mehr als einer Sache unterscheiden, misst nicht das, was er glaubt. Erst derselbe Gedanke in zwei Sprachen ergibt einen Vergleich.
Was das praktisch heißt
- Kontextfenster werden in Tokens gemessen, nicht in Zeichen. Ein deutscher Text füllt es schneller als ein gleich langer englischer.
- Abgerechnet wird in Tokens — für die Eingabe und noch einmal für die Ausgabe. Deutsche Ein- und Ausgabe zahlt den Aufschlag zweimal.
- Als Größenordnung: alle 200 Schlagzeilen dieser Seite zusammen sind 2'866 Tokens. Ein Modell mit 128'000 Token Kontext könnte den Nachrichtenstand von rund 8'932 Schlagzeilen auf einmal lesen.
Alle Zahlen mit o200k_base (GPT-4o/5-Familie), tiktoken erhoben, am 2026-08-14 gegen den echten Bestand dieser Seite. Reproduzierbar: werkzeug/token-messung.py.