Für KI-Einsteiger: Dieser Artikel gehört zur Reihe „Was ist eigentlich …?“ und setzt kein Vorwissen voraus. Wenn du ChatGPT, Claude oder Gemini schon einmal eine Frage gestellt hast, bringst du alles mit, was du brauchst.
„Ich hab doch nur eine kurze Frage gestellt. Warum ist mein Limit schon aufgebraucht?“ Genau an dieser Stelle fällt in meinen Schulungen früher oder später das Wort Token, und genau an dieser Stelle steigt die halbe Runde gedanklich aus. Schade, denn die Antwort auf die Frage „Was sind Tokens?“ ist weniger technisch, als der Begriff klingt. Wer versteht, was Tokens sind, versteht auch, warum KI kostet, was sie kostet, und warum sie manchmal flott und manchmal zäh antwortet. Nach diesem Artikel weißt du, wie ein Sprachmodell Text zerlegt, wie du grob abschätzt, wie viel dein Text verbraucht, und warum Deutsch dabei teurer ist als Englisch. Dafür schauen wir zuerst einem Sprachmodell beim Lesen zu.
Kurz erklärt
- Token
- ein Textbaustein, mit dem ein Sprachmodell rechnet. Das kann ein ganzes Wort sein, ein Wortteil, ein einzelnes Zeichen oder ein Satzzeichen.
- Tokenizer
- das Werkzeug, das deinen Text in Tokens zerlegt, bevor das Modell ihn verarbeitet. Jeder Anbieter hat seinen eigenen.
- Input- und Output-Tokens
- Input ist alles, was an das Modell geht, also deine Frage samt Kontext. Output ist alles, was das Modell erzeugt.
- Kontextfenster
- die maximale Menge an Tokens, die ein Modell in einer Anfrage gleichzeitig verarbeiten kann. Mehr Begriffe dieser Art findest du in meinem KI-Lexikon mit den wichtigsten Fachbegriffen von A bis Z.
„Ein Token ist die Rechen- und Abrechnungseinheit eines Sprachmodells: Die KI liest in Tokens, schreibt in Tokens, und in Tokens wird auch bezahlt.“
Was sind Tokens, einfach erklärt?
Ein Sprachmodell liest keine Wörter so, wie du sie liest. Bevor es mit deinem Text überhaupt etwas anfangen kann, zerlegt der Tokenizer ihn in Bausteine und übersetzt jeden Baustein in eine Zahl. Mit diesen Zahlen rechnet das Modell, und am Ende werden die errechneten Zahlen wieder in Text zurückverwandelt, den du auf dem Bildschirm siehst.
Häufige, kurze Wörter bleiben dabei meistens am Stück. Seltene oder lange Wörter werden zerschnitten. Das Wort „Kostenvoranschlag“ etwa zerlegt der Tokenizer, den OpenAI für GPT-4o verwendet, in sechs Teile: K, ost, env, or, ansch, lag. Mit Silben hat das wenig zu tun. Der Tokenizer hat beim Training gelernt, welche Zeichenfolgen oft gemeinsam vorkommen, und schneidet nach dieser Statistik.
Stell dir einen Legokasten vor. Für häufige Formen gibt es fertige große Steine, für ungewöhnliche Formen musst du mehrere kleine zusammenstecken. Das Bild hinkt leicht, weil ein Legostein keinen Preis pro Stück hat, aber es trifft den Kern: Je ungewöhnlicher der Text, desto mehr Steine brauchst du.
Was sind eigentlich Tokens? Dein Prompt wird in Tokens zerlegt, also Textbausteine, die das Modell als Zahlen verarbeitet. Das Sprachmodell bewertet in jedem Durchgang alle möglichen nächsten Tokens und hängt eines an die Antwort an. Jeder Durchgang ergibt genau ein Token. Eine lange Antwort braucht deshalb viel mehr Durchgänge. Beispielrechnung: Eine kurze Antwort mit 40 Output-Tokens kostet 220 Einheiten, eine lange mit 800 Output-Tokens 4.020 Einheiten, rund 18-mal so viel. Mehr Tokens, mehr Rechenschritte, höhere Kosten.
Für eine grobe Schätzung reicht eine Faustregel, die OpenAI in seinem Hilfeartikel zum Verstehen und Zählen von Tokens nennt: Bei englischem Text entspricht ein Token ungefähr vier Zeichen oder drei Viertel eines Wortes, 100 Tokens sind also rund 75 Wörter. OpenAI betont dort selbst, dass das Schätzwerte sind und andere Sprachen anders zerfallen. Und damit sind wir bei uns.
Warum braucht Deutsch mehr Tokens als Englisch?
Die Tokenizer der großen Anbieter wurden mit Unmengen an Text trainiert, und ein großer Teil davon ist Englisch. Englische Wörter bekommen deshalb öfter einen eigenen, großen Baustein. Deutsche Komposita wie „Badezimmerrenovierung“ oder „Donaudampfschifffahrt“ kennt der Tokenizer seltener am Stück.
Du kannst das selbst ausprobieren. Der Satz „Ich brauche ein Angebot für die Renovierung meines Badezimmers.“ ergibt im Tokenizer von GPT-4o 13 Tokens. Die englische Fassung „I need a quote for renovating my bathroom.“ kommt mit 9 aus. Gleiche Aussage, gut 40 Prozent mehr Bausteine. Bei einem einzelnen Satz ist das egal, bei einem 50-seitigen Handbuch, das du Seite für Seite analysieren lässt, macht es sich in der Rechnung bemerkbar.
Die Forschung bestätigt das Muster. Eine Studie der University of Oxford, vorgestellt auf der NeurIPS-Konferenz 2023, hat gezeigt, dass derselbe Text je nach Sprache sehr unterschiedlich viele Tokens erzeugt, mit Unterschieden bis zum Fünfzehnfachen. Die Autoren nennen drei Folgen: höhere Kosten, längere Antwortzeiten und weniger Platz für Inhalte. Deutsch gehört zu den gut abgedeckten Sprachen und kommt vergleichsweise glimpflich davon, einen Aufpreis zahlst du trotzdem.
Dazu kommt, dass jeder Anbieter anders zerlegt, und manchmal sogar jede Modellgeneration. Anthropic hat bei den neueren Claude-Modellen einen Tokenizer eingeführt, der denselben Text in spürbar mehr Tokens zerlegt. Was das für den Preisvergleich zwischen Modellen bedeutet, hab ich im Artikel über den Modellwechsel mitten in der Aufgabe durchgerechnet. Für dich als Einsteiger reicht die Merkregel: Token-Zahlen sind nur innerhalb desselben Modells wirklich vergleichbar.
Was haben Tokens mit den Kosten zu tun?
Hier trennt sich die Welt in zwei Lager, und du solltest wissen, in welchem du stehst.
Wer KI über eine Programmierschnittstelle nutzt, die sogenannte API, zahlt direkt pro Token. Die Preise werden fast immer pro Million Tokens angegeben, getrennt nach Input und Output. Ein aktuelles Beispiel: Claude Sonnet 5 kostet laut Anthropics Preisliste 2 Dollar pro Million Input-Tokens und 10 Dollar pro Million Output-Tokens. Das Schreiben ist also fünfmal so teuer wie das Lesen.
Was das konkret bedeutet: Schickst du eine Frage mit 500 Tokens und bekommst eine Antwort mit 1.000 Tokens zurück, kostet das bei diesen Preisen gut einen Cent. Klingt nach nichts. Ein Kundenservice-Bot, der das zehntausendmal im Monat macht, landet aber bei über 100 Dollar, und da ist noch kein einziges Dokument im Spiel.
Ein Detail überrascht viele. Moderne Modelle „denken“ vor der eigentlichen Antwort nach, und dieses Nachdenken besteht ebenfalls aus Tokens. Du siehst es nicht als Antworttext, bezahlt wird es trotzdem, und zwar zum Output-Preis. Eine kurze Antwort kann deshalb deutlich mehr Tokens verbraucht haben, als auf dem Bildschirm steht.
Das zweite Lager sind die Abos wie ChatGPT Plus oder Claude Pro. Dort bekommst du keine Token-Rechnung, dafür ein Nutzungslimit. Anthropic nennt als Einflussfaktoren ausdrücklich die Länge und Komplexität der Unterhaltung, das gewählte Modell und die genutzten Funktionen. Eine feste Zahl an Nachrichten gibt es nicht. Übersetzt heißt das: Auch im Abo zählst du Tokens, du siehst sie nur nicht.
Und jetzt kommt der Teil, der die Eingangsfrage aus meiner Schulung beantwortet. Ein Sprachmodell hat zwischen zwei Nachrichten kein Gedächtnis. Damit es weiß, worüber ihr redet, wird bei jeder neuen Nachricht die komplette bisherige Unterhaltung wieder mitgeschickt. Deine kurze Frage am Ende eines stundenlangen Chats ist rechnerisch keine kurze Frage. Wie ich meine eigene Arbeitsweise deshalb umgebaut hab, steht in meinem Leitfaden, wie du Claude nutzt, ohne ins Tokenlimit zu laufen.
Warum bestimmen Tokens die Geschwindigkeit?
Ein Sprachmodell schreibt seine Antwort nicht auf einen Sitz. Es erzeugt ein Token, hängt es an, berechnet das nächste, hängt es an, und so weiter, bis die Antwort fertig ist. Deshalb siehst du den Text im Chatfenster Stück für Stück erscheinen. Die Geschwindigkeit eines Modells wird entsprechend in Tokens pro Sekunde gemessen.
Daraus folgen drei Dinge, die du im Alltag spürst. Lange Antworten dauern länger als kurze, logisch. Modelle, die vorher nachdenken, lassen dich warten, weil die Denk-Tokens auch erst erzeugt werden müssen. Und Deutsch ist tendenziell etwas langsamer als Englisch, weil für dieselbe Antwort mehr Bausteine entstehen. Genau diesen Zusammenhang zwischen Token-Menge und Wartezeit beschreibt auch die Oxford-Studie.
Das Lesen deines Inputs geht übrigens wesentlich schneller als das Schreiben, weil das Modell deinen Text in einem Rutsch verarbeiten kann. Ein langes Dokument hochzuladen bremst also weniger, als eine lange Antwort anzufordern.
Was passiert, wenn das Kontextfenster voll ist?
Jedes Modell hat eine Obergrenze, wie viele Tokens es auf einmal im Blick behalten kann. Bei Claude reicht das Kontextfenster auf den bezahlten Plänen je nach Modell bis zu einer Million Tokens, andere Anbieter liegen darüber oder darunter. Das klingt nach unendlich viel Platz. Wer aber ein paar dicke PDFs hochlädt und stundenlang im selben Chat arbeitet, kommt trotzdem an die Grenze.
Ist das Fenster voll, muss der Inhalt gekürzt oder zusammengefasst werden. Dabei gehen Details verloren. Wenn eine KI nach langer Arbeit plötzlich eine Vorgabe vom Anfang „vergisst“, liegt das oft genau daran.
Wie gehst du als Einsteiger sinnvoll mit Tokens um?
Du musst keine Tokens zählen, um gut mit KI zu arbeiten. Ein paar Gewohnheiten helfen aber sofort.
Fang für ein neues Thema einen neuen Chat an. Der alte Verlauf wandert sonst bei jeder Nachricht mit, obwohl er für die neue Frage nichts beiträgt. Schreib deine Anfrage vollständig in eine Nachricht, statt fünf kleine Nachfragen hinterherzuschicken. Und sag dazu, wie lang die Antwort sein soll. „Drei Sätze reichen“ spart Output-Tokens, und die sind die teureren.
Wenn du es genau wissen willst, kopier einen deiner Prompts in den kostenlosen Tokenizer, den OpenAI auf seiner Plattform anbietet. Die farbige Zerlegung zeigt dir in zehn Sekunden mehr als jede Erklärung.
Häufige Fragen zu Tokens
Tokens sind für KI das, was Kilowattstunden für deine Stromrechnung sind: unsichtbar im Alltag, entscheidend auf der Abrechnung. Du musst sie nicht zählen. Aber wenn du das nächste Mal ins Limit läufst, weißt du jetzt, wo du suchen musst.





