Was ITL tatsächlich misst
Nach dem ersten Token, das die TTFT erfasst, erzeugt das Modell den Rest der Antwort Token für Token. Das ist die Decode-Phase. Die ITL ist der durchschnittliche Abstand zwischen diesen Token. Benchmarking-Tools berechnen sie meist so: End-to-End-Latenz minus TTFT, geteilt durch die Zahl der Ausgabe-Token minus eins. Das erste Token bleibt bewusst außen vor, damit die ITL die reine Generierungsgeschwindigkeit zeigt.
ITL und Ausgabegeschwindigkeit sind zwei Blickwinkel auf dieselbe Größe: Je länger die Ausgabe, desto näher kommen die Token pro Sekunde eines Requests dem Wert 1 geteilt durch ITL. Unsere gemessenen 713 Token pro Sekunde mit gpt-oss-120b entsprechen einem durchschnittlichen Abstand von rund 1,4 Millisekunden zwischen zwei Token. 428 Token pro Sekunde mit MiniMax M2.7 Ultraspeed entsprechen rund 2,3 Millisekunden.
Warum ITL wichtig ist
Für Menschen, die eine Chat-Antwort lesen, ist fast jeder moderne Anbieter schnell genug, denn wir lesen nur wenige Token pro Sekunde. Entscheidend wird die ITL bei agentischen Workloads, in denen Software die Ausgabe weiterverarbeitet. Ein Coding-Agent, der auf einen Diff mit 3000 Token wartet, wartet auf jedes einzelne dieser Token. Bei 30 Millisekunden Abstand sind das 90 Sekunden Generierung, bei 1,4 Millisekunden etwa 4 Sekunden. Agenten arbeiten in Schleifen: generieren, Tools ausführen, wieder generieren. Deshalb summiert sich die Inter-Token-Latenz über jeden Schritt der Kette.
Die ITL zeigt außerdem, wie gut eine Infrastruktur unter Last arbeitet. Die Decode-Phase ist durch die Speicherbandbreite begrenzt. Bündelt ein Anbieter viele Nutzer im selben Batch auf derselben Hardware, steigt die ITL für jeden einzelnen. Bleibt die ITL über den ganzen Tag stabil, ist die Kapazität tatsächlich vorhanden und nicht überbucht.
Feinheiten, die man kennen sollte
Benchmarking-Tools rechnen nicht alle mit derselben Formel. Manche lassen das erste Token beim Durchschnitt weg, andere zählen es mit. ITL-Werte aus verschiedenen Tools lassen sich deshalb nicht direkt vergleichen. Außerdem ist die ITL ein Durchschnitt: Die tatsächlichen Abstände schwanken im Lauf einer Antwort, weil der KV-Cache wächst. Die Metrik heißt mitunter auch TPOT (Time per Output Token). In der technischen Dokumentation der Branche werden beide Begriffe gleichbedeutend verwendet.
Quellen
Sehen Sie diese Metriken live gemessen auf unserer EU-Infrastruktur: echte Werte von Produktionshardware, unabhängig verifiziert.
Live-Benchmarks ansehen