Was TTFT tatsächlich misst
Trifft ein Request ein, verarbeitet das Modell zuerst den gesamten Prompt in einem einzigen parallelen Durchlauf, der Prefill-Phase. Dabei baut es seinen internen Zustand auf, den KV-Cache. Erst danach kann es das erste Token ausgeben. TTFT erfasst diese Verarbeitungszeit und alles, was dazukommt: die Wartezeit in der Warteschlange des Anbieters und den Roundtrip durch das Netzwerk. Gängige Benchmark-Definitionen messen TTFT vom Absenden des Requests bis zum ersten Token, einschließlich Warteschlange, Prefill und Netzwerklatenz.
Weil das Prefill jedes Eingabe-Token verarbeitet, wächst die TTFT mit der Länge des Prompts: Je länger der Prompt, desto später kommt das erste Token. Unter hoher Last wird die Warteschlange zum wichtigsten Faktor. Treffen mehr Requests ein, als das System in Batches bündeln kann, steigt die TTFT, obwohl das Modell selbst nicht langsamer rechnet.
Warum TTFT wichtig ist
TTFT ist die Metrik für Reaktionsschnelligkeit. Im Chat bestimmt sie, wie lange der Bildschirm leer bleibt, nachdem der Nutzer Enter gedrückt hat. Davon hängt mehr als von allem anderen ab, ob sich eine KI-Anwendung schnell anfühlt. Bei Voice Agents ist TTFT noch kritischer: Eine Gesprächspause von mehr als einer Sekunde wirkt, als wäre etwas kaputt.
Auf unserer Produktionsinfrastruktur in München messen wir für gpt-oss-120b eine p50-TTFT von 388ms bei 10.000 Token Eingabe. Das ist serverseitig gemessen, mit einem langen Prompt. Artificial Analysis, die unabhängige Benchmarking-Organisation, definiert TTFT genau so, wie wir sie angeben: als Zeit zwischen dem Absenden eines Requests und dem Eintreffen des ersten Tokens der Antwort.
Feinheiten, die man kennen sollte
Clientseitig und serverseitig gemessene TTFT unterscheiden sich. Der Client sieht Wartezeit, Prefill und Netzwerk zusammen. Serverseitige Metriken trennen die Wartezeit meist vom Prefill. Prüfen Sie beim Vergleich von Anbietern, welcher Wert angegeben ist. Bei Reasoning-Modellen kommt eine weitere Unterscheidung hinzu: Das erste Token kann ein "Thinking"-Token sein. Benchmarks erfassen deshalb die Zeit bis zum ersten Token und die Zeit bis zum ersten Antwort-Token getrennt.
Für ein vollständiges Bild der Antwortgeschwindigkeit braucht es TTFT und Ausgabegeschwindigkeit zusammen. Die Gesamtlatenz ist ungefähr TTFT plus die Zahl der erzeugten Token mal die Zeit pro Ausgabe-Token. Was Ihre Nutzer tatsächlich erleben, die End-to-End-Latenz, enthält auch Anteile ganz außerhalb des Modells. Dazu gehören Netzwerk-Roundtrips, die doppelt anfallen (für Request und Antwort) und mit der Entfernung zum Rechenzentrum wachsen. Hinzu kommen Gateway-Overhead für Authentifizierung und Routing sowie Wartezeit auf geteilter Infrastruktur. Ein Anbieter, der von einem anderen Kontinent aus mit schneller TTFT wirbt, kann sich in Europa trotzdem langsam anfühlen. Auch deshalb veröffentlichen wir serverseitige Werte und weisen darauf hin, dass clientseitige Ergebnisse je nach Standort schwanken.
Quellen
Sehen Sie diese Metriken live gemessen auf unserer EU-Infrastruktur: echte Werte von Produktionshardware, unabhängig verifiziert.
Live-Benchmarks ansehen