Die Anatomie einer Antwort
Jede LLM-Antwort entsteht in zwei Phasen. Zuerst verarbeitet das Modell Ihren gesamten Prompt in einem parallelen Durchlauf (Prefill). Diese Phase bestimmt die Zeit bis zum ersten Token. Danach erzeugt es die Ausgabe Token für Token (Decode). Das Tempo dieser Phase ist die Inter-Token-Latenz, meist angegeben als Ausgabe-Token pro Sekunde. Die gesamte Antwortzeit ist ungefähr TTFT plus die Zahl der erzeugten Token mal die Zeit pro Token.
Die beiden Phasen belasten die Hardware unterschiedlich. Das Prefill ist in der Regel rechengebunden (compute-bound). Das Decode ist bei üblichen Batch-Größen meist speichergebunden (memory-bound), also durch die Speicherbandbreite begrenzt: Für jedes neue Token muss die Hardware die Modellgewichte aus dem Speicher bewegen. Deshalb kann dieselbe Hardware ein hervorragendes Prefill und zugleich eine mittelmäßige Generierungsgeschwindigkeit haben.
Welche Metrik für welchen Workload zählt
Im interaktiven Chat prägt vor allem die TTFT die Wahrnehmung. Nutzer bemerken die stille Pause vor dem Beginn der Ausgabe viel stärker als das Tempo des Streamings. Bei Voice Agents zählen beide Werte, und das Zeitbudget ist knapp. Bei agentischen Workloads wie Coding-Agents, Tool-Calling-Pipelines und autonomen Workflows dominiert die Ausgabegeschwindigkeit. Der Agent muss jedes Token jedes Schritts erhalten, bevor er handeln kann. So summiert sich die Generierungszeit über die ganze Kette.
Auf unserer Infrastruktur in München veröffentlichen wir alle drei Werte pro Modell. Für gpt-oss-120b sind das 388ms TTFT, 713 tok/s Ausgabe-Durchsatz und 1,789 Sekunden End-to-End bei einem Request mit 10.000 Token Eingabe und 1000 Token Ausgabe (serverseitig, p50).
Ehrlich messen
Geschwindigkeitswerte sind nur vergleichbar, wenn der Workload angegeben ist. Die Länge des Prompts verändert die TTFT. Die Länge der Ausgabe verschiebt das Verhältnis zwischen TTFT und Generierung. Die Parallelität verändert alles. Die End-to-End-Latenz enthält außerdem Anteile außerhalb des Modells: Netzwerk-Roundtrips (die Entfernung zum Rechenzentrum zählt), Gateway-Overhead und Wartezeit auf geteilter Kapazität. Clientseitig gemessene Werte weichen deshalb immer von serverseitigen ab. Unabhängige Benchmarks wie Artificial Analysis veröffentlichen ihre genauen Workloads: Tests mit 1K und 10K Eingabe-Token, 8-mal täglich gemessen, angegeben als Median über 72 Stunden. Diesem Standard folgen auch unsere veröffentlichten Benchmarks.
Quellen
Sehen Sie diese Metriken live gemessen auf unserer EU-Infrastruktur: echte Werte von Produktionshardware, unabhängig verifiziert.
Live-Benchmarks ansehen