Geschwindigkeit pro Request: was Benchmarks angeben

Wenn unabhängige Benchmarks wie Artificial Analysis die "Ausgabegeschwindigkeit" angeben, messen sie die durchschnittliche Zahl der Token, die nach dem ersten Token pro Sekunde eintreffen. Gemessen wird ein einzelner Request. Die Zeit bis zum ersten Token zählt bewusst nicht mit. Diese Zahl bestimmt, was der Nutzer erlebt: wie schnell die Antwort gestreamt wird.

Auf unserer EU-Infrastruktur messen wir pro Request einen Ausgabe-Durchsatz von 713 tok/s mit gpt-oss-120b und 428 tok/s mit MiniMax M2.7 Ultraspeed (p50, 10.000 Token Eingabe, ein einzelner Request). Modelle verwenden unterschiedliche Tokenizer. Damit ihre Werte vergleichbar bleiben, rechnet Artificial Analysis alle Geschwindigkeiten in OpenAI-Token um, gezählt mit dem Tokenizer o200k_base von tiktoken.

Systemdurchsatz: wovon die Wirtschaftlichkeit der Anbieter abhängt

Die zweite Bedeutung ist der aggregierte Durchsatz: alle Token, die ein System pro Sekunde über sämtliche gleichzeitigen Requests hinweg erzeugt. Die Benchmarking-Literatur unterscheidet ausdrücklich zwischen "TPS pro Nutzer" und "TPS pro System". Ein GPU-Server liefert vielleicht jedem von 100 gleichzeitigen Nutzern 30 tok/s. Das ergibt 3000 tok/s Systemdurchsatz, für den einzelnen Request aber ein deutlich langsameres Erlebnis.

Genau hier werden Geschwindigkeitsangaben unscharf. Ein Anbieter kann wahrheitsgemäß mit Tausenden Token pro Sekunde werben, während jeder einzelne Request im Schneckentempo läuft. Fragen Sie deshalb bei jeder tok/s-Zahl zuerst: pro Request oder für das ganze System?

So lesen Sie eine tok/s-Angabe

Prüfen Sie drei Dinge. Erstens: Gilt der Wert pro Request oder für das ganze System? Zweitens: Ist die TTFT eingerechnet oder nicht? Artificial Analysis klammert sie per Definition aus. Drittens: Wie sieht der Workload aus? Prompt-Länge und Ausgabelänge verändern beide die Zahl. Unsere veröffentlichten Benchmarks nennen alle drei Angaben: pro Request, serverseitig, p50, 10.000 Token Eingabe und 1000 Token Ausgabe.

Quellen

Sehen Sie diese Metriken live gemessen auf unserer EU-Infrastruktur: echte Werte von Produktionshardware, unabhängig verifiziert.

Live-Benchmarks ansehen