Velocità per richiesta: cosa riportano i benchmark
Quando benchmark indipendenti come Artificial Analysis riportano la "velocità di output", misurano il numero medio di token ricevuti al secondo dopo l'arrivo del primo token. La misura riguarda una singola richiesta ed esclude di proposito il tempo al primo token. È questo il numero che determina l'esperienza dell'utente: la velocità con cui la risposta arriva in streaming.
Sulla nostra infrastruttura UE misuriamo un throughput di output per richiesta di 713 tok/s su gpt-oss-120b e di 428 tok/s su MiniMax M2.7 Ultraspeed (p50, input di 10.000 token, singola richiesta). I modelli usano tokenizer diversi. Per renderli confrontabili, Artificial Analysis converte tutte le metriche di velocità in token OpenAI, contati con il tokenizer o200k_base di tiktoken.
Throughput di sistema: da cosa dipende l'economia dei provider
Il secondo significato è il throughput aggregato: il totale dei token che un sistema produce al secondo su tutte le richieste simultanee. La letteratura sui benchmark distingue esplicitamente tra "TPS per utente" e "TPS per sistema". Un server GPU può fornire 30 tok/s a ciascuno di 100 utenti simultanei: sono 3.000 tok/s di throughput di sistema, ma un'esperienza molto più lenta per la singola richiesta.
È qui che le dichiarazioni sulla velocità diventano ambigue: un provider può pubblicizzare in modo veritiero migliaia di token al secondo mentre ogni singola richiesta procede a passo di lumaca. Quando vedi un valore in tok/s, la prima domanda da porsi è: per richiesta o sull'intero sistema?
Come leggere un dato in tok/s
Verifica tre cose: se il valore è per richiesta o aggregato, se il TTFT è incluso o escluso (Artificial Analysis lo esclude per definizione) e la forma del workload, perché sia la lunghezza del prompt sia quella dell'output cambiano il numero. I nostri benchmark pubblicati indicano tutti e tre gli aspetti: per richiesta, lato server, p50, 10.000 token di input e 1.000 token di output.
Fonti
Guarda queste metriche misurate dal vivo sulla nostra infrastruttura UE: numeri reali da hardware di produzione, verificati in modo indipendente.
Vedi i benchmark dal vivo