Performance

Velocità di inferenza, misurata

Ogni numero di questa pagina viene dalla nostra API di produzione a Monaco di Baviera, con metodo e data accanto. Puoi eseguire lo stesso test anche tu.

713tok/s con gpt-oss-120bMisurazioni
388ms al primo token, gpt-oss-120bMisurazioni
428tok/s con MiniMax M2.7Misurazioni
fino a10xpiù veloce dell'inferenza su GPUFonti

Throughput di output, p50, 10K input / 1K output, singola richiesta. Ultima misurazione: luglio 2026.

Token al secondo, misurati

Questi numeri provengono dalla nostra API di produzione, con i nostri server nell'UE. Non è il marketing di un fornitore, ma misurazioni reali che puoi ripetere.

gpt-oss-120b

Il nostro più veloce

713tok/s · Throughput di output
388ms · Time to First Token
1,789s · Latenza end-to-end

Fino a 772 tok/s con prompt più brevi

MiniMax M2.7 Ultraspeed

Il nostro modello di ragionamento

428tok/s · Throughput di output
690ms · Time to First Token
3,023s · Latenza end-to-end

Fino a 444 tok/s con prompt più brevi

Gemma 4 31B

Multimodale nativo

199tok/s · Throughput di output
1.189ms · Time to First Token
6,206s · Latenza end-to-end

Comprende nativamente immagini e testo

Metriche lato server (p50), misurate con il nostro strumento di benchmark open source. I tuoi risultati lato client dipendono dalla posizione e dalle condizioni della rete. Ultima misurazione: luglio 2026.

Inferenza LLM veloce, per workload

Quale numero determina la tua velocità dipende da ciò che stai costruendo. Ecco le stesse misurazioni viste da tre angolazioni.

Chat e voce

Time to First Token

388 ms

gpt-oss-120b - p50

Le interfacce conversazionali e vocali si giudicano da quanto in fretta compare la prima parola, non da quanto in fretta arriva il resto.

Time to First Token

Agenti e coding

Throughput di output

713 tok/s

gpt-oss-120b - p50

I loop degli agenti e gli assistenti di coding aspettano la risposta completa, quindi sono i token al secondo a dettare il ritmo. Per il ragionamento di livello frontier su esecuzioni lunghe, MiniMax M2.7 Ultraspeed misura 428 tok/s con un context window di 192K.

Throughput di output

Batch e RAG

Latenza end-to-end

1,789 s

gpt-oss-120b - p50

Per le pipeline conta il tempo totale fino alla risposta completa. Gemma 4 31B accetta immagini e testo nella stessa richiesta, per workload di documenti e visione.

Latenza end-to-end

La velocità è solo metà del discorso. Ogni numero qui sopra è stato misurato su hardware di nostra proprietà a Monaco. Scopri cosa significa sovrano UE nella pratica.

Cosa succede sotto carico

La velocità di output di una richiesta resta stabile quando più richieste girano in parallelo: il chip elabora un piccolo batch alla volta, e ogni risposta continua a scorrere quasi alla massima velocità. Ciò che cresce è il time to first token, quando le richieste devono aspettare un posto nel batch successivo. Sull'API condivisa succede nelle ore di punta. Se il tuo workload ha bisogno di capacità pianificata, i piani Enterprise includono rate limit garantiti, e un rack dedicato serve solo il tuo traffico.

Dedicated Capacity

Open source

Esegui il tuo benchmark

Il nostro strumento di benchmark è completamente open source. Eseguilo sulla nostra API con la tua chiave API, oppure clona il repository ed eseguilo in locale. Stesso codice, stessa metodologia, i tuoi risultati.

  1. 01

    Prestazioni sintetiche

    Numero fisso di token di input e di output per confronti controllati tra modelli

  2. 02

    Simulazione di workload reali

    Tassi di richiesta variabili che riproducono i modelli di traffico della produzione

  3. 03

    Dataset personalizzato

    Carica i tuoi prompt e misura le prestazioni sul tuo workload reale

  4. 04

    Chat interattiva

    Metriche per ogni risposta in una chat dal vivo: TTFT e throughput visibili a ogni risposta

Come misuriamo

Tre numeri, misurati nelle stesse condizioni: p50 lato server, 10K token di input e 1K di output, una richiesta alla volta. Ripetiamo le misurazioni ogni trimestre.

Time to First Token (TTFT)

Quanto in fretta il modello inizia a rispondere dopo la tua richiesta. Fondamentale per le applicazioni interattive e le interfacce di chat.

Throughput di output

I token generati al secondo dopo il primo token. Determinano quanto in fretta una risposta completa arriva all'utente.

Latenza end-to-end

Il tempo totale dalla richiesta alla risposta completa, cioè il TTFT più l'intero tempo di generazione. È il numero che conta per i workload batch.

Da dove vengono questi numeri

Tutte le misurazioni vengono dalla nostra infrastruttura di produzione a Monaco di Baviera.

Sede
Monaco, Germania
Hardware
SambaNova SN40L
Proprietà
Hardware di proprietà
Certificazione
Certificazione ISO 27001

Le tue richieste vengono elaborate su rack che appartengono a Infercom, non su capacità cloud in affitto.

Come funziona l'hardware

Velocità ed energia

Meno movimento di dati rende il chip veloce e fa risparmiare energia: una richiesta che finisce prima assorbe potenza per meno tempo.

10 kW

Per rack, tipici

Circa 10 kW nel funzionamento tipico, 7-14,5 kW in inferenza.

Ad aria

Nessun raffreddamento a liquido

Si adatta ai datacenter costruiti per i server normali. I chip non usano acqua per il raffreddamento.

Fino a 5x

Efficienza energetica

SambaNova: da 2,5x a 5,6x rispetto a una NVIDIA H200 con Llama 70B, a seconda della dimensione del batch (2025).

Perché il chip fa risparmiare energia

Velocità di inferenza LLM: domande frequenti

Chi ha l'inferenza LLM più veloce in Europa?

Non stiliamo classifiche di altri provider; lo fanno confronti indipendenti come Artificial Analysis. Pubblichiamo la nostra misurazione: 713 tok/s con gpt-oss-120b, fino a 772 tok/s con prompt più brevi, misurati sulla nostra API di produzione a Monaco di Baviera (luglio 2026). Con il nostro strumento di benchmark open source puoi eseguire lo stesso test su qualsiasi provider.

Esegui tu il benchmark

Quale modello è il più veloce, e per cosa?

gpt-oss-120b guida il throughput di output con 713 tok/s e ha anche il nostro time to first token più basso, 388 ms: per questo è la scelta predefinita per chat, voce e loop di agenti ad alto volume. MiniMax M2.7 Ultraspeed è il nostro modello di ragionamento di frontiera da 229B parametri: 428 tok/s e una context window di 192K per lunghe esecuzioni agentiche e compiti di coding difficili. Gemma 4 31B misura 199 tok/s e accetta anche immagini e testo in input. Chat e voce dipendono dal time to first token, agenti e coding dal throughput.

Confronta i modelli

Come viene misurato, e posso verificarlo?

Sì. Ogni numero è un p50 lato server con 10K token di input e 1K token di output, singola richiesta, misurato sulla nostra API di produzione con il nostro strumento di benchmark open source. Eseguilo online sulla nostra API con la tua chiave, oppure clona il repository ed eseguilo in locale con i tuoi prompt. I tuoi risultati lato client varieranno in base alla posizione e alle condizioni della rete.

Vedi il codice sorgente dello strumento di benchmark

Cosa succede alla velocità quando molte richieste girano insieme?

Ogni richiesta continua a scorrere quasi alla massima velocità di output, perché il chip elabora un piccolo batch alla volta. Il time to first token cresce quando le richieste aspettano il batch successivo, cosa che sull'API condivisa succede nelle ore di punta. Per una capacità pianificata ci sono i rate limit Enterprise o un rack dedicato.

Dedicated Capacity

La velocità è verificata in modo indipendente?

Artificial Analysis misura di continuo il cloud di SambaNova, VentureBeat e TechRadar ne hanno raccontato la velocità, e uno studio di Stanford sull'efficienza energetica include il SN40L. Queste fonti riguardano la tecnologia. I numeri per modello di questa pagina sono misurazioni nostre sulla nostra infrastruttura a Monaco di Baviera, ed è per questo che pubblichiamo lo strumento di benchmark: così puoi verificarli.

Vedi i benchmark indipendenti

Perché il dataflow è più veloce delle GPU?

Mentre scrive una risposta, una GPU esegue uno strato del modello in tanti passaggi separati e riscrive in memoria i risultati intermedi. Un chip dataflow esegue l'intero strato in un solo passaggio e tiene quei risultati sul chip, così usa la larghezza di banda di memoria per i pesi e risponde prima.

Architettura dataflow e GPU a confronto

Vuoi costruire il futuro dell'AI in Europa?

Unisciti alle organizzazioni che usano l'AI sovrana con prestazioni di altissimo livello