Performance
Velocità di inferenza, misurata
Ogni numero di questa pagina viene dalla nostra API di produzione a Monaco di Baviera, con metodo e data accanto. Puoi eseguire lo stesso test anche tu.
Throughput di output, p50, 10K input / 1K output, singola richiesta. Ultima misurazione: luglio 2026.
Token al secondo, misurati
Questi numeri provengono dalla nostra API di produzione, con i nostri server nell'UE. Non è il marketing di un fornitore, ma misurazioni reali che puoi ripetere.
gpt-oss-120b
Il nostro più veloce
Fino a 772 tok/s con prompt più brevi
MiniMax M2.7 Ultraspeed
Il nostro modello di ragionamento
Fino a 444 tok/s con prompt più brevi
Gemma 4 31B
Multimodale nativo
Comprende nativamente immagini e testo
Metriche lato server (p50), misurate con il nostro strumento di benchmark open source. I tuoi risultati lato client dipendono dalla posizione e dalle condizioni della rete. Ultima misurazione: luglio 2026.
Inferenza LLM veloce, per workload
Quale numero determina la tua velocità dipende da ciò che stai costruendo. Ecco le stesse misurazioni viste da tre angolazioni.
Chat e voce
Time to First Token
388 ms
gpt-oss-120b - p50
Le interfacce conversazionali e vocali si giudicano da quanto in fretta compare la prima parola, non da quanto in fretta arriva il resto.
Agenti e coding
Throughput di output
713 tok/s
gpt-oss-120b - p50
I loop degli agenti e gli assistenti di coding aspettano la risposta completa, quindi sono i token al secondo a dettare il ritmo. Per il ragionamento di livello frontier su esecuzioni lunghe, MiniMax M2.7 Ultraspeed misura 428 tok/s con un context window di 192K.
Batch e RAG
Latenza end-to-end
1,789 s
gpt-oss-120b - p50
Per le pipeline conta il tempo totale fino alla risposta completa. Gemma 4 31B accetta immagini e testo nella stessa richiesta, per workload di documenti e visione.
La velocità è solo metà del discorso. Ogni numero qui sopra è stato misurato su hardware di nostra proprietà a Monaco. Scopri cosa significa sovrano UE nella pratica.
Cosa succede sotto carico
La velocità di output di una richiesta resta stabile quando più richieste girano in parallelo: il chip elabora un piccolo batch alla volta, e ogni risposta continua a scorrere quasi alla massima velocità. Ciò che cresce è il time to first token, quando le richieste devono aspettare un posto nel batch successivo. Sull'API condivisa succede nelle ore di punta. Se il tuo workload ha bisogno di capacità pianificata, i piani Enterprise includono rate limit garantiti, e un rack dedicato serve solo il tuo traffico.
Open source
Esegui il tuo benchmark
Il nostro strumento di benchmark è completamente open source. Eseguilo sulla nostra API con la tua chiave API, oppure clona il repository ed eseguilo in locale. Stesso codice, stessa metodologia, i tuoi risultati.
- 01
Prestazioni sintetiche
Numero fisso di token di input e di output per confronti controllati tra modelli
- 02
Simulazione di workload reali
Tassi di richiesta variabili che riproducono i modelli di traffico della produzione
- 03
Dataset personalizzato
Carica i tuoi prompt e misura le prestazioni sul tuo workload reale
- 04
Chat interattiva
Metriche per ogni risposta in una chat dal vivo: TTFT e throughput visibili a ogni risposta
Come misuriamo
Tre numeri, misurati nelle stesse condizioni: p50 lato server, 10K token di input e 1K di output, una richiesta alla volta. Ripetiamo le misurazioni ogni trimestre.
Time to First Token (TTFT)
Quanto in fretta il modello inizia a rispondere dopo la tua richiesta. Fondamentale per le applicazioni interattive e le interfacce di chat.
Throughput di output
I token generati al secondo dopo il primo token. Determinano quanto in fretta una risposta completa arriva all'utente.
Latenza end-to-end
Il tempo totale dalla richiesta alla risposta completa, cioè il TTFT più l'intero tempo di generazione. È il numero che conta per i workload batch.
Da dove vengono questi numeri
Tutte le misurazioni vengono dalla nostra infrastruttura di produzione a Monaco di Baviera.
- Sede
- Monaco, Germania
- Hardware
- SambaNova SN40L
- Proprietà
- Hardware di proprietà
- Certificazione
- Certificazione ISO 27001
Le tue richieste vengono elaborate su rack che appartengono a Infercom, non su capacità cloud in affitto.
La tecnologia, vista in modo indipendente
Queste fonti hanno misurato o raccontato la tecnologia dataflow di SambaNova, per lo più sul cloud di SambaNova negli Stati Uniti. Non sono misurazioni del nostro servizio; le nostre sono sopra.
- Artificial Analysis - Benchmark di SambaNova Artificial Analysis: Misurazioni indipendenti e sempre aggiornate di velocità e latenza del cloud di SambaNova, accanto ad altri provider.
- SambaNova supera la soglia dei 1.000 token al secondo VentureBeat: 2024: SambaNova supera i 1.000 token al secondo con Llama 3.
- DeepSeek R1 671B con il 95% di chip in meno TechRadar: 2025: SambaNova esegue DeepSeek R1 671B su 16 chip, dove i sistemi GPU ne usano molti di più.
- Record di velocità con Llama 3.1 405B SambaNova: Il risultato di velocità di SambaNova con Llama 3.1 405B, misurato da Artificial Analysis.
- Intelligence per Joule SambaNova: SambaNova sul perché l'energia per unità di intelligenza conta su larga scala.
- Ricerca su Intelligence per Watt Stanford Hazy Research: Un metodo indipendente per misurare l'efficienza dell'AI; lo studio include il SN40L.
Velocità ed energia
Meno movimento di dati rende il chip veloce e fa risparmiare energia: una richiesta che finisce prima assorbe potenza per meno tempo.
10 kW
Per rack, tipici
Circa 10 kW nel funzionamento tipico, 7-14,5 kW in inferenza.
Ad aria
Nessun raffreddamento a liquido
Si adatta ai datacenter costruiti per i server normali. I chip non usano acqua per il raffreddamento.
Fino a 5x
Efficienza energetica
SambaNova: da 2,5x a 5,6x rispetto a una NVIDIA H200 con Llama 70B, a seconda della dimensione del batch (2025).
Velocità di inferenza LLM: domande frequenti
Chi ha l'inferenza LLM più veloce in Europa?
Non stiliamo classifiche di altri provider; lo fanno confronti indipendenti come Artificial Analysis. Pubblichiamo la nostra misurazione: 713 tok/s con gpt-oss-120b, fino a 772 tok/s con prompt più brevi, misurati sulla nostra API di produzione a Monaco di Baviera (luglio 2026). Con il nostro strumento di benchmark open source puoi eseguire lo stesso test su qualsiasi provider.
Quale modello è il più veloce, e per cosa?
gpt-oss-120b guida il throughput di output con 713 tok/s e ha anche il nostro time to first token più basso, 388 ms: per questo è la scelta predefinita per chat, voce e loop di agenti ad alto volume. MiniMax M2.7 Ultraspeed è il nostro modello di ragionamento di frontiera da 229B parametri: 428 tok/s e una context window di 192K per lunghe esecuzioni agentiche e compiti di coding difficili. Gemma 4 31B misura 199 tok/s e accetta anche immagini e testo in input. Chat e voce dipendono dal time to first token, agenti e coding dal throughput.
Come viene misurato, e posso verificarlo?
Sì. Ogni numero è un p50 lato server con 10K token di input e 1K token di output, singola richiesta, misurato sulla nostra API di produzione con il nostro strumento di benchmark open source. Eseguilo online sulla nostra API con la tua chiave, oppure clona il repository ed eseguilo in locale con i tuoi prompt. I tuoi risultati lato client varieranno in base alla posizione e alle condizioni della rete.
Cosa succede alla velocità quando molte richieste girano insieme?
Ogni richiesta continua a scorrere quasi alla massima velocità di output, perché il chip elabora un piccolo batch alla volta. Il time to first token cresce quando le richieste aspettano il batch successivo, cosa che sull'API condivisa succede nelle ore di punta. Per una capacità pianificata ci sono i rate limit Enterprise o un rack dedicato.
La velocità è verificata in modo indipendente?
Artificial Analysis misura di continuo il cloud di SambaNova, VentureBeat e TechRadar ne hanno raccontato la velocità, e uno studio di Stanford sull'efficienza energetica include il SN40L. Queste fonti riguardano la tecnologia. I numeri per modello di questa pagina sono misurazioni nostre sulla nostra infrastruttura a Monaco di Baviera, ed è per questo che pubblichiamo lo strumento di benchmark: così puoi verificarli.
Perché il dataflow è più veloce delle GPU?
Mentre scrive una risposta, una GPU esegue uno strato del modello in tanti passaggi separati e riscrive in memoria i risultati intermedi. Un chip dataflow esegue l'intero strato in un solo passaggio e tiene quei risultati sul chip, così usa la larghezza di banda di memoria per i pesi e risponde prima.
Ottimizza la tua integrazione
Ottieni le migliori prestazioni dalla tua integrazione con Infercom grazie alle nostre risorse per sviluppatori.