Performance
Inferenshastighed, målt
Hvert tal på denne side kommer fra vores produktions-API i München, med metoden og datoen ved siden af. Du kan køre den samme test selv.
Tokens per sekund, målt
Tallene kommer fra vores produktions-API på vores servere i EU. Ikke en leverandørs markedsføring, men rigtige målinger, som du selv kan gentage.
gpt-oss-120b
Vores hurtigste
Op til 772 tok/s ved kortere prompts
MiniMax M2.7 Ultraspeed
Vores reasoning-model
Op til 444 tok/s ved kortere prompts
Gemma 4 31B
Indbygget multimodal
Forstår billeder og tekst direkte
Målinger på serversiden (p50), foretaget med vores open source-benchmarkværktøj. Dine resultater hos klienten afhænger af netværkets placering og forhold. Senest målt: juli 2026.
Hurtig LLM-inferens, efter workload
Hvilket tal der afgør din hastighed, afhænger af, hvad du bygger. Her er de samme målinger set fra tre vinkler.
Chat og stemme
Time to First Token
388 ms
gpt-oss-120b - p50
Samtale- og stemmegrænseflader bliver vurderet på, hvor hurtigt det første ord dukker op, ikke på, hvor hurtigt resten kommer.
Agenter og kode
Output-throughput
713 tok/s
gpt-oss-120b - p50
Agent-loops og kodeassistenter venter på hele svaret, så tokens per sekund sætter tempoet. Til frontier-ræsonnering over lange kørsler måler MiniMax M2.7 Ultraspeed 428 tok/s med et kontekstvindue på 192K.
Batch og RAG
End-to-end-latens
1,789 s
gpt-oss-120b - p50
For pipelines tæller den samlede tid, til svaret er komplet. Gemma 4 31B tager billede og tekst i samme forespørgsel til dokument- og vision-workloads.
Hastighed er kun den ene halvdel. Hvert tal ovenfor er målt på hardware, vi selv ejer i München. Se, hvad EU-suveræn betyder i praksis.
Hvad der sker under belastning
En forespørgsels outputhastighed holder, når flere forespørgsler kører parallelt: Chippen behandler en lille batch ad gangen, og hvert svar strømmer videre med næsten fuld hastighed. Det, der vokser, er time to first token, når forespørgsler skal vente på en plads i den næste batch. På det delte API sker det i spidsbelastningsperioder. Har din workload brug for planlagt kapacitet, har Enterprise-planer garanterede rate limits, og et dedikeret rack betjener kun din trafik.
Open source
Kør dit eget benchmark
Vores benchmarkværktøj er fuldt open source. Kør det mod vores API med din API-nøgle, eller klon repositoriet, og kør det lokalt. Samme kode, samme metode, dine egne resultater.
- 01
Syntetisk performance
Faste antal input- og output-tokens til kontrollerede sammenligninger mellem modeller
- 02
Simulering af rigtige workloads
Skiftende forespørgselsrater, der efterligner trafikmønstre fra produktion
- 03
Eget datasæt
Upload dine egne prompts, og mål performance på dit faktiske workload
- 04
Interaktiv chat
Målinger for hvert svar i en live chat: TTFT og throughput på hvert eneste svar
Sådan måler vi
Tre tal, målt under de samme betingelser: serverside p50, 10K input- og 1K output-tokens, én forespørgsel ad gangen. Vi måler igen hvert kvartal.
Time to First Token (TTFT)
Hvor hurtigt modellen begynder at svare efter din forespørgsel. Afgørende for interaktive applikationer og chatgrænseflader.
Output-throughput
De tokens per sekund, der genereres efter det første token. De afgør, hvor hurtigt et komplet svar når frem til brugeren.
End-to-end-latens
Den samlede tid fra forespørgsel til komplet svar, altså TTFT plus hele genereringstiden. Det er tallet, der tæller for batch-workloads.
Hvor tallene kommer fra
Alle målinger kommer fra vores produktionsinfrastruktur i München.
- Placering
- München, Tyskland
- Hardware
- SambaNova SN40L
- Ejerskab
- Egen hardware
- Certificering
- ISO 27001-certificeret
Dine forespørgsler behandles på racks, der tilhører Infercom, ikke på lejet cloud-kapacitet.
Teknologien, set uafhængigt
Disse kilder har målt eller skrevet om SambaNovas dataflow-teknologi, for det meste på SambaNovas egen cloud i USA. De er ikke målinger af vores tjeneste; vores står ovenfor.
- Artificial Analysis - SambaNova-benchmarks Artificial Analysis: Uafhængige, løbende opdaterede målinger af hastighed og latens for SambaNovas cloud, side om side med andre udbydere.
- SambaNova bryder grænsen på 1.000 tokens per sekund VentureBeat: 2024: SambaNova passerer 1.000 tokens per sekund med Llama 3.
- DeepSeek R1 671B med 95% færre chips TechRadar: 2025: SambaNova kører DeepSeek R1 671B på 16 chips, hvor GPU-opsætninger bruger langt flere.
- Hastighedsrekord med Llama 3.1 405B SambaNova: SambaNovas hastighedsresultat med Llama 3.1 405B, målt af Artificial Analysis.
- Intelligence per Joule SambaNova: SambaNova om, hvorfor energi per enhed intelligens betyder noget i stor skala.
- Forskning i Intelligence per Watt Stanford Hazy Research: En uafhængig metode til at måle AI-effektivitet; undersøgelsen omfatter SN40L.
Hastighed og energi
Mindre dataflytning gør chippen hurtig og sparer energi: En forespørgsel, der bliver færdig hurtigere, bruger strøm i kortere tid.
10 kW
Per rack, typisk
Omkring 10 kW ved typisk drift, 7-14,5 kW ved inferens.
Luftkølet
Ingen væskekøling
Passer ind i datacentre, der er bygget til almindelige servere. Chippene bruger ikke vand til køling.
Op til 5x
Energieffektivitet
SambaNova: 2,5x til 5,6x mod en NVIDIA H200 med Llama 70B, afhængigt af batchstørrelse (2025).
LLM-inferenshastighed: ofte stillede spørgsmål
Hvem har den hurtigste LLM-inferens i Europa?
Vi rangerer ikke andre udbydere; det gør uafhængige sammenligninger som Artificial Analysis. Vi offentliggør vores egen måling: 713 tok/s med gpt-oss-120b, op til 772 tok/s ved kortere prompts, målt på vores produktions-API i München (juli 2026). Med vores open source-benchmarkværktøj kan du køre den samme test mod enhver udbyder.
Hvilken model er hurtigst, og til hvad?
gpt-oss-120b har den højeste output-throughput med 713 tok/s og også vores korteste time to first token med 388 ms. Derfor er den standardvalget til chat, voice og agent-loops med stor volumen. MiniMax M2.7 Ultraspeed er vores frontier-reasoning-model med 229B parametre: 428 tok/s og et context window på 192K til lange agentiske kørsler og svære kodeopgaver. Gemma 4 31B måler 199 tok/s og tager også billeder og tekst som input. Chat og voice afhænger af time to first token, agenter og kodning af throughput.
Hvordan måles det, og kan jeg gentage målingen?
Ja. Hvert tal er en p50-måling på serversiden ved 10K input-tokens og 1K output-tokens med én forespørgsel, målt mod vores produktions-API med vores open source-benchmarkværktøj. Kør det online mod vores API med din egen nøgle, eller klon repositoriet, og kør det lokalt med dine egne prompts. Dine resultater hos klienten vil afvige afhængigt af netværkets placering og forhold.
Hvad sker der med hastigheden, når mange forespørgsler kører på én gang?
Hver forespørgsel strømmer videre med næsten fuld outputhastighed, fordi chippen behandler en lille batch ad gangen. Time to first token vokser, når forespørgsler venter på den næste batch, og det sker på det delte API i spidsbelastningsperioder. Til planlagt kapacitet findes Enterprise-rate limits eller et dedikeret rack.
Er hastigheden uafhængigt verificeret?
Artificial Analysis måler løbende SambaNovas cloud, VentureBeat og TechRadar har skrevet om dens hastighed, og en undersøgelse fra Stanford om energieffektivitet omfatter SN40L. Disse kilder handler om teknologien. Tallene per model på denne side er vores egne målinger på vores egen infrastruktur i München, og derfor offentliggør vi benchmarkværktøjet, så du selv kan tjekke dem.
Hvorfor er dataflow hurtigere end GPU'er?
Mens en GPU skriver et svar, kører den et modellag som mange separate trin og skriver resultaterne imellem tilbage til hukommelsen. En dataflow-chip kører hele laget som ét trin og holder resultaterne på chippen, så den bruger sin hukommelsesbåndbredde på vægtene og svarer hurtigere.
Optimer din integration
Få den bedste performance ud af din Infercom-integration med vores ressourcer til udviklere.
- Performance-guide Connection pooling, streaming og teknikker, der sænker latensen
- Benchmarkværktøj Kør benchmarks mod vores API med dine egne workloads
- AI Starter Kit Open source-eksempler, benchmarks og skabeloner til integration
- Priser Gennemsigtige priser per token: Du betaler kun for det, du bruger