Performance

Inferenshastighed, målt

Hvert tal på denne side kommer fra vores produktions-API i München, med metoden og datoen ved siden af. Du kan køre den samme test selv.

713tok/s med gpt-oss-120bMålinger
388ms til første token, gpt-oss-120bMålinger
428tok/s med MiniMax M2.7Målinger
op til10xhurtigere end GPU-baseret inferensKilder

Output-throughput, p50, 10K input / 1K output, én forespørgsel. Senest målt: juli 2026.

Tokens per sekund, målt

Tallene kommer fra vores produktions-API på vores servere i EU. Ikke en leverandørs markedsføring, men rigtige målinger, som du selv kan gentage.

gpt-oss-120b

Vores hurtigste

713tok/s · Output-throughput
388ms · Time to First Token
1,789s · End-to-end-latens

Op til 772 tok/s ved kortere prompts

MiniMax M2.7 Ultraspeed

Vores reasoning-model

428tok/s · Output-throughput
690ms · Time to First Token
3,023s · End-to-end-latens

Op til 444 tok/s ved kortere prompts

Gemma 4 31B

Indbygget multimodal

199tok/s · Output-throughput
1.189ms · Time to First Token
6,206s · End-to-end-latens

Forstår billeder og tekst direkte

Målinger på serversiden (p50), foretaget med vores open source-benchmarkværktøj. Dine resultater hos klienten afhænger af netværkets placering og forhold. Senest målt: juli 2026.

Hurtig LLM-inferens, efter workload

Hvilket tal der afgør din hastighed, afhænger af, hvad du bygger. Her er de samme målinger set fra tre vinkler.

Chat og stemme

Time to First Token

388 ms

gpt-oss-120b - p50

Samtale- og stemmegrænseflader bliver vurderet på, hvor hurtigt det første ord dukker op, ikke på, hvor hurtigt resten kommer.

Time to First Token

Agenter og kode

Output-throughput

713 tok/s

gpt-oss-120b - p50

Agent-loops og kodeassistenter venter på hele svaret, så tokens per sekund sætter tempoet. Til frontier-ræsonnering over lange kørsler måler MiniMax M2.7 Ultraspeed 428 tok/s med et kontekstvindue på 192K.

Output-throughput

Batch og RAG

End-to-end-latens

1,789 s

gpt-oss-120b - p50

For pipelines tæller den samlede tid, til svaret er komplet. Gemma 4 31B tager billede og tekst i samme forespørgsel til dokument- og vision-workloads.

End-to-end-latens

Hastighed er kun den ene halvdel. Hvert tal ovenfor er målt på hardware, vi selv ejer i München. Se, hvad EU-suveræn betyder i praksis.

Hvad der sker under belastning

En forespørgsels outputhastighed holder, når flere forespørgsler kører parallelt: Chippen behandler en lille batch ad gangen, og hvert svar strømmer videre med næsten fuld hastighed. Det, der vokser, er time to first token, når forespørgsler skal vente på en plads i den næste batch. På det delte API sker det i spidsbelastningsperioder. Har din workload brug for planlagt kapacitet, har Enterprise-planer garanterede rate limits, og et dedikeret rack betjener kun din trafik.

Dedicated Capacity

Open source

Kør dit eget benchmark

Vores benchmarkværktøj er fuldt open source. Kør det mod vores API med din API-nøgle, eller klon repositoriet, og kør det lokalt. Samme kode, samme metode, dine egne resultater.

  1. 01

    Syntetisk performance

    Faste antal input- og output-tokens til kontrollerede sammenligninger mellem modeller

  2. 02

    Simulering af rigtige workloads

    Skiftende forespørgselsrater, der efterligner trafikmønstre fra produktion

  3. 03

    Eget datasæt

    Upload dine egne prompts, og mål performance på dit faktiske workload

  4. 04

    Interaktiv chat

    Målinger for hvert svar i en live chat: TTFT og throughput på hvert eneste svar

Sådan måler vi

Tre tal, målt under de samme betingelser: serverside p50, 10K input- og 1K output-tokens, én forespørgsel ad gangen. Vi måler igen hvert kvartal.

Time to First Token (TTFT)

Hvor hurtigt modellen begynder at svare efter din forespørgsel. Afgørende for interaktive applikationer og chatgrænseflader.

Output-throughput

De tokens per sekund, der genereres efter det første token. De afgør, hvor hurtigt et komplet svar når frem til brugeren.

End-to-end-latens

Den samlede tid fra forespørgsel til komplet svar, altså TTFT plus hele genereringstiden. Det er tallet, der tæller for batch-workloads.

Hvor tallene kommer fra

Alle målinger kommer fra vores produktionsinfrastruktur i München.

Placering
München, Tyskland
Hardware
SambaNova SN40L
Ejerskab
Egen hardware
Certificering
ISO 27001-certificeret

Dine forespørgsler behandles på racks, der tilhører Infercom, ikke på lejet cloud-kapacitet.

Sådan fungerer hardwaren

Hastighed og energi

Mindre dataflytning gør chippen hurtig og sparer energi: En forespørgsel, der bliver færdig hurtigere, bruger strøm i kortere tid.

10 kW

Per rack, typisk

Omkring 10 kW ved typisk drift, 7-14,5 kW ved inferens.

Luftkølet

Ingen væskekøling

Passer ind i datacentre, der er bygget til almindelige servere. Chippene bruger ikke vand til køling.

Op til 5x

Energieffektivitet

SambaNova: 2,5x til 5,6x mod en NVIDIA H200 med Llama 70B, afhængigt af batchstørrelse (2025).

Hvorfor chippen sparer energi

LLM-inferenshastighed: ofte stillede spørgsmål

Hvem har den hurtigste LLM-inferens i Europa?

Vi rangerer ikke andre udbydere; det gør uafhængige sammenligninger som Artificial Analysis. Vi offentliggør vores egen måling: 713 tok/s med gpt-oss-120b, op til 772 tok/s ved kortere prompts, målt på vores produktions-API i München (juli 2026). Med vores open source-benchmarkværktøj kan du køre den samme test mod enhver udbyder.

Kør benchmarket selv

Hvilken model er hurtigst, og til hvad?

gpt-oss-120b har den højeste output-throughput med 713 tok/s og også vores korteste time to first token med 388 ms. Derfor er den standardvalget til chat, voice og agent-loops med stor volumen. MiniMax M2.7 Ultraspeed er vores frontier-reasoning-model med 229B parametre: 428 tok/s og et context window på 192K til lange agentiske kørsler og svære kodeopgaver. Gemma 4 31B måler 199 tok/s og tager også billeder og tekst som input. Chat og voice afhænger af time to first token, agenter og kodning af throughput.

Sammenlign modellerne

Hvordan måles det, og kan jeg gentage målingen?

Ja. Hvert tal er en p50-måling på serversiden ved 10K input-tokens og 1K output-tokens med én forespørgsel, målt mod vores produktions-API med vores open source-benchmarkværktøj. Kør det online mod vores API med din egen nøgle, eller klon repositoriet, og kør det lokalt med dine egne prompts. Dine resultater hos klienten vil afvige afhængigt af netværkets placering og forhold.

Se kildekoden til benchmarkværktøjet

Hvad sker der med hastigheden, når mange forespørgsler kører på én gang?

Hver forespørgsel strømmer videre med næsten fuld outputhastighed, fordi chippen behandler en lille batch ad gangen. Time to first token vokser, når forespørgsler venter på den næste batch, og det sker på det delte API i spidsbelastningsperioder. Til planlagt kapacitet findes Enterprise-rate limits eller et dedikeret rack.

Dedicated Capacity

Er hastigheden uafhængigt verificeret?

Artificial Analysis måler løbende SambaNovas cloud, VentureBeat og TechRadar har skrevet om dens hastighed, og en undersøgelse fra Stanford om energieffektivitet omfatter SN40L. Disse kilder handler om teknologien. Tallene per model på denne side er vores egne målinger på vores egen infrastruktur i München, og derfor offentliggør vi benchmarkværktøjet, så du selv kan tjekke dem.

Se de uafhængige benchmarks

Hvorfor er dataflow hurtigere end GPU'er?

Mens en GPU skriver et svar, kører den et modellag som mange separate trin og skriver resultaterne imellem tilbage til hukommelsen. En dataflow-chip kører hele laget som ét trin og holder resultaterne på chippen, så den bruger sin hukommelsesbåndbredde på vægtene og svarer hurtigere.

Dataflow- og GPU-arkitektur forklaret

Klar til at bygge fremtidens AI i Europa?

Slut dig til virksomheder, der bruger suveræn AI med performance i topklasse