Teknologi

Chips udviklet til hurtig AI-inferens

Vi kører åbne modeller på hardware, der er valgt til opgaven. Til hurtig inferens er det i dag SambaNovas SN40L: chips, der lader modellen strømme gennem chippen i stedet for at flytte data frem og tilbage til hukommelsen, så svarene kommer hurtigere.

713tok/s med gpt-oss-120b, målt på vores APIBenchmarks
op til10xhurtigere end GPU-baseret inferensBenchmarks
10 kWtypisk effekt per rack, luftkøletDatablad
128chips i vores racks i MünchenHvor det kører

Output-throughput, p50, 10K input / 1K output, én forespørgsel. Senest målt: juli 2026.

Inferens er et hukommelsesproblem, ikke et beregningsproblem

En sprogmodel skriver sit svar ét token ad gangen. For hvert token henter en GPU modellens vægte fra hukommelsen, regner og skriver resultatet tilbage. Turen til hukommelsen tager langt længere tid end selve beregningen, så i denne fase, kaldet decode, bruger GPU'en det meste af tiden på at vente. Udbydere skjuler ventetiden ved at samle mange brugere i én batch: Systemet producerer flere tokens i alt, men hvert enkelt svar kommer langsommere.

Prefill og decode forklaret

Dataflow: ingen omveje gennem hukommelsen

SambaNovas chip, RDU'en (Reconfigurable Dataflow Unit), fordeler beregningstrinnene for et helt modellag ud over chippen og lader data strømme igennem dem. Vægtene hentes fra højbåndbreddehukommelsen (HBM) i samme pakke. Alt, hvad der beregnes undervejs, bliver på chippen i stedet for at gå tilbage til hukommelsen efter hvert trin. Derfor kan chippen bruge næsten 85% af sin hukommelsesbåndbredde på vægtene (SambaNova, artikel om SN40L).

Hver chip kan tilgå hukommelsen på alle 16 chips i et rack. Derfor kan ét rack køre modeller med flere hundrede milliarder parametre.

Afvejningen

En chip behandler en lille batch af forespørgsler ad gangen. Det holder hvert svar hurtigt. Ved store batchjob, hvor ingen venter på svaret, betyder den maksimale throughput i batch mere end hastigheden per forespørgsel.

Hvad det ændrer i praksis

Udviklere

Hurtige tokens for hver enkelt forespørgsel, ikke kun samlet: 713 tok/s med gpt-oss-120b og 428 tok/s med MiniMax M2.7, målt på vores API. En agent når flere trin på samme tid.

Benchmarks

Platformteams

Store modeller på ét rack. Flere modeller ligger i hukommelsen på samme tid og skifter på millisekunder, så et dedikeret rack kan køre dine fine-tunede checkpoints side om side. Lange kontekster: 192K tokens på MiniMax M2.7, 128K på gpt-oss-120b og Gemma 4. På MiniMax M2.7 hentes gentaget kontekst fra en prompt-cache i chippenes hukommelse og skrives aldrig til disk.

Dedicated Capacity

Ledelse og bæredygtighed

Mindre dataflytning er det, der gør chippen hurtig, og det sparer også energi: En forespørgsel, der bliver færdig hurtigere, bruger strøm i kortere tid, og en stor model passer på færre chips. SambaNova oplyser op til 5x bedre energieffektivitet end en GPU (2,5x til 5,6x mod en NVIDIA H200 med Llama 70B, afhængigt af batchstørrelse, 2025). Et rack bruger omkring 10 kW ved typisk drift og er luftkølet, så det passer ind i de datacentre, der findes i dag.

On-Premises

Sådan vælger vi, hvad der kører nedenunder

Vi er en inferensudbyder, ikke en chipproducent. Vi vurderer al hardware ud fra fem spørgsmål, i denne rækkefølge:

  1. 01

    Passer det ind i de datacentre, Europa har?

    Strøm og køling kommer først. Luftkølede racks kan stå alle steder, mens kapacitet til væskekøling er knap.

  2. 02

    Findes der en komplet software-stack?

    En chip er ikke en tjeneste. Vi har brug for den compiler, runtime og serving-lag, der gør den til et API.

  3. 03

    Hvor hurtigt kører det med de modeller, vores kunder bruger?

    Store, aktuelle åbne modeller, målt af os selv.

  4. 04

    Hvad koster det i alt?

    Hardware, strøm og drift per million tokens.

  5. 05

    Hvor kører det, og hvem driver det?

    På hardware, vi selv ejer, i EU.

Til hurtig inferens besvarer SambaNovas SN40L disse spørgsmål bedst i dag, og alle modeller, vi leverer fra München, kører på den. Uanset hvad der kører nedenunder, kalder du det samme API.

Specifikationer for SN40L

Chip: SambaNova SN40L RDU

Proces
TSMC 5nm
Pakke
To dies i én pakke (CoWoS)
Beregningsenheder
1.040 (PCU'er)
Maksimal ydelse (BF16)
638 TFLOPS
Hukommelse per chip
520 MB SRAM, 64 GB HBM, op til 1,5 TB DDR

Kilde: SambaNova, arkitekturartikel om SN40L

Rack: SambaRack SN40L-16

Chips
16 RDU'er
Maksimal ydelse (BF16)
10.2 PFLOPS
Hukommelse
8 GB SRAM, 1 TB HBM, 12 TB DDR
Effekt
7-14,5 kW ved inferens, typisk 10 kW
Køling
Luft
Mål (H x B x D)
1994 x 610 x 1270 mm
Vægt
485 kg

Kilde: SambaNova, datablad for SambaRack SN40L-16

Rack af typen SambaRack SN40L-16
SambaRack SN40L-16. Billede: SambaNova
Chippakke fra SambaNova SN40L
SN40L RDU. Foto: SambaNova

Vores installation: 8 racks med 128 RDU'er hos Equinix München 4.

I München, på hardware vi ejer

  • Equinix München 4, Tyskland. Racks'ene tilhører Infercom.
  • Datacentret kører på 100% vedvarende strøm via oprindelsesgarantier.
  • Det køler med tørkølere og frikøling. Chippene bruger ikke vand til køling.
  • Datacentret er certificeret efter ISO 27001, ISO 14001 og ISO 50001.

SambaNovas software kører modellerne, og SambaNova hjælper med dele af driften. Hvad det betyder for dine data

Spørgsmål

Hvad er en Reconfigurable Dataflow Unit (RDU)?

Det er SambaNovas AI-chip. I stedet for at køre en model trin for trin og gå tilbage til hukommelsen imellem, fordeler den modellens beregningstrin ud over chippen og lader data strømme igennem dem. Infercom kører generationen SN40L.

RDU i ordlisten

Hvorfor er dataflow hurtigere end en GPU til inferens?

Mens en GPU skriver et svar, kører den et modellag som mange separate trin og skriver resultaterne imellem tilbage til hukommelsen. En dataflow-chip kører hele laget som ét trin og holder resultaterne på chippen, så den bruger sin hukommelsesbåndbredde på vægtene og svarer hurtigere.

Målte hastigheder

Hvilken hardware kører Infercom?

SambaRack SN40L-16-systemer med SambaNovas SN40L-chips: 8 racks med 128 chips hos Equinix München 4. Vi har valgt dem til hurtig inferens.

Kører I SambaNovas SN50?

Nej, vores racks kører SN40L, og alle tal på denne side gælder for SN40L.

Hvor meget strøm bruger et rack, og kræver det væskekøling?

Omkring 10 kW ved typisk drift (7-14,5 kW ved inferens). Væskekøling er ikke nødvendig: Racket er luftkølet og passer ind i datacentre, der er bygget til almindelige servere.

On-Premises

Kan ét rack køre flere modeller?

Ja, flere modeller ligger i hukommelsen på samme tid, og racket skifter mellem dem på millisekunder. På et dedikeret rack kan du derfor køre dine egne fine-tunede checkpoints side om side.

Dedicated Capacity

Klar til at bygge fremtidens AI i Europa?

Slut dig til virksomheder, der bruger suveræn AI med performance i topklasse