Kernel for kernel vs. streaming

En GPU afvikler et neuralt netværk som en række kernels: kør en operation, skriv mellemresultatet til hukommelsen, hent det tilbage til næste operation, synkronisér, gentag. SambaNovas ingeniører påpeger, at hver af disse overgange koster latens, hukommelsestrafik og energi. Den pris betales for hvert token. I den autoregressive decode-fase, hvor tokens genereres ét ad gangen, hober den sig op.

En dataflow-processor lægger i stedet beregningen ud som en sammenhængende pipeline på et gitter af beregnings- og hukommelsesenheder. Mens én operation kører, hentes data til den næste allerede. Mellemliggende aktiveringer bliver lokalt på chippen i stedet for at tage turen til den eksterne hukommelse og tilbage. SambaNovas offentliggjorte SN40L-artikel beskriver, hvordan pipelines med 20 eller flere operatorer fusioneres til ét enkelt kernel-kald. Almindelig GPU-fusion samler typisk 1 til 5 operatorer. Opstartsomkostningen for kernels bliver dermed fordelt, og hukommelsesbåndbredden bliver fri til det, der betyder noget: at streame vægte og KV-cache.

Hvorfor det betyder noget netop for inferens

LLM-inferens har to faser med modsatte krav til hardwaren. Prefill (behandlingen af prompten) er beregningstung og parallel. Det er arbejde, som GPU'er er godt egnede til, hvilket SambaNova selv anerkender. Decode (genereringen af tokens) er memory-bound: Hvert token kræver, at modellens vægte streames fra hukommelsen, så afviklingens effektivitet og dataflytning afgør hastigheden. Dataflow-afvikling er bygget til netop denne fase, og det er den fase, der dominerer nu: Branchen kalder skiftet mod agentiske workloads, der genererer mange tokens, for decode-æraen.

Den praktiske konsekvens viser sig i hastigheden per forespørgsel ved små batch-størrelser. GPU-serving genvinder effektiviteten i decode ved at samle mange brugere i batches og bytter dermed den enkeltes latens for samlet throughput. En dataflow-pipeline holder udnyttelsen høj uden at være afhængig af store batches og leverer derfor høj hastighed til den enkelte forespørgsel. På vores SN40L-baserede infrastruktur i München giver det 713 tokens per sekund på gpt-oss-120b og 428 tokens per sekund på MiniMax M2.7 Ultraspeed, målt per forespørgsel på produktionshardware.

Hukommelsessystemet bag

Streaming-afvikling kræver en hukommelse, der er bygget til den. SN40L kobler sine dataflow-beregningsenheder til et hukommelsessystem i tre niveauer: 520 MB SRAM på chippen, 64 GB HBM per sokkel og direkte tilsluttet DDR-hukommelse. SambaNova beskriver det som vejen over AI'ens hukommelsesmur. SRAM holder de mest brugte lokale data. Fra HBM streames den aktive models vægte. DDR-niveauet rummer yderligere modeller og prompt-caches. Derfor tager et modelskift millisekunder i stedet for de sekunder, GPU-stacks skal bruge.

Kilder

Læs, hvordan SambaNovas dataflow-arkitektur ændrer økonomien i inferens, og hvorfor vi har bygget på den.

Udforsk teknologien