Esecuzione kernel dopo kernel vs. streaming

Una GPU esegue una rete neurale come sequenza di kernel: esegue un'operazione, scrive il risultato intermedio in memoria, lo rilegge per l'operazione successiva, si sincronizza e ricomincia. Gli ingegneri di SambaNova fanno notare che ognuno di questi passaggi aggiunge latenza, traffico di memoria e consumo di energia. È un costo che si paga a ogni token e che si accumula nella fase di decode autoregressiva, dove i token vengono generati uno alla volta.

Un processore dataflow, invece, dispone il calcolo come una pipeline continua su una griglia di unità di calcolo e di memoria. Mentre un'operazione è in esecuzione, i dati per la successiva vengono già caricati, e le attivazioni intermedie restano sul chip invece di fare avanti e indietro con la memoria esterna. Il paper sull'SN40L pubblicato da SambaNova descrive la fusione di pipeline di 20 o più operatori in un'unica chiamata di kernel, mentre la fusione tradizionale su GPU combina di solito da 1 a 5 operatori. Così il costo di avvio dei kernel si distribuisce e la larghezza di banda della memoria resta libera per ciò che conta: lo streaming dei pesi e della KV cache.

Perché conta proprio per l'inferenza

L'inferenza LLM ha due fasi con esigenze hardware opposte. Il prefill (l'elaborazione del prompt) è intensivo nel calcolo e parallelo: un lavoro per cui le GPU sono adatte, come riconosce la stessa SambaNova. Il decode (la generazione dei token) è limitato dalla larghezza di banda della memoria (memory-bound): ogni token richiede di leggere in streaming i pesi del modello, quindi sono l'efficienza di esecuzione e lo spostamento dei dati a determinare la velocità. L'esecuzione dataflow è costruita proprio per questa fase, che oggi è quella dominante: il settore chiama il passaggio a workload agentici, che generano molti token, l'era del decode.

La conseguenza pratica si vede nella velocità per richiesta con batch piccoli. Il serving su GPU recupera efficienza nel decode raggruppando molti utenti in batch, scambiando la latenza del singolo con il throughput complessivo. Una pipeline dataflow mantiene un utilizzo elevato senza dipendere da batch grandi e offre così un'alta velocità alla singola richiesta. Sulla nostra infrastruttura basata su SN40L a Monaco questo si traduce in 713 token al secondo su gpt-oss-120b e 428 token al secondo su MiniMax M2.7 Ultraspeed, misurati per richiesta su hardware di produzione.

Il sistema di memoria alla base

L'esecuzione in streaming ha bisogno di una memoria progettata per questo. L'SN40L collega le sue unità di calcolo dataflow a un sistema di memoria a tre livelli: 520 MB di SRAM sul chip, 64 GB di HBM per socket e memoria DDR collegata direttamente. SambaNova lo descrive come il modo per superare il memory wall dell'AI. La SRAM contiene i dati locali più usati. Dall'HBM vengono letti in streaming i pesi del modello attivo. Il livello DDR ospita altri modelli e le prompt cache. Così il cambio di modello richiede millisecondi invece dei secondi necessari agli stack su GPU.

Fonti

Scopri come l'architettura dataflow di SambaNova cambia l'economia dell'inferenza, e perché abbiamo scelto di costruirci sopra.

Esplora la tecnologia