Cos'è una RDU

L'RDU è il processore al centro dei sistemi SambaNova, cioè l'hardware su cui gira la nostra piattaforma. Invece di una pipeline di istruzioni fissa, il chip offre una griglia di Programmable Compute Units (PCU) e Programmable Memory Units (PMU) che il compilatore configura per ogni modello: le operazioni vengono disposte nello spazio e i tensori le attraversano come in una pipeline. È il modello di esecuzione dataflow. SambaNova paragona il risultato a una catena di montaggio: i dati passano da un'operazione AI alla successiva, e i dati per l'operazione seguente vengono caricati mentre quella in corso è ancora in esecuzione.

L'attuale chip di produzione, l'SN40L, abbina queste unità di calcolo a un sistema di memoria a tre livelli: 520 MB di SRAM sul chip per i dati più usati, 64 GB di HBM nello stesso package, da cui vengono letti in streaming i pesi del modello, e memoria DDR collegata direttamente per il prompt caching e per un intero catalogo di modelli. Ogni socket SN40L fornisce 638 teraFLOPS BF16 da 1.040 unità di calcolo.

Perché esiste: il memory wall

Il team di ingegneri di SambaNova lo dice senza giri di parole: l'inferenza AI è un problema di spostamento dei dati, non di calcolo. Nella fase di decode l'hardware deve prelevare dalla memoria i pesi del modello per ogni token generato. Sulle architetture basate su istruzioni è questo traffico di memoria, e non l'aritmetica, a determinare la latenza. Il design dataflow dell'RDU attacca il problema alla radice: la fusione degli operatori tiene i risultati intermedi sul chip. Nel paper sull'SN40L pubblicato da SambaNova, gli operatori fusi in grandi pipeline hanno raggiunto oltre l'85% di utilizzo della banda HBM, eliminando il costo di avvio di ogni kernel.

Il paper sull'SN40L, sottoposto a revisione paritaria (MICRO 2024), riporta un'accelerazione da 2x a 13x rispetto a una configurazione di riferimento senza fusione e di 3,7x rispetto a un sistema DGX H100 su workload di inferenza composition-of-experts. Il livello DDR è collegato direttamente al sistema di memoria del chip. Per questo passare da un checkpoint di modello all'altro richiede solo millisecondi: SambaNova ha misurato circa 60-90ms per hot-swap che sugli stack di serving basati su GPU richiedono circa 800ms.

Le RDU in pratica

Un SambaRack riunisce 16 RDU in un unico rack da 19 pollici raffreddato ad aria, con un consumo tipico di circa 10 kW. È normale infrastruttura da datacenter, senza raffreddamento a liquido. Un solo rack esegue modelli di classe frontier, compresi modelli da 671B parametri, che altrimenti richiederebbero più rack di GPU. La nostra piattaforma gestisce 8 sistemi SambaRack SN40L (128 RDU) a Monaco. La velocità che questa architettura offre è misurabile: 713 token al secondo su gpt-oss-120b, verificabili in modo indipendente attraverso i benchmark che pubblichiamo.

Fonti

Scopri come l'architettura dataflow di SambaNova cambia l'economia dell'inferenza, e perché abbiamo scelto di costruirci sopra.

Esplora la tecnologia