Hvad en RDU er

RDU'en er processoren i hjertet af SambaNovas systemer, altså den hardware, vores platform kører på. I stedet for en fast instruktions-pipeline har chippen et gitter af Programmable Compute Units (PCUs) og Programmable Memory Units (PMUs). Compileren konfigurerer gitteret til hver model: Operationerne placeres rumligt, og tensorer strømmer gennem dem som en pipeline. Det er dataflow-afviklingsmodellen. SambaNova sammenligner resultatet med et samlebånd: Data bevæger sig fra én AI-operation til den næste, og data til den næste operation hentes, mens den aktuelle stadig kører.

Den nuværende produktionschip, SN40L, kobler disse beregningsenheder til et hukommelsessystem i tre niveauer. Det består af 520 MB SRAM på selve chippen til de mest brugte data, 64 GB HBM i samme pakke, som modellens vægte streames fra, og direkte tilsluttet DDR-hukommelse til prompt-caching og et helt katalog af modeller. Hver SN40L-sokkel leverer 638 BF16-teraFLOPS fra 1.040 beregningsenheder.

Hvorfor den findes: hukommelsesmuren

SambaNovas ingeniørteam siger det ligeud: AI-inferens er et problem med dataflytning, ikke med regnekraft. I decode-fasen skal hardwaren hente modellens vægte fra hukommelsen for hvert genereret token. På instruktionsbaserede arkitekturer er det denne hukommelsestrafik, der styrer latensen, ikke aritmetikken. RDU'ens dataflow-design går direkte efter problemet: Operator-fusion holder mellemresultater på chippen. I SambaNovas offentliggjorte SN40L-artikel nåede operatorer, der var fusioneret til store pipelines, over 85% udnyttelse af HBM-båndbredden, og opstartsomkostningen per kernel forsvandt.

Den fagfællebedømte SN40L-artikel (MICRO 2024) rapporterer 2x til 13x hurtigere afvikling sammenlignet med en ufusioneret baseline og 3,7x sammenlignet med et DGX H100-system på composition-of-experts-workloads i inferens. DDR-niveauet sidder direkte på chippens hukommelsessystem. Derfor tager et skift mellem model-checkpoints kun millisekunder: SambaNova målte cirka 60-90ms for hot-swaps, der tager omkring 800ms på GPU-baserede serving-stacks.

RDU'er i praksis

Et SambaRack samler 16 RDU'er i ét luftkølet 19-tommer rack med et typisk strømforbrug på omkring 10 kW. Det er almindelig datacenterinfrastruktur uden væskekøling. Ét rack kører modeller i frontier-klassen, herunder modeller med 671B parametre, som ellers ville kræve flere GPU-racks. Vores platform driver 8 SambaRack SN40L-systemer (128 RDU'er) i München. Den hastighed, arkitekturen leverer, kan måles: 713 tokens per sekund på gpt-oss-120b, som du selv kan efterprøve i vores offentliggjorte benchmarks.

Kilder

Læs, hvordan SambaNovas dataflow-arkitektur ændrer økonomien i inferens, og hvorfor vi har bygget på den.

Udforsk teknologien