Was eine RDU ist
Die RDU ist der Prozessor im Kern der SambaNova-Systeme, also der Hardware, auf der unsere Plattform läuft. Statt einer festen Befehlspipeline bietet der Chip ein Raster aus Programmable Compute Units (PCUs) und Programmable Memory Units (PMUs). Der Compiler konfiguriert dieses Raster für jedes Modell neu: Die Operationen werden räumlich angeordnet, und die Tensoren fließen wie durch eine Pipeline hindurch. Das ist das Dataflow-Ausführungsmodell. SambaNova vergleicht das Ergebnis mit einem Fließband: Die Daten wandern von einer KI-Operation zur nächsten, und die Daten für die nächste Operation werden schon geladen, während die aktuelle noch läuft.
Der aktuelle Produktionschip SN40L verbindet diese Recheneinheiten mit einem dreistufigen Speichersystem. Es besteht aus 520 MB SRAM auf dem Chip für die am häufigsten genutzten Daten, 64 GB HBM im selben Gehäuse, aus dem die Modellgewichte gestreamt werden, und direkt angebundenem DDR-Speicher für Prompt-Caching und einen ganzen Katalog von Modellen. Jeder SN40L-Sockel liefert 638 BF16-TeraFLOPS aus 1040 Recheneinheiten.
Warum es sie gibt: die Memory Wall
Das Engineering-Team von SambaNova benennt das Problem ohne Umschweife: KI-Inferenz ist ein Problem der Datenbewegung, nicht der Rechenleistung. In der Decode-Phase muss die Hardware für jedes erzeugte Token die Modellgewichte aus dem Speicher holen. Auf befehlsbasierten Architekturen bestimmt dieser Speicherverkehr die Latenz, nicht die Arithmetik. Das Dataflow-Design der RDU setzt genau dort an: Durch Operator-Fusion bleiben Zwischenergebnisse auf dem Chip. Im veröffentlichten SN40L-Paper von SambaNova erreichten Operatoren, die zu großen Pipelines fusioniert waren, über 85% Auslastung der HBM-Bandbreite, und der Startaufwand pro Kernel entfiel.
Das begutachtete SN40L-Paper (MICRO 2024) berichtet von 2x bis 13x schnellerer Ausführung gegenüber einem nicht fusionierten Ausgangswert und von 3,7x gegenüber einem DGX-H100-System, gemessen an Composition-of-Experts-Workloads in der Inferenz. Die DDR-Ebene hängt direkt am Speichersystem des Chips. Deshalb dauert der Wechsel zwischen Modell-Checkpoints nur Millisekunden: SambaNova maß rund 60-90ms für Hot-Swaps, die auf GPU-basierten Serving-Stacks etwa 800ms brauchen.
RDUs in der Praxis
Ein SambaRack vereint 16 RDUs in einem einzigen luftgekühlten 19-Zoll-Rack mit einer typischen Leistungsaufnahme von etwa 10 kW. Das ist normale Rechenzentrumsinfrastruktur, ohne Flüssigkühlung. Ein Rack betreibt Modelle im Frontier-Maßstab, darunter Modelle mit 671B Parametern, für die man sonst mehrere GPU-Racks bräuchte. Unsere Plattform betreibt 8 SambaRack-SN40L-Systeme (128 RDUs) in München. Die Geschwindigkeit dieser Architektur ist messbar: 713 Token pro Sekunde mit gpt-oss-120b, unabhängig überprüfbar anhand unserer veröffentlichten Benchmarks.
Quellen
Erfahren Sie, wie die Dataflow-Architektur von SambaNova die Wirtschaftlichkeit der Inferenz verändert und warum wir auf ihr aufbauen.
Technologie entdecken