Ausführung Kernel für Kernel vs. Streaming
Eine GPU führt ein neuronales Netz als Folge von Kerneln aus: Operation ausführen, Zwischenergebnis in den Speicher schreiben, für die nächste Operation zurückholen, synchronisieren, wiederholen. Die Ingenieure von SambaNova weisen darauf hin, dass jeder dieser Übergänge Latenz, Speicherverkehr und Energie kostet. Diesen Aufschlag zahlt man bei jedem Token. In der autoregressiven Decode-Phase, in der die Token einzeln entstehen, summiert er sich auf.
Ein Dataflow-Prozessor bildet die Berechnung stattdessen als durchgehende Pipeline auf ein Raster aus Rechen- und Speichereinheiten ab. Während eine Operation läuft, werden die Daten für die nächste bereits geladen. Zwischenaktivierungen bleiben lokal auf dem Chip, statt den Umweg über den externen Speicher zu nehmen. Das veröffentlichte SN40L-Paper von SambaNova beschreibt, wie Pipelines aus 20 oder mehr Operatoren zu einem einzigen Kernel-Aufruf fusioniert werden. Konventionelle GPU-Fusion fasst typischerweise 1 bis 5 Operatoren zusammen. So verteilt sich der Startaufwand der Kernel, und die Speicherbandbreite bleibt für das Wesentliche frei: das Streamen von Gewichten und KV-Cache.
Warum das gerade für die Inferenz zählt
LLM-Inferenz hat zwei Phasen mit gegensätzlichen Ansprüchen an die Hardware. Das Prefill (die Verarbeitung des Prompts) ist rechenintensiv und parallel. Für diese Arbeit sind GPUs gut geeignet, wie SambaNova selbst einräumt. Das Decode (die Erzeugung der Token) ist durch die Speicherbandbreite begrenzt: Für jedes Token müssen die Modellgewichte aus dem Speicher gestreamt werden, deshalb bestimmen Ausführungseffizienz und Datenbewegung die Geschwindigkeit. Die Dataflow-Ausführung ist genau für diese Phase gebaut. Das passt zur aktuellen Entwicklung: Die Branche spricht von der Decode-Ära, weil agentische Workloads immer mehr Token erzeugen.
Die praktische Folge zeigt sich in der Geschwindigkeit pro Request bei kleinen Batch-Größen. GPU-Serving holt die Effizienz im Decode zurück, indem es viele Nutzer gemeinsam batcht und dabei die Latenz des Einzelnen gegen Gesamtdurchsatz tauscht. Eine Dataflow-Pipeline hält die Auslastung hoch, ohne auf große Batches angewiesen zu sein, und liefert so hohe Geschwindigkeit für den einzelnen Request. Auf unserer SN40L-Infrastruktur in München sind das 713 Token pro Sekunde mit gpt-oss-120b und 428 Token pro Sekunde mit MiniMax M2.7 Ultraspeed, gemessen pro Request auf Produktionshardware.
Das Speichersystem dahinter
Streaming-Ausführung braucht einen Speicher, der dafür gebaut ist. Der SN40L verbindet seine Dataflow-Recheneinheiten mit einem dreistufigen Speichersystem: 520 MB SRAM auf dem Chip, 64 GB HBM pro Sockel und direkt angebundener DDR-Speicher. SambaNova beschreibt das als Weg, die Memory Wall der KI zu überwinden. Der SRAM hält die am häufigsten genutzten lokalen Daten. Aus dem HBM werden die Gewichte des aktiven Modells gestreamt. Die DDR-Ebene hält weitere Modelle und Prompt-Caches vor. So dauert ein Modellwechsel Millisekunden statt der Sekunden, die GPU-Stacks brauchen.
Quellen
Erfahren Sie, wie die Dataflow-Architektur von SambaNova die Wirtschaftlichkeit der Inferenz verändert und warum wir auf ihr aufbauen.
Technologie entdecken