Was eine Parameterzahl bedeutet
Ein neuronales Netz ist eine sehr große Menge von Zahlen, in Schichten organisiert. Diese Zahlen sind seine Parameter, auch Gewichte genannt. Das Training stellt sie so ein, dass die Ausgaben des Modells zu den Mustern in den Daten passen. Nach dem Training sind sie eingefroren, und ein Modell auszuführen heißt, Eingaben mit ihnen zu multiplizieren. Heißt ein Modell "120B", hat es 120 Milliarden solcher Zahlen. Die Parameterzahl ist die gängige Kennzahl für Leistungsfähigkeit, erzählt aber nicht die ganze Geschichte: Wie ein Modell trainiert wurde, zählt ebenso viel wie seine Größe. Die Chinchilla-Studie hat gezeigt, dass bei festem Rechenbudget Modellgröße und Menge der Trainingsdaten gemeinsam wachsen sollten. Viele Modelle sind nicht leistungsfähiger, weil sie größer sind, sondern weil sie mit mehr Daten trainiert wurden.
Nicht jeder Parameter ist bei jedem Token aktiv. Dense-Modelle (etwa Gemma 4 31B) nutzen für jedes Token alle Parameter. Mixture-of-Experts-Modelle (MoE) leiten jedes Token nur durch einen Bruchteil ihrer Parameter. Die Architektur von DeepSeek hat Hunderte Milliarden Parameter insgesamt, aktiviert pro Token aber nur einige Dutzend Milliarden. Deshalb kann ein sehr großes MoE-Modell weit schneller laufen, als seine Gesamtgröße vermuten lässt. Beim Vergleich von Modellen sagt die Zahl der aktiven Parameter das Verhalten bei der Inferenz voraus, nicht die Gesamtzahl.
Warum die Parameterzahl Geschwindigkeit und Kosten bestimmt
Um ein Token zu erzeugen, müssen die aktiven Parameter aus dem Speicher gelesen werden. Die Rechnung selbst ist billig, das Bewegen der Zahlen nicht. Für jedes einzelne Token Dutzende Milliarden Parameter zu lesen, Token für Token, ist ein Problem der Speicherbandbreite. Es ist der größte Kostenfaktor der Decode-Phase. Das ist der Hauptgrund, warum größere Modelle langsamer generieren: nicht weil die Mathematik schwieriger ist, sondern weil bei jedem Schritt mehr Gewichte aus dem Speicher gestreamt werden müssen. Deshalb folgen auch die Inter-Token-Latenz und die Ausgabe-Token pro Sekunde so eng der Modellgröße.
Die Parameterzahl bestimmt auch, wie viel Hardware ein Modell braucht. Die Gewichte müssen in schnellem Speicher liegen, damit das Modell effizient läuft. Bei 16-Bit-Präzision belegt eine Milliarde Parameter rund zwei Gigabyte. Ein Modell im Frontier-Maßstab kann deshalb weit mehr Speicher brauchen, als ein einzelner Beschleuniger bietet, und muss auf viele verteilt werden. Spezialisierte Inferenz-Hardware setzt genau hier an: Die RDU von SambaNova nutzt ein dreistufiges Speichersystem, das die Gewichte nah an den Recheneinheiten hält. Sie kann mehrere große Modelle gleichzeitig im Speicher halten, sodass ein Wechsel zwischen ihnen Millisekunden dauert. Der andere gängige Hebel ist Quantisierung: Die Parameter werden mit geringerer Präzision gespeichert, etwa mit 8 Bit. Das senkt den Speicher- und Bandbreitenbedarf einer gegebenen Parameterzahl, meist mit geringem Qualitätsverlust.
Größer ist nicht automatisch besser
Für die meisten Produktions-Workloads ist das größte verfügbare Modell selten die richtige Standardwahl. Ein aktuelles mittelgroßes Modell, das schnell läuft, schlägt oft ein größeres, das langsam antwortet, und es kostet pro Token weniger. Die Parameterzahl bestimmt Speicher und Bandbreite und damit Geschwindigkeit und Preis. Die Modellwahl ist deshalb eine Abwägung zwischen Leistungsfähigkeit und Kosten, nicht die Frage "je mehr, desto besser". Die praktische Frage lautet: Welches Modell ist für die Aufgabe leistungsfähig genug? Und dann: Welcher Anbieter betreibt es am schnellsten und hält Ihre Daten in der richtigen Jurisdiktion? Mit Open-Weight-Modellen treffen Sie diese Entscheidung selbst und nicht der Herausgeber des Modells.
Auch hier zählt das Hosting. Ein einzelnes SambaRack fasst 16 RDUs, betreibt Modelle im Frontier-Maßstab bis zur Klasse von 671 Milliarden Parametern und hält mehrere davon gleichzeitig im Speicher. So wechselt es in Millisekunden zwischen Modellen, statt pro Request Dutzende Gigabyte an Gewichten neu zu laden. Jede Aufgabe läuft damit auf dem passend großen Modell, ohne Wartezeit durch einen Kaltstart. Auf unserer geteilten EU-Plattform steckt das hinter einer einzigen OpenAI-kompatiblen API. Wenn Sie garantierte Kapazität oder vollständige Datenisolation brauchen, stützt dieselbe Architektur von SambaNova unsere Angebote für Dedicated Capacity und On-Premises.
Quellen
Erfahren Sie, wie die Dataflow-Architektur von SambaNova die Wirtschaftlichkeit der Inferenz verändert und warum wir auf ihr aufbauen.
Technologie entdecken