Inferenz vs. Training
Maschinelles Lernen kennt zwei grundverschiedene Phasen. Beim Training werden die Parameter eines Modells an großen Datensätzen so lange angepasst, bis sein Verhalten zu den Mustern in den Daten passt. Das ist eine gewaltige Berechnung, die einmal oder in größeren Abständen stattfindet. Die Inferenz wendet das fertige Modell an: Die Gewichte sind eingefroren, eine Eingabe geht hinein, ein Ergebnis kommt heraus. IBM bringt es gut auf den Punkt: Jedes Mal, wenn ein KI-Modell in einer realen Anwendung tatsächlich Ergebnisse erzeugt oder Entscheidungen trifft, ist das Inferenz.
Gelegentlich liest man auch "Inferencing". Der übliche Fachbegriff ist Inferenz. Bei LLMs bedeutet Inferenz, Token zu erzeugen: Das Modell verarbeitet zuerst Ihren Prompt (Prefill) und erzeugt dann die Antwort Token für Token (Decode).
Warum im Betrieb die Inferenz zählt
Die Schlagzeilen gehören dem Training. Im Produktionsbetrieb aber zählt die Inferenz, denn hier summieren sich Kosten und Wartezeit. Ein Modell wird einmal trainiert und beantwortet danach Millionen von Requests. Jede Nutzerinteraktion, jeder Schritt eines Agenten und jeder Pipeline-Lauf zahlt Latenz und Kosten der Inferenz aufs Neue. KI verlagert sich zunehmend zu agentischen Workloads, die pro Aufgabe weit mehr Token erzeugen. Damit bestimmen die Kennzahlen des Servings (Token pro Sekunde, Kosten pro Token, Energie pro Token) immer stärker die Wirtschaftlichkeit von KI insgesamt.
Inferenz belastet die Hardware außerdem anders als Training. Training ist rechengebundene (compute-bound) Parallelarbeit, und darin sind GPUs stark. Bei der LLM-Inferenz dominiert dagegen die Decode-Phase, und die ist speichergebunden (memory-bound): Ihr Tempo begrenzt die Speicherbandbreite. Deshalb kann Hardware, die speziell für Inferenz entwickelt wurde, bei diesem Workload universelle Beschleuniger in Geschwindigkeit und Effizienz übertreffen. Ein Beispiel ist die RDU-Architektur, auf der unsere Plattform läuft.
Inferenz messen
Die Leistung der Inferenz wird mit den Metriken gemessen, die dieses Glossar erklärt: der Zeit bis zum ersten Token für die Reaktionszeit, der Inter-Token-Latenz und dem Ausgabe-Durchsatz für die Generierungsgeschwindigkeit und der End-to-End-Latenz für die gesamte Antwortzeit. Auch der Ort zählt, an dem das Modell läuft. Inferenz verarbeitet bei jedem Request Ihre echten Produktionsdaten. Deshalb sind Datenresidenz und Jurisdiktion Fragen der Inferenz: Das Modell, das Ihre Nutzer bedient, verarbeitet alles, was sie eingeben.
Quellen
Erfahren Sie, wie die Dataflow-Architektur von SambaNova die Wirtschaftlichkeit der Inferenz verändert und warum wir auf ihr aufbauen.
Technologie entdecken