Ressourcen für Entwickler
Glossar zur EU-souveränen KI-Inferenz
Klare Definitionen mit Quellen rund um EU-souveräne KI-Inferenz: von Data Residency, DSGVO und Zero Data Retention bis zu TTFT, Durchsatz und Dataflow-Architektur. Jeder Eintrag stützt sich auf veröffentlichte Quellen und echte Benchmark-Daten aus unserer EU-Infrastruktur.
Souveränität & Compliance
- Data ResidencyWo Ihre Daten physisch gespeichert und verarbeitet werden. Das ist ein notwendiger Teil von Souveränität, aber nicht dasselbe wie die Kontrolle darüber, wer rechtlich auf die Daten zugreifen kann.
- Auftragsverarbeitungsvertrag (AVV / DPA)Der Auftragsverarbeitungsvertrag (AVV) nach Art. 28 DSGVO, englisch Data Processing Agreement (DPA), regelt, wie ein Inferenz-Anbieter die personenbezogenen Daten in Ihren Prompts verarbeiten darf. An ihm zeigt sich schnell, ob ein Anbieter für den Einsatz in Unternehmen bereit ist.
- DSGVO (GDPR) für KI-InferenzWas das europäische Datenschutzrecht verlangt, wenn Ihre Prompts personenbezogene Daten enthalten: eine Rechtsgrundlage, einen Auftragsverarbeitungsvertrag und eine Verarbeitung, die im Zugriffsbereich des EU-Rechts bleibt.
- Zero Data Retention (ZDR)Ein Inferenz-Anbieter speichert Ihre Prompts und Ausgaben nach der Verarbeitung nicht und trainiert nie mit ihnen. Ihre Daten sind damit nur für die Dauer der Verarbeitung im System.
Performance-Metriken
- TTFT (Zeit bis zum ersten Token)Die Zeit, die ein Nutzer nach dem Absenden eines Requests auf das erste Token der Antwort wartet.
- Inter-Token-Latenz (ITL)Der durchschnittliche Abstand zwischen zwei aufeinanderfolgenden Token während der Generierung, auch TPOT genannt.
- Token pro SekundeDie Standardeinheit für die Generierungsgeschwindigkeit von LLMs, und warum dieselbe Zahl zwei verschiedene Dinge bedeuten kann.
- InferenzgeschwindigkeitDer Oberbegriff für TTFT, Inter-Token-Latenz und Durchsatz, und welche dieser Metriken wann zählt.
Architektur
- RDU (Reconfigurable Dataflow Unit)Der KI-Prozessor von SambaNova: ein speziell für KI entwickelter Chip, der Modelle als Datenfluss ausführt statt Befehl für Befehl.
- Dataflow-ArchitekturDas Ausführungsmodell, bei dem Daten wie durch eine Pipeline durch die Operationen fließen. Die Umwege über den Speicher, die GPUs zwischen zwei Kerneln machen, entfallen.
Modelle & Inferenz
- InferenzDas Ausführen eines trainierten KI-Modells, um Ergebnisse zu erzeugen. Inferenz ist der Produktionsbetrieb der KI: Kosten und Wartezeit fallen bei jeder Nutzung erneut an.
- Durchsatz (LLM-Serving)Token pro Sekunde in zwei Bedeutungen: der Ausgabe-Durchsatz pro Request und die Kapazität des ganzen Systems. Batching erhöht das eine auf Kosten des anderen.
- Prefill vs. DecodeDie zwei Phasen der LLM-Inferenz: parallele Verarbeitung des Prompts und Generierung Token für Token.
- Latenz vs. DurchsatzDer grundlegende Zielkonflikt im Serving: die Gesamtleistung des Systems gegen die Geschwindigkeit für jeden einzelnen Nutzer.
- Open-Weight-ModellEin Modell, dessen trainierte Parameter veröffentlicht sind, sodass jeder es selbst betreiben kann. Das ist die technische Grundlage souveräner Inferenz.
- Context WindowDie maximale Textmenge in Token, die ein Modell auf einmal berücksichtigen kann, Prompt und Ausgabe zusammen. Seine Länge bestimmt direkt die Geschwindigkeit und die Kosten der Inferenz.
- ParameterDie gelernten Gewichte eines Modells: ein grobes Maß für seine Größe und Leistungsfähigkeit und der direkte Treiber für Speicherbedarf, Geschwindigkeit und Kosten.
- Temperature (Sampling)Der Parameter, der die Zufälligkeit bei der Auswahl des nächsten Tokens steuert. 1.0 ist der Ausgangswert, 0 erzwingt Greedy Decoding.
- Top-P (Nucleus Sampling)Ein Sampling-Verfahren, das nur so viele wahrscheinliche Token behält, bis zusammen die Wahrscheinlichkeit p erreicht ist. Der Kandidatenpool passt sich so der Sicherheit des Modells an.
- Top-K SamplingEin Sampling-Verfahren, das die Auswahl auf die k wahrscheinlichsten Token beschränkt: eine harte Obergrenze für den Kandidatenpool.
- Greedy DecodingDie Decoding-Strategie, die immer das wahrscheinlichste Token wählt: deterministisch, aber anfällig für Wiederholungsschleifen.