Ressourcer til udviklere
Ordliste om EU-suveræn AI-inferens
Klare definitioner med kilder inden for EU-suveræn AI-inferens: fra dataresidency, GDPR og zero data retention til TTFT, throughput og dataflow-arkitektur. Hver forklaring bygger på offentliggjorte kilder og reelle benchmarkdata fra vores EU-infrastruktur.
Suverænitet og compliance
- Data ResidencyHvor dine data fysisk lagres og behandles. Det er en nødvendig del af suverænitet, men ikke det samme som kontrol over, hvem der juridisk kan få adgang til dem.
- Data Processing Agreement (DPA)Databehandleraftalen efter GDPR artikel 28 (på engelsk Data Processing Agreement, DPA) regulerer, hvordan en inferensudbyder må behandle persondataene i dine prompts. Den viser hurtigt, om en udbyder er klar til virksomhedsbrug.
- GDPR for AI-inferensHvad EU's databeskyttelsesregler kræver, når dine prompts indeholder persondata: et lovligt grundlag, en databehandleraftale og behandling, der forbliver inden for EU-rettens rækkevidde.
- Zero Data Retention (ZDR)En inferensudbyder gemmer ikke dine prompts eller outputs efter behandlingen og træner aldrig på dem. Dine data findes dermed kun i systemet, mens de behandles.
Ydeevnemålinger
- TTFT (Time to First Token)Hvor længe en bruger venter, fra en forespørgsel sendes, til det første token i svaret dukker op.
- Inter-Token Latency (ITL)Den gennemsnitlige tid mellem to tokens i træk under genereringen, også kaldet TPOT.
- Tokens per sekundStandardenheden for genereringshastighed i LLM'er, og hvorfor det samme tal kan betyde to forskellige ting.
- Inference-hastighedOverbegrebet for TTFT, inter-token latency og throughput, og hvilken metrik der tæller hvornår.
Arkitektur
- RDU (Reconfigurable Dataflow Unit)SambaNovas AI-processor: en chip bygget specifikt til AI, som afvikler modeller som et dataflow i stedet for instruktion for instruktion.
- Dataflow-arkitekturAfviklingsmodellen, hvor data strømmer gennem operationerne som en pipeline. Den fjerner de omveje via hukommelsen, som en GPU tager mellem hver kernel.
Modeller og inferens
- InferenceKørsel af en trænet AI-model for at skabe output. Inferens er AI i produktion: Omkostninger og ventetid kommer igen, hver gang modellen bruges.
- Throughput (LLM-serving)Tokens per sekund i to betydninger: output-throughput per forespørgsel og kapaciteten i hele systemet. Batching øger det ene på bekostning af det andet.
- Prefill vs. DecodeLLM-inferensens to faser: parallel behandling af prompten og generering ét token ad gangen.
- Latency vs. ThroughputDen grundlæggende afvejning i serving: systemets samlede output mod hver enkelt brugers hastighed.
- Open-weight-modelEn model, hvis trænede parametre er offentliggjort, så alle selv kan køre den. Det er det tekniske fundament for suveræn inferens.
- Context WindowDen maksimale mængde tekst i tokens, som en model kan tage i betragtning på én gang, prompt og output tilsammen. Længden påvirker direkte hastigheden og omkostningen ved inferens.
- ParametreEn models lærte vægte: et groft mål for dens størrelse og kapacitet og den direkte årsag til dens hukommelsesforbrug, hastighed og omkostning.
- Temperature (Sampling)Den parameter, der styrer tilfældigheden, når næste token vælges. 1.0 er baseline, og 0 tvinger greedy decoding.
- Top-P (Nucleus Sampling)En sampling-metode, der kun beholder så mange sandsynlige tokens, at de tilsammen dækker sandsynligheden p. Kandidat-puljen tilpasser sig dermed modellens sikkerhed.
- Top-K SamplingEn sampling-metode, der begrænser valget til de k mest sandsynlige tokens: et hårdt loft over kandidat-puljen.
- Greedy DecodingDecoding-strategien, der altid vælger det mest sandsynlige token: deterministisk, men udsat for gentagelsesloops.