Inferens vs. træning
Maskinlæring har to grundlæggende forskellige faser. Under træning justeres en models parametre mod store datasæt, indtil modellens adfærd passer til mønstrene i data. Det er en enorm beregning, der sker én gang eller med jævne mellemrum. Inferens bruger den færdige model: Vægtene ligger fast, et input går ind, og et output kommer ud. IBM rammer det præcist: Hver gang en AI-model skaber output eller træffer beslutninger i en rigtig applikation, er det inferens.
Nogle gange ser man ordet "inferencing". Standardbegrebet blandt fagfolk er inferens. For LLM'er betyder inferens, at modellen genererer tokens: Den behandler først din prompt (prefill) og skaber derefter svaret ét token ad gangen (decode).
Hvorfor det er inferens, der tæller i drift
Træning får overskrifterne, men det er i inferens, at AI møder produktion. Det er også her, omkostninger og ventetid hober sig op. En model trænes én gang og betjener derefter millioner af forespørgsler. Hver brugerinteraktion, hvert agenttrin og hver pipeline-kørsel betaler inferensens latens og omkostning igen. AI bevæger sig mod agentiske workloads, der genererer langt flere tokens per opgave. Derfor fylder økonomien i serving (tokens per sekund, omkostning per token, energi per token) stadig mere i den samlede økonomi for AI.
Inferens belaster også hardwaren anderledes end træning. Træning er compute-bound parallelt arbejde, som GPU'er er gode til. LLM-inferens domineres af decode-fasen, som er memory-bound: Hukommelsesbåndbredden sætter grænsen for tempoet. Derfor kan hardware, der er bygget specifikt til inferens, slå generelle acceleratorer på hastighed og effektivitet i netop denne type arbejde. Et eksempel er RDU-arkitekturen, som vores platform kører på.
Sådan måler man inferens
Inferens måles med de metrikker, som denne ordliste forklarer: time to first token for responstid, inter-token latency og output-throughput for genereringshastighed og end-to-end-latens for den samlede svartid. Det betyder også noget, hvor modellen kører. Inferens behandler dine rigtige produktionsdata ved hver forespørgsel. Derfor er dataresidency og jurisdiktion spørgsmål om inferens: Den model, der betjener dine brugere, håndterer alt, hvad de sender.
Kilder
Læs, hvordan SambaNovas dataflow-arkitektur ændrer økonomien i inferens, og hvorfor vi har bygget på den.
Udforsk teknologien