Hvad et antal parametre betyder
Et neuralt netværk er en meget stor mængde tal, organiseret i lag. Tallene er dets parametre, også kaldet vægte. Træningen indstiller dem, så modellens output passer til mønstrene i data. Når træningen er færdig, ligger de fast, og at køre modellen betyder at gange input igennem dem. Når en model beskrives som "120B", er det 120 milliarder af den slags tal. Antallet af parametre er det gængse mål for kapacitet, men det fortæller ikke hele historien: Hvordan en model er trænet, betyder lige så meget som dens størrelse. Chinchilla-studiet viste, at modelstørrelse og mængden af træningsdata bør vokse sammen, når regnebudgettet er fast. Mange modeller er ikke dygtigere, fordi de er større, men fordi de er trænet på flere data.
Ikke alle parametre er aktive for hvert token. Dense-modeller (som Gemma 4 31B) bruger alle deres parametre for hvert token. Mixture-of-experts-modeller (MoE) sender hvert token gennem kun en brøkdel af deres parametre. DeepSeeks arkitektur har hundredvis af milliarder parametre i alt, men aktiverer kun nogle titals milliarder per token. Derfor kan en meget stor MoE-model køre langt hurtigere, end dens samlede størrelse antyder. Når du sammenligner modeller, er det antallet af aktive parametre, der forudsiger opførslen under inferens, ikke det samlede antal.
Hvorfor antallet af parametre styrer hastighed og omkostning
For at generere et token skal de aktive parametre læses fra hukommelsen. Selve regnestykket er billigt, men det er det ikke at flytte tallene. At læse titals milliarder parametre for hvert eneste token, ét token ad gangen, er et problem med hukommelsesbåndbredde. Det er den største omkostning i decode-fasen. Det er hovedårsagen til, at større modeller genererer langsommere: ikke fordi matematikken er sværere, men fordi der skal streames flere vægte fra hukommelsen i hvert trin. Det er også derfor, inter-token latency og output-tokens per sekund følger modelstørrelsen så tæt.
Antallet af parametre afgør også, hvor meget hardware en model kræver. Vægtene skal ligge i hurtig hukommelse, for at modellen kan køre effektivt. Ved 16-bit præcision fylder en milliard parametre omkring to gigabyte. En model i frontier-klassen kan derfor kræve langt mere hukommelse, end én accelerator har, og må fordeles på mange. Hardware bygget specifikt til inferens går direkte efter problemet: SambaNovas RDU bruger et hukommelsessystem i tre niveauer, der holder vægtene tæt på beregningsenhederne. Den kan have flere store modeller i hukommelsen på samme tid, så et skift mellem dem tager millisekunder. Den anden almindelige løftestang er kvantisering: Parametrene gemmes med lavere præcision, for eksempel 8 bit. Det mindsker den hukommelse og båndbredde, et givet antal parametre kræver, som regel med et lille kvalitetstab.
Større er ikke automatisk bedre
Til de fleste produktions-workloads er den største tilgængelige model sjældent det rigtige standardvalg. En aktuel mellemstor model, der kører hurtigt, slår ofte en større model, der svarer langsomt, og den koster mindre per token. Antallet af parametre styrer hukommelse og båndbredde og dermed både hastighed og pris. Valget af model er derfor en afvejning mellem kapacitet og omkostning, ikke et spørgsmål om "jo mere, jo bedre". Det praktiske spørgsmål er: Hvilken model er god nok til opgaven? Og dernæst: Hvilken udbyder kører den hurtigst og holder dine data i den rigtige jurisdiktion? Med open-weight-modeller er det dig, der træffer det valg, ikke modellens udgiver.
Her betyder hostingen også noget. Ét SambaRack rummer 16 RDU'er, kører modeller i frontier-klassen op til 671 milliarder parametre og holder flere af dem i hukommelsen på samme tid. Derfor skifter det mellem modeller på millisekunder i stedet for at genindlæse titals gigabyte vægte for hver forespørgsel. Hver opgave kan dermed køre på en model i den rette størrelse uden ventetid fra en koldstart. På vores delte platform i EU ligger det bag ét OpenAI-kompatibelt API. Hvis du har brug for garanteret kapacitet eller fuld dataisolering, ligger den samme SambaNova-arkitektur bag vores løsninger med Dedicated Capacity og On-Premises.
Kilder
Læs, hvordan SambaNovas dataflow-arkitektur ændrer økonomien i inferens, og hvorfor vi har bygget på den.
Udforsk teknologien