Sådan virker greedy decoding

I hvert genereringstrin danner modellen en sandsynlighedsfordeling over sit ordforråd. Med greedy decoding vælges det token, der har den højeste sandsynlighed, uden betingelser: ingen sampling, ingen tilfældighed. Næste trin bygger på det token, danner en ny fordeling og tager igen maksimum. Sådan fortsætter det, indtil modellen sender et stop-token eller rammer output-grænsen.

Du udløser greedy decoding ved at sætte temperature til 0. Så samler fordelingen sig i én spids på det øverste token. Samme effekt får du ved at sætte top-k til 1, fordi filteret så kun efterlader én kandidat. I begge tilfælde bliver tilfældighedsgeneratoren aldrig brugt, og det samme input giver altid det samme output. Det forudsætter, at de numeriske forhold på hardwaren er identiske.

Problemet med gentagelsesloops

Determinismen er både det tiltrækkende ved greedy decoding og dens svaghed. Fordi modellen altid tager den mest sandsynlige vej, kan den køre fast. Hvis en række tokens fører ind i et mønster, hvor gentagelse eller omformulering er den mest sandsynlige fortsættelse, følger greedy decoding den vej for evigt. Sampling ville en gang imellem vælge et mindre sandsynligt token og bryde ud. Det kan greedy decoding ikke.

Vi har set det direkte på reasoning-modeller: Ved temperature 0 løste en model en logisk gåde korrekt og havnede derefter i et endeløst synonym-loop. Den omformulerede sin konklusion med nye ord, indtil den ramte token-grænsen. Med de indstillinger, udgiveren anbefaler (temperature 1.0 med top-p og top-k), blev de samme prompts afsluttet normalt. Loopet er et fikspunkt i modellens sandsynlighedsfordeling. Sampling kan slippe ud af det, greedy decoding kan ikke.

Hvornår du skal bruge det, og hvornår ikke

Greedy decoding passer til opgaver, hvor konsistens betyder mere end variation, og hvor outputtet er kort eller stærkt begrænset: klassifikations-labels, struktureret udtræk eller JSON-output via constrained decoding. Til åben generering, reasoning eller enhver opgave, hvor modellen kan havne i et selvforstærkende mønster, skal du i stedet bruge de sampling-parametre, udgiveren anbefaler. Hvis du udelader temperature på Infercom, bruger de fleste modeller greedy decoding. Derfor advarer vores dokumentation om altid at sætte den eksplicit.

Kilder

Læs, hvordan SambaNovas dataflow-arkitektur ændrer økonomien i inferens, og hvorfor vi har bygget på den.

Udforsk teknologien