Inferenza vs. addestramento
Il machine learning ha due fasi profondamente diverse. Durante l'addestramento, i parametri di un modello vengono regolati su grandi dataset finché il suo comportamento non riflette i pattern presenti nei dati. È un calcolo enorme, eseguito una volta sola o a intervalli. L'inferenza usa il modello finito: i pesi sono congelati, entra un input, esce un output. La definizione di IBM coglie il punto: ogni volta che un modello AI genera output o prende decisioni in un'applicazione reale, si tratta di inferenza.
A volte si legge anche "inferencing". Tra gli addetti ai lavori il termine standard è inferenza. Per gli LLM, fare inferenza significa generare token: il modello elabora prima il tuo prompt (prefill) e poi produce la risposta un token alla volta (decode).
Perché in produzione conta l'inferenza
L'addestramento finisce sui giornali, ma è con l'inferenza che l'AI entra in produzione. Ed è lì che costi e tempi si accumulano. Un modello viene addestrato una volta e poi serve milioni di richieste. Ogni interazione degli utenti, ogni passo di un agente e ogni esecuzione di una pipeline paga di nuovo la latenza e il costo dell'inferenza. L'AI si sta spostando verso workload agentici che generano molti più token per ogni attività. Per questo l'economia del serving (token al secondo, costo per token, energia per token) pesa sempre di più sull'economia complessiva dell'AI.
L'inferenza sollecita anche l'hardware in modo diverso dall'addestramento. L'addestramento è lavoro parallelo limitato dal calcolo (compute-bound), in cui le GPU eccellono. Nell'inferenza degli LLM domina invece la fase di decode, che è memory-bound: a limitarne la velocità è la larghezza di banda della memoria. Per questo un hardware progettato specificamente per l'inferenza, come l'architettura RDU su cui gira la nostra piattaforma, può superare gli acceleratori general purpose in velocità ed efficienza su questo workload.
Misurare l'inferenza
Le prestazioni dell'inferenza si misurano con le metriche spiegate in questo glossario: il tempo al primo token per la reattività, la latenza inter-token e il throughput di output per la velocità di generazione, la latenza end-to-end per il tempo totale di risposta. Conta anche il luogo in cui gira il modello. L'inferenza elabora i tuoi dati di produzione reali a ogni richiesta. Per questo residenza dei dati e giurisdizione sono questioni di inferenza: il modello che serve i tuoi utenti gestisce tutto ciò che inviano.
Fonti
Scopri come l'architettura dataflow di SambaNova cambia l'economia dell'inferenza, e perché abbiamo scelto di costruirci sopra.
Esplora la tecnologia