Cosa significa il numero di parametri
Una rete neurale è un insieme enorme di numeri, organizzati in strati: sono i suoi parametri, detti anche pesi. L'addestramento li regola in modo che l'output del modello rifletta i pattern presenti nei dati. Finito l'addestramento, restano fissi, ed eseguire il modello significa moltiplicare gli input attraverso di essi. Quando un modello viene descritto come "120B", significa 120 miliardi di questi numeri. Il numero di parametri è l'indicatore più citato della capacità, ma non racconta tutto: come un modello è stato addestrato conta quanto la sua dimensione. Lo studio Chinchilla ha mostrato che, a parità di budget di calcolo, dimensione del modello e quantità di dati di addestramento dovrebbero crescere insieme. Molti modelli sono più capaci non perché siano più grandi, ma perché sono stati addestrati su più dati.
Non tutti i parametri sono attivi per ogni token. I modelli densi (come Gemma 4 31B) usano tutti i loro parametri per ogni token. I modelli mixture-of-experts (MoE) fanno passare ogni token solo per una parte dei propri: l'architettura di DeepSeek ha centinaia di miliardi di parametri in totale, ma ne attiva solo qualche decina di miliardi per token. Per questo un modello MoE molto grande può girare molto più velocemente di quanto suggerisca la sua dimensione totale. Quando confronti i modelli, il numero che predice il comportamento in inferenza è quello dei parametri attivi, non il totale.
Perché il numero di parametri determina velocità e costo
Per generare un token bisogna leggere dalla memoria i parametri attivi. Il calcolo in sé costa poco, spostare i numeri no. Leggere decine di miliardi di parametri per ogni singolo token, un token alla volta, è un problema di larghezza di banda della memoria, ed è il costo dominante della fase di decode. È il motivo principale per cui i modelli più grandi generano più lentamente: non perché la matematica sia più difficile, ma perché a ogni passo ci sono più pesi da leggere in streaming dalla memoria. Ed è anche per questo che la latenza inter-token e i token al secondo di output seguono così da vicino la dimensione del modello.
Il numero di parametri determina anche l'impronta hardware. Per essere serviti in modo efficiente, i pesi devono stare in una memoria veloce: a precisione 16 bit, un miliardo di parametri occupa circa due gigabyte. Un modello di classe frontier può quindi richiedere molta più memoria di quella offerta da un singolo acceleratore, e va distribuito su molti. L'hardware progettato apposta per l'inferenza affronta direttamente il problema: l'RDU di SambaNova usa un sistema di memoria a tre livelli che tiene i pesi vicini al calcolo e può mantenere in memoria più modelli grandi contemporaneamente, così passare dall'uno all'altro richiede millisecondi. L'altra leva comune è la quantizzazione: memorizzare i parametri a precisione più bassa, per esempio a 8 bit, riduce la memoria e la banda richieste da un dato numero di parametri, di solito con una perdita di qualità minima.
Più grande non significa automaticamente migliore
Per la maggior parte dei workload di produzione, il modello più grande disponibile raramente è la scelta giusta di partenza. Un modello attuale di medie dimensioni, servito velocemente, spesso batte un modello più grande che risponde lentamente, e costa meno per token. Poiché il numero di parametri determina memoria e banda, e quindi sia velocità sia prezzo, scegliere un modello è una decisione tra capacità e costo, non una questione di "più è meglio". La domanda pratica è quale modello sia abbastanza capace per il compito, e poi quale provider lo esegua più velocemente mantenendo i tuoi dati nella giurisdizione giusta. I modelli open-weight mettono questa scelta nelle tue mani, invece che in quelle di chi pubblica il modello.
Anche l'hosting conta. Un singolo SambaRack contiene 16 RDU, esegue modelli di classe frontier fino a 671 miliardi di parametri e ne tiene diversi in memoria contemporaneamente. Così passa da un modello all'altro in millisecondi, invece di ricaricare decine di gigabyte di pesi a ogni richiesta, e ogni compito gira sul modello della dimensione giusta senza la penalità di un avvio a freddo. Sulla nostra piattaforma UE condivisa tutto questo sta dietro un'unica API compatibile con OpenAI. Se ti servono capacità garantita o pieno isolamento dei dati, la stessa architettura SambaNova è alla base delle nostre offerte Dedicated Capacity e On-Premises.
Fonti
Scopri come l'architettura dataflow di SambaNova cambia l'economia dell'inferenza, e perché abbiamo scelto di costruirci sopra.
Esplora la tecnologia