Da dove nasce il compromesso
La generazione dei token è limitata dalla larghezza di banda della memoria: ogni passo di decode deve leggere dalla memoria i pesi del modello. Con il batching l'hardware carica i pesi una volta e fa avanzare molte richieste insieme, quindi i token al secondo totali crescono rapidamente all'aumentare del batch size. Ma tutte le richieste del batch condividono la stessa larghezza di banda, e i token di ciascun utente arrivano più lentamente. Databricks lo ha misurato concretamente su una A100: con batch size 64 il throughput era 14x, con una latenza per richiesta di 4x.
Il compromesso ha un limite netto. Quando i batch diventano così grandi che il decode passa a essere compute-bound, il throughput smette di migliorare mentre la latenza continua a peggiorare: con le parole di Databricks, oltre quel punto ogni raddoppio del batch size aumenta soltanto la latenza. Sistemi di ricerca come Sarathi-Serve (OSDI 2024) esistono proprio per gestire questa curva, perché uno scheduling ingenuo permette al prefill di un utente di bloccare la generazione di tutti gli altri.
Cosa significa nella scelta di un provider
Due provider che eseguono modelli identici su GPU identiche possono offrire esperienze completamente diverse, a seconda di quanto aggressivamente usano il batching. Un utilizzo elevato fa bene all'economia del provider. Una latenza bassa fa bene ai tuoi utenti. Uno scheduling migliore (continuous batching, chunked prefill) sposta la curva verso l'esterno, e un hardware diverso ne cambia del tutto la forma: le architetture che restano efficienti con batch piccoli possono offrire un'alta velocità per richiesta senza sacrificare altrettanta capacità. È l'idea alla base dell'architettura dataflow su cui si basa la nostra piattaforma.
Un consiglio pratico: metti alla prova i provider con il tuo workload reale e la tua concorrenza reale, non solo con singole richieste a mezzanotte. Osserva quanto resta stabile la latenza inter-token nell'arco della giornata: rivela quanto la capacità sia in overbooking.
Fonti
Guarda queste metriche misurate dal vivo sulla nostra infrastruttura UE: numeri reali da hardware di produzione, verificati in modo indipendente.
Vedi i benchmark dal vivo