Risorse per sviluppatori
Glossario dell'inferenza AI sovrana nell'UE
Definizioni chiare e documentate sull'inferenza AI sovrana nell'UE: dalla data residency al GDPR e alla zero data retention, fino a TTFT, throughput e architettura dataflow. Ogni voce si basa su fonti pubblicate e su dati di benchmark reali della nostra infrastruttura UE.
Sovranità e compliance
- Data ResidencyDove i tuoi dati sono fisicamente archiviati ed elaborati. È una parte necessaria della sovranità, ma non coincide con il controllo su chi può accedervi legalmente.
- Data Processing Agreement (DPA)Il contratto previsto dall'articolo 28 del GDPR che regola come un provider di inferenza può trattare i dati personali contenuti nei tuoi prompt. Mostra subito se un provider è pronto per l'uso aziendale.
- GDPR per l'inferenza AICosa richiede la normativa europea sulla protezione dei dati quando i tuoi prompt contengono dati personali: una base giuridica, un accordo con il responsabile del trattamento e un trattamento che resta alla portata del diritto UE.
- Zero Data Retention (ZDR)Un provider di inferenza non conserva i tuoi prompt né gli output dopo l'elaborazione e non li usa mai per l'addestramento. I tuoi dati restano nel sistema solo per il tempo dell'elaborazione.
Metriche di prestazione
- TTFT (Time to First Token)Quanto aspetta un utente tra l'invio di una richiesta e la comparsa del primo token della risposta.
- Latenza inter-token (ITL)L'intervallo medio tra un token e il successivo durante la generazione, detto anche TPOT.
- Token al secondoL'unità standard della velocità di generazione degli LLM, e perché lo stesso numero può indicare due cose diverse.
- Velocità di inferenzaIl termine generale che comprende TTFT, latenza inter-token e throughput, e quale metrica conta in quale caso.
Architettura
- RDU (Reconfigurable Dataflow Unit)Il processore AI di SambaNova: un chip progettato apposta per l'AI, che esegue i modelli come flusso di dati invece che istruzione per istruzione.
- Architettura dataflowIl modello di esecuzione in cui i dati scorrono attraverso le operazioni come in una pipeline, senza i continui passaggi dalla memoria che la GPU fa tra un kernel e l'altro.
Modelli e inferenza
- InferenzaL'esecuzione di un modello AI addestrato per produrre output. È il lavoro dell'AI in produzione: costi e tempi di attesa si ripresentano a ogni utilizzo.
- Throughput (serving LLM)Token al secondo in due sensi: il throughput di output per richiesta e la capacità dell'intero sistema. Il batching aumenta l'uno a scapito dell'altro.
- Prefill vs. DecodeLe due fasi dell'inferenza LLM: l'elaborazione parallela del prompt e la generazione un token alla volta.
- Latenza vs. throughputIl compromesso di fondo del serving: la produzione totale del sistema contro la velocità del singolo utente.
- Modello open-weightUn modello i cui parametri addestrati sono pubblicati, così che chiunque possa eseguirlo in proprio. È la base tecnica dell'inferenza sovrana.
- Context WindowLa quantità massima di testo, in token, che un modello può considerare in una volta, tra prompt e output. La sua lunghezza incide direttamente su velocità e costo dell'inferenza.
- ParametriI pesi appresi di un modello: una misura approssimativa della sua dimensione e capacità, e il fattore che determina direttamente memoria, velocità e costo.
- Temperature (Sampling)Il parametro che controlla la casualità nella scelta del token successivo: 1.0 è il valore di partenza, 0 impone il greedy decoding.
- Top-P (Nucleus Sampling)Un metodo di sampling che tiene solo i token più probabili necessari a coprire una probabilità cumulativa p, adattando il pool di candidati alla sicurezza del modello.
- Top-K SamplingUn metodo di sampling che limita la scelta ai k token più probabili: un tetto rigido al pool di candidati.
- Greedy DecodingLa strategia di decoding che sceglie sempre il token più probabile: deterministica, ma soggetta a loop di ripetizione.