Temperature 0 Non è Deterministica nei Modelli di LLM
Un’analisi su come la non determinismo nei modelli LLM si manifesta a temperature zero e perché le risposte non sono sempre identiche.
Un team di ricercatori ha scoperto che anche a temperature zero, i modelli linguistici di grandi dimensioni (LLM) non producono sempre risposte identiche. L’esperienza condotta da Horace He e colleghi del Thinking Machines Lab ha rivelato che, nonostante la temperatura zero dovrebbe garantire una scelta deterministica del token più probabile, le risposte differiscono a causa di errori numerici e variabilità nella precisione del calcolo. L’articolo esplora il motivo di questa non determinismo e presenta una formula per stimare la probabilità di differenze tra completamenti.
La Non Determinismo a Temperature Zero
La temperatura zero implica che il modello seleziona sempre il token con il punteggio logit più alto. Tuttavia, il calcolo dei logit avviene in floating point, dove l’addizione non è associativa. Questo porta a errori numerici che possono causare differenze nei risultati. L’articolo spiega che, nonostante la formula matematica sia deterministica, l’aritmetica effettiva introduce variabilità. La differenza tra i due approcci è cruciale per comprendere perché le risposte non sono sempre identiche.
La non determinismo non è un errore, ma un effetto della precisione del calcolo.
La Formula per la Probabilità di Differenze
La formula derivata nell’articolo fornisce una stima della probabilità che un token cambierà tra due completamenti. La probabilità di flip per token è data da f(0) · E|Δ| / 2, dove f(0) rappresenta la densità dei gap vicini a zero e E|Δ| è l’errore medio. Questa formula è stata verificata con simulazioni e test su modelli reali, come GPT-2, e ha mostrato una buona accuratezza. L’errore numerico, in particolare nei calcoli in bfloat16, ha un impatto significativo sulla stabilità delle risposte. Un esempio concreto mostra che, con una densità di gap f(0) ≈ 0.83 e un errore medio di 0.02 logits, la probabilità di flip è circa 0.01. Questo valore è stato confermato sperimentalmente, dimostrando che la formula è valida e applicabile in contesti reali.
Le Implicazioni per l’Inferenza e la Valutazione
La non determinismo a temperature zero ha implicazioni importanti per l’inferenza e la valutazione dei modelli LLM. I ricercatori sottolineano che non si dovrebbe aspettarsi esattamente lo stesso risultato per due chiamate identiche. Invece, è consigliabile confrontare i risultati con una tolleranza o valutarli semanticamente. Inoltre, l’uso di kernel batch-invariant può ridurre l’effetto del non determinismo, ma a scapito della velocità di elaborazione.
La formula fornita nell’articolo permette di prevedere la probabilità di differenze tra completamenti, basandosi sulla media del tasso di flip e sul livello di rumore nel sistema. Questo strumento è utile per valutare la stabilità dei modelli e migliorare la loro affidabilità in contesti di inferenza. Il lavoro di Horace He e colleghi rappresenta un passo avanti nella comprensione dei meccanismi di non determinismo nei modelli LLM e offre una base per migliorare la loro affidabilità e prevedibilità.
