Google sviluppa un metodo per evitare che gli agenti AI memorizzino i test

Google presenta un nuovo metodo per evitare che gli agenti AI memorizzino i test, migliorando le prestazioni su compiti nuovi.

Google ha sviluppato un nuovo metodo per evitare che gli agenti AI memorizzino i test, un problema che ha limitato la capacità degli agenti di generalizzare su compiti nuovi. Il metodo, chiamato RRSI (Regularized Recursive Self-Improvement of Agent Harnesses), mira a migliorare l’efficienza e la capacità di apprendimento degli agenti senza compromettere le prestazioni. L’approccio si basa su un framework chiamato “harness”, che controlla come l’agente interagisce con i dati e le operazioni. L’obiettivo è permettere agli agenti di migliorare autonomamente senza diventare troppo specializzati nei compiti di test.

RRSI: un sistema per controllare l’auto-ottimizzazione

RRSI funziona regolando due punti chiave del processo di ottimizzazione: quando l’agente propone nuove modifiche e quando decide quali di esse diventano parte permanente del “harness”. Il sistema impone un budget per le modifiche, che si riduce nel tempo, limitando il numero di cambiamenti indipendenti che possono essere applicati in una singola iterazione. Questo aiuta a evitare che l’agente si concentri troppo su compiti specifici, riducendo il rischio di memorizzazione. Inoltre, il sistema tiene traccia delle modifiche precedenti per evitare di ripetere idee fallite.

Un critico interno valuta ogni proposta e elimina quelle che codificano nomi di compiti, soluzioni o trucchi specifici per benchmark. Questo processo garantisce che il “harness” rimanga flessibile e generalizzabile. Il sistema si basa su un feedback continuo per ottimizzare il “harness”, che a sua volta controlla il comportamento dell’agente. Questo approccio permette un miglioramento senza compromettere la capacità di adattamento a nuovi compiti.

Risultati positivi su benchmark diversi

Il team ha testato RRSI su otto benchmark che coprono coding, lavoro di tipo agente e progettazione ingegneristica. L’agente utilizzato, Claude Opus 4.8, è rimasto invariato durante i test, mentre il “harness” è stato ottimizzato. I risultati mostrano che RRSI ha migliorato le prestazioni su compiti nuovi, con un incremento fino a 4.7 punti su cinque benchmark mai visti. Inoltre, il sistema utilizza il 30% in meno di token rispetto alla versione non regolata. Tra tutti i metodi testati, RRSI è stato l’unico a superare il baseline su compiti non visti.

Un altro aspetto chiave di RRSI è la sua capacità di migliorare anche agenti più deboli. Ad esempio, un “harness” ottimizzato con Gemini 3.5 Flash ha migliorato la precisione di Gemini 3.1 Flash Lite da 11.2 a 14.6 punti senza modifiche. Questo dimostra che i meccanismi trovati non dipendono dalla capacità del modello utilizzato per scoprire i miglioramenti. La ricerca indica che l’auto-ottimizzazione è efficace solo quando i feedback vengono trasformati in cambiamenti duraturi. Il sistema RRSI rappresenta un passo avanti nella ricerca sull’auto-ottimizzazione degli agenti AI, permettendo loro di migliorare senza diventare troppo specializzati. Questo potrebbe portare a agenti più versatili e capaci di adattarsi a nuovi compiti, senza compromettere le prestazioni su quelli già conosciuti. La ricerca è disponibile su GitHub, e i ricercatori sperano che il metodo possa essere applicato a una vasta gamma di scenari di utilizzo.