Alessandro Santandrea
Terminal-Bench-Science: Un benchmark per valutare le capacità scientifiche degli agenti AI
Un benchmark innovativo per valutare le capacità scientifiche degli agenti AI, con dati su 70 task e modelli come Claude Opus 5 e GPT-5.6 Sol.




















