Paper / 016

Valutare un agente senza benchmark

lettura: 15 minper: builderarXiv ↗
PAPER ORIGINALE“Evaluating Language-Model Agents on Realistic Tasks”

I benchmark pubblici sono utili per confrontare modelli in astratto. Ma non ti dicono la cosa che ti serve: funziona sul mio caso?

Perché conta per te

Perché prima o poi dovrai decidere se un agente è «abbastanza buono» per il tuo lavoro, e la risposta non è su una classifica. È nei tuoi dati, sui tuoi compiti.

§1 · Costruisci il tuo set di casi

Non serve un dataset enorme: servono 10–20 casi reali del tuo dominio, con la risposta che consideri buona. È il minimo per smettere di giudicare «a sensazione».

§2 · Misura ciò che decide

Misura la cosa da cui dipende una decisione, non ciò che è facile contare. Un agente che sbaglia il 2% dei numeri critici è peggio di uno che sbaglia il 20% delle virgole. Collega questo al playbook «Progetta l’analisi»: decidi prima cosa conta, poi misuralo.

Scrivi per cercare fra corso, playbook, skill, paper…