Leggere i benchmark senza farsi fregare
- per iniziare
- solo un browser: sono tutte pagine pubbliche
- quando sceglierlo
- Un annuncio sventola un punteggio e vuoi capire cosa dice davvero, prima di cambiare strumento o opinione.
Ogni annuncio di modello cita un punteggio, e il radar di questo sito ne riporta di continuo. Questa guida è il decodificatore: le quattro pagelle che incontri più spesso, cosa misura ciascuna, e cosa non ti dice mentre te la sventolano davanti.
SWE-bench Verified: il codice vero
Cosa misura. Il modello (anzi: il sistema modello più agente) riceve 500 issue reali di progetti open source in Python, validate a mano, e deve produrre la correzione. Passa se i test del progetto passano. Niente giudizi umani: o il codice funziona o no.
In trenta secondi. La percentuale è la quota di issue risolte. Due accortezze: il punteggio appartiene alla coppia modello+scaffold (lo stesso modello con un agente diverso cambia risultato), e il terreno è la manutenzione di progetti Python esistenti: dice poco su altri linguaggi e niente sul progetto tuo. Pagina: swebench.com, metodologia verificata il 19/07/2026.
Terminal-Bench: il lavoro end-to-end
Cosa misura. Ottantanove compiti difficili da terminale (compilare, configurare, addestrare, fare debug) in ambienti containerizzati, ognuno con una suite di verifica scritta prima. Per confrontare i modelli ad armi pari usa un agente neutro e minimale (Terminus 2: solo bash). È il benchmark più vicino a «delegare un compito vero a un agente».
In trenta secondi. Percentuale di task portati a termine da soli. Guarda se il numero viene dall’agente neutro o da un agente commerciale ottimizzato: misurano cose diverse, entrambe legittime. Pagina: tbench.ai, verificata alla stessa data.
LMArena: cosa piace alle persone
Cosa misura. Utenti veri fanno la stessa domanda a due modelli anonimi e votano la risposta migliore; i voti diventano un punteggio in stile Elo. Misura la preferenza umana media su domande da chat, che conta, ma con bias documentati: le risposte lunghe e ben formattate vincono, quelle che ti danno ragione vincono, e i laboratori grandi presentano molte varianti aumentando le probabilità che una salga (è la tesi del paper «The Leaderboard Illusion», aprile 2025).
In trenta secondi. Utile per farsi un’idea di tono e gradevolezza, debole come misura di affidabilità sul compito: un modello può piacere e sbagliare i numeri. Pagina: lmarena.ai.
Artificial Analysis: il colpo d’occhio
Cosa misura. Un indice composito 0-100 che aggrega nove valutazioni in quattro aree pesate uguali: agenti, coding, capacità generali, ragionamento scientifico. Accanto all’indice, le curve prezzo/velocità/qualità che il radar cita spesso. È il modo più rapido di posizionare un modello nuovo nel panorama.
In trenta secondi. Ottimo per il quadro, ma è una media: un modello mediocre nell’indice può eccellere proprio nell’area che serve a te, e viceversa. Apri il dettaglio per aree prima di trarre conclusioni. Pagine: artificialanalysis.ai e la metodologia, verificate alla stessa data.
Le tre trappole, in ogni annuncio
La contaminazione. I benchmark pubblici finiscono nei dati di addestramento: un punteggio alto può misurare la memoria invece della capacità. I benchmark con casi tenuti privati o rinnovati soffrono meno; i punteggi record su test vecchi di anni meritano un sopracciglio alzato.
Il cherry-picking. L’annuncio cita il benchmark dove il modello vince e tace gli altri. Il manuale di sopravvivenza agli annunci AI ha la checklist completa; la versione corta è: se l’annuncio cita un solo numero, chiediti quali mancano.
La media che nasconde. Due modelli con lo stesso punteggio medio possono avere profili opposti: uno costante, uno che alterna picchi e disastri. Per un uso professionale la varianza conta quanto la media, e nessun indice sintetico te la mostra.
La regola finale
I benchmark servono a orientarsi in trenta secondi, e per questo sono preziosi. La decisione però resta ai tuoi casi: cinque esempi veri del tuo lavoro, fatti girare sui modelli candidati, dicono di più di qualunque classifica. Il metodo è in scegliere il modello col cronometro e col portafoglio, e il playground di un gateway lo rende un esercizio da un quarto d’ora.