Radar · 10/07/2026 · fatto del 09/07/2026 · modelli

OpenAI lancia GPT-5.6 con tre varianti e ChatGPT Work

OpenAI ha reso pubblico GPT-5.6, dopo due settimane di anteprima riservata a organizzazioni approvate dal governo. Il modello arriva in tre varianti: Luna (la più piccola), Terra (media) e Sol (la più grande), con prezzi da $1 a $5 per milione di token in input. Tutte e tre hanno una finestra di contesto di un milione di token e un massimo di 128.000 token in output.

Insieme ai modelli, OpenAI lancia ChatGPT Work: un agente che si muove tra app (Google Drive, Slack, Salesforce) e file, resta su un progetto per ore se serve, e porta a termine compiti complessi senza che tu debba orchestrare ogni passo. Sol dimostra capacità avanzate: può eseguire post-training autonomo su Luna e, nella modalità Ultra, ha prodotto una dimostrazione matematica della Cycle Double Cover Conjecture.

Perché ti riguarda. Se usi modelli di linguaggio nel lavoro quotidiano, la scelta si complica: tre dimensioni dello stesso modello, cinque livelli di ragionamento (da Light a xhigh, più Max e Ultra), e ora un agente che dovrebbe fare il giro completo di un progetto. La domanda diventa pratica: quando Luna basta, quando serve Sol, e se ChatGPT Work regge davvero una giornata di lavoro o si impalla a metà. OpenAI pubblica benchmark che mostrano Sol davanti a Claude Fable 5 nei compiti agentici lunghi, ma è lo stesso giorno in cui squalifica circa il 30% di SWE-Bench Pro, un test di programmazione dove Fable aveva stracciato Sol. I numeri di benchmark vanno presi con questo contesto.

Dove guardare. La pagina di model guidance di OpenAI elenca le nuove funzionalità API (tool calling programmatico, multi-agente, breakpoint di cache). Un confronto indipendente ha raccolto i costi di 18 varianti dello stesso prompt: da 0,71 centesimi (Luna, senza ragionamento) a 48,55 centesimi (Sol, massimo sforzo).

Nel dettaglio

Il contesto: l’anteprima frenata

Due settimane fa OpenAI aveva rilasciato GPT-5.6 solo a organizzazioni approvate dal governo, in una “limited preview” che aveva sollevato discussioni. Il 9 luglio l’amministrazione Trump ha dato il via libera pubblico. Sam Altman l’ha chiamato “il miglior modello che abbiamo mai prodotto”.

Le tre varianti e i prezzi

Luna, Terra e Sol costano rispettivamente $1/$6, $2.50/$15, $5/$30 per milione di token (input/output). Per confronto, Claude Opus è a $5/$25 e Fable 5 a $10/$50. Ma il prezzo per milione di token non dice molto: i modelli con ragionamento possono consumare quantità molto diverse di token interni per lo stesso compito.

Tutte e tre le varianti hanno data di conoscenza al 16 febbraio 2026, finestra di contesto da un milione di token, e massimo output di 128.000 token. I cinque livelli di ragionamento (none, low, medium, high, xhigh) permettono di scegliere quanto lavoro interno il modello deve fare. Sopra xhigh ci sono Max e Ultra, che attivano sub-agenti paralleli.

I benchmark: OpenAI davanti su agenti, dietro su codice

OpenAI punta sui compiti agentici lunghi: su Agents’ Last Exam (55 campi professionali), GPT-5.6 Sol arriva a 53.6 punti, battendo Fable 5 di 13.1 punti. Anche a ragionamento medio, Sol batte Fable di 11.4 punti a un quarto del costo stimato. Luna e Terra superano Fable a un sedicesimo del costo.

Su SWE-Bench Pro (un test di programmazione), invece, Fable 5 aveva ottenuto l’80% contro il 64.6% di Sol. Il giorno prima del lancio, OpenAI ha pubblicato un articolo in cui stima che circa il 30% dei compiti di SWE-Bench Pro siano “broken” e consiglia cautela nell’usare quel benchmark. Un tempismo che non è passato inosservato.

ChatGPT Work: l’agente che dovrebbe fare il giro completo

ChatGPT Work è descritto come un agente che prende un obiettivo e lo porta a termine, muovendosi tra app e file, restando su un progetto per ore. È alimentato da Codex (lo strumento di programmazione di OpenAI, ora fuso in ChatGPT) e da GPT-5.6. Può accedere a Google Drive, Slack, Salesforce. La promessa è: dai un compito, torna quando è finito.

Il problema è che gli agenti autonomi tendono a impantanarsi o a divergere quando i compiti diventano lunghi. La capacità di “restare su un progetto per ore” è la parte più difficile da verificare senza usarlo davvero.

Sol Ultra e la matematica avanzata

GPT-5.6 Sol, nella modalità Ultra, ha prodotto una dimostrazione della Cycle Double Cover Conjecture, un problema aperto di teoria dei grafi. Il PDF della dimostrazione è pubblico. Secondo OpenAI, Sol può anche eseguire post-training autonomo su Luna: si auto-migliora addestrando versioni più piccole di sé. Sono affermazioni forti, che vanno oltre l’uso quotidiano, ma segnalano la direzione.

Le nuove funzionalità API

La model guidance elenca novità che cambiano come si usano i modelli:

  • Programmatic Tool Calling: il modello scrive e esegue JavaScript per orchestrare chiamate a strumenti, invece di restituire una sequenza di chiamate da eseguire esternamente.
  • Multi-agent: il modello può attivare sub-agenti per lavori paralleli e focalizzati, direttamente dall’API.
  • Prompt cache breakpoints: come Claude, puoi segnalare dove mettere i punti di cache invece di affidarti al rilevamento automatico.
  • detail: original per le immagini: il modello non ridimensiona l’immagine prima di processarla.

Il tool calling programmatico somiglia al meccanismo di dynamic filtering che Anthropic ha aggiunto alla ricerca web: invece di restituire risultati grezzi, il modello esegue codice sui risultati in un solo turno.

Cosa NON sappiamo

Chi ha avuto accesso anticipato a Sol lo descrive come “decisamente molto competente”, ma non migliore di Fable sui compiti complessi di programmazione provati. È un dato aneddotico, non un benchmark, ma è il tipo di osservazione che conta: quella di chi usa i modelli ogni giorno.

Non sappiamo ancora quanto ChatGPT Work regga su progetti veri e lunghi, né quanto sia affidabile il post-training autonomo di Sol su Luna. E il fatto che OpenAI abbia squalificato circa un terzo di SWE-Bench Pro il giorno prima del lancio solleva la domanda: quanto sono robusti gli altri benchmark che citano?

Dove questo porta

I modelli ora sono famiglie, non singoli. La scelta del modello giusto per un compito diventa parte del mestiere: quando basta Luna, quando serve Terra, quando Sol giustifica il costo. E se gli agenti come ChatGPT Work reggono davvero, il mestiere cambia: passi dal dare istruzioni passo-passo a dare obiettivi e verificare che siano raggiunti. Ma siamo ancora nella fase in cui le promesse vanno verificate sul campo, non prese per buone dai comunicati.

Scrivi per cercare fra corso, playbook, skill, paper…