Se c’è una parola che ha dominato questa settimana nel mondo dell’IA, è efficienza. OpenAI ha scatenato un’ondata di annunci tra il 27 luglio e il 31 luglio che ruotano tutti attorno allo stesso concetto: fare di più con meno.
Taglio dei prezzi, ottimizzazione dell’inferenza, benchmark rivalutati, e una visione strategica chiamata “abbondanza”. Nel frattempo Mistral AI ha piazzato due colpi importanti, uno nel mondo della robotica e uno in quello della matematica formale. Mentre in borsa, Google ha fatto +6,73% in una sola seduta, contrariamente a chi vedeva nel calo di utile della settimana scorsa un segnale negativo.
Vediamo tutto.
Di cosa parleremo..
GPT-5.6 diventa piu economico: Luna -80%, Terra -20%
La notizia più importante della settimana arriva il 30 luglio: OpenAI ha annunciato un taglio drastico dei prezzi per la famiglia GPT-5.6. GPT-5.6 Luna, il modello più veloce ed economico della gamma, costa ora l’80% in meno: 0,20 dollari per milione di token in input e 1,20 dollari per milione di token in output. GPT-5.6 Terra, il modello bilanciato per il lavoro quotidiano, scende del 20% (2 e 12 dollari rispettivamente).
Per GPT-5.6 Sol, il modello di punta, arriva invece la Fast mode nell’API: fino a 2,5 volte più veloce della modalità standard, al doppio del prezzo, senza alcuna perdita di qualità.
I numeri parlano chiaro: Luna oggi offre prestazioni paragonabili a modelli che un anno fa erano considerati frontiera, a circa 6 centesimi per dollaro per task, con una velocità quasi nove volte superiore. Rispetto a Fable 5 di Anthropic, Luna ha un costo per task inferiore di quasi il 99% su benchmark professionali.
In questo momento potrebbe convenire sostituire gpt-5.4-nano con luna, il suo model id è gpt-5.6-luna.
OpenAI svela i segreti dell’efficienza di GPT-5.6
In un post tecnico pubblicato il 29 luglio, OpenAI ha raccontato come GPT-5.6 Sol sia stato usato per ottimizzare se stesso. Il modello ha riscritto e ottimizzato in autonomia i kernel di produzione che servono i modelli, ha progettato ed eseguito centinaia di esperimenti per migliorare la generazione dei token e ha monitorato l’addestramento intervenendo quando necessario.
Il risultato? Una riduzione del 20% del costo end-to-end di serving e un aumento del 15% dell’efficienza nella speculative decoding. Non è fantascienza: è un ciclo di feedback in cui modelli più intelligenti accelerano i miglioramenti che li renderanno ancora più efficienti.
OpenAI ha anche condiviso dati sulla crescita: 1 miliardo di utenti attivi e oltre 2 milioni di aziende. E ha notato un dato interessante: sei mesi dopo essersi iscritti, gli utenti mandano il 50% in più di messaggi al giorno e usano ChatGPT per circa il doppio dei tipi di attività.
ARC-AGI-3, il benchmark che ingannava tutti
Il 29 luglio OpenAI ha pubblicato un’analisi che ridefinisce il modo di interpretare i benchmark. GPT-5.6 Sol sul benchmark ARC-AGI-3 (puzzle 2D) aveva ottenuto un misero 7,8%.
Poi i ricercatori hanno scoperto che il problema non era il modello, ma l’harness di valutazione.
L’harness ufficiale scartava il ragionamento privato del modello dopo ogni azione e usava una finestra di troncamento che cancellava le azioni precedenti. Due impostazioni dell’API di OpenAI, retained reasoning (ragionamento conservato) e compaction (compattazione), hanno triplicato i punteggi portandoli al 38,3%, usando 6 volte meno token in output. La media umana stimata è del 48%.
La lezione è chiara: i benchmark non misurano solo i modelli, ma anche (e a volte soprattutto) le scelte di design dell’infrastruttura che li circonda.
ChatGPT per la ricerca scientifica e la salute
Settimana intensa anche sul fronte delle applicazioni. Il 29 luglio OpenAI ha lanciato ChatGPT for Academic Researchers, un programma che darà accesso gratuito ai modelli di frontiera a 100.000 ricercatori entro il 2027, con un investimento di oltre 250 milioni di dollari. Le prime 10.000 adesioni partono già quest’estate.
Il 23 luglio è arrivato Health in ChatGPT per gli utenti USA: collega Apple Health e cartelle cliniche per conversazioni più informate. Oltre il 70% delle conversazioni sulla salute avviene fuori dallo spazio dedicato, quindi OpenAI ha integrato la funzione nel flusso normale di chat. In tutta onestà, lo trovo un po’ inquietante.
Il 28 luglio, un report su Scientific Computing e AI agentica ha documentato 8 progetti reali (5 con Codex, 3 con Codex + Claude Code) in cui gli agenti AI hanno accelerato lo sviluppo software scientifico, dalla modernizzazione di librerie per dati genomici alla migrazione su GPU.
Come l’IA sta riscrivendo i confini tra mestieri
Il 27 luglio OpenAI ha pubblicato il primo report della serie “Work at the Frontier“. L’analisi di 800.000 messaggi lavorativi su ChatGPT rivela un fenomeno chiamato task crossover: quasi la metà (43,5%) dei messaggi legati a mansioni specifiche riguarda compiti che storicamente appartenevano a un’altra professione.
Il crossover è più marcato in alcuni ruoli: il 77% dei messaggi dei lavoratori dell’assistenza clienti, il 75% dei designer e il 69% delle risorse umane riguardano compiti “presi in prestito” da altre professioni. Marketing e ingegneria sono i compiti che “viaggiano” di più verso altri ruoli.
Mistral AI, robot che navigano e teoremi dimostrati
Mistral AI ha pubblicato due novità importanti.
Robostral Navigate è un modello da 8 miliardi di parametri che permette a un robot di navigare in ambienti complessi usando una sola telecamera RGB, senza LiDAR o sensori di profondità. Raggiunge il 76,6% di successo su percorsi mai visti nel benchmark R2R-CE, superando sistemi che usano più sensori.
Leanstral 1.5 è invece un modello MoE open source (Apache 2.0) con 119 miliardi di parametri totali ma solo 6 miliardi attivi, specializzato in dimostrazioni matematiche formali. Satura completamente miniF2F (100%), risolve 587 problemi su 672 del PutnamBench, e costa circa 4 dollari a problema contro i 300+ dollari di altri sistemi.
Ha anche trovato 5 bug precedentemente sconosciuti in repository open source reali.
IA e Borsa: Google vola, NVIDIA rimbalza
Seduta molto positiva quella di venerdì 31 luglio per i titoli IA:
- Alphabet (GOOGL): +6,73% a $356,13 — il rialzo più forte della giornata tra le big tech, market cap $4.355 miliardi
- Meta (META): +3,28% a $556,71, market cap $1.418 miliardi
- Microsoft (MSFT): +3,02% a $464,72, market cap $3.451 miliardi
- NVIDIA (NVDA): +2,93% a $200,75, market cap $4.862 miliardi
Da inizio anno NVIDIA è a +7,77%, Microsoft a +3,48%, mentre Alphabet (+13,93%) e Meta (+15,51%) sovraperformano l’S&P 500 (+9,41%) dopo il leggero calo recente. L’appuntamento da segnare: NVIDIA pubblica i risultati trimestrali il 26 agosto.
Guida della settimana: sfruttare al meglio GPT-5.6 Luna
Con il taglio dei prezzi, GPT-5.6 Luna diventa estremamente conveniente per task ad alto volume.
Ecco tre consigli pratici:
Scegli il modello giusto per ogni fase del workflow
Non serve usare Sol per tutto. Una strategia efficace: usa Sol per definire il piano e risolvere le ambiguità, poi passa a Luna per implementare, scrivere test e validare i risultati. Risparmi fino al 99% per task.
Attiva Fast mode solo quando serve
La Fast mode di Sol costa il doppio ma è 2,5x più veloce. È perfetta per workflow interattivi dove la latenza conta, meno per batch processing notturno.
Misura il costo per risultato, non per token
Un modello più costoso che completa il lavoro al primo colpo può essere più economico di uno cheap che richiede 5 tentativi e supervisione umana. Valuta sempre il costo dell’outcome, non il costo per token.
Come funziona: Speculative Decoding
Quando parlate con un modello come GPT-5.6 Sol, il processo di generazione dei token (le porzioni trasformate delle unità di testo) avviene un token alla volta. Per generare “Il gatto dorme”, il modello deve predire “Il”, poi “gatto”, poi “dorme”, in sequenza andando a rileggere tutto il contesto precedente, in maniera efficiente con il meccanismo dell’attenzione.
In sostanza, durante il primo passaggio, chiamato spesso prefill, il modello elabora il prompt completo e costruisce una KV cache, cioè memorizza le rappresentazioni delle chiavi e dei valori dell’attenzione per i token già processati.
Durante la generazione successiva:
- non ricalcola interamente i token precedenti;
- calcola le rappresentazioni del nuovo token;
- usa la KV cache per metterlo in relazione con il contesto precedente;
- aggiorna la cache con il nuovo token.
Quindi il modello continua ad applicare attenzione al contesto passato, ma riutilizza gran parte dei calcoli già svolti.
Questo sistema è comunque lento e costoso, perché ogni passaggio richiede un’intera computazione sulla GPU, che quindi deve avere molta RAM.
La speculative decoding è una tecnica che accelera questo processo. L’idea è geniale nella sua semplicità: invece di far lavorare il modello grande (come GPT-5.6 Sol) un token alla volta, si usa un modello draft più piccolo e veloce per proporre più token in una volta sola. Poi il modello grande li verifica in parallelo.
Immaginate un architetto e un disegnatore. Il disegnatore (modello draft) schizza rapidamente 5-6 idee per il prossimo tratto. L’architetto (modello grande) le esamina tutte insieme e approva quelle corrette, scartando le altre. Invece di disegnare una riga alla volta, l’architetto controlla interi blocchi.
OpenAI ha rivelato che GPT-5.6 Sol ha migliorato la speculative decoding del 15% riscrivendo autonomamente i kernel di produzione. Questo significa che il modello ha ottimizzato il codice GPU che esegue la verifica parallela, rendendo l’intero processo più efficiente senza cambiare il modello stesso.
La speculative decoding è una delle ragioni per cui modelli come GPT-5.6 Luna possono essere 9 volte più veloci a costi drasticamente inferiori. Non è solo una questione di modello più piccolo: è l’ingegneria dell’inferenza che fa la differenza.
FAQ della settimana
GPT-5.6 Luna è abbastanza potente per il mio lavoro?
Dipende dal task. Su benchmark professionali come Agents’ Last Exam, Luna supera Fable 5 di Anthropic con un costo per task inferiore del 99%. Per lavori di scrittura, analisi dati, coding di base e automazione è più che adeguato. Per problemi molto complessi che richiedono ragionamento profondo, meglio Sol o Terra.
Cos’è l’ARC-AGI-3 e perché è importante?
È un benchmark di puzzle 2D progettato per misurare la capacità di ragionamento e apprendimento degli agenti AI in ambienti sconosciuti. La vicenda di questa settimana ha dimostrato che i risultati dei benchmark dipendono fortemente dall’infrastruttura di testing, non solo dal modello.
Robostral Navigate funziona davvero con una sola telecamera?
Sì, ed è la sua forza. Usa una normale telecamera RGB, senza LiDAR o sensori di profondità, e raggiunge il 76,6% di successo su percorsi mai visti. Il modello punta letteralmente le coordinate dell’immagine verso cui muoversi.
Come funziona la Fast mode di GPT-5.6 Sol?
La Fast mode è disponibile via API e offre velocità fino a 2,5x rispetto alla modalità standard. Costa il doppio, ma la qualità delle risposte è identica. Sostituisce la vecchia Priority Processing.
Leanstral 1.5 è davvero gratis?
Sì, è rilasciato con licenza Apache 2.0, completamente open source. Ha 119 miliardi di parametri totali ma ne attiva solo 6 miliardi per inferenza (architettura Mixture of Experts). Puoi scaricarlo da Hugging Face o usarlo via API gratuita.


