ChatGPT introduce un innovativo generatore di immagini, completamente integrato nel modello GPT‑4o, segnando un avanzamento importante nell’intelligenza artificiale generativa di OpenAI. La nuova funzione promette prestazioni visive comparabili, se non superiori, a quelle offerte da piattaforme come Midjourney e Ideogram, fino ad oggi considerate benchmark nel settore.
L’annuncio di OpenAI è accompagnato da numerose immagini dimostrative, che evidenziano le potenzialità di questa nuova funzione. Tra le caratteristiche più esaltate vi sono l’elevata fedeltà visiva ai prompt forniti, la precisione nella resa dei testi presenti nelle immagini e la capacità del modello di contestualizzare correttamente le istruzioni. Non si tratta solo di generare un’immagine coerente, ma anche di interpretare correttamente input complessi, come schemi dettagliati o scenari articolati.
L’esperimento del prisma di Newton
Uno degli esempi emblematici condivisi da OpenAI mostra un esperimento ispirato al prisma di Newton, dove la sequenza in tre fasi rappresenta l’evoluzione visiva del prompt: dall’idea scientifica, alla rappresentazione storica del personaggio, fino a una messa in scena urbana ambientata in una piazza di New York.
Un punto particolarmente rilevante è la capacità del generatore di immagini di rappresentare testi in modo corretto, un obiettivo che molti altri sistemi basati sull’IA faticano a raggiungere. Nei cartelli stradali, per esempio, il rendering del testo risulta preciso e grammaticalmente corretto, senza gli errori comuni riscontrabili in altri modelli.
Il nuovo generatore si distingue anche per la sua versatilità: può creare illustrazioni stilizzate, fumetti, infografiche e contenuti fotorealistici, adattandosi al contesto richiesto dall’utente. Questo è possibile grazie all’interconnessione con le competenze linguistiche già consolidate del modello GPT, che applica la stessa capacità interpretativa anche alla componente visiva.
I limiti ci sono ancora
Tuttavia, non mancano i limiti. OpenAI ha chiarito che la generazione di immagini molto lunghe, come i poster, può presentare difetti, in particolare tagli innaturali vicino ai bordi delle immagini. Questo è uno degli aspetti su cui il team sta già lavorando, con l’obiettivo di migliorare la coerenza e la qualità visiva nel tempo.
Sul fronte della privacy e della sicurezza, OpenAI ha adottato un approccio trasparente: ogni immagine generata sarà contrassegnata con metadati C2PA, che ne identificheranno l’origine da GPT‑4o. Inoltre, il sistema incorpora blocchi preventivi per evitare la creazione di contenuti inappropriati, come deepfake sessuali o materiale pedopornografico.
Il generatore è già disponibile per gli utenti Plus, Pro, Team e Free, diventando la modalità predefinita per la creazione di immagini in ChatGPT. L’accesso per le versioni Enterprise ed Edu è previsto a breve, mentre per chi preferisce ancora DALL-E, resta possibile utilizzarlo tramite collegamenti GPT dedicati.





