
Ideogram 4.0 è Ora Open-Weight: Cosa Gira su una GPU da 24GB (2026)
Ideogram 4.0 è uscito il 3 giugno 2026 e ha rotto il modello. Ogni versione precedente di Ideogram viveva dietro un'app web. Questa viene fornita con i pesi. Puoi scaricare un modello da 9,3 miliardi di parametri da Hugging Face ed eseguire la versione nf4 su una singola GPU da 24GB, come una RTX 4090, a casa tua. Non è il campione estetico. Sulla classifica DesignArena Elo, GPT Image 2 è avanti con circa 1405, mentre Ideogram 4.0 si attesta intorno a 1285. Ma per testo e tipografia? Nessun modello open gli si avvicina. Ecco l'analisi onesta.
Verdetto rapido:
- Ideogram 4.0 (3 giugno 2026) è il primo modello open-weight di Ideogram: un DiT da 9,3B parametri che gira su una GPU da 24GB.
- Vince in modo netto su testo e tipografia; è dietro a GPT Image 2 sull'Elo estetico (~1285 vs ~1405).
- Tre modi per usarlo: app web, API cloud, o self-hosting locale tramite il checkpoint nf4.
- "Open-weight" non significa open-source. La licenza di download è non commerciale. Verificala prima di rilasciare qualcosa.
Cos'è Ideogram 4.0?
Ideogram 4.0 è un modello text-to-image da 9,3 miliardi di parametri rilasciato il 3 giugno 2026, ed è il primo Ideogram che puoi scaricare e far girare tu stesso. Ogni versione precedente, dalla 0.1 alla 3.0, era solo cloud. La funzionalità principale è il text rendering di qualità superiore a risoluzione nativa 2K, pensato per designer, sviluppatori e chiunque generi poster, loghi o segnaletica.
Cosa c'è davvero sotto al cofano? Alcune specifiche utili, in breve:
- Architettura: un Diffusion Transformer (DiT). In parole povere, è un modello che parte dal rumore visivo e lo raffina passo dopo passo verso il tuo prompt, usando la stessa matematica transformer che alimenta i grandi modelli linguistici. "9,3B" è il numero di parametri, piccolo rispetto ai ~32B di Flux 2.
- Encoder testuale: Ideogram lo abbina a un encoder vision-language Qwen3-VL, ed è la ragione principale per cui le lettere vengono così nitide.
- Risoluzione: output nativo 2K, senza trucchi di upscaling.
- Magic Prompt: un auto-potenziatore opzionale che riscrive il tuo prompt breve in uno più ricco prima della generazione. Utile per gli utenti casual, fastidioso se vuoi controllo preciso. Si può disattivare.
La vera storia non è l'architettura, però. È che Ideogram si è unita all'onda dei modelli open-weight che sta ridisegnando come i team costruiscono con l'AI. Se hai seguito le uscite di modelli LLM open-weight di quest'anno, conosci già il pattern: un lab proprietario forte pubblica pesi scaricabili, e all'improvviso hobbisti e startup possono fare self-host di quello che prima era solo un prodotto API. Ideogram 4.0 è la prima versione che puoi scaricare e far girare sul tuo hardware. Secondo il post tecnico ufficiale di Ideogram, i pesi si trovano su Hugging Face in due versioni quantizzate, e il codice di inferenza è su GitHub.
Ideogram 4.0 si può davvero usare in locale?
Sì, in tre modi diversi. L'app web non richiede nessuna configurazione ed è adatta agli utenti casual e ai designer. L'API cloud è per gli sviluppatori che integrano la generazione di immagini in un'app. E il self-hosting locale è la novità: scarica i pesi open da Hugging Face, eseguili su una GPU da 24GB e non paghi nulla per immagine. Scegli il percorso che si adatta al tuo hardware e al tuo budget.
Come scegliere:
- App web su ideogram.ai. Sceglila se vuoi solo immagini senza pensare alle GPU. Esiste un piano gratuito; i piani a pagamento aggiungono volume e velocità.
- API cloud. Sceglila se stai integrando la generazione di immagini in un prodotto e vuoi una fatturazione prevedibile per immagine senza possedere una GPU. I prezzi sono nella sezione successiva.
- Self-hosting locale. Sceglilo se hai una scheda da 24GB e vuoi generazione illimitata senza costo per immagine. È anche la strada se tieni alla privacy o vuoi fare fine-tuning.
Per il percorso locale, la via pratica al momento è ComfyUI, l'interfaccia a nodi che la maggior parte dei modelli di immagini open supporta per prima. Il flusso di base è questo:
- Accetta il gate della licenza sulla pagina del modello Hugging Face (
ideogram-ai/ideogram-4-nf4) e scarica il checkpoint. - Mettilo nella cartella dei modelli di ComfyUI.
- Carica un workflow ComfyUI per Ideogram 4.0 della community (ne circolano già diversi).
- Genera.
Un avvertimento: a fine giugno 2026, il checkpoint fp8 non è ancora supportato dalla libreria Diffusers, quindi gli utenti fp8 usano principalmente ComfyUI. La versione nf4 ha un supporto di strumenti più ampio. Se preferisci evitare l'hardware locale, puoi distribuirlo su una GPU cloud e affittare la VRAM al minuto, lo stesso trucco che si usa per eseguire modelli open in locale senza comprare una 4090.
Quale hardware e quanta VRAM servono per eseguirlo in locale?
Il checkpoint nf4 su una scheda con 24GB di VRAM (come una RTX 4090) è il punto ottimale. 16GB è al limite, funziona con l'offloading ma rallenta. 32GB e oltre è comodo. La versione fp8 ad alta fedeltà vuole di più, realisticamente un A100 o H100. E per essere chiari, si tratta di VRAM GPU, non di RAM di sistema.
| Checkpoint | VRAM minima | GPU consigliata | Qualità | Note |
|---|---|---|---|---|
| nf4 | ~16GB (al limite) | 24GB (RTX 4090) | Buona | Supportato da Diffusers; il punto ottimale |
| fp8 | ~32GB+ | A100 / H100 | Superiore | Nessun supporto Diffusers ancora; percorso ComfyUI |
Con una scheda da 24GB, puoi far girare Ideogram 4.0 a casa. Con meno stai stringendo.
E per Mac? Risposta onesta: non esiste ancora un percorso locale pratico per Apple Silicon. Gli strumenti rilasciati presuppongono CUDA, cioè Nvidia. I Mac con chip M non riescono a eseguire i checkpoint in modo utilizzabile oggi, quindi gli utenti Mac dovrebbero restare con l'app web o l'API. Potrebbe cambiare man mano che la community porta il modello, ma non comprare un Mac Studio aspettandoti di fare self-host di questo a giugno 2026.
La velocità di generazione dipende molto dalla tua GPU specifica, quindi non inventerò un numero. Gli utenti Reddit che testano la versione nf4 riportano che le immagini 2K su una 4090 arrivano in pochi decine di secondi, ma trattala come una cifra della community, non un benchmark di laboratorio. Se hai bisogno di latenze esatte per la pianificazione della produzione, misurale sulla tua scheda. Il punto che conta davvero: una GPU consumer da 24GB è più che sufficiente, il che non era mai stato vero per Ideogram prima d'ora.
Quanto costa l'API di Ideogram 4.0?
L'API di Ideogram 4.0 addebita una tariffa fissa per immagine di output, divisa in tre livelli: Turbo a circa $0,03, Default a circa $0,06 e Quality a circa $0,10. Esiste anche un piano gratuito nell'app web per uso casual. Queste cifre provengono dalla pagina ufficiale dei prezzi al 26 giugno 2026, quindi verificale prima di pianificare un budget ad alto volume.
| Livello | Prezzo per immagine | Ideale per |
|---|---|---|
| Turbo | ~$0,03 | Bozze, iterazione in volume |
| Default | ~$0,06 | Produzione quotidiana |
| Quality | ~$0,10 | Asset hero finali |
Una richiesta che restituisce quattro immagini costa quattro volte la tariffa per immagine, quindi usa il batch con generosità solo quando ha senso. Il calcolo è semplice: se generi migliaia di immagini al mese, fare self-hosting dei pesi open sulla tua GPU alla fine batte l'API sui costi. Sotto qualche centinaio al mese, l'API è più economica dell'elettricità e di una 4090. La pagina dei prezzi API di Ideogram è la fonte da seguire, poiché i blog della settimana di lancio citavano già numeri obsoleti.
In cosa è davvero bravo Ideogram 4.0?
Testo. È la risposta in una parola. Ideogram 4.0 rende il testo comprensibile e correttamente scritto su più parole meglio di qualsiasi modello open e della maggior parte di quelli chiusi. Gestisce anche la segnaletica multilingue, i loghi con tagline, il layout dei poster tramite prompt JSON strutturati, e prodotti fotorealistici puliti a 2K. Se il tuo lavoro riguarda le parole all'interno dell'immagine, questo è il modello.
Analizziamo ogni punto di forza:
- Testo e tipografia. Questa è la firma. Ideogram riporta circa 0,97 di accuratezza OCR X-Omni sul testo denso nel suo articolo tecnico, che è la percentuale di caratteri resi che un lettore riesce a identificare correttamente. Per confronto, una recensione indipendente ha misurato Midjourney intorno al 30% sul testo a più parole, e le varianti Flux tra il 30 e il 40%. Quel divario è enorme.
- Testo multilingue. Gli script latini vengono puliti, e i tester di lingua spagnola su Reddit hanno specificamente elogiato la gestione di accenti e diacritici.
- Loghi e tagline. I mockup di brand con un nome più uno slogan vengono nitidi, motivo per cui i team di design lo stanno adottando.
- Controllo del layout via JSON. Questa è la parte per gli sviluppatori. Puoi passare un prompt strutturato con bounding box che indicano al modello dove va ogni elemento.
Ecco un prompt di layout in stile JSON minimale per mostrare l'idea:
{
"prompt": "minimalist coffee shop poster, cream background",
"elements": [
{ "type": "heading", "text": "MORNING RITUAL", "box": [0.1, 0.1, 0.9, 0.3] },
{ "type": "subtext", "text": "single-origin, slow-brewed", "box": [0.1, 0.35, 0.9, 0.45] }
]
}Quel controllo con bounding box è ciò che separa "un'immagine con parole" da "un layout progettato", ed è raro in questa categoria di modelli.

Una nota di onestà rapida sui dati qui sotto. Non ho eseguito personalmente un test locale privato con 10 prompt, quindi non lo inventerò. Ecco invece una sintesi di ciò che i test pubblici documentati riportano, ognuno attribuito alla sua fonte. Le immagini in questo articolo (sopra e più in basso) sono generazioni originali nostre, realizzate con Higgsfield usando GPT Image 2 e FLUX.2 come riferimenti per le fasce di qualità, non output letterali di Ideogram.
| Compito | Risultato documentato | Fonte |
|---|---|---|
| Testo poster a più parole | ~0,97 accuratezza OCR su testo denso | Ideogram (X-Omni OCR, blog ufficiale) |
| Segnaletica multilingue | Forte sugli script latini; spagnolo elogiato | Reddit r/LocalLLaMA testers |
| Logo + tagline | Nitido e leggibile | Recensione goenhance |
| Mani in scene affollate | Frequentemente difettose | Recensione goenhance |
| Volto + didascalia insieme | Conflitti riportati | Recensione goenhance |
| Prodotto fotorealistico 2K | Buono ma dietro a GPT Image 2 / Imagen | Leaderboard Artificial Analysis |
Nelle recensioni pubbliche documentate il consenso è coerente: per il lavoro ricco di testo, nessun altro modello open si avvicina.
Dove è carente Ideogram 4.0?
È diretto dove perde. Le mani si rompono nelle composizioni affollate. Le scene con più persone diventano confuse. Chiedere un volto e una didascalia leggibile nella stessa immagine spesso fa soffrire uno dei due. I filtri di sicurezza sono aggressivi e rifiutano molto. E il prompting JSON che alimenta il controllo del layout aggiunge attrito reale per gli utenti casual.
I modi in cui fallisce che i recensori continuano a trovare:
- Mani e anatomia. Nella recensione di goenhance, le mani si degradavano nella maggior parte delle riprese affollate e con più elementi. Chiedi a una persona di tenere un cartello e spesso otterrai un'ottima scritta sopra una mano con sei dita.
- Volto più testo insieme. Quando un prompt richiede sia un volto riconoscibile che una didascalia leggibile, il modello tende a sbagliarne uno dei due.
- Scene umane affollate. Le folle e le interazioni complesse perdono coerenza più rapidamente che su GPT Image 2 o Imagen.
- Filtri di sicurezza. I filtri sui contenuti sono severi e si attivano su molti prompt innocui. Se hai bisogno di output non filtrato, questo non è il tuo modello.
- Attrito JSON. Il prompting con bounding box è potente ma macchinoso. Gli utenti casual lo troveranno più lento del flusso "scrivi una frase" di Midjourney.
Quindi non scegliere Ideogram 4.0 quando hai bisogno di scene umane affollate, ritratti fotorealistici grezzi, generazione casual a basso attrito, o qualsiasi cosa i filtri rifiuteranno. Per quei casi, Imagen e Flux 2 Pro sono scelte migliori. Usalo per ciò in cui eccelle, e instrada il resto altrove.
Ideogram 4.0 può sostituire Midjourney, GPT Image 2 e Flux 2?
In parte, e solo per il lavoro giusto. Ideogram 4.0 vince in modo netto su testo, tipografia, e nell'essere open-weight ed eseguibile in locale. Perde sull'Elo estetico e sull'anatomia. Sulla classifica DesignArena si attesta intorno a 1285, mentre GPT Image 2 guida intorno a 1405. Non c'è un vincitore assoluto. Dipende interamente dal caso d'uso.

Ecco il confronto diretto per caso d'uso:
| Modello | Ideale per | Text rendering | Pesi open / locale | Elo estetico |
|---|---|---|---|---|
| Ideogram 4.0 | Testo, loghi, poster | Migliore della categoria | Sì (GPU 24GB) | ~1285 (mid top-tier) |
| GPT Image 2 | Tutto, fotorealistico | Forte | No | ~1405 (guida) |
| Midjourney v7 | Artistico, estetico | Debole (~30%) | No | Alto |
| Flux 2 [dev/Pro] | Fotorealistico, anatomia | Da debole a medio | dev è open | Variabile |
| Imagen | Fotorealistico | Medio | No | Alto |
| Recraft | Vettoriale, design | Forte | No | Non in classifica |
Una nota sui numeri: le fonti dei benchmark sono molto discordanti in rete, quindi leggi le cifre Elo come "circa X", non come valori certi. Ho controllato la classifica Artificial Analysis text-to-image il 26 giugno 2026, e anche lì le posizioni cambiano man mano che vengono aggiunte nuove voci. L'inquadramento onesto: Ideogram 4.0 è un modello da 9,3B che regge il confronto con rivali due e tre volte più grandi, il che è notevole, ma non è in cima alla classifica estetica. GPT Image 2 lo è.
Chi dovrebbe fare lo switch? Se produci poster, creatività pubblicitaria, loghi, o qualsiasi cosa con parole, Ideogram 4.0 può sostituire Midjourney direttamente e spesso batte GPT Image 2 sul testo stesso. Se hai bisogno di arte pittorica, esseri umani fotorealistici, o scene affollate, tieni il tuo strumento attuale. Il divario tra i modelli emerge più chiaramente nella fedeltà del testo, che il confronto qui sotto rende evidente.

Se stai scegliendo un generatore per una pipeline specifica, il caso d'uso decide tutto. Abbiamo già approfondito scelte adiacenti, dagli strumenti AI per asset di giochi ad altri strumenti di arte generativa che abbiamo confrontato, e la stessa regola vale: abbina il modello al lavoro, non inseguire una singola classifica.
Ideogram 4.0 è davvero Open Source?
No, non nel senso OSI pulito, e questa è la parte che la maggior parte delle guide sbaglia. Ideogram lo chiama "open-weight," il che è accurato. Puoi scaricare i pesi gratuitamente. Ma la licenza effettiva sulla scheda del modello Hugging Face è l'Ideogram Non-Commercial Model Agreement. Ciò significa gratuito per uso personale e di ricerca, licenza a pagamento richiesta per il deployment commerciale. Verificala prima di rilasciare qualsiasi cosa.
Facciamo chiarezza, perché c'è molta confusione. Wikipedia e diversi blog della settimana di lancio affermavano Apache 2.0. È sbagliato. Quando apri la scheda del modello ideogram-ai/ideogram-4-nf4 e passi attraverso il gate di accesso, la licenza che accetti è il Non-Commercial Model Agreement, senza soglia di fatturato e senza esenzione per le piccole imprese. Qualsiasi uso monetizzato dei pesi in self-hosting richiede una licenza commerciale negoziata separatamente con Ideogram. Il subreddit r/LocalLLaMA di Reddit ha notato questo entro pochi giorni dal lancio, ed è rimasto il punto più dibattuto sul rilascio.
Pesi scaricabili non equivalgono a una licenza permissiva. Leggi la LICENZA di Ideogram prima di rilasciare qualsiasi cosa commerciale.
Cosa significa in pratica?
- Progetti personali, ricerca, apprendimento: nessun problema, vai avanti.
- Lavoro per clienti, prodotti, servizi a pagamento: hai bisogno di una licenza commerciale. Fare self-hosting del download gratuito per un cliente pagante viola l'accordo.
- Fine-tuning e LoRA: tecnicamente possibile poiché i pesi sono scaricabili, e la community sta già addestrando adattatori. Ma la stessa restrizione non commerciale si applica a ciò che fai con i risultati.
Non è un motivo per evitare il modello. È un motivo per leggere i termini. Molti team useranno l'API (che include i diritti commerciali) per la produzione e terranno il download locale per la sperimentazione. Non dare per scontato che "open-weight" significhi "fai quello che vuoi", perché qui non è così.
Sull'Autore
Mert Batur è co-fondatore di Techsy.io, dove il team sviluppa agenti AI, sistemi di automazione e pipeline voice/SDR per clienti B2B. Scrive sullo stack di strumenti LLM che il team Techsy usa realmente in produzione. Co-Founder, Techsy.io. Connettiti su LinkedIn.
Domande Frequenti
Ideogram 4.0 è open source?
Non nel senso stretto. Ideogram lo chiama "open-weight", il che è corretto: i pesi sono scaricabili da Hugging Face. Ma la licenza è l'Ideogram Non-Commercial Model Agreement, non Apache 2.0, nonostante alcuni blog affermino il contrario. È gratuito per uso personale e di ricerca, e il deployment commerciale richiede una licenza a pagamento separata.
Quanta VRAM serve per eseguire Ideogram 4.0?
Una GPU da 24GB (come una RTX 4090) con il checkpoint nf4 è il punto ottimale. 16GB funziona tecnicamente con l'offloading della memoria ma è più lento e al limite. 32GB e oltre è comodo, e la versione fp8 di qualità superiore vuole realisticamente un A100 o H100. Ricorda che si tratta di VRAM GPU, non di RAM di sistema.
Ideogram 4.0 può girare su Mac?
Non in modo pratico, almeno non a giugno 2026. Gli strumenti rilasciati presuppongono CUDA, cioè GPU Nvidia. I Mac con Apple Silicon non riescono ancora a eseguire i checkpoint in modo utilizzabile. Gli utenti Mac dovrebbero usare l'app web o l'API cloud. Potrebbe cambiare se la community porta il modello, ma oggi non esiste un percorso locale utilizzabile.
Ideogram 4.0 è migliore di Midjourney?
Per testo, loghi e poster, sì, con ampio margine. Ideogram riporta circa 0,97 di accuratezza OCR sul testo denso contro circa il 30% misurato per Midjourney sul testo a più parole. Per estetica pittorica, artistica e stilizzata, Midjourney v7 di solito vince ancora. Scegli in base al fatto che le tue immagini contengano parole leggibili.
Ideogram 4.0 è migliore di GPT Image 2?
Dipende dalla metrica. Sull'Elo estetico, no: GPT Image 2 guida a circa 1405 contro i ~1285 di Ideogram su DesignArena. Sul text rendering e nell'essere open-weight ed eseguibile in locale, Ideogram vince. GPT Image 2 è il migliore in assoluto; Ideogram 4.0 è il migliore specialista del testo.
Quanto costa l'API di Ideogram 4.0?
Per immagine di output, i livelli sono circa $0,03 (Turbo), $0,06 (Default) e $0,10 (Quality) al 26 giugno 2026. Una richiesta che restituisce quattro immagini costa quattro volte la tariffa. Esiste anche un piano gratuito nell'app web per uso casual. Conferma i prezzi correnti sulla pagina ufficiale prima di pianificare il budget ad alto volume.
Posso usare Ideogram 4.0 commercialmente?
Solo con la licenza giusta. Il download gratuito di Hugging Face è non commerciale ai sensi dell'Ideogram Non-Commercial Model Agreement, quindi fare self-hosting per lavoro a pagamento non è consentito. L'uso commerciale richiede l'API cloud (che include i diritti commerciali) o una licenza commerciale negoziata separatamente per i pesi. Verifica prima la scheda del modello.
Cos'è Magic Prompt in Ideogram 4.0?
Magic Prompt è una funzionalità opzionale che riscrive automaticamente il tuo prompt breve in uno più ricco e dettagliato prima della generazione. Aiuta gli utenti casual a ottenere risultati migliori da poche parole. Se vuoi un controllo preciso sull'output, puoi disattivarlo e scrivere il tuo prompt completo tu stesso.
Ideogram 4.0 è gratuito?
In parte. L'app web ha un piano gratuito con limiti. Il self-hosting dei pesi open non costa nulla per immagine se possiedi già una GPU da 24GB, anche se l'uso commerciale richiede comunque una licenza. L'API cloud è a pagamento, fatturata per immagine. Quindi è gratuito da provare e gratuito da eseguire in locale per uso personale.
Si può fare fine-tuning di Ideogram 4.0 o usare LoRA?
Sì, tecnicamente. Poiché i pesi sono scaricabili, il fine-tuning e l'addestramento LoRA sono possibili, e la community sta già producendo adattatori. Il problema è la licenza: l'accordo non commerciale regola ancora ciò che fai con qualsiasi cosa addestri sopra il modello base, quindi i fine-tune commerciali richiedono una licenza appropriata.
Il Verdetto
Ideogram 4.0 è la release open-weight di immagini più importante del 2026, ma non per il motivo che suggerisce l'hype. Ecco chi dovrebbe fare cosa:
- Eseguilo in locale se hai una GPU da 24GB, fai lavoro di design ricco di testo, e il tuo uso è personale o di ricerca. Gratuito, privato, illimitato.
- Usa l'API se stai costruendo un prodotto o facendo lavoro per clienti, poiché include i diritti commerciali ed elimina la questione hardware.
- Resta con GPT Image 2 o Midjourney se hai bisogno di esseri umani fotorealistici, arte pittorica, o scene affollate, dove Ideogram perde ancora.
Il modello è uno specialista del text rendering che per caso è scaricabile, non un killer di Midjourney tuttofare. Trattalo così e otterrai il meglio da esso. E leggi la licenza prima di rilasciare.
Se stai valutando quale modello di immagini o AI integrare in un prodotto reale, è esattamente il tipo di decisione che il nostro team prende con i clienti ogni settimana. Richiedi una consulenza gratuita e ti aiuteremo ad abbinare il modello al lavoro.