
Ideogram 4.0 já tem pesos abertos: o que funciona numa GPU de 24 GB (2026)
O Ideogram 4.0 chegou a 3 de junho de 2026 e quebrou o padrão. Todas as versões anteriores do Ideogram viviam por trás de uma aplicação web. Esta versão distribui os pesos do modelo. Pode descarregar um modelo de 9,3 mil milhões de parâmetros do Hugging Face e executar a compilação nf4 numa única GPU de 24 GB, como uma RTX 4090, em casa. Não é o campeão da estética. No quadro Elo da DesignArena, o GPT Image 2 está à frente com cerca de 1405, enquanto o Ideogram 4.0 fica perto dos 1285. Mas para texto e tipografia? Nenhum modelo aberto se lhe aproxima. Eis a análise honesta.
Veredicto Rápido:
- O Ideogram 4.0 (3 de junho de 2026) é o primeiro modelo de pesos abertos da Ideogram: um DiT de 9,3 mil milhões de parâmetros que funciona numa GPU de 24 GB.
- Ganha decisivamente em texto e tipografia; fica atrás do GPT Image 2 no Elo estético (~1285 vs ~1405).
- Três formas de o utilizar: aplicação web, API na nuvem ou alojamento local próprio através do checkpoint nf4.
- "Pesos abertos" não significa código aberto aqui. A licença de download é não comercial. Verifique antes de lançar qualquer produto.
O que é o Ideogram 4.0?
O Ideogram 4.0 é um modelo de texto-para-imagem com 9,3 mil milhões de parâmetros, lançado a 3 de junho de 2026, e é o primeiro Ideogram que pode descarregar e executar por conta própria. Todos os lançamentos anteriores, desde a versão 0.1 até à 3.0, eram exclusivos da nuvem. A funcionalidade de destaque é a renderização de texto de classe mundial na resolução nativa 2K, destinada a designers, programadores e qualquer pessoa que gere cartazes, logótipos ou sinalética.
Então, o que está realmente nos bastidores? Algumas especificações que vale a pena conhecer, de forma resumida:
- Arquitetura: um Transformer de Difusão (DiT). Em termos simples, é um modelo que começa a partir de ruído visual e o refina passo a passo em direção ao seu prompt, utilizando a mesma matemática de transformador que alimenta os grandes modelos de linguagem. Os "9,3B" referem-se à sua contagem de parâmetros, o que é reduzido comparado com os ~32B do Flux 2.
- Codificador de texto: A Ideogram combina-o com um codificador de linguagem visão-texto Qwen3-VL, que é a principal razão pela qual a sua letra sai tão limpa.
- Resolução: saída nativa 2K, sem necessidade de truques de upscaling.
- Magic Prompt: um melhorador automático opcional que reescreve o seu prompt curto num mais rico antes da geração. Útil para utilizadores casuais, irritante se quiser controlo exato. Pode desativá-lo.
A verdadeira história não é a arquitetura, porém. É que a Ideogram se juntou à onda de modelos com pesos abertos que tem vindo a remodelar a forma como as equipas constroem com IA. Se tem acompanhado os lançamentos de LLMs de pesos abertos deste ano, já conhece o padrão: um laboratório proprietário forte publica pesos para download e, de repente, entusiastas e startups podem alojar autonomamente o que antes era um produto apenas de API. O Ideogram 4.0 é a primeira versão que pode descarregar e executar no seu próprio hardware. De acordo com a publicação técnica oficial da Ideogram, os pesos estão no Hugging Face em duas variantes quantizadas, e o código de inferência está no GitHub.
Consegue realmente executar o Ideogram 4.0?
Sim, de três formas diferentes. A aplicação web não requer configuração e serve utilizadores casuais e de design. A API na nuvem é para programadores que integram a geração de imagens numa aplicação. E o alojamento local próprio é a novidade: descarregue os pesos abertos do Hugging Face, execute-os numa GPU de 24 GB e não pague nada por imagem. Escolha o caminho que corresponde ao seu hardware e orçamento.
Eis como escolher:
- Aplicação web em ideogram.ai. Escolha esta opção se apenas quiser imagens e não quiser pensar em GPUs. Existe um nível gratuito, e os planos pagos adicionam volume e velocidade.
- API na nuvem. Escolha esta opção se estiver a integrar a geração de imagens num produto e quiser faturação previsível por imagem sem possuir uma GPU. Os preços estão na próxima secção.
- Alojamento local próprio. Escolha esta opção se tiver uma placa de 24 GB e quiser geração ilimitada sem custo por imagem. Esta é também a via se se preocupar com a privacidade ou quiser fazer fine-tuning.
Para a via local, o caminho prático neste momento é o ComfyUI, a interface baseada em nós que a maioria dos modelos de imagem abertos visa primeiro. O fluxo básico é o seguinte:
- Aceite o portão de licença na página do modelo no Hugging Face (
ideogram-ai/ideogram-4-nf4) e descarregue o checkpoint. - Coloque-o na sua pasta de modelos do ComfyUI.
- Carregue um fluxo de trabalho comunitário do Ideogram 4.0 (já circulam vários).
- Gere.
Uma ressalva: até finais de junho de 2026, o checkpoint fp8 ainda não é suportado na biblioteca Diffusers, por isso os utilizadores de fp8 estão maioritariamente no ComfyUI. A compilação nf4 tem um suporte de ferramentas mais amplo. Se preferir evitar completamente o hardware local, pode implementá-lo numa GPU na nuvem e alugar a VRAM ao minuto, que é o mesmo truque que as pessoas usam para executar modelos abertos localmente sem comprar uma 4090.
De que hardware e VRAM precisa para o executar localmente?
O checkpoint nf4 numa placa de VRAM de 24 GB (como uma RTX 4090) é o ponto ideal. 16 GB é um aperto que funciona com offloading, mas torna-se mais lento. 32 GB ou mais é confortável. A compilação fp8 de maior fidelidade exige mais, realisticamente uma A100 ou H100. E para ser claro, isto é VRAM da GPU, não RAM do sistema.
| Checkpoint | VRAM Mínima | GPU Recomendada | Qualidade | Notas |
|---|---|---|---|---|
| nf4 | ~16GB (apertado) | 24GB (RTX 4090) | Boa | Suportado pelo Diffusers; o ponto ideal |
| fp8 | ~32GB+ | A100 / H100 | Superior | Sem suporte Diffusers ainda; via ComfyUI |
Se tiver uma placa de 24 GB, pode executar o Ideogram 4.0 em casa. Qualquer coisa menos e estará a forçar os limites.
E quanto ao Mac? Resposta honesta: ainda não existe um caminho local prático para Apple Silicon. As ferramentas lançadas assumem CUDA, o que significa Nvidia. Os Macs da série M não conseguem executar os checkpoints de forma utilizável hoje, por isso os utilizadores de Mac devem ficar com a aplicação web ou a API. Isso pode mudar à medida que a comunidade fizer ports, mas não compre um Mac Studio à espera de o alojar autonomamente em junho de 2026.
A velocidade de geração depende muito da sua GPU exata, por isso não vou inventar um número. Utilizadores do Reddit a testar a compilação nf4 relatam que imagens 2K numa 4090 ficam na ordem das dezenas baixas de segundos, mas trate isso como um dado da comunidade, não como um benchmark de laboratório. Se precisar de latência exata para planeamento de produção, cronometre na sua própria placa. A conclusão importante: uma GPU de consumo de 24 GB é genuinamente suficiente, o que nunca foi verdade para o Ideogram antes.
Quanto custa a API do Ideogram 4.0?
A API do Ideogram 4.0 cobra uma taxa fixa por imagem de saída, dividida em três níveis: Turbo a cerca de $0,03, Default a cerca de $0,06 e Quality a cerca de $0,10. Existe também um nível gratuito da aplicação web para uso casual. Estes valores são da página oficial de preços em 26 de junho de 2026, por isso confirme-os em tempo real antes de orçamentar em volume.
| Nível | Preço por imagem | Ideal para |
|---|---|---|
| Turbo | ~$0,03 | Rascunhos, iteração em massa |
| Default | ~$0,06 | Produção diária |
| Quality | ~$0,10 | Ativos finais de destaque |
Um pedido que devolve quatro imagens custa quatro vezes a taxa por imagem, por isso faça lotes generosos apenas quando for necessário. A matemática é simples: se estiver a gerar milhares de imagens por mês, alojar autonomamente os pesos abertos na sua própria GPU acaba por superar a API em custos. Abaixo de algumas centenas por mês, a API é mais barata do que a eletricidade e uma 4090. A página de preços da API da própria Ideogram é a fonte confiável aqui, uma vez que os blogs da semana de lançamento já citavam números desatualizados.
Em que é o Ideogram 4.0 realmente bom?
Texto. Essa é a resposta numa palavra. O Ideogram 4.0 renderiza texto legível, corretamente soletrado e com várias palavras melhor do que qualquer modelo aberto e a maioria dos fechados. Também lida com sinalética multilingue, logótipos com slogans, layout de cartazes através de prompts JSON estruturados e fotos de produtos fotorrealistas limpas em 2K. Se o seu trabalho envolve palavras dentro da imagem, este é o modelo.
Vamos detalhar cada ponto forte:
- Texto e tipografia. Esta é a assinatura. A Ideogram relata aproximadamente 0,97 de precisão OCR X-Omni em texto denso na sua descrição técnica, que é a percentagem de caracteres renderizados que um leitor consegue identificar corretamente. Para comparação, uma revisão independente mediu o Midjourney em cerca de 30% em texto de várias palavras, e as variantes Flux na gama de 30 a 40%. Essa diferença é enorme.
- Texto multilingue. Os scripts latinos saem limpos, e os testadores de língua espanhola no Reddit elogiaram especificamente o tratamento de acentos e diacríticos.
- Logótipos e slogans. Mockups de marca com um nome mais uma frase de efeito renderizam nitidamente, razão pela qual as equipas de design o estão a considerar.
- Controlo de layout via JSON. Esta é a parte amiga do programador. Pode passar um prompt estruturado com caixas delimitadoras a indicar ao modelo onde vai cada elemento.
Eis um prompt de layout mínimo estilo JSON para mostrar a ideia:
{
"prompt": "minimalist coffee shop poster, cream background",
"elements": [
{ "type": "heading", "text": "MORNING RITUAL", "box": [0.1, 0.1, 0.9, 0.3] },
{ "type": "subtext", "text": "single-origin, slow-brewed", "box": [0.1, 0.35, 0.9, 0.45] }
]
}Esse controlo de caixa delimitadora é o que separa "uma imagem com palavras" de "um layout desenhado", e é raro nesta classe de modelos.

Uma nota rápida de honestidade sobre os dados abaixo. Não realizei pessoalmente um teste local privado de 10 prompts, por isso não vou fingir que sim. Em vez disso, eis uma síntese do que os testes públicos documentados relatam, cada um atribuído à sua fonte. As imagens neste artigo (acima e mais abaixo) são as nossas próprias gerações originais, feitas com Higgsfield usando GPT Image 2 e FLUX.2 como substitutos para os níveis de qualidade, não sendo saída literal do Ideogram.
| Tarefa | Resultado documentado | Fonte |
|---|---|---|
| Texto de cartaz de várias palavras | ~0,97 de precisão OCR em texto denso | Ideogram (X-Omni OCR, blog oficial) |
| Sinalética multilingue | Forte em scripts latinos; espanhol elogiado | Testadores do Reddit r/LocalLLaMA |
| Logótipo + slogan | Limpo e legível | Revisão goenhance |
| Mãos em cenas agitadas | Frequentemente quebradas | Revisão goenhance |
| Rosto + legenda juntos | Conflitos reportados | Revisão goenhance |
| Produto fotorrealista 2K | Bom, mas atrás do GPT Image 2 / Imagen | Leaderboard Artificial Analysis |
Nas revisões públicas documentadas, o consenso é consistente: para trabalho pesado em texto, nenhum outro modelo aberto se aproxima.
Onde é que o Ideogram 4.0 falha?
É brutal onde perde. As mãos quebram em composições agitadas. Cenas com várias pessoas ficam confusas. Pedir um rosto e uma legenda legível na mesma imagem frequentemente faz com que um deles sofra. Os filtros de segurança são agressivos e recusam muita coisa. E o prompting JSON que alimenta o controlo de layout adiciona fricção real para utilizadores casuais.
Os modos de falha que os revisores continuam a encontrar:
- Mãos e anatomia. Na revisão da goenhance, as mãos degradaram-se na maioria das tomadas agitadas com múltiplos elementos. Peça uma pessoa a segurar um cartaz e frequentemente obterá uma excelente letra acima de uma mão com seis dedos.
- Rosto mais texto juntos. Quando um prompt exige tanto um rosto reconhecível como uma legenda legível, o modelo tende a acertar num e falhar no outro.
- Cenas humanas agitadas. Multidões e interações complexas perdem coerência mais rapidamente do que no GPT Image 2 ou Imagen.
- Filtros de segurança. Os filtros de conteúdo são rigorosos e ativam-se em muitos prompts benignos. Se precisar de saída irrestrita, este não é o seu modelo.
- Fricção JSON. O prompting de caixa delimitadora é poderoso, mas trabalhoso. Os utilizadores casuais acharão que é mais lento do que o fluxo "escreva uma frase" do Midjourney.
Por isso, não recorra ao Ideogram 4.0 quando precisar de cenas humanas lotadas, retratos fotorrealistas brutos, geração casual de baixa fricção ou qualquer coisa que os filtros rejeitem. Para esses casos, Imagen e Flux 2 Pro são melhores opções. Use-o para aquilo em que é elite e encaminhe o resto para outro lado.
Pode o Ideogram 4.0 substituir o Midjourney, GPT Image 2 e Flux 2?
Parcialmente, e apenas para a tarefa certa. O Ideogram 4.0 ganha decisivamente em texto, tipografia e por ter pesos abertos e ser executável localmente. Perde em Elo estético e anatomia. No quadro da DesignArena fica perto dos 1285, enquanto o GPT Image 2 lidera com cerca de 1405. Não há um único vencedor aqui. Depende inteiramente do seu caso de uso.

Eis o confronto direto por caso de uso:
| Modelo | Ideal para | Renderização de texto | Pesos abertos / local | Elo Estético |
|---|---|---|---|---|
| Ideogram 4.0 | Texto, logótipos, cartazes | Melhor da classe | Sim (GPU 24GB) | ~1285 (meio do topo) |
| GPT Image 2 | Uso geral, fotorrealismo | Forte | Não | ~1405 (líder) |
| Midjourney v7 | Artístico, estético | Fraco (~30%) | Não | Alto |
| Flux 2 [dev/Pro] | Fotorrealismo, anatomia | Fraco a médio | dev é aberto | Varia |
| Imagen | Fotorrealismo | Médio | Não | Alto |
| Recraft | Vetor, design | Forte | Não | Não listado |
Uma nota sobre os números: as fontes de benchmark discordam wildly na web, por isso leia os valores Elo como "cerca de X", não como dogma. Verifiquei o leaderboard de texto-para-imagem da Artificial Analysis a 26 de junho de 2026, e mesmo lá as posições mudam à medida que novas entradas são adicionadas. O enquadramento honesto: o Ideogram 4.0 é um modelo de 9,3B que se mantém contra rivais duas e três vezes o seu tamanho, o que é impressionante, mas não está no topo do quadro estético. O GPT Image 2 está.
Então, quem deve mudar? Se a sua saída são cartazes, criativos publicitários, logótipos ou qualquer coisa com palavras, o Ideogram 4.0 pode substituir o Midjourney totalmente e muitas vezes supera o GPT Image 2 no próprio texto. Se precisar de arte pictórica, humanos fotorrealistas ou cenas lotadas, mantenha a sua ferramenta atual. A lacuna entre modelos mostra-se mais claramente na fidelidade do texto, o que a comparação abaixo torna óbvio.

Se estiver a escolher um gerador para um pipeline específico, o caso de uso decide tudo. Já analisámos profundamente escolhas adjacentes antes, desde ferramentas de imagem AI para ativos de jogos até outras ferramentas de arte generativa que comparámos, e a mesma regra se aplica: adapte o modelo à tarefa, não persiga uma única posição no leaderboard.
O Ideogram 4.0 é realmente Open Source?
Não, não no sentido estrito da OSI, e esta é a parte que a maioria dos guias erra. A Ideogram chama-lhe "open-weight" (pesos abertos), o que é preciso. Pode descarregar os pesos gratuitamente. Mas a licença real no cartão do modelo no Hugging Face é o Acordo de Modelo Não Comercial da Ideogram. Isso significa gratuito para uso pessoal e de investigação, licença paga necessária para implementação comercial. Verifique antes de lançar qualquer coisa.
Vamos esclarecer a confusão, porque há muita. A Wikipedia e vários blogs da semana de lançamento afirmaram Apache 2.0. Isso está errado. Quando abre o cartão do modelo ideogram-ai/ideogram-4-nf4 e clica através do portão de acesso, a licença que aceita é o Acordo de Modelo Não Comercial, sem limite de receita e sem isenção para pequenas empresas. Qualquer uso monetizado dos pesos alojados autonomamente necessita de uma licença comercial negociada separadamente com a Ideogram. O r/LocalLLaMA do Reddit detetou isto poucos dias após o lançamento, e continua a ser o ponto mais debatido sobre o lançamento.
Pesos descarregáveis não são o mesmo que uma licença permissiva. Leia a LICENÇA da Ideogram antes de lançar qualquer coisa comercial.
O que é que isso significa na prática?
- Projetos pessoais, investigação, aprendizagem: tudo bem, avance.
- Trabalho para clientes, produtos, serviços pagos: precisa de uma licença comercial. Alojar autonomamente o download gratuito para um cliente pagante viola o acordo.
- Fine-tuning e LoRA: tecnicamente possível, uma vez que os pesos são descarregáveis, e a comunidade já está a treinar adaptadores. Mas a mesma restrição não comercial aplica-se ao que faz com os resultados.
Isto não é uma razão para evitar o modelo. É uma razão para ler os termos. Muitas equipas usarão a API (que vem com direitos comerciais) para produção e manterão o download local para experimentação. Apenas não assuma que "pesos abertos" significa "faça o que quiser", porque aqui não é esse o caso.
Sobre o Autor
Mert Batur Gurbuz é Co-Fundador da Techsy.io, onde a equipa desenvolve agentes de IA, sistemas de automação e pipelines de voz/SDR para clientes B2B. Estuda na Universidade de Birmingham e escreve sobre a stack de ferramentas LLM que a equipa da Techsy realmente usa em produção. Co-Fundador, Techsy.io, Universidade de Birmingham. Ligue-se no LinkedIn.
Perguntas Frequentes
O Ideogram 4.0 é open source?
Não no sentido estrito. A Ideogram chama-lhe "open-weight", o que é justo: os pesos são descarregáveis do Hugging Face. Mas a licença é o Acordo de Modelo Não Comercial da Ideogram, não Apache 2.0, apesar de alguns blogs afirmarem o contrário. É gratuito para uso pessoal e de investigação, e a implementação comercial necessita de uma licença paga separada.
De quanta VRAM precisa para executar o Ideogram 4.0?
Uma GPU de 24 GB (como uma RTX 4090) a executar o checkpoint nf4 é o ponto ideal. 16 GB tecnicamente funciona com offloading de memória, mas corre mais lento e apertado. 32 GB ou mais é confortável, e a compilação fp8 de maior qualidade realisticamente quer uma A100 ou H100. Lembre-se que isto é VRAM da GPU, não RAM do sistema.
O Ideogram 4.0 pode correr num Mac?
Não praticamente, pelo menos não em junho de 2026. As ferramentas lançadas assumem CUDA, o que significa GPUs Nvidia. Os Macs Apple Silicon ainda não conseguem executar os checkpoints de forma utilizável. Os utilizadores de Mac devem usar a aplicação web ou a API na nuvem. Isto pode mudar se a comunidade fizer port do modelo, mas não há um caminho local utilizável hoje.
O Ideogram 4.0 é melhor que o Midjourney?
Para texto, logótipos e cartazes, sim, por uma larga margem. A Ideogram reporta cerca de 0,97 de precisão OCR em texto denso versus aproximadamente 30% medidos para o Midjourney em texto de várias palavras. Para estética pictórica, artística e estilizada, o Midjourney v7 geralmente ainda vence. Escolha com base em se as suas imagens contêm palavras legíveis.
O Ideogram 4.0 é melhor que o GPT Image 2?
Depende da métrica. No Elo estético, não: o GPT Image 2 lidera com cerca de 1405 versus ~1285 do Ideogram na DesignArena. Na renderização de texto e por ser de pesos abertos e executável localmente, o Ideogram vence. O GPT Image 2 é o melhor generalista; o Ideogram 4.0 é o melhor especialista em texto.
Quanto custa a API do Ideogram 4.0?
Por imagem de saída, os níveis são aproximadamente $0,03 (Turbo), $0,06 (Default) e $0,10 (Quality) em 26 de junho de 2026. Um pedido que devolve quatro imagens custa quatro vezes a taxa. Existe também um nível gratuito da aplicação web para uso casual. Confirme os preços atuais na página oficial antes de orçamentar em volume.
Posso usar o Ideogram 4.0 comercialmente?
Apenas com a licença correta. O download gratuito do Hugging Face é não comercial sob o Acordo de Modelo Não Comercial da Ideogram, por isso alojar autonomamente para trabalho pago não é permitido. O uso comercial requer either a API na nuvem (que inclui direitos comerciais) ou uma licença comercial negociada separadamente para os pesos. Verifique primeiro o cartão do modelo.
O que é o Magic Prompt no Ideogram 4.0?
O Magic Prompt é uma funcionalidade opcional que reescreve automaticamente o seu prompt curto num mais rico e detalhado antes da geração. Ajuda os utilizadores casuais a obter melhores resultados a partir de poucas palavras. Se quiser controlo exato sobre a saída, pode desativá-lo e escrever o seu prompt completo você mesmo.
O Ideogram 4.0 é gratuito?
Parcialmente. A aplicação web tem um nível gratuito com limites. Alojar autonomamente os pesos abertos não custa nada por imagem se já possuir uma GPU de 24 GB, embora o uso comercial ainda necessite de licença. A API na nuvem é paga, faturada por imagem. Por isso, é gratuito para experimentar e gratuito para executar localmente para uso pessoal.
Pode fazer fine-tuning do Ideogram 4.0 ou usar LoRA?
Sim, tecnicamente. Como os pesos são descarregáveis, o fine-tuning e o treino LoRA são possíveis, e a comunidade já está a produzir adaptadores. A questão é a licença: o acordo não comercial ainda governa o que faz com qualquer coisa que treine em cima do modelo base, por isso os fine-tunes comerciais precisam de licenciamento adequado.
O Veredicto
O Ideogram 4.0 é o lançamento de imagem com pesos abertos mais importante de 2026, mas não pela razão que o hype sugere. Eis quem deve fazer o quê:
- Execute localmente se tiver uma GPU de 24 GB, fizer trabalho de design pesado em texto e o seu uso for pessoal ou de investigação. Gratuito, privado, ilimitado.
- Use a API se estiver a construir um produto ou a fazer trabalho para clientes, uma vez que inclui direitos comerciais e evita a questão do hardware.
- Fique com o GPT Image 2 ou Midjourney se precisar de humanos fotorrealistas, arte pictórica ou cenas lotadas, onde o Ideogram ainda perde.
O modelo é um especialista em renderização de texto que acontece ser descarregável, não um assassino do Midjourney todo-o-terreno. Trate-o dessa forma e tirará o melhor dele. E leia a licença antes de lançar.
Se estiver a pesar qual modelo de imagem ou IA integrar num produto real, esse é exatamente o tipo de decisão que a nossa equipa toma com clientes todas as semanas. Obtenha uma consulta gratuita e ajudaremos a adaptar o modelo à tarefa.