Techsy
Contacto
Começar
Voltar ao blog
ai-machine-learning

Preços da API do Gemini Omni: O Que Sabemos, O Que Substitui e Quanto Vai Custar (maio de 2026)

Escrito por Techsy Editorial Team
May 19, 2026
20 min de leitura
Índice
Preços da API do Gemini Omni: O Que Sabemos, O Que Substitui e Quanto Vai Custar (maio de 2026)

Preços da API do Gemini Omni: O Que Sabemos, O Que Substitui e Quanto Vai Custar (maio de 2026)

A Google lançou o Gemini Omni no I/O 2026 há cerca de cinco horas, e a linha de preços da API do Gemini Omni na própria página de preços da Google está literalmente em branco. Abaixo encontra o que sabemos hoje, a matemática de projeção para as tarifas de amanhã ancorada no Veo 3.1 e no Gemini 3.5 Flash, e a pilha de quatro modelos que o Omni reúne numa única chamada. Última verificação: 2026-05-19. Atualizarei este artigo no dia em que a Google publicar as tarifas da API.

Resposta Rápida: Os preços da API do Gemini Omni ainda não são públicos a 19 de maio de 2026. O acesso para consumidores começa nos 20 $/mês (AI Plus), 30 $/mês (AI Pro) e 100 $/mês (AI Ultra). Espera-se a disponibilização da API na Vertex AI dentro de semanas. Ancoradas no Veo 3.1 e no Gemini 3.5 Flash, as tarifas projetadas da API situam-se entre 1,50 $ e 2,50 $ por 1M de tokens de input e 0,20 $ a 0,60 $ por segundo de output de vídeo.

O que é o Gemini Omni?

O Gemini Omni é o primeiro modelo multimodal "any-to-any" da Google, anunciado na I/O 2026 a 19 de maio de 2026. Aceita texto, imagem, áudio e vídeo como input e, atualmente, produz vídeo como output (o output de imagem e áudio está prometido "a tempo", nas palavras da própria Google). São lançadas duas variantes no lançamento: o Omni Flash para clipes rápidos de 10 segundos, e o Omni Pro para output mais longo e de maior fidelidade.

Eis o que o torna interessante do ponto de vista do design de stack. O Omni não acrescenta uma funcionalidade à gama Gemini. Funde quatro modelos separados numa única chamada de API. O que antes era geração de texto mais visão mais conversão de voz em texto mais síntese de vídeo passa a ser uma única ida e volta. O modelo é construído sobre a fundação de vídeo Veo 3.1, pelo que a fasquia da qualidade de vídeo já está definida (e sim, cada output contém uma marca de água SynthID, de acordo com o anúncio de lançamento do Omni da Google).

Alguns detalhes que vale a pena saber antes de ler o resto deste artigo:

  • O limite de clipes de 10 segundos no Omni Flash é aquilo a que a Google chama uma "decisão de implementação, não uma limitação do modelo". Ou seja: provavelmente vai crescer.
  • A ficha do modelo da DeepMind confirma input de texto + imagem + áudio + vídeo, e output apenas de vídeo para já.
  • Tanto a análise da TechCrunch como o detalhe de lançamento da 9to5Google destacam o roteiro de "mais modalidades no output, mais tarde" como a história mais relevante.

Se veio aqui à procura de uma tabela de preços, a próxima secção é a parte honesta que procurava. Se veio pela matemática das projeções, salte duas secções abaixo.

Quanto Custa Hoje a API do Gemini Omni? (Spoiler: Ainda Não Tem Preço)

Os preços da API do Gemini Omni ainda não foram publicados. A página oficial de preços da Google em ai.google.dev/gemini-api/docs/pricing (verificada a 19 de maio de 2026) lista todos os modelos Gemini, EXCETO o Omni. A linha está em branco. O acesso para consumidores já está disponível através dos planos da app Gemini; o acesso à API via Vertex AI estará "disponível nas próximas semanas", segundo a própria formulação de lançamento da Google.

Verifiquei a página de preços às 8h ET e novamente às 13h ET. O mesmo resultado nas duas vezes. A página lista 14 modelos Gemini. O Omni não é um deles. Pelo menos por agora.

ModeloEntrada ($/1M tokens)Saída ($/1M tokens)Entrada de áudioNotas
Gemini 3.5 Flash$1.50$9.00$3.00Entrada de texto/imagem/áudio; saída de texto
Gemini 3.1 Pro$2.00 / $4.00 (>200k)$12.00 / $18.00 (>200k)$3.00Preço 2× acima de 200k de contexto
Gemini 3.1 Flash-Lite$0.10$0.40$0.30O modelo de produção mais barato
Gemini 2.5 Pro$1.25$10.00$3.00Legado, ainda suportado
Veo 3.1 (vídeo)n/d$0.40 / segn/dFaturação de saída por segundo
Gemini OmniAinda não publicadoAinda não publicadon/dVer tabela de projeção abaixo

Fonte: ai.google.dev/gemini-api/docs/pricing, verificada a 2026-05-19.

Os únicos números do Omni que existem hoje são as subscrições de nível consumidor:

  • AI Plus: $20/mês
  • AI Pro: $30/mês
  • AI Ultra: $100/mês

O blogue de subscrições de IA da Google explica o que cada plano desbloqueia. O caminho da API está dividido, como é habitual: Vertex AI para compromissos empresariais (provavelmente o primeiro a ser lançado) e AI Studio para pagamento por utilização (que normalmente chega algumas semanas depois). Ainda não foi publicado qualquer indício de um plano gratuito para o Omni. A análise empresarial da VentureBeat confirma a formulação das "próximas semanas". Esse é o sinal mais forte de calendário que temos.

Por isso, se hoje pesquisou por "Gemini Omni API pricing" e saltou entre cinco separadores com tabelas desatualizadas do Gemini 3.1 Pro, o problema não é seu. Os preços simplesmente ainda não foram divulgados.

Quanto Custará Realmente a API do Gemini Omni? (A Matemática da Projeção)

Preços projetados da API do Gemini Omni, interpolados a partir do Veo 3.1 ($0,05–$0,60/seg de output) e do Gemini 3.5 Flash ($1,50/$9 por 1M de tokens): cenário baixo $1,50 de input / $0,20/seg de output, cenário médio $2,00 de input / $0,40/seg de output, cenário alto $2,50 de input / $0,60/seg de output por 1M de tokens. O input de áudio é projetado em $3–$5 por 1M de tokens. Todos os valores aqui apresentados são projetados, não confirmados.

Eis como chegámos a estes valores. O Veo 3.1 cobra atualmente $0,40 por segundo de output de vídeo, e o Omni Pro é construído sobre a mesma base de vídeo. Por isso, a tarifa por segundo do Omni Pro deverá situar-se dentro da faixa do Veo 3.1. O I/O de texto do Gemini 3.5 Flash é de $1,50/$9 por milhão de tokens; o I/O de texto do Omni Flash provavelmente situa-se entre 0,7–1,5× desse valor, uma vez que a Google historicamente define preços das novas variantes multimodais Flash próximos dos seus equivalentes apenas de texto.

CenárioInput ($/1M)Output de texto ($/1M)Output de vídeo ($/seg)Input de áudio ($/1M)Modelo de referência
Baixo (projetado)$1,50$7,00$0,20$3,00Gemini 3.5 Flash + Veo 3.1 Lite
Médio (projetado)$2,00$10,00$0,40$4,00Flash/Pro combinado + Veo 3.1 standard
Alto (projetado)$2,50$14,00$0,60$5,00Gemini 3.1 Pro + Veo 3.1 standard

Todas as tarifas por milhão de tokens, salvo indicação em contrário. Verificação cruzada com os preços da OpenAI e os preços do Claude da Anthropic para limites de coerência.

Algumas coisas a esperar para além das tarifas base:

  • Níveis Batch / Flex / Priority. Todos os outros modelos Gemini oferecem estes níveis. O Batch geralmente reduz o custo em ~50%; o Priority acrescenta garantias de latência mediante um prémio. O Omni quase de certeza que replica o padrão.
  • Preços por nível de contexto. O Gemini 3.1 Pro cobra 2× acima de 200k tokens. O Omni provavelmente adota a mesma regra, especialmente dado que a contagem de frames de vídeo faz os totais de tokens subir rapidamente.
  • Tokenização do input de áudio. O áudio é faturado por token (codificado), não por segundo. Aproximadamente 32 tokens por segundo de áudio às tarifas atuais do Gemini, pelo que deve orçamentar em conformidade. Ancorado no Veo 3.1 e no Gemini 3.5 Flash, o Omni Flash deverá custar entre $1,50 e $2,50 por milhão de tokens de entrada e entre $0,20 e $0,60 por segundo de vídeo gerado. Fizemos os cálculos duas vezes (uma ancorada apenas no Veo, outra combinada com o Flash) e os intervalos mantiveram-se abaixo de $0,50/seg no limite superior. Quando o Omni for lançado, vai querer encaminhar os pedidos de forma inteligente, e o nosso guia para reduzir os custos de APIs de LLM cobre o encaminhamento por gateway e os níveis de cache que vale a pena pré-configurar desde já.

"Projected per-1M-token cost (input + output blended)"

Tabela de dados
"Projected per-1M-token cost (input + output blended)"
"USD per 1M tokens"Séries 1
"Gemini Omni (low projection)"3.5
"Gemini Omni (mid projection)"5.5
"Gemini Omni (high projection)"8
"Gemini 2.5 Pro"7
"GPT-4o"12.5
"Claude Sonnet 4.6"9

Intervalo de custos projetado do Gemini Omni vs. taxas combinadas de entrada/saída da concorrência em 2026-05-19. Os valores do Omni são interpolados a partir do Veo 3.1 e do Gemini 3.5 Flash; este gráfico será atualizado no dia em que a Google publicar os preços.

O que é que o Gemini Omni substitui? A folha de cálculo do colapso da stack

O Omni substitui um pipeline multimodelo: GPT-4o para texto, GPT-4o Vision para classificação de imagens, Whisper para transcrição de áudio e Veo 3.1 para geração de vídeo. Um fluxo de trabalho típico de vídeo com narração de 30 segundos custa hoje cerca de $12,27, repartido por quatro chamadas de API. Com os preços projetados do Omni para o cenário intermédio, o mesmo fluxo de trabalho desce para $4–$18 por clipe numa única chamada (sim, o limite superior é mais amplo do que gostaria, mas continue a ler).

Nos nossos pipelines de produção, executamos atualmente este exato formato de quatro etapas para fluxos de trabalho de vídeos explicativos para clientes. Eis para onde vai o dinheiro hoje versus para onde iria com o Omni Pro às taxas projetadas do cenário intermédio:

EtapaModelo atualCusto atualChamada OmniCusto projetado
Transcrever o áudio de inputWhisper$0,006/minSubsumido no input do Omniincluído
Classificar a imagem de inputGPT-4o Vision$8 por 1M de tokens de input (imagem)Subsumidoincluído
Gerar legenda / guiãoGPT-4o$2,50 / $10 por 1M de tokensSubsumidoincluído
Gerar vídeo de 30 segVeo 3.1$0,40/seg × 30 = $12,00Omni Pro projetado $0,20–$0,60/seg × 30$6–$18 projetados
Total por clipe~$12,27$4–$18 projetados (intervalo)

Diagrama que mostra quatro APIs de modelos separadas (GPT-4o, GPT-4o Vision, Whisper, Veo 3.1) a colapsar numa única chamada de API do Gemini Omni
Pipeline multimodal de quatro chamadas colapsa numa única chamada do Omni

Eis a ressalva honesta. No limite superior do intervalo de projeção, o Omni Pro pode, na verdade, ser mais caro por clipe do que o atual pipeline de quatro fornecedores. O output de vídeo é o item de custo dominante e, se a Google precificar o Omni Pro aos $0,40+/seg completos do Veo 3.1 (mais o markup de tokens de input para o contexto multimodal), os fluxos de trabalho intensivos em vídeo podem não ver uma poupança em $ desde o primeiro dia.

Então de onde vem realmente a poupança? Dica profissional: se hoje paga por Whisper + Vision + GPT-4o + Veo 3.1, o seu verdadeiro ganho com o Omni nem sempre é em dólares. É livrar-se de 3 fornecedores, 3 SDKs e 3 SLAs numa única chamada. Essa é a parte que o CTO vai aprovar, não a matemática por clipe. A latência desce, o código de tratamento de erros encolhe e a sua lógica de retry deixa de se ramificar por quatro taxonomias de erros. Quando a API ficar indisponível, vai querer testar o Omni em A/B contra a sua stack atual com espelhamento de tráfego, e não com uma migração abrupta. O tutorial da Responses API do GPT-4o explica passo a passo a stack multimodal exata que o Omni foi concebido para unificar, e um gateway de LLM torna o teste lado a lado simples, sem reescrever cada ponto de chamada.

O Gemini Omni Compensa para a Automação de Instagram?

Para automação de Instagram apenas com legendas, o GPT-4o-mini a $0,15/$0,60 por 1M de tokens continua mais barato do que as tarifas projetadas do Omni: cerca de $1,60 por 100 publicações contra $4–$10 por 100 publicações no cenário intermédio do Omni. O Omni ganha quando o teu fluxo de trabalho também gera a imagem ou o vídeo. Para legendas apenas de texto em fotos existentes, fica com a cadeia GPT-4o-mini. Esta não é uma resposta única para todos os casos.

O fluxo de trabalho que a maioria dos indie hackers usa atualmente é o template de automação de Instagram do n8n: n8n + geração de legendas com GPT-4o-mini + avaliação de imagens com GPT-4o Vision + geração de hashtags com GPT-4o-mini + publicação via Buffer. Números reais por 100 publicações hoje:

  • Legendas (GPT-4o-mini, ~500 tokens de entrada / 100 de saída × 100 publicações): ~$0,30
  • Avaliação de imagens (GPT-4o Vision, 1 imagem × 100 publicações): ~$1,20
  • Geração de hashtags (GPT-4o-mini, ~200 tokens × 100): ~$0,10
  • Total: ~$1,60 por 100 publicações em gastos brutos de API

Com as tarifas projetadas do Omni no cenário intermédio (uma única chamada multimodal por publicação: imagem de entrada mais geração de texto, saída apenas de texto, sem necessidade de vídeo para publicações estáticas de Instagram), ficarias algures na faixa dos $4–$10 por 100 publicações. Isso é 2,5–6× mais caro do que a cadeia GPT-4o-mini para exatamente o mesmo resultado.

Veredito honesto: se estás a gerar Reels de Instagram (vídeo), o Omni é uma escolha óbvia no momento em que a API for lançada, porque nenhuma das alternativas produz vídeo de 30 segundos numa única chamada. Se estás a publicar imagens estáticas com legendas de IA, o GPT-4o-mini continua a ganhar em custo por ~3×. Não migres só por migrar.

"Cost per 100 Instagram posts (caption + image scoring + hashtags)"

Tabela de dados
"Cost per 100 Instagram posts (caption + image scoring + hashtags)"
"Stack"Séries 1
"GPT-4o-mini chain (today)"1.6
"Gemini 2.5 Flash-Lite chain"1.2
"Gemini Omni (projected mid)"6
"GPT-4o full chain"11.4

Para publicações estáticas de Instagram, o GPT-4o-mini continua a ganhar em custo. O Omni só assume a liderança quando é necessária saída de vídeo. O número projetado do Omni está ancorado nas tarifas do cenário intermédio (combinação de Veo 3.1 + Gemini 3.5 Flash) em 2026-05-19. Se está a começar a construir estes pipelines, o tutorial de agentes de IA do n8n explica os conceitos básicos. Para fluxos de trabalho de agências com maior volume, os padrões de automação de fluxos de trabalho de IA empresarial abordam a lógica de encaminhamento em que o Omni se vai integrar.

Gemini Omni vs. GPT-4o vs. Claude Sonnet 4.6: A Comparação Honesta

Comparar o Gemini Omni com o GPT-4o e o Claude Sonnet 4.6 hoje não é uma comparação direta. O Omni produz vídeo (os outros não produzem), o GPT-4o faz áudio em tempo real (o Omni ainda não faz), e o Claude tem a maior janela de contexto para trabalho com documentos longos. A pergunta certa é quais são os pontos fortes do modelo que correspondem à sua carga de trabalho, e não qual é o mais barato.

FuncionalidadeGemini Omni (projetado)GPT-4oClaude Sonnet 4.6
Modalidades de entradatexto + imagem + áudio + vídeotexto + imagem + áudiotexto + imagem
Modalidades de saídavídeo (imagem/áudio mais tarde)texto + áudio (tempo real)texto
Áudio em tempo realNãoSimNão
Janela de contexto1M (padrão da família Gemini)128k1M
Preço (entrada/saída por 1M)projetado $1,50–$2,50 / $7–$14$2,50 / $10$3 / $15
Disponibilidade da API hojeNão (nas próximas semanas)SimSim

Tarifas de origem obtidas em Preços da OpenAI e Preços do Claude, verificadas em 2026-05-19.

O Omni não supera o GPT-4o nem o Claude no preço. Supera-os na cobertura de modalidades. Se precisa de saída de vídeo hoje, o Omni é a única opção entre os três grandes (o Veo 3.1 continua a ser o melhor para vídeo puro, mas o Omni acrescenta a camada de entrada multimodal). Se precisa de voz em tempo real, o GPT-4o ainda domina esse campo. Se precisa de uma janela de contexto de 1M tokens para fluxos de trabalho com documentos, o Claude Opus 4.7 levou as coisas ainda mais longe. E para trabalho em lote sensível a custos, as alternativas multimodais de código aberto cobrem o mesmo campo com custo zero por token (com as suas próprias contrapartidas em termos de configuração e custos de GPU).

Quando NÃO Usar o Gemini Omni

Evite o Gemini Omni em fluxos de trabalho apenas de texto (RAG, classificação, chat), pipelines de alto volume e baixa margem (use o Gemini 2.5 Flash-Lite ou o GPT-4o-mini, com um custo 10–50× inferior), aplicações de voz em tempo real (o GPT-4o Realtime continua a dominar neste campo) ou qualquer coisa que exija fine-tuning. O Omni destina-se a tarefas em que a multimodalidade É a proposta de valor, e não uma forma mais barata de executar um chatbot.

Em concreto, evite o Omni se:

  • A sua carga de trabalho for apenas de texto e de alto volume: use o Gemini 2.5 Flash-Lite ($0,10/$0,40) ou o GPT-4o-mini ($0,15/$0,60)
  • Precisar de voz em tempo real: o GPT-4o Realtime continua a ser a escolha certa
  • Precisar de fine-tuning: o Veo 3.1 não o suporta, e o Omni é construído sobre a mesma base, pelo que deve assumir que não haverá fine-tuning no lançamento
  • Precisar de saída de imagem hoje: Imagen 4 ou DALL-E 3 (no lançamento, o Omni produz vídeo, não imagens)
  • Precisar de saída de áudio hoje: ElevenLabs, OpenAI TTS ou Gemini TTS, uma vez que a saída de áudio do Omni fica para "mais tarde"
  • Precisar de clipes com mais de 10 segundos no Flash: aguarde pelo nível Pro ou use diretamente o Veo 3.1
  • A sua UX precisar de resposta em menos de um segundo: as chamadas multimodais são mais lentas do que as de apenas texto; reserve latência adicional

Antes de substituir uma única chamada em produção, compare o Omni com a sua stack atual usando um conjunto de avaliação partilhado. O Omni é a escolha errada para chatbots, classificação e RAG. É um modelo para tarefas multimodais, não um modelo de tokens baratos.

Folha de Referência de Migração: De Múltiplas Chamadas para uma Única Chamada Omni

Quando a API for lançada, migrar de um pipeline de 4 chamadas para uma única chamada Omni será uma alteração de código de aproximadamente 15 linhas. A estrutura abaixo é pseudocódigo. As assinaturas reais do SDK chegarão com a API. A convenção de nomenclatura da Google sugere gemini-omni-flash e gemini-omni-pro, com base no padrão do Veo 3.1.

Atualmente: quatro chamadas separadas entre dois fornecedores.

python
# HOJE: quatro chamadas de API, dois fornecedores, quatro taxonomias de erro
from openai import OpenAI
from google import genai

openai = OpenAI()
google = genai.Client()

transcript = openai.audio.transcriptions.create(model="whisper-1", file=audio)
vision = openai.chat.completions.create(model="gpt-4o", messages=[
    {"role": "user", "content": [{"type": "image_url", "image_url": image_url}]}])
caption = openai.chat.completions.create(model="gpt-4o", messages=[
    {"role": "user", "content": f"Caption for {vision.choices[0].message.content}"}])
video = google.models.generate_videos(model="veo-3.1", prompt=caption.choices[0].message.content)

Tomorrow (projected): one call to Omni.

python
# PREVISTO: uma única chamada Omni (pseudocódigo — o SDK real chega com a API)
from google import genai

client = genai.Client()
response = client.models.generate_content(
    model="gemini-omni-flash",  # or "gemini-omni-pro" for longer clips
    contents=[text_prompt, image, audio, video_reference],
    config={"output_modality": "video", "duration_seconds": 10}
)

Quando a API for lançada, a migração consistirá sobretudo em eliminar código. Preste atenção ao nome do modelo no dia do lançamento e fixe-o numa constante, para poder alternar entre omni-flash e omni-pro consoante a carga de trabalho sem tocar nos pontos de chamada. O padrão atual do SDK Python para o Gemini já lida com conteúdos multimodais, pelo que a estrutura acima se integra sem problemas.

Como a Techsy Pensa Sobre a Migração para o Omni

Quando avaliamos qualquer troca de stack de modelos para clientes, fazemos três perguntas: qual é o orçamento de latência, o novo modelo cobre as modalidades que a sua carga de trabalho realmente utiliza, e existe uma vantagem de consolidação de fornecedores que justifique o custo da reconstrução? Duas dessas perguntas costumam responder-se sozinhas; a terceira é onde a maioria das migrações se deixa convencer a existir pelas razões erradas.

Não estamos a recomendar que os clientes reconstruam sobre o Omni hoje. A API ainda não foi lançada, os preços não estão publicados, e um intervalo de projeção é uma ferramenta de planeamento, não um sinal verde para entregar uma refatoração. O que faríamos agora é configurar a camada de gateway que lhe permite fazer testes A/B do Omni contra a sua stack atual no momento em que a API for disponibilizada. Faça cache agressivo das chamadas multimodais (inputs de imagem + áudio são suficientemente determinísticos para acertar no cache com frequência) e mantenha uma feature flag para o nome do modelo.

Está a construir uma stack de IA que precisa de absorver lançamentos de modelos sem uma reescrita a cada seis semanas? Obtenha uma consulta gratuita e nós vamos testar onde o Omni encaixa (ou não).

Perguntas Frequentes

Quanto custa a API do Gemini Omni?

A 19 de maio de 2026, os preços da API do Gemini Omni ainda não foram publicados. A página de preços da Google lista todos os modelos Gemini, exceto o Omni. Com base no Veo 3.1 e no Gemini 3.5 Flash, as taxas projetadas situam-se entre 1,50 $ e 2,50 $ por 1M de tokens de entrada e entre 0,20 $ e 0,60 $ por segundo de saída de vídeo. Os valores são projeções, não taxas confirmadas.

Quando será lançada a API do Gemini Omni?

A Google afirmou que a API seria disponibilizada "nas próximas semanas" durante a I/O 2026, a 19 de maio. O acesso através do Vertex AI costuma chegar primeiro para os novos modelos Gemini, com o modelo pay-as-you-go do AI Studio a surgir algumas semanas depois. A publicação oficial de lançamento é a fonte canónica para o calendário. Iremos atualizar esta publicação no dia em que as tarifas forem publicadas.

O Gemini Omni é mais barato que o GPT-4o?

Depende da carga de trabalho. Para saída de vídeo, o Omni é a única opção dos três grandes que disponibiliza geração numa única chamada, uma vez que o GPT-4o não produz vídeo. Para trabalho apenas com texto, o GPT-4o-mini, a $0,15/$0,60 por 1M tokens, supera as taxas projetadas do Omni em cerca de 3×. Escolha o modelo que corresponda às modalidades que o seu pipeline efetivamente produz.

O que é que o Gemini Omni substitui na minha stack?

Para fluxos de trabalho de vídeo multimodal, o Omni substitui quatro chamadas de API separadas: o Whisper para transcrição, o GPT-4o Vision para compreensão de imagem, o GPT-4o para geração de texto e o Veo 3.1 para síntese de vídeo. A maior vantagem é, normalmente, ficar livre de três SDKs de fornecedores, três SLAs e três taxonomias de erro, e não tanto a poupança direta em dólares. Consulta a folha de cálculo de colapso da stack acima para as contas por clipe.

Posso usar o Gemini Omni através da API hoje?

Não. À data de 19 de maio de 2026, o acesso à API ainda não está disponível. O acesso para consumidores está ativo através dos planos da app Gemini: AI Plus a $20/mês, AI Pro a $30/mês e AI Ultra a $100/mês, segundo o blogue de subscrições de IA da Google. O lançamento da API através do Vertex AI está previsto para as "próximas semanas", segundo as próprias palavras da Google.

O Gemini Omni suporta fine-tuning?

Não foi anunciado até à data de lançamento. O Veo 3.1 também não suporta fine-tuning, e o Omni é construído sobre a mesma base de vídeo, pelo que se deve assumir que não haverá fine-tuning no lançamento. Historicamente, a Google tem adicionado fine-tuning aos modelos multimodais alguns meses após a disponibilidade geral, pelo que um cronograma para o 3.º ou 4.º trimestre de 2026 é plausível, mas não está confirmado.

Como funciona a faturação do Gemini Omni?

Prevê-se que siga o padrão habitual da Google: tarifas por milhão de tokens para entrada (texto, imagem, áudio, fotogramas de vídeo), acrescidas de faturação ao segundo para saída de vídeo. Os níveis Batch (geralmente com ~50% de desconto), Flex e Priority deverão estar disponíveis, tal como noutros modelos Gemini. A tarifação por escalão de contexto (taxa 2× acima de 200 mil tokens) deverá aplicar-se, dado que os fotogramas de vídeo fazem disparar rapidamente a contagem de tokens.

Qual é a diferença entre o Omni Flash e o Omni Pro?

O Omni Flash é a variante mais rápida e económica, limitada a clipes de 10 segundos. O Omni Pro processa clipes mais longos, com maior fidelidade, a um custo estimado mais elevado. Ambos abrangem a mesma matriz de modalidades (entrada de texto, imagem, áudio e vídeo; atualmente, apenas saída de vídeo). A Google descreve o limite de 10 segundos do Flash como uma "decisão de implementação, não uma limitação do modelo", pelo que é de esperar que venha a ser alargado.

O Gemini Omni vai substituir o GPT-4o na minha automação de Instagram?

Depende do que geras. Para Reels (saída de vídeo): sim, eventualmente, uma vez que o Omni é a única opção de chamada única para síntese de vídeo de 30 segundos. Para publicações estáticas com legendas e hashtags geradas por IA: provavelmente não. O GPT-4o-mini continua a superar as tarifas projetadas do Omni em cerca de 3× em termos de custo, e a cadeia n8n + GPT-4o-mini já está testada em produção.

A concluir

Três ideias a reter:

  • Os preços da API Gemini Omni não estão publicados à data de 19 de maio de 2026. A linha na página de preços está em branco, os planos para consumidores estão disponíveis entre $20–$100/mês e o acesso à API via Vertex AI está previsto para "dentro de semanas".
  • Intervalo de projeção: $1,50–$2,50 por 1M de tokens de entrada e $0,20–$0,60 por segundo de vídeo de saída, ancorado no Veo 3.1 e no Gemini 3.5 Flash. A entrada de áudio está projetada entre $3–$5 por 1M de tokens. Todos os valores são projeções, não factos.
  • A poupança por colapso da stack nem sempre se mede em dólares. Trata-se de eliminar 3 fornecedores, 3 SDKs e 3 SLAs numa única chamada multimodal. Planeie a migração em torno da consolidação de fornecedores e da latência, e não do $/clipe bruto.

Última verificação: 2026-05-19 (SLA de atualização: 24 horas após a Google publicar as tarifas). Atualizarei este artigo no dia em que a Google publicar os preços da API. Guarde-o nos favoritos.

A equipa editorial da Techsy implementa pipelines multimodais com GPT-4o + Veo 3.1 + Whisper desde 2024. Atualizamos este artigo quando a Google publicar as tarifas Omni.

Etiquetas

preços-api-gemini-omnigemini-omnipreços-llmia-multimodalvertex-ai

Partilhar este artigo

Artigos relacionados

Mais em ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 chegou: inteligência quase Fable 5 a metade do preço

A Anthropic lançou o Claude Opus 5 a 24 de julho de 2026. Mais do que duplica o Opus 4.8 no Frontier-Bench e mantém o preço do Opus, mas perde alguns testes para o Fable 5 e o Mythos 5. Eis a tabela de benchmarks, o preço e a recomendação de mudar/esperar/ficar.

10 min read min de leitura
Ler
ai-machine-learning
Jul 20, 2026

8 Melhores APIs de Web Scraping com IA em 2026 (Testadas na Nossa Própria Stack de Agentes)

Testámos 8 APIs de web scraping com IA com preços reais de 2026, obtidos através da nossa própria stack de agentes. Firecrawl, Bright Data, ScrapingBee e mais 5, classificadas por output pronto para LLM, anti-bot e suporte MCP.

9 min read min de leitura
Ler
ai-machine-learning
Jul 20, 2026

Engenharia de Prompts para Programação: 7 Padrões Que Usamos Diariamente no Claude Code e Cursor (2026)

A maioria dos artigos sobre 'prompts de IA para programação' oferece 50 modelos para copiar. Este ensina os 7 padrões que usamos todos os dias para gerir um pipeline de 16 agentes no Claude Code, com exemplos reais de antes e depois, além de indicar onde cada padrão se encaixa no Claude Code, Cursor e Copilot em 2026.

11 min read min de leitura
Ler
Ver todos os artigos
Inicia o Teu Projeto

Pronto para criar algo extraordinário?

Vamos transformar a sua visão em realidade. A nossa equipa está pronta para o ajudar a criar software que faz a diferença.

Marca uma chamada de scope 30 minVer o Nosso Trabalho

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto

Legal

  • Política de Privacidade
  • Termos de Serviço
  • Política de Cookies

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto
LegalPolítica de PrivacidadeTermos de ServiçoPolítica de Cookies
TECHSY
© 2026 Techsy. Todos os direitos reservados.