ai-machine-learning

Precios de la API de Gemini Omni: Lo que sabemos, lo que reemplaza y lo que costará (mayo 2026)

Escrito por Techsy Editorial Team
May 19, 2026
19 lectura
Precios de la API de Gemini Omni: Lo que sabemos, lo que reemplaza y lo que costará (mayo 2026)

Precios de la API de Gemini Omni: Lo que sabemos, lo que reemplaza y lo que costará (mayo 2026)

Google presentó Gemini Omni en I/O 2026 hace unas cinco horas, y la fila de precios de la API de Gemini Omni en la página de precios oficial de Google está literalmente en blanco. A continuación encontrarás todo lo que sabemos hoy, los cálculos proyectados para las tarifas de mañana basados en Veo 3.1 y Gemini 3.5 Flash, y la pila de cuatro modelos que Omni colapsa en una única llamada. Última verificación: 19 de mayo de 2026. Actualizaré este artículo el día que Google publique los precios de la API.

Respuesta rápida: El precio de la API de Gemini Omni aún no es público a 19 de mayo de 2026. El acceso para consumidores comienza en $20/mes (AI Plus), $30/mes (AI Pro) y $100/mes (AI Ultra). El despliegue de la API en Vertex AI se espera en las próximas semanas. Anclados a Veo 3.1 y Gemini 3.5 Flash, las tarifas de API proyectadas se sitúan en $1,50–$2,50 por 1M de tokens de entrada y $0,20–$0,60 por segundo de vídeo generado.

¿Qué es Gemini Omni?

Gemini Omni es el primer modelo multimodal "cualquier a cualquier" de Google, presentado en I/O 2026 el 19 de mayo de 2026. Acepta texto, imagen, audio y vídeo como entrada y actualmente genera vídeo como salida (la salida de imagen y audio está prometida "próximamente" según la propia redacción de Google). Dos variantes están disponibles en el lanzamiento: Omni Flash para clips rápidos de 10 segundos, y Omni Pro para salidas más largas y de mayor fidelidad.

Lo que lo hace interesante desde el punto de vista del diseño de sistemas es esto: Omni no añade una funcionalidad más a la línea de Gemini. Colapsa cuatro modelos separados en una sola llamada API. Lo que antes era generación de texto, más visión, más transcripción de audio, más síntesis de vídeo se convierte en un único viaje de ida y vuelta. El modelo está construido sobre la base de vídeo de Veo 3.1, así que el listón de calidad de vídeo ya está establecido (y sí, cada salida lleva una marca de agua SynthID, según el anuncio de lanzamiento de Omni de Google).

Algunos detalles que conviene conocer antes de leer el resto de este artículo:

  • El límite de 10 segundos para clips en Omni Flash es lo que Google denomina una "decisión de despliegue, no una limitación del modelo." Léase: probablemente crezca.
  • La ficha del modelo de DeepMind confirma entrada de texto + imagen + audio + vídeo, y salida solo de vídeo por ahora.
  • El análisis de TechCrunch y el detalle de lanzamiento de 9to5Google señalan ambos la hoja de ruta de "más modalidades de salida, más adelante" como la historia más importante.

Si llegaste aquí buscando una tabla de tarifas, la siguiente sección es la parte honesta que buscabas. Si lo que te interesa son los cálculos proyectados, salta dos secciones.

¿Cuánto cuesta la API de Gemini Omni hoy? (Spoiler: todavía nada)

Los precios de la API de Gemini Omni aún no están publicados. La página de precios oficial de Google en ai.google.dev/gemini-api/docs/pricing (verificada el 19 de mayo de 2026) lista todos los modelos Gemini EXCEPTO Omni. La fila está en blanco. El acceso para consumidores ya está disponible mediante los planes de la app Gemini; el acceso a la API vía Vertex AI llegará "en las próximas semanas" según la propia redacción de Google en el lanzamiento.

Revisé la página de precios a las 8h ET y de nuevo a las 13h ET. El mismo resultado ambas veces. La página lista 14 modelos Gemini. Omni no es uno de ellos. Todavía.

ModeloEntrada ($/1M tokens)Salida ($/1M tokens)Entrada de audioNotas
Gemini 3.5 Flash$1,50$9,00$3,00Texto/imagen/audio entrada; texto salida
Gemini 3.1 Pro$2,00 / $4,00 (>200k)$12,00 / $18,00 (>200k)$3,00Tarifa 2× superando 200k de contexto
Gemini 3.1 Flash-Lite$0,10$0,40$0,30El modelo de producción más económico
Gemini 2.5 Pro$1,25$10,00$3,00Legacy, aún con soporte
Veo 3.1 (vídeo)n/d$0,40 / segn/dFacturación por segundo de salida
Gemini OmniPendiente de publicaciónPendiente de publicaciónn/dVer tabla de proyección abajo

Fuente: ai.google.dev/gemini-api/docs/pricing, verificado el 19 de mayo de 2026.

Los únicos números de Omni que existen hoy son los planes de suscripción para consumidores:

  • AI Plus: $20/mes
  • AI Pro: $30/mes
  • AI Ultra: $100/mes

El blog de suscripciones de IA de Google detalla qué desbloquea cada plan. El acceso por API está dividido como siempre: Vertex AI para compromisos empresariales (probablemente despliega primero), y AI Studio para pago por uso (suele seguir unas semanas después). No hay señal de nivel gratuito para Omni todavía. El análisis empresarial de VentureBeat confirma el enfoque de "próximas semanas." Es la señal de calendario más fiable que tenemos.

Así que si buscaste "precios API Gemini Omni" hoy y saltaste por cinco pestañas con tablas desactualizadas de Gemini 3.1 Pro, el problema no eres tú. Los precios literalmente no están disponibles.

¿Cuánto costará realmente la API de Gemini Omni? (Los cálculos proyectados)

Precio proyectado de la API de Gemini Omni, interpolado a partir de Veo 3.1 ($0,05–$0,60/seg de salida) y Gemini 3.5 Flash ($1,50/$9 por 1M de tokens): caso bajo $1,50 entrada / $0,20/seg salida, caso medio $2,00 entrada / $0,40/seg salida, caso alto $2,50 entrada / $0,60/seg salida por 1M de tokens. La entrada de audio está proyectada en $3–$5 por 1M de tokens. Todos los números aquí son proyectados, no confirmados.

Así llegamos a estas cifras. Veo 3.1 cobra $0,40 por segundo de vídeo generado hoy, y Omni Pro está construido sobre la misma base de vídeo. Por tanto, la tarifa por segundo de Omni Pro probablemente caiga dentro de la banda de Veo 3.1. El texto de entrada/salida de Gemini 3.5 Flash es $1,50/$9 por millón de tokens; el texto de Omni Flash probablemente se sitúe entre 0,7–1,5× de esa cifra, ya que Google históricamente pone precio a las nuevas variantes Flash multimodales cerca de su hermano de solo texto.

CasoEntrada ($/1M)Salida texto ($/1M)Salida vídeo ($/seg)Entrada audio ($/1M)Modelo de referencia
Bajo (proyectado)$1,50$7,00$0,20$3,00Gemini 3.5 Flash + Veo 3.1 Lite
Medio (proyectado)$2,00$10,00$0,40$4,00Flash/Pro combinado + Veo 3.1 estándar
Alto (proyectado)$2,50$14,00$0,60$5,00Gemini 3.1 Pro + Veo 3.1 estándar

Todas las tarifas por millón de tokens salvo indicación contraria. Verificado con los precios de OpenAI y los precios de Claude de Anthropic como límites de referencia.

Algunas cosas adicionales que esperar sobre las tarifas base:

  • Niveles Batch / Flex / Priority. Todos los demás modelos Gemini los ofrecen. Batch suele reducir el coste ~50%; Priority añade garantías de latencia con una prima. Omni casi con seguridad replica este patrón.
  • Precios por nivel de contexto. Gemini 3.1 Pro cobra 2× superando los 200k tokens. Omni probablemente aplica la misma regla, especialmente dado que los fotogramas de vídeo disparan el recuento de tokens rápidamente.
  • Tokenización de audio de entrada. El audio se factura por token (codificado), no por segundo. Aproximadamente 32 tokens por segundo de audio a las tarifas actuales de Gemini, así que presupuesta en consecuencia.

Anclados a Veo 3.1 y Gemini 3.5 Flash, es probable que Omni Flash cueste $1,50–$2,50 por millón de tokens de entrada y $0,20–$0,60 por segundo de vídeo generado. Hicimos los cálculos dos veces (una anclados solo a Veo, otra combinando con Flash) y las bandas se mantuvieron por debajo de $0,50/seg en el extremo alto. Cuando Omni aterrice querrás enrutar las peticiones de forma inteligente, y nuestra guía para reducir costes de API de LLM cubre el enrutamiento por gateway y los niveles de caché que merece la pena configurar ya.

"Coste proyectado por 1M de tokens (entrada + salida combinados)"

Tabla de datos
"Coste proyectado por 1M de tokens (entrada + salida combinados)"
"USD por 1M de tokens"Serie 1
"Gemini Omni (proyección baja)"3.5
"Gemini Omni (proyección media)"5.5
"Gemini Omni (proyección alta)"8
"Gemini 2.5 Pro"7
"GPT-4o"12.5
"Claude Sonnet 4.6"9

Banda de costes proyectada de Gemini Omni frente a tarifas combinadas de entrada/salida de la competencia a 19 de mayo de 2026. Los números de Omni son interpolados a partir de Veo 3.1 y Gemini 3.5 Flash; este gráfico se actualiza el día que Google publique las tarifas.

¿Qué reemplaza Gemini Omni? La hoja de cálculo del colapso de pila

Omni reemplaza un pipeline de múltiples modelos: GPT-4o para texto, GPT-4o Vision para puntuación de imágenes, Whisper para transcripción de audio y Veo 3.1 para generación de vídeo. Un flujo de trabajo típico de vídeo-con-narración de 30 segundos cuesta hoy ~$12,27 en cuatro llamadas API. Con los precios de Omni proyectados en el caso medio, el mismo flujo de trabajo baja a $4–$18 por clip en una sola llamada (sí, el extremo alto es más amplio de lo que te gustaría, pero sigue leyendo).

En nuestros pipelines de producción actualmente ejecutamos exactamente esta forma de cuatro pasos para flujos de trabajo de vídeo-explicativo para clientes. Así es donde va el dinero hoy frente a donde iría con Omni Pro a las tarifas proyectadas del caso medio:

PasoModelo actualCoste actualLlamada OmniCoste proyectado
Transcribir audio de entradaWhisper$0,006/minAbsorbido en la entrada de Omniincluido
Puntuar imagen de entradaGPT-4o Vision$8 por 1M de tokens de entrada (imagen)Absorbidoincluido
Generar pie de foto / guiónGPT-4o$2,50 / $10 por 1M de tokensAbsorbidoincluido
Generar vídeo de 30 segVeo 3.1$0,40/seg × 30 = $12,00Omni Pro proyectado $0,20–$0,60/seg × 30proyectado $6–$18
Total por clip~$12,27proyectado $4–$18 (banda)

Diagrama que muestra cuatro APIs de modelos separados (GPT-4o, GPT-4o Vision, Whisper, Veo 3.1) colapsando en una única llamada a la API de Gemini Omni
El pipeline multimodal de cuatro llamadas colapsa en una sola llamada Omni

Aquí va la advertencia honesta. En el extremo alto de la banda proyectada, Omni Pro podría ser más caro por clip que el pipeline actual de cuatro proveedores. La salida de vídeo es el elemento de coste dominante, y si Google pone precio a Omni Pro al nivel completo de $0,40+/seg de Veo 3.1 (más el margen de tokens de entrada por el contexto multimodal), los flujos de trabajo con mucho vídeo podrían no ver un ahorro en dólares el primer día.

¿Entonces dónde está el ahorro real? Consejo pro: si hoy pagas Whisper + Vision + GPT-4o + Veo 3.1, tu verdadera ganancia con Omni no siempre son dólares. Es perder 3 proveedores, 3 SDKs y 3 SLAs en una sola llamada. Eso es lo que el CTO firmará, no el cálculo por clip. La latencia baja, el código de manejo de errores se reduce y tu lógica de reintentos deja de ramificarse entre cuatro taxonomías de errores distintas.

Cuando llegue la API, querrás hacer un A/B de Omni frente a tu pila actual con duplicación de tráfico, no una migración directa. El tutorial de la API de Responses de OpenAI repasa exactamente la pila multimodal que Omni está diseñado para colapsar, y un gateway de LLM hace que la prueba comparativa sea sencilla sin reescribir cada punto de llamada.

¿Vale la pena Gemini Omni para la automatización de Instagram?

Para la automatización de Instagram solo con pies de foto, GPT-4o-mini a $0,15/$0,60 por 1M de tokens sigue siendo más barato que las tarifas proyectadas de Omni: unos $1,60 por 100 publicaciones frente a $4–$10 por 100 publicaciones con Omni en el caso medio. Omni gana cuando tu flujo de trabajo también genera la imagen o el vídeo. Para pies de foto de texto en fotos existentes, quédate con la cadena de GPT-4o-mini. No hay una respuesta única para todo.

El flujo de trabajo que la mayoría de indie hackers usa ahora mismo es la plantilla de automatización de Instagram de n8n: n8n + generación de pies de foto con GPT-4o-mini + puntuación de imagen con GPT-4o Vision + generación de hashtags con GPT-4o-mini + publicación con Buffer. Números reales por 100 publicaciones hoy:

  • Pies de foto (GPT-4o-mini, ~500 tokens entrada / 100 salida × 100 publicaciones): ~$0,30
  • Puntuación de imagen (GPT-4o Vision, 1 imagen × 100 publicaciones): ~$1,20
  • Generación de hashtags (GPT-4o-mini, ~200 tokens × 100): ~$0,10
  • Total: ~$1,60 por 100 publicaciones en gasto directo de API

Con las tarifas proyectadas de Omni en el caso medio (una sola llamada multimodal por publicación: imagen de entrada más generación de texto, salida solo texto, sin vídeo para publicaciones estáticas de Instagram), acabarías en la banda de los $4–$10 por 100 publicaciones. Eso es 2,5–6× más caro que la cadena de GPT-4o-mini para exactamente el mismo resultado.

Veredicto honesto: si generas Reels de Instagram (vídeo), Omni es una elección obvia en cuanto llegue la API porque ninguna alternativa genera vídeo de 30 segundos en una sola llamada. Si publicas imágenes estáticas con pies de foto de IA, GPT-4o-mini sigue ganando en coste por ~3×. No migres por migrar.

"Coste por 100 publicaciones de Instagram (pie de foto + puntuación de imagen + hashtags)"

Tabla de datos
"Coste por 100 publicaciones de Instagram (pie de foto + puntuación de imagen + hashtags)"
"Pila"Serie 1
"Cadena GPT-4o-mini (hoy)"1.6
"Cadena Gemini 2.5 Flash-Lite"1.2
"Gemini Omni (proyección media)"6
"Cadena GPT-4o completa"11.4

Para publicaciones estáticas de Instagram, GPT-4o-mini sigue ganando en coste. Omni solo toma la delantera cuando se necesita salida de vídeo. Número de Omni proyectado anclado a las tarifas del caso medio (combinación Veo 3.1 + Gemini 3.5 Flash) a 19 de mayo de 2026.

Si estás empezando a construir estos pipelines, el tutorial de agentes de IA con n8n repasa lo básico. Para flujos de trabajo de agencias de mayor volumen, los patrones de automatización de flujos de trabajo de IA empresarial cubren la lógica de enrutamiento en la que Omni encajará.

Gemini Omni vs GPT-4o vs Claude Sonnet 4.6: La comparación honesta

Comparar Gemini Omni con GPT-4o y Claude Sonnet 4.6 hoy no es una comparación de igual a igual. Omni genera vídeo (los otros no), GPT-4o hace audio en tiempo real (Omni todavía no), y Claude tiene la ventana de contexto más grande para trabajos con documentos extensos. La pregunta correcta es qué fortalezas del modelo encajan con tu carga de trabajo, no cuál es el más barato.

FuncionalidadGemini Omni (proyectado)GPT-4oClaude Sonnet 4.6
Modalidades de entradatexto + imagen + audio + vídeotexto + imagen + audiotexto + imagen
Modalidades de salidavídeo (imagen/audio más adelante)texto + audio (tiempo real)texto
Audio en tiempo realNoNo
Ventana de contexto1M (valor por defecto familia Gemini)128k1M
Precio (entrada/salida por 1M)proyectado $1,50–$2,50 / $7–$14$2,50 / $10$3 / $15
Disponibilidad de API hoyNo (próximas semanas)

Tarifas de referencia extraídas de los precios de OpenAI y los precios de Claude, verificadas el 19 de mayo de 2026.

Omni no supera a GPT-4o ni a Claude en precio. Los supera en cobertura de modalidades. Si necesitas salida de vídeo hoy, Omni es la única opción del Big-3 (Veo 3.1 sigue ganando para vídeo puro, pero Omni añade la capa de entrada multimodal). Si necesitas voz en tiempo real, GPT-4o sigue siendo el rey de ese terreno. Si necesitas una ventana de contexto de 1M de tokens para flujos de trabajo con documentos, Claude Opus 4.7 amplió todavía más esas posibilidades. Y para trabajos batch sensibles al coste, las alternativas multimodales de código abierto cubren el mismo espacio a coste cero por token (con sus propias contrapartidas en configuración y gasto en GPU).

Cuándo NO usar Gemini Omni

Descarta Gemini Omni para flujos de trabajo solo de texto (RAG, clasificación, chat), pipelines de alto volumen y bajo margen (usa Gemini 2.5 Flash-Lite o GPT-4o-mini a un coste 10–50× menor), apps de voz en tiempo real (GPT-4o Realtime sigue siendo la opción) o cualquier cosa que necesite ajuste fino. Omni es para los trabajos donde lo multimodal ES la propuesta de valor, no una forma más barata de ejecutar un chatbot.

Concretamente, descarta Omni si:

  • Tu carga de trabajo es solo texto y de alto volumen: usa Gemini 2.5 Flash-Lite ($0,10/$0,40) o GPT-4o-mini ($0,15/$0,60)
  • Necesitas voz en tiempo real: GPT-4o Realtime sigue siendo la llamada correcta
  • Necesitas ajuste fino: Veo 3.1 no lo admite y Omni está construido sobre la misma base, así que da por hecho que no habrá ajuste fino en el lanzamiento
  • Necesitas salida de imagen hoy: Imagen 4 o DALL-E 3 (Omni genera vídeo, no imágenes, en el lanzamiento)
  • Necesitas salida de audio hoy: ElevenLabs, OpenAI TTS o Gemini TTS, ya que la salida de audio de Omni llegará "más adelante"
  • Necesitas clips de más de 10 segundos en Flash: espera al nivel Pro o usa Veo 3.1 directamente
  • Tu UX necesita respuesta en menos de un segundo: las llamadas multimodales son más lentas que las de solo texto; presupuesta latencia adicional

Antes de cambiar una sola llamada en producción, evalúa Omni frente a tu pila actual usando una suite de evaluación compartida. Omni es la elección incorrecta para chatbots, clasificación y RAG. Es un modelo para trabajos multimodales, no un modelo de tokens baratos.

Hoja de ruta para la migración: De múltiples llamadas a una sola llamada Omni

Cuando llegue la API, migrar de un pipeline de 4 llamadas a una sola llamada Omni es aproximadamente un cambio de 15 líneas de código. La forma que se muestra a continuación es pseudocódigo. Las firmas reales del SDK llegarán con la API. La convención de nomenclatura de Google sugiere gemini-omni-flash y gemini-omni-pro basándose en el patrón de Veo 3.1.

Hoy: cuatro llamadas separadas a dos proveedores.

python
# HOY: cuatro llamadas API, dos proveedores, cuatro taxonomías de errores
from openai import OpenAI
from google import genai

openai = OpenAI()
google = genai.Client()

transcript = openai.audio.transcriptions.create(model="whisper-1", file=audio)
vision = openai.chat.completions.create(model="gpt-4o", messages=[
    {"role": "user", "content": [{"type": "image_url", "image_url": image_url}]}])
caption = openai.chat.completions.create(model="gpt-4o", messages=[
    {"role": "user", "content": f"Caption for {vision.choices[0].message.content}"}])
video = google.models.generate_videos(model="veo-3.1", prompt=caption.choices[0].message.content)

Mañana (proyectado): una sola llamada a Omni.

python
# PROYECTADO: una sola llamada Omni (pseudocódigo — el SDK real llega con la API)
from google import genai

client = genai.Client()
response = client.models.generate_content(
    model="gemini-omni-flash",  # o "gemini-omni-pro" para clips más largos
    contents=[text_prompt, image, audio, video_reference],
    config={"output_modality": "video", "duration_seconds": 10}
)

Cuando llegue la API, la migración consiste principalmente en eliminar código. Pon el nombre del modelo en una constante el día del lanzamiento para poder cambiar entre omni-flash y omni-pro según la carga de trabajo sin tocar los puntos de llamada. El patrón actual del SDK de Python para Gemini ya gestiona contenidos multimodales, así que la forma mostrada arriba encaja de forma limpia.

Cómo piensa Techsy sobre la migración a Omni

Cuando evaluamos cualquier cambio de pila de modelos para clientes, hacemos tres preguntas: cuál es el presupuesto de latencia, si el nuevo modelo cubre las modalidades que tu carga de trabajo realmente usa, y si hay una ventaja de consolidación de proveedores que justifique el coste de la reconstrucción. Dos de ellas normalmente se responden solas; la tercera es donde la mayoría de las migraciones acaban haciéndose por las razones equivocadas.

No recomendamos a los clientes que reconstruyan en Omni hoy. La API no está disponible, los precios no están publicados y una banda proyectada es una herramienta de planificación, no una señal verde para enviar un refactor. Lo que haríamos ahora mismo es configurar la capa de gateway que permita hacer un A/B de Omni frente a tu pila actual en el momento en que llegue la API. Cachea las llamadas multimodales agresivamente (las entradas de imagen + audio son suficientemente deterministas como para que el caché funcione a menudo), y mantén un feature flag para el nombre del modelo.

¿Construyendo una pila de IA que necesita absorber lanzamientos de modelos sin una reescritura cada seis semanas? Solicita una consulta gratuita y analizaremos dónde encaja Omni (o no encaja).

Preguntas frecuentes

¿Cuánto cuesta la API de Gemini Omni?

A 19 de mayo de 2026, el precio de la API de Gemini Omni no ha sido publicado. La página de precios de Google lista todos los modelos Gemini excepto Omni. Anclados a Veo 3.1 y Gemini 3.5 Flash, las tarifas proyectadas se sitúan en $1,50–$2,50 por 1M de tokens de entrada y $0,20–$0,60 por segundo de vídeo generado. Los números son proyecciones, no tarifas confirmadas.

¿Cuándo se lanzará la API de Gemini Omni?

Google dijo que la API se desplegaría "en las próximas semanas" en I/O 2026 el 19 de mayo. El acceso por Vertex AI suele llegar primero para los nuevos modelos Gemini, con el pago por uso de AI Studio siguiendo unas semanas después. La publicación de lanzamiento oficial es la fuente canónica del calendario. Actualizaremos este artículo el día que se publiquen los precios.

¿Es Gemini Omni más barato que GPT-4o?

Depende de la carga de trabajo. Para salida de vídeo, Omni es la única opción del Big-3 que genera en una sola llamada, ya que GPT-4o no genera vídeo. Para trabajo solo de texto, GPT-4o-mini a $0,15/$0,60 por 1M de tokens supera las tarifas proyectadas de Omni en aproximadamente 3×. Elige el modelo que coincida con las modalidades que tu pipeline realmente produce.

¿Qué reemplaza Gemini Omni en mi pila?

Para flujos de trabajo de vídeo multimodal, Omni reemplaza cuatro llamadas API separadas: Whisper para transcripción, GPT-4o Vision para comprensión de imágenes, GPT-4o para generación de texto y Veo 3.1 para síntesis de vídeo. La mayor ganancia suele ser perder tres SDKs de proveedores, tres SLAs y tres taxonomías de errores, no el ahorro bruto en dólares. Consulta la hoja de cálculo del colapso de pila más arriba para el cálculo por clip.

¿Puedo usar Gemini Omni a través de la API hoy?

No. A 19 de mayo de 2026, el acceso por API todavía no está disponible. El acceso para consumidores ya está activo mediante los planes de la app Gemini: AI Plus a $20/mes, AI Pro a $30/mes y AI Ultra a $100/mes, según el blog de suscripciones de IA de Google. El despliegue de la API vía Vertex AI llega "en las próximas semanas" según la propia redacción de Google.

¿Admite Gemini Omni el ajuste fino?

No está anunciado a fecha de lanzamiento. Veo 3.1 tampoco admite ajuste fino, y Omni está construido sobre la misma base de vídeo, así que da por hecho que no habrá ajuste fino en el lanzamiento. Google históricamente ha añadido ajuste fino a los modelos multimodales unos meses después de la disponibilidad general, así que un calendario de Q3 o Q4 de 2026 es plausible pero no está confirmado.

¿Cómo funciona la facturación de Gemini Omni?

Se proyecta que siga el patrón estándar de Google: tarifas por millón de tokens para la entrada (texto, imagen, audio, fotogramas de vídeo) más facturación por segundo para la salida de vídeo. Es probable que estén disponibles los niveles Batch (descuento típico de ~50%), Flex y Priority, como en otros modelos Gemini. Los precios por nivel de contexto (tarifa 2× superando los 200k tokens) probablemente aplican dado que los fotogramas de vídeo disparan el recuento de tokens rápidamente.

¿Cuál es la diferencia entre Omni Flash y Omni Pro?

Omni Flash es la variante más rápida y económica, limitada a clips de 10 segundos. Omni Pro genera clips más largos con mayor fidelidad a un coste proyectado mayor. Ambas cubren la misma matriz de modalidades (texto, imagen, audio, vídeo como entrada; vídeo como salida hoy). Google llama al límite de 10 segundos de Flash una "decisión de despliegue, no una limitación del modelo", así que es de esperar que se amplíe.

¿Reemplazará Gemini Omni a GPT-4o en mi automatización de Instagram?

Depende de lo que generes. Para Reels (salida de vídeo): sí, eventualmente, ya que Omni es la única opción de una sola llamada para síntesis de vídeo de 30 segundos. Para publicaciones estáticas con pies de foto e hashtags de IA: probablemente no. GPT-4o-mini sigue superando las tarifas proyectadas de Omni en ~3× en coste, y la cadena n8n + GPT-4o-mini ya está probada en producción.

Para terminar

Tres conclusiones clave:

  • El precio de la API de Gemini Omni no está publicado a 19 de mayo de 2026. La fila en la página de precios está en blanco, los planes para consumidores están activos a $20–$100/mes y el acceso por API vía Vertex AI llegará "en las próximas semanas."
  • Banda proyectada: $1,50–$2,50 por 1M de tokens de entrada y $0,20–$0,60 por segundo de vídeo generado, anclados a Veo 3.1 y Gemini 3.5 Flash. Audio de entrada proyectado en $3–$5 por 1M de tokens. Todos los números son proyecciones, no hechos.
  • El ahorro del colapso de pila no siempre son dólares. Es perder 3 proveedores, 3 SDKs y 3 SLAs en una única llamada multimodal. Planifica la migración en torno a la consolidación de proveedores y la latencia, no al coste bruto por clip.

Última verificación: 19 de mayo de 2026 (SLA de actualización: 24 horas después de que Google publique los precios). Actualizaré este artículo el día que Google publique las tarifas de la API. Guárdalo en favoritos.

El equipo editorial de Techsy lleva desde 2024 ejecutando pipelines multimodales con GPT-4o + Veo 3.1 + Whisper. Actualizamos este artículo cuando Google publique los precios de Omni.

Etiquetas

gemini-omni-precios-apigemini-omniprecios-llmia-multimodalvertex-ai

Compartir este artículo

Inicia Tu Proyecto

¿Listo para construir algo extraordinario?

Convirtamos tu visión en realidad. Nuestro equipo está listo para ayudarte a crear software que marque la diferencia.