Techsy
Liên hệ
Bắt đầu
Quay lại Blog
ai-machine-learning

Giá API Gemini Omni: Những Gì Đã Biết, Nó Thay Thế Gì và Chi Phí Ra Sao (Tháng 5/2026)

Viết bởi Techsy Editorial Team
May 19, 2026
24 phút đọc
Mục lục
Giá API Gemini Omni: Những Gì Đã Biết, Nó Thay Thế Gì và Chi Phí Ra Sao (Tháng 5/2026)

Giá API Gemini Omni: Những Gì Đã Biết, Những Gì Được Thay Thế, Và Chi Phí Sẽ Ra Sao (Tháng 5/2026)

Google đã ra mắt Gemini Omni tại I/O 2026 khoảng năm giờ trước, và dòng giá API Gemini Omni trên chính trang giá của Google hiện đang để trống hoàn toàn. Dưới đây là những gì chúng ta biết tính đến hôm nay, phép tính dự báo cho mức giá ngày mai được neo theo Veo 3.1 và Gemini 3.5 Flash, cùng với ngăn xếp bốn mô hình mà Omni gộp lại thành một lời gọi duy nhất. Lần xác minh cuối: 2026-05-19. Tôi sẽ cập nhật bài viết này ngay trong ngày Google công bố mức giá API.

Câu trả lời nhanh: Giá API Gemini Omni vẫn chưa được công bố tính đến ngày 19 tháng 5 năm 2026. Quyền truy cập cho người dùng cá nhân bắt đầu từ $20/tháng (AI Plus), $30/tháng (AI Pro), và $100/tháng (AI Ultra). Việc triển khai API trên Vertex AI dự kiến sẽ diễn ra trong vòng vài tuần tới. Được neo theo Veo 3.1 và Gemini 3.5 Flash, mức giá API dự kiến rơi vào khoảng $1,50–$2,50 cho mỗi 1 triệu token đầu vào và $0,20–$0,60 cho mỗi giây video đầu ra.

Gemini Omni là gì?

Gemini Omni là mô hình đa phương thức "any-to-any" đầu tiên của Google, được công bố tại I/O 2026 vào ngày 19 tháng 5 năm 2026. Nó chấp nhận đầu vào là văn bản, hình ảnh, âm thanh và video, và hiện tại chỉ xuất ra video (đầu ra hình ảnh và âm thanh được hứa hẹn "trong thời gian tới" theo đúng cách diễn đạt của Google). Hai biến thể được phát hành khi ra mắt: Omni Flash cho các đoạn clip nhanh dài 10 giây, và Omni Pro cho đầu ra dài hơn, độ trung thực cao hơn.

Đây là điều khiến nó trở nên thú vị từ góc độ thiết kế stack. Omni không thêm một tính năng vào dòng sản phẩm Gemini. Nó gộp bốn mô hình riêng biệt thành một lời gọi API. Những gì trước đây là tạo văn bản cộng với thị giác máy tính cộng với chuyển giọng nói thành văn bản cộng với tổng hợp video, giờ trở thành một lượt trao đổi duy nhất. Mô hình được xây dựng trên nền tảng video Veo 3.1, vì vậy chuẩn chất lượng video đã được ấn định sẵn (và vâng, mọi đầu ra đều được gắn watermark SynthID, theo thông báo ra mắt Omni của Google).

Một vài chi tiết đáng biết trước khi bạn đọc phần còn lại của bài viết này:

  • Giới hạn clip 10 giây trên Omni Flash là điều mà Google gọi là "quyết định triển khai, không phải giới hạn của mô hình." Hiểu là: nó có thể sẽ được nới rộng.
  • Thẻ mô hình của DeepMind xác nhận đầu vào gồm văn bản + hình ảnh + âm thanh + video, và hiện tại chỉ xuất ra video.
  • Bài phân tích của TechCrunch và chi tiết ra mắt của 9to5Google đều nhận định lộ trình "thêm nhiều phương thức đầu ra hơn, sau này" mới là câu chuyện lớn hơn.

Nếu bạn đến đây để tìm bảng giá, phần tiếp theo chính là phần trung thực mà bạn mong đợi. Nếu bạn đến để xem bài toán dự phóng, hãy nhảy xuống hai phần.

Gemini Omni API hiện có giá bao nhiêu? (Tiết lộ: Vẫn chưa có giá)

Giá Gemini Omni API vẫn chưa được công bố. Trang giá chính thức của Google tại ai.google.dev/gemini-api/docs/pricing (đã xác minh ngày 19 tháng 5 năm 2026) liệt kê mọi mô hình Gemini NGOẠI TRỪ Omni. Dòng đó bị bỏ trống. Quyền truy cập cho người dùng cá nhân đã khả dụng thông qua các gói của ứng dụng Gemini; còn quyền truy cập API qua Vertex AI thì "sẽ ra mắt trong vài tuần tới" theo đúng thông điệp ra mắt của chính Google.

Tôi đã kiểm tra trang giá lúc 8 giờ sáng (giờ ET), rồi kiểm tra lại lúc 1 giờ chiều (giờ ET). Cả hai lần đều cho kết quả giống nhau. Trang liệt kê 14 mô hình Gemini. Omni không nằm trong số đó. Ít nhất là vào lúc này.

Mô hìnhĐầu vào ($/1 triệu token)Đầu ra ($/1 triệu token)Đầu vào âm thanhGhi chú
Gemini 3.5 Flash$1,50$9,00$3,00Đầu vào văn bản/hình ảnh/âm thanh; đầu ra văn bản
Gemini 3.1 Pro$2,00 / $4,00 (>200k)$12,00 / $18,00 (>200k)$3,00Mức giá gấp 2× khi vượt quá 200k ngữ cảnh
Gemini 3.1 Flash-Lite$0,10$0,40$0,30Mô hình production rẻ nhất
Gemini 2.5 Pro$1,25$10,00$3,00Mô hình cũ, vẫn được hỗ trợ
Veo 3.1 (video)không áp dụng$0,40 / giâykhông áp dụngTính phí đầu ra theo giây
Gemini OmniChưa được công bốChưa được công bốkhông áp dụngXem bảng dự báo bên dưới

Nguồn: ai.google.dev/gemini-api/docs/pricing, đã xác minh ngày 19-05-2026.

Những con số duy nhất liên quan đến Omni tồn tại vào lúc này là các gói đăng ký dành cho người dùng cá nhân:

  • AI Plus: $20/tháng
  • AI Pro: $30/tháng
  • AI Ultra: $100/tháng

Blog về các gói đăng ký AI của Google trình bày chi tiết những gì mỗi gói mở khóa. Lộ trình API được chia tách như thường lệ: Vertex AI cho các cam kết doanh nghiệp (nhiều khả năng ra mắt trước), và AI Studio cho hình thức trả phí theo mức sử dụng (thường đi sau vài tuần). Vẫn chưa có thông tin nào về gói miễn phí cho Omni được công bố. Bài phân tích dành cho doanh nghiệp của VentureBeat xác nhận cách diễn đạt "vài tuần tới". Đó là tín hiệu mạnh nhất về mốc thời gian mà chúng ta có được.

Vì vậy, nếu hôm nay bạn tìm kiếm "giá Gemini Omni API" và phải nhảy qua năm thẻ trình duyệt toàn những bảng Gemini 3.1 Pro đã lỗi thời, thì vấn đề không nằm ở bạn. Đơn giản là thông tin giá vẫn chưa được công bố.

Giá API Gemini Omni Thực Tế Sẽ Là Bao Nhiêu? (Bài Toán Dự Báo)

Giá API Gemini Omni dự kiến, được nội suy từ Veo 3.1 ($0,05–$0,60/giây đầu ra) và Gemini 3.5 Flash ($1,50/$9 cho mỗi 1 triệu token): kịch bản thấp $1,50 đầu vào / $0,20/giây đầu ra, kịch bản trung bình $2,00 đầu vào / $0,40/giây đầu ra, kịch bản cao $2,50 đầu vào / $0,60/giây đầu ra cho mỗi 1 triệu token. Đầu vào âm thanh được dự báo ở mức $3–$5 cho mỗi 1 triệu token. Mọi con số ở đây đều là dự báo, chưa được xác nhận.

Đây là cách chúng tôi đi đến kết quả đó. Veo 3.1 hiện tính phí $0,40 mỗi giây video đầu ra, và Omni Pro được xây dựng trên cùng nền tảng video đó. Vì vậy, mức giá theo giây của Omni Pro nhiều khả năng sẽ nằm trong dải giá của Veo 3.1. Chi phí I/O văn bản của Gemini 3.5 Flash là $1,50/$9 cho mỗi triệu token; I/O văn bản của Omni Flash có thể nằm trong khoảng 0,7–1,5 lần mức đó, vì Google từ trước đến nay thường định giá các biến thể Flash đa phương thức mới ở mức gần với phiên bản chỉ có văn bản tương ứng.

Kịch bảnĐầu vào ($/1M)Văn bản đầu ra ($/1M)Video đầu ra ($/giây)Đầu vào âm thanh ($/1M)Mô hình neo
Thấp (dự báo)$1,50$7,00$0,20$3,00Gemini 3.5 Flash + Veo 3.1 Lite
Trung bình (dự báo)$2,00$10,00$0,40$4,00Flash/Pro kết hợp + Veo 3.1 tiêu chuẩn
Cao (dự báo)$2,50$14,00$0,60$5,00Gemini 3.1 Pro + Veo 3.1 tiêu chuẩn

Mọi mức giá tính theo mỗi triệu token trừ khi có ghi chú khác. Đã đối chiếu chéo với bảng giá của OpenAI và bảng giá Claude của Anthropic để xác định giới hạn hợp lý.

Một số điều cần dự kiến ngoài các mức giá cơ bản:

  • Các hạng Batch / Flex / Priority. Mọi mô hình Gemini khác đều cung cấp các hạng này. Batch thường giảm khoảng 50% chi phí; Priority bổ sung đảm bảo độ trễ với mức phí cao hơn. Omni gần như chắc chắn sẽ theo cùng mô hình này.
  • Định giá theo hạng ngữ cảnh. Gemini 3.1 Pro tính phí gấp 2 lần khi vượt quá 200k token. Omni có thể cũng áp dụng quy tắc tương tự, đặc biệt khi số lượng khung hình video đẩy tổng số token tăng nhanh.
  • Mã hóa token đầu vào âm thanh. Âm thanh được tính phí theo token (đã mã hóa), không theo giây. Khoảng 32 token cho mỗi giây âm thanh ở mức giá Gemini hiện tại, vì vậy hãy dự trù ngân sách cho phù hợp. Dựa trên Veo 3.1 và Gemini 3.5 Flash, Omni Flash có khả năng sẽ có giá $1.50–$2.50 cho mỗi triệu token đầu vào và $0.20–$0.60 cho mỗi giây video đầu ra. Chúng tôi đã tính toán con số này hai lần (một lần chỉ dựa trên Veo, một lần kết hợp với Flash) và các khoảng giá vẫn duy trì dưới mức $0.50/giây ở cận trên. Khi Omni ra mắt, bạn sẽ muốn định tuyến các yêu cầu một cách thông minh, và hướng dẫn của chúng tôi về cách giảm chi phí API LLM bao gồm các nội dung về định tuyến qua gateway và các tầng cache đáng để chuẩn bị sẵn từ bây giờ.

"Projected per-1M-token cost (input + output blended)"

Bảng dữ liệu
"Projected per-1M-token cost (input + output blended)"
"USD per 1M tokens"Chuỗi 1
"Gemini Omni (low projection)"3.5
"Gemini Omni (mid projection)"5.5
"Gemini Omni (high projection)"8
"Gemini 2.5 Pro"7
"GPT-4o"12.5
"Claude Sonnet 4.6"9

Khoảng giá dự kiến của Gemini Omni so với mức giá đầu vào/đầu ra kết hợp của các đối thủ tính đến ngày 2026-05-19. Các con số của Omni được nội suy từ Veo 3.1 và Gemini 3.5 Flash; biểu đồ này sẽ được cập nhật ngay trong ngày Google công bố giá.

Gemini Omni thay thế những gì? Bảng tính thu gọn stack

Omni thay thế một pipeline đa mô hình: GPT-4o cho văn bản, GPT-4o Vision cho chấm điểm hình ảnh, Whisper cho phiên âm âm thanh, và Veo 3.1 cho tạo video. Một quy trình video có lời dẫn dài 30 giây điển hình hiện tiêu tốn khoảng $12,27 qua bốn lệnh gọi API. Với mức giá Omni dự kiến theo kịch bản trung bình, cùng quy trình đó giảm xuống còn $4–$18 mỗi clip trong một lệnh gọi duy nhất (vâng, cận trên rộng hơn bạn kỳ vọng, nhưng hãy đọc tiếp).

Trong các pipeline sản xuất của mình, hiện chúng tôi đang chạy chính xác cấu trúc bốn bước này cho các quy trình video giải thích của khách hàng. Đây là nơi tiền được chi hôm nay so với nơi nó sẽ được chi trên Omni Pro ở mức giá dự kiến theo kịch bản trung bình:

BướcMô hình hiện tạiChi phí hiện tạiLệnh gọi OmniChi phí dự kiến
Phiên âm âm thanh đầu vàoWhisper$0,006/phútGộp vào đầu vào của Omniđã bao gồm
Chấm điểm hình ảnh đầu vàoGPT-4o Vision$8 cho 1 triệu token đầu vào (hình ảnh)Gộpđã bao gồm
Tạo phụ đề / kịch bảnGPT-4o$2,50 / $10 cho 1 triệu tokenGộpđã bao gồm
Tạo video 30 giâyVeo 3.1$0,40/giây × 30 = $12,00Omni Pro dự kiến $0,20–$0,60/giây × 30dự kiến $6–$18
Tổng mỗi clip~$12,27dự kiến $4–$18 (dải)

Sơ đồ thể hiện bốn API mô hình riêng biệt (GPT-4o, GPT-4o Vision, Whisper, Veo 3.1) thu gọn thành một lệnh gọi API Gemini Omni duy nhất
Pipeline đa phương thức bốn lệnh gọi thu gọn thành một lệnh gọi Omni

Đây là lưu ý thành thật. Ở cận trên của dải dự kiến, Omni Pro thực tế có thể đắt hơn mỗi clip so với pipeline bốn nhà cung cấp hiện tại. Đầu ra video là khoản chi phí chiếm ưu thế, và nếu Google định giá Omni Pro ở mức đầy đủ $0,40+/giây của Veo 3.1 (cộng thêm phần tăng giá token đầu vào cho ngữ cảnh đa phương thức), các quy trình nặng về video có thể chưa thấy tiết kiệm chi phí trong ngày đầu tiên.

Vậy khoản tiết kiệm thực sự đến từ đâu? Mẹo hay: nếu bạn đang trả tiền cho Whisper + Vision + GPT-4o + Veo 3.1 hôm nay, lợi ích thực sự của bạn từ Omni không phải lúc nào cũng là đô la. Đó là loại bỏ 3 nhà cung cấp, 3 SDK và 3 SLA trong một lệnh gọi duy nhất. Đó là phần mà CTO sẽ phê duyệt, chứ không phải bài toán chi phí mỗi clip. Độ trễ giảm, mã xử lý lỗi thu hẹp, và logic thử lại của bạn không còn phân nhánh qua bốn hệ phân loại lỗi. Khi API gặp sự cố, bạn sẽ muốn A/B test Omni với stack hiện tại bằng cách mirror traffic, chứ không phải chuyển đổi đột ngột. Hướng dẫn GPT-4o Responses API trình bày chi tiết chính xác stack đa phương thức mà Omni được thiết kế để hợp nhất, và một LLM gateway giúp việc thử nghiệm song song trở nên đơn giản mà không cần viết lại mọi call site.

Gemini Omni có đáng dùng cho tự động hóa Instagram không?

Với tự động hóa Instagram chỉ tạo caption, GPT-4o-mini ở mức $0.15/$0.60 cho mỗi 1M token vẫn rẻ hơn so với mức giá dự kiến của Omni: khoảng $1.60 cho 100 bài đăng so với $4–$10 cho 100 bài đăng theo kịch bản trung bình của Omni. Omni thắng thế khi quy trình của bạn còn tạo cả hình ảnh hoặc video. Với caption chỉ dạng văn bản cho ảnh có sẵn, hãy gắn bó với chuỗi GPT-4o-mini. Đây không phải câu trả lời phù hợp cho mọi trường hợp.

Quy trình mà hầu hết các indie hacker đang chạy hiện nay là mẫu tự động hóa Instagram trên n8n: n8n + tạo caption bằng GPT-4o-mini + chấm điểm ảnh bằng GPT-4o Vision + tạo hashtag bằng GPT-4o-mini + đăng bài qua Buffer. Con số thực tế cho mỗi 100 bài đăng hiện nay:

  • Caption (GPT-4o-mini, ~500 token đầu vào / 100 đầu ra × 100 bài): ~$0.30
  • Chấm điểm ảnh bằng Vision (GPT-4o Vision, 1 ảnh × 100 bài): ~$1.20
  • Tạo hashtag (GPT-4o-mini, ~200 token × 100): ~$0.10
  • Tổng cộng: ~$1.60 cho 100 bài đăng chi phí API thuần

Với mức giá Omni dự kiến theo kịch bản trung bình (một lệnh gọi đa phương thức duy nhất mỗi bài: đầu vào là ảnh cộng với tạo văn bản, đầu ra chỉ văn bản, không cần video cho các bài đăng Instagram tĩnh), bạn sẽ rơi vào khoảng $4–$10 cho 100 bài đăng. Mức này đắt hơn 2.5–6 lần so với chuỗi GPT-4o-mini cho cùng một kết quả đầu ra.

Đánh giá thẳng thắn: nếu bạn đang tạo Instagram Reels (video), Omni là lựa chọn hiển nhiên ngay khi API ra mắt vì không có giải pháp thay thế nào xuất ra video 30 giây chỉ trong một lệnh gọi. Nếu bạn đăng ảnh tĩnh kèm caption do AI tạo, GPT-4o-mini vẫn thắng về chi phí với mức ~3 lần. Đừng chuyển đổi chỉ vì muốn chuyển đổi.

"Cost per 100 Instagram posts (caption + image scoring + hashtags)"

Bảng dữ liệu
"Cost per 100 Instagram posts (caption + image scoring + hashtags)"
"Stack"Chuỗi 1
"GPT-4o-mini chain (today)"1.6
"Gemini 2.5 Flash-Lite chain"1.2
"Gemini Omni (projected mid)"6
"GPT-4o full chain"11.4

Với các bài đăng Instagram tĩnh, GPT-4o-mini vẫn thắng về chi phí. Omni chỉ vươn lên dẫn trước khi cần đầu ra video. Con số dự kiến của Omni được neo theo mức giá kịch bản trung bình (kết hợp Veo 3.1 + Gemini 3.5 Flash) tính đến ngày 19-05-2026. Nếu bạn mới bắt đầu xây dựng các pipeline này, hướng dẫn về AI agent trong n8n sẽ giúp bạn nắm vững những kiến thức cơ bản. Với các quy trình làm việc của agency có khối lượng xử lý lớn hơn, các mẫu tự động hóa quy trình AI cho doanh nghiệp sẽ bao quát logic định tuyến mà Omni sẽ được ghép vào.

Gemini Omni vs GPT-4o vs Claude Sonnet 4.6: So sánh thẳng thắn

So sánh Gemini Omni với GPT-4o và Claude Sonnet 4.6 ở thời điểm hiện tại là khập khiễng. Omni xuất ra video (các model khác thì không), GPT-4o xử lý âm thanh thời gian thực (Omni thì chưa), còn Claude có cửa sổ ngữ cảnh lớn nhất cho công việc với tài liệu dài. Câu hỏi đúng đắn là điểm mạnh của model nào phù hợp với khối lượng công việc của bạn, chứ không phải model nào rẻ nhất.

Tính năngGemini Omni (dự kiến)GPT-4oClaude Sonnet 4.6
Đầu vào đa phương thứcvăn bản + hình ảnh + âm thanh + videovăn bản + hình ảnh + âm thanhvăn bản + hình ảnh
Đầu ra đa phương thứcvideo (hình ảnh/âm thanh sau này)văn bản + âm thanh (thời gian thực)văn bản
Âm thanh thời gian thựcKhôngCóKhông
Cửa sổ ngữ cảnh1M (mặc định của dòng Gemini)128k1M
Giá (đầu vào/đầu ra mỗi 1M)dự kiến $1,50–$2,50 / $7–$14$2,50 / $10$3 / $15
Khả dụng API hiện tạiKhông (vài tuần tới)CóCó

Nguồn giá được lấy từ bảng giá của OpenAI và bảng giá của Claude, xác minh ngày 19-05-2026.

Omni không thắng GPT-4o hay Claude về giá. Nó thắng ở độ phủ phương thức. Nếu bạn cần đầu ra video ngay hôm nay, Omni là lựa chọn duy nhất trong Big-3 (Veo 3.1 vẫn vượt trội về video thuần túy, nhưng Omni bổ sung thêm lớp đầu vào đa phương thức). Nếu bạn cần giọng nói thời gian thực, GPT-4o vẫn thống trị mảng đó. Nếu bạn cần cửa sổ ngữ cảnh 1M token cho quy trình làm việc với tài liệu, Claude Opus 4.7 đã mở rộng mọi thứ xa hơn. Và với công việc xử lý hàng loạt nhạy cảm về chi phí, các lựa chọn thay thế mã nguồn mở đa phương thức đáp ứng cùng nhu cầu với chi phí mỗi token bằng không (đổi lại là những đánh đổi về thiết lập và chi phí GPU).

Khi nào KHÔNG nên dùng Gemini Omni

Hãy bỏ qua Gemini Omni đối với các quy trình chỉ xử lý văn bản (RAG, phân loại, chat), các pipeline có khối lượng lớn nhưng biên lợi nhuận thấp (hãy dùng Gemini 2.5 Flash-Lite hoặc GPT-4o-mini với chi phí thấp hơn 10–50 lần), các ứng dụng giọng nói thời gian thực (GPT-4o Realtime vẫn đang thống lĩnh mảng này), hoặc bất kỳ tác vụ nào cần fine-tuning. Omni dành cho những công việc mà đa phương thức CHÍNH LÀ giá trị cốt lõi, chứ không phải một cách rẻ hơn để chạy chatbot.

Cụ thể, hãy bỏ qua Omni nếu:

  • Tác vụ của bạn chỉ toàn văn bản và có khối lượng lớn: hãy dùng Gemini 2.5 Flash-Lite ($0.10/$0.40) hoặc GPT-4o-mini ($0.15/$0.60)
  • Bạn cần giọng nói thời gian thực: GPT-4o Realtime vẫn là lựa chọn đáng dùng
  • Bạn cần fine-tuning: Veo 3.1 không hỗ trợ tính năng này, và Omni được xây dựng trên cùng nền tảng, vì vậy hãy xem như sẽ không có fine-tuning khi ra mắt
  • Bạn cần xuất hình ảnh ngay từ bây giờ: Imagen 4 hoặc DALL-E 3 (khi ra mắt, Omni xuất video chứ không xuất hình ảnh)
  • Bạn cần xuất âm thanh ngay từ bây giờ: ElevenLabs, OpenAI TTS hoặc Gemini TTS, vì đầu ra âm thanh của Omni sẽ có "sau"
  • Bạn cần các đoạn video dài hơn 10 giây trên Flash: hãy đợi hạng Pro hoặc dùng trực tiếp Veo 3.1
  • UX của bạn cần phản hồi dưới một giây: các lệnh gọi đa phương thức chậm hơn so với chỉ văn bản; hãy dự trù thêm độ trễ

Trước khi thay thế dù chỉ một lệnh gọi production, hãy đánh giá Omni so với stack hiện tại của bạn bằng một bộ eval dùng chung. Omni là lựa chọn sai lầm cho chatbot, phân loại và RAG. Đây là mô hình dành cho công việc đa phương thức, không phải mô hình token giá rẻ.

Bảng tra cứu nhanh về di chuyển: Từ nhiều lời gọi sang một lời gọi Omni duy nhất

Khi API ra mắt, việc di chuyển từ quy trình 4 lời gọi sang một lời gọi Omni duy nhất chỉ là thay đổi khoảng 15 dòng mã. Hình dạng bên dưới là mã giả. Chữ ký SDK thực tế sẽ có cùng với API. Quy ước đặt tên của Google gợi ý gemini-omni-flash và gemini-omni-pro dựa trên mẫu Veo 3.1.

Hiện tại: bốn lời gọi riêng biệt qua hai nhà cung cấp.

python
# HÔM NAY: bốn lời gọi API, hai nhà cung cấp, bốn hệ thống phân loại lỗi
from openai import OpenAI
from google import genai

openai = OpenAI()
google = genai.Client()

transcript = openai.audio.transcriptions.create(model="whisper-1", file=audio)
vision = openai.chat.completions.create(model="gpt-4o", messages=[
    {"role": "user", "content": [{"type": "image_url", "image_url": image_url}]}])
caption = openai.chat.completions.create(model="gpt-4o", messages=[
    {"role": "user", "content": f"Caption for {vision.choices[0].message.content}"}])
video = google.models.generate_videos(model="veo-3.1", prompt=caption.choices[0].message.content)

Tomorrow (projected): one call to Omni.

python
# DỰ KIẾN: một lời gọi Omni duy nhất (mã giả — SDK thực sẽ ra mắt cùng API)
from google import genai

client = genai.Client()
response = client.models.generate_content(
    model="gemini-omni-flash",  # or "gemini-omni-pro" for longer clips
    contents=[text_prompt, image, audio, video_reference],
    config={"output_modality": "video", "duration_seconds": 10}
)

Khi API được phát hành, việc chuyển đổi chủ yếu chỉ là xóa bớt code. Hãy để ý tên mô hình vào ngày ra mắt, và gán nó vào một hằng số để bạn có thể chuyển đổi giữa omni-flash và omni-pro tùy theo từng workload mà không cần chạm vào các điểm gọi. Mẫu Python SDK hiện tại của Gemini đã hỗ trợ nội dung đa phương thức, nên cấu trúc bên trên sẽ tích hợp vào một cách liền mạch.

Cách Techsy nhìn nhận về việc di chuyển sang Omni

Khi đánh giá bất kỳ cuộc chuyển đổi ngăn xếp mô hình nào cho khách hàng, chúng tôi đều đặt ra ba câu hỏi: ngân sách độ trễ là bao nhiêu, mô hình mới có bao phủ các phương thức mà khối lượng công việc của bạn thực sự sử dụng hay không, và liệu lợi ích từ việc hợp nhất nhà cung cấp có xứng đáng với chi phí tái thiết kế hay không? Hai trong số đó thường tự có câu trả lời; câu hỏi thứ ba mới là nơi hầu hết các cuộc di chuyển bị thuyết phục triển khai vì những lý do sai lầm.

Chúng tôi không khuyến nghị khách hàng tái thiết kế trên Omni vào lúc này. API vẫn chưa ra mắt, giá cả chưa được công bố, và một dải dự báo là công cụ lập kế hoạch, chứ không phải đèn xanh để triển khai một bản tái cấu trúc. Điều chúng tôi sẽ làm ngay bây giờ là thiết lập lớp cổng (gateway) cho phép bạn thử nghiệm A/B giữa Omni và ngăn xếp hiện tại ngay khi API ra mắt. Hãy cache mạnh mẽ các lời gọi đa phương thức (đầu vào hình ảnh + âm thanh đủ tính xác định để thường xuyên trúng cache), và giữ một cờ tính năng (feature flag) cho tên mô hình.

Bạn đang xây dựng một ngăn xếp AI cần tiếp nhận các đợt ra mắt mô hình mà không phải viết lại mỗi sáu tuần một lần? Nhận tư vấn miễn phí và chúng tôi sẽ kiểm chứng xem Omni phù hợp ở đâu (hoặc không phù hợp ở đâu).

Câu hỏi thường gặp

API Gemini Omni có giá bao nhiêu?

Tính đến ngày 19 tháng 5 năm 2026, bảng giá của API Gemini Omni vẫn chưa được công bố. Trang giá của Google liệt kê mọi mô hình Gemini ngoại trừ Omni. Dựa trên mức giá của Veo 3.1 và Gemini 3.5 Flash, mức giá dự kiến nằm trong khoảng 1,50–2,50 USD cho mỗi 1 triệu token đầu vào và 0,20–0,60 USD cho mỗi giây video đầu ra. Các con số này là dự báo, không phải mức giá đã được xác nhận.

Khi nào Gemini Omni API ra mắt?

Google cho biết API sẽ được phát hành "trong vài tuần tới" tại sự kiện I/O 2026 vào ngày 19 tháng 5. Quyền truy cập Vertex AI thường được triển khai trước đối với các mô hình Gemini mới, sau đó vài tuần mới đến lượt AI Studio với hình thức trả phí theo mức sử dụng. Bài đăng ra mắt chính thức là nguồn thông tin chính thức về mốc thời gian. Chúng tôi sẽ cập nhật bài viết này ngay trong ngày mức giá được công bố.

Gemini Omni có rẻ hơn GPT-4o không?

Tùy thuộc vào khối lượng công việc. Đối với đầu ra video, Omni là lựa chọn duy nhất trong nhóm Big-3 cung cấp khả năng tạo sinh chỉ trong một lần gọi, vì GPT-4o không xuất ra video. Đối với công việc chỉ có văn bản, GPT-4o-mini với mức giá $0.15/$0.60 cho mỗi 1M token rẻ hơn khoảng 3 lần so với mức giá dự kiến của Omni. Hãy chọn mô hình phù hợp với các phương thức mà quy trình của bạn thực sự tạo ra.

Gemini Omni thay thế những gì trong stack của tôi?

Đối với quy trình làm việc video đa phương thức, Omni thay thế bốn lệnh gọi API riêng biệt: Whisper cho việc chuyển đổi giọng nói thành văn bản, GPT-4o Vision cho việc nhận diện hình ảnh, GPT-4o cho việc tạo văn bản, và Veo 3.1 cho việc tổng hợp video. Lợi ích lớn nhất thường là loại bỏ được ba bộ SDK của nhà cung cấp, ba thỏa thuận SLA và ba hệ thống phân loại lỗi, chứ không phải tiết kiệm chi phí trực tiếp. Xem bảng tính thu gọn stack ở trên để biết tính toán chi tiết cho từng clip.

Hiện tại tôi có thể sử dụng Gemini Omni qua API không?

Không. Tính đến ngày 19 tháng 5 năm 2026, quyền truy cập API vẫn chưa khả dụng. Người dùng cá nhân có thể truy cập thông qua các gói của ứng dụng Gemini: AI Plus với giá 20 đô la/tháng, AI Pro với giá 30 đô la/tháng và AI Ultra với giá 100 đô la/tháng, theo blog về gói đăng ký AI của Google. Việc triển khai API qua Vertex AI sẽ "diễn ra trong vài tuần tới" theo chính cách diễn đạt của Google.

Gemini Omni có hỗ trợ fine-tuning không?

Tính đến ngày ra mắt, chưa có thông báo chính thức. Veo 3.1 cũng không hỗ trợ fine-tuning, và Omni được xây dựng trên cùng nền tảng video đó, nên có thể giả định rằng sẽ không có fine-tuning khi ra mắt. Google trước đây thường bổ sung khả năng fine-tuning cho các mô hình đa phương thức vài tháng sau khi phát hành rộng rãi, vì vậy mốc thời gian Q3 hoặc Q4 năm 2026 là hợp lý nhưng chưa được xác nhận.

Gemini Omni được tính phí như thế nào?

Dự kiến sẽ tuân theo mô hình tiêu chuẩn của Google: mức giá theo mỗi triệu token cho đầu vào (văn bản, hình ảnh, âm thanh, khung hình video) cộng với tính phí theo giây cho đầu ra video. Các cấp Batch (thường giảm giá khoảng 50%), Flex và Priority có thể sẽ khả dụng giống như các mô hình Gemini khác. Mức giá theo ngữ cảnh (gấp 2 lần khi vượt quá 200k token) có thể sẽ được áp dụng do các khung hình video làm tăng số lượng token rất nhanh.

Omni Flash và Omni Pro khác nhau ở điểm nào?

Omni Flash là phiên bản nhanh hơn, chi phí thấp hơn, được giới hạn ở các đoạn video dài 10 giây. Omni Pro xử lý các đoạn video dài hơn với độ trung thực cao hơn, đi kèm mức chi phí dự kiến cao hơn. Cả hai đều hỗ trợ cùng một ma trận phương thức (đầu vào gồm văn bản, hình ảnh, âm thanh, video; đầu ra hiện tại là video). Google gọi giới hạn 10 giây của Flash là "quyết định triển khai, không phải giới hạn của mô hình," vì vậy hãy kỳ vọng giới hạn này sẽ được mở rộng.

Gemini Omni có thay thế GPT-4o trong quy trình tự động hóa Instagram của tôi không?

Tùy thuộc vào những gì bạn tạo ra. Đối với Reels (đầu ra video): có, sớm hay muộn, vì Omni là lựa chọn gọi một lần duy nhất để tổng hợp video 30 giây. Đối với các bài đăng tĩnh có chú thích và hashtag do AI tạo: có lẽ là không. GPT-4o-mini vẫn đánh bại mức giá dự kiến của Omni khoảng 3 lần về chi phí, và chuỗi n8n + GPT-4o-mini đã được kiểm chứng thực tế trong môi trường production.

Tổng kết

Ba điều cần ghi nhớ:

  • Giá API Gemini Omni chưa được công bố tính đến ngày 19 tháng 5 năm 2026. Dòng giá trên trang định giá vẫn để trống, các gói dành cho người dùng cá nhân đã hoạt động ở mức $20–$100/tháng, và quyền truy cập API qua Vertex AI sẽ ra mắt "trong vài tuần tới."
  • Khoảng dự báo: $1,50–$2,50 cho mỗi 1 triệu token đầu vào và $0,20–$0,60 cho mỗi giây video đầu ra, được neo theo Veo 3.1 và Gemini 3.5 Flash. Đầu vào âm thanh được dự báo ở mức $3–$5 cho mỗi 1 triệu token. Tất cả các con số đều là dự báo, không phải sự thật.
  • Khoản tiết kiệm từ việc gộp chồng công nghệ không phải lúc nào cũng tính bằng đô la. Đó là việc loại bỏ 3 nhà cung cấp, 3 SDK và 3 SLA trong một lời gọi đa phương thức duy nhất. Hãy lên kế hoạch di trú xoay quanh việc hợp nhất nhà cung cấp và độ trễ, chứ không phải chi phí thô $/clip.

Xác minh lần cuối: 2026-05-19 (SLA cập nhật: 24 giờ sau khi Google công bố giá). Tôi sẽ cập nhật bài viết này ngay trong ngày Google công bố giá API. Hãy đánh dấu trang.

Đội ngũ biên tập của Techsy đã vận hành các pipeline đa phương thức trên GPT-4o + Veo 3.1 + Whisper từ năm 2024. Chúng tôi cập nhật bài viết này khi Google công bố giá Omni.

Thẻ

giá gemini omni apigemini omnigiá llmai đa phương thứcvertex ai

Chia sẻ bài viết này

Bài viết liên quan

Thêm từ chuyên mục ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 Đã Ra Mắt: Trí Tuệ Gần Bằng Fable 5 Với Nửa Giá

Anthropic đã phát hành Claude Opus 5 vào ngày 24 tháng 7 năm 2026. Nó đạt điểm cao hơn gấp đôi Opus 4.8 trên Frontier-Bench và giữ nguyên mức giá của Opus, nhưng lại thua Fable 5 và Mythos 5 ở một vài bài kiểm tra. Dưới đây là bảng benchmark, mức giá và khuyến nghị nên chuyển đổi, chờ đợi hay giữ nguyên.

10 min read phút đọc
Đọc
ai-machine-learning
Jul 20, 2026

8 API Web Scraping AI Tốt Nhất Năm 2026 (Đã Kiểm Thử Trên Chính Agent Stack Của Chúng Tôi)

Chúng tôi đã kiểm thử 8 API web scraping AI với mức giá thực tế năm 2026 được kéo qua chính agent stack của mình. Firecrawl, Bright Data, ScrapingBee và 5 công cụ khác, xếp hạng theo đầu ra sẵn sàng cho LLM, khả năng vượt anti-bot và hỗ trợ MCP.

9 min read phút đọc
Đọc
ai-machine-learning
Jul 20, 2026

Kỹ thuật Prompt cho Lập trình: 7 Mẫu Chúng Tôi Dùng Hàng Ngày trong Claude Code và Cursor (2026)

Hầu hết các bài viết về 'prompt lập trình AI' chỉ đưa cho bạn 50 mẫu để sao chép. Bài này dạy 7 mẫu chúng tôi dùng mỗi ngày để vận hành quy trình Claude Code gồm 16 agent, với ví dụ thực tế trước-và-sau cho từng mẫu, cùng vị trí áp dụng từng mẫu trong Claude Code, Cursor và Copilot năm 2026.

11 min read phút đọc
Đọc
Xem tất cả bài viết
Khởi động dự án của bạn

Sẵn sàng tạo nên điều gì đó đột phá?

Hãy biến tầm nhìn của bạn thành hiện thực. Đội ngũ của chúng tôi sẵn sàng đồng hành cùng bạn tạo ra phần mềm tạo nên sự khác biệt.

Đặt lịch gọi ý tưởng 30 phútXem dự án của chúng tôi

Công cụ hot trong kho

Claude Skills

Xem tất cả
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Tự động hoá AI

Xem tất cả
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Công cụ hot trong kho

Claude Skills

Xem tất cả
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Tự động hoá AI

Xem tất cả
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Dịch vụ

  • Giải pháp doanh nghiệp
  • Ứng dụng di động
  • Ứng dụng web

Giải pháp

  • Hệ thống CRM
  • Tích hợp AI
  • Giải pháp ERP
  • Voice Agent
  • Tự động hóa quy trình
  • Bảo mật thông tin

Thư viện

  • Blog
  • Dự án

Cộng đồng

  • Tự động hoá AI
  • Claude Skills

Công cụ

  • Tính phí làm ứng dụng mobile
  • Tính phí dùng OpenAI / LLM API
  • Tính phí làm MVP
  • Tính phí làm Voice AI Agent

Công ty

  • Giới thiệu
  • Cộng sự
  • Liên hệ

Pháp lý

  • Chính sách quyền riêng tư
  • Điều khoản dịch vụ
  • Chính sách cookie

Dịch vụ

  • Giải pháp doanh nghiệp
  • Ứng dụng di động
  • Ứng dụng web

Giải pháp

  • Hệ thống CRM
  • Tích hợp AI
  • Giải pháp ERP
  • Voice Agent
  • Tự động hóa quy trình
  • Bảo mật thông tin

Thư viện

  • Blog
  • Dự án

Cộng đồng

  • Tự động hoá AI
  • Claude Skills

Công cụ

  • Tính phí làm ứng dụng mobile
  • Tính phí dùng OpenAI / LLM API
  • Tính phí làm MVP
  • Tính phí làm Voice AI Agent

Công ty

  • Giới thiệu
  • Cộng sự
  • Liên hệ
Pháp lýChính sách quyền riêng tưĐiều khoản dịch vụChính sách cookie
TECHSY
© 2026 Techsy. Bảo lưu mọi quyền.