
Dịch vụ phát triển AI agent năm 2026: Chi phí thực tế, stack, và những lúc không nên thuê
Cập nhật ngày 22 tháng 4 năm 2026. Techsy xây dựng AI agent cho khách hàng, bao gồm workflow agent bằng LangGraph, prototype bằng OpenAI Agents SDK, và hệ thống doanh nghiệp tích hợp MCP. Hướng dẫn này được viết từ phía người xây dựng, không phải phía người mua. Đã được đội ngũ kỹ thuật của chúng tôi review.
Hầu hết các bài hướng dẫn về dịch vụ phát triển AI agent đều là trang bán hàng của vendor đội lốt cẩm nang mua sắm. Bài này thì không. Bạn sẽ nhận được các khoảng chi phí thực tế của năm 2026, stack mà chúng tôi thực sự dùng để bàn giao, và năm tình huống mà thuê agency là một quyết định sai — ngay cả khi agency sẵn sàng nhận lời.
Phát triển AI agent thực sự bao gồm những gì
Phát triển AI agent là quá trình xây dựng các hệ thống vận hành bằng LLM, có khả năng tự chủ theo đuổi mục tiêu thông qua lập kế hoạch, gọi tool, sử dụng bộ nhớ và tự sửa lỗi — chứ không chỉ trả lời prompt. Một dự án phát triển AI agent theo yêu cầu thường bao gồm sáu giai đoạn: khám phá (discovery), kiến trúc, xây dựng, đánh giá (eval), triển khai và vận hành. Sản phẩm cuối cùng là phần mềm production, không phải bản demo.
Ranh giới giữa chatbot và agent liên tục bị làm mờ, nên hãy vạch rõ nó ra. Chatbot phản ứng: bạn gửi tin nhắn, nó trả lời. Agent theo đuổi mục tiêu: bạn giao cho nó một kết quả cần đạt, rồi nó lập kế hoạch các bước, gọi tool, đọc từ bộ nhớ, kiểm tra lại việc của chính mình, và lặp vòng cho đến khi mục tiêu hoàn thành (hoặc thất bại đủ "ồn ào" để con người can thiệp). Bài viết Building Effective Agents của Anthropic đến nay vẫn là cách diễn đạt rõ ràng nhất từ góc nhìn người làm nghề về sự phân biệt này mà chúng tôi từng đọc.
Điều gì khiến một hệ thống được gọi là "agent" thay vì chatbot
Sau khi đưa các hệ thống agent vào production ở một vài ngành dọc, đây là năm đặc điểm định nghĩa mà chúng tôi tìm kiếm:
- Tính tự chủ: nó tự quyết định bước tiếp theo mà không cần con người nhắc lệnh cho từng hành động
- Sử dụng tool: nó gọi API, cơ sở dữ liệu và các dịch vụ, chứ không chỉ gọi model
- Bộ nhớ: ngắn hạn (context), ngữ nghĩa (vector store) và tình huống (lịch sử)
- Lập kế hoạch: nó phân rã mục tiêu thành các bước nhỏ có thứ tự
- Tự sửa lỗi: nó phát hiện được thất bại và thử lại hoặc leo thang xử lý
Nếu "agent" của bạn thiếu ba trong số này, thì thứ bạn có chỉ là một chatbot với system prompt xịn hơn. Hãy đọc bài viết rộng hơn của chúng tôi về use case AI agent cho doanh nghiệp nếu bạn muốn tìm cảm hứng use case trước khi viết spec cho dự án.
Vòng đời phát triển 6 giai đoạn
Mọi dự án agent nghiêm túc đều đi qua các giai đoạn giống nhau, gần như theo đúng thứ tự:
- Khám phá (Discovery): định hình bài toán, kiểm toán dữ liệu, chỉ số thành công
- Kiến trúc: planner, schema tool, mô hình bộ nhớ agent
- Xây dựng (Build): prompt, kết nối tool, điều phối (orchestration)
- Đánh giá (Evals): bộ dữ liệu vàng (golden dataset), LLM-as-judge, phân loại lỗi
- Triển khai (Deploy): observability, guardrail, giới hạn tốc độ (rate limit), quản lý secrets
- Vận hành (Operate): giám sát, cải tiến lặp, tối ưu chi phí
Thêm một cách phân loại nữa: custom AI agent development (phát triển agent theo yêu cầu) và agent trên nền tảng (Zapier Agents, Relevance AI, Dust). Nền tảng rất tuyệt khi use case của bạn phổ biến và có ít tích hợp. Custom thắng thế ngay khi bạn có yêu cầu tuân thủ, workflow đặc thù, hoặc từ ba hệ thống cần tích hợp trở lên. Chúng tôi sẽ nói kỹ hơn về quyết định này ngay sau đây.
Khi nào bạn nên thuê một agency phát triển AI agent
Hãy thuê agency phát triển AI agent khi bạn cần độ tin cậy cấp production mà team của bạn chưa từng đưa agent nào vào sản xuất, khi bạn có từ ba tích hợp doanh nghiệp trở lên với xác thực phức tạp, khi bạn cần voice agent, khi bạn hoạt động trong ngành bị quản lý chặt, hoặc khi bạn cần bàn giao trong vòng chưa đầy 90 ngày mà không có kỹ sư AI cấp cao nào trong biên chế. Nếu không, hãy giữ việc này trong nội bộ.
Cụ thể, đây là năm kịch bản mà agency xứng đáng với số tiền bạn bỏ ra:
- Bạn cần độ tin cậy cấp production. Evals, observability, guardrail, uptime. Nếu team của bạn mới xây prototype mà chưa từng bàn giao một agent nào mà người ta thực sự phụ thuộc vào, thì phần gia cố chính là nơi dự án chết yểu.
- Bạn có từ 3 tích hợp doanh nghiệp trở lên với độ phức tạp về xác thực. CRM, ERP, ticketing, định danh. Mỗi thứ là một cái hang thỏ. Vendor có kinh nghiệm sẽ có sẵn các pattern dựng trước cho OAuth, SSO và service account trên những hệ thống quen mặt.
- Bạn cần voice agent. Triển khai cho tổng đài, SDR hay IVR là một lĩnh vực chuyên sâu (ngân sách độ trễ, barge-in, tinh chỉnh ASR, điện thoại). Riêng với nhóm này, chúng tôi khuyên bạn tìm đến agency AI SDR chuyên sâu hoặc đối tác voice agent doanh nghiệp thay vì một agency đa năng.
- Bạn hoạt động trong ngành bị quản lý chặt. Các ràng buộc HIPAA, SOX, GDPR hay cư trú dữ liệu sẽ thay đổi kiến trúc hệ thống. Bạn cần một vendor đã từng trải qua các cuộc review bảo mật như vậy.
- Bạn cần bàn giao trong vòng dưới 90 ngày mà không có kỹ sư agent cấp cao trong biên chế. Tuyển một kỹ sư agent cấp cao năm 2026 là bài toán 4-6 tháng. Agency là con đường nhanh.
Nếu bạn là người mua phía doanh nghiệp, có một số điều thay đổi bất kể bạn thuộc kịch bản nào: bộ phận mua sắm muốn SOC 2, an ninh muốn mô hình hóa mối đe dọa, IT muốn SSO và SCIM, còn pháp chế muốn có DPA trước cả cuộc họp kickoff. Gartner đã xếp agentic AI vào nhóm xu hướng công nghệ chiến lược hàng đầu cho năm 2026 chính xác là vì các pattern tích hợp doanh nghiệp này đang trưởng thành thành những triển khai thực sự (xem xu hướng 2026 của Gartner). Nếu phạm vi của bạn là tự động hóa workflow liên phòng ban, bài viết của chúng tôi về tự động hóa workflow AI doanh nghiệp bao quát các pattern triển khai mà chúng tôi thấy hiệu quả.
Một lưu ý thực tế về AI voice agent development: tổng đài hiện là triển khai agent có ROI cao nhất mà chúng tôi thấy. Một voice agent được xây tốt có thể giảm tải 30-60% cuộc gọi cấp 1. Nếu đó là use case của bạn, hãy lập ngân sách nghiêm túc. Voice làm tăng 40-60% chi phí so với một text agent tương đương.
Khi nào bạn KHÔNG nên thuê agency phát triển AI agent
Hãy bỏ qua agency nếu định nghĩa bài toán của bạn còn mơ hồ, không ai trong nội bộ đứng ra chịu trách nhiệm dự án, bạn không thể nêu được chỉ số thành công dưới dạng con số, workflow nền tảng đang được thiết kế lại trong quý này, hoặc dự án tồn tại chỉ vì ban quản trị hỏi "câu chuyện AI của chúng ta là gì?" Trong cả năm trường hợp, điều rẻ nhất bạn có thể làm là trì hoãn 60 ngày và sửa điều kiện tiên quyết. Điều đắt nhất là cứ thuê bằng được.
Đây là chi tiết năm yếu tố loại trừ. Nếu bất kỳ yếu tố nào đang đúng với bạn lúc này, thì không vendor nào (kể cả chúng tôi) cứu được dự án.
- Định nghĩa bài toán không rõ ràng. Nếu bạn không thể viết tiêu chí thành công trong một câu ("agent tự xử lý trọn vẹn ít nhất 40% ticket đổi trả từ đầu đến cuối không cần con người can thiệp"), thì không vendor nào bàn giao được. Bản demo trông sẽ ổn, còn kết quả production sẽ chỉ khiến mọi người nhún vai. Hãy chốt kỹ bài toán trước khi phát RFP.
- Không có một người chịu trách nhiệm duy nhất trong nội bộ. Dự án agent động chạm đến dữ liệu, hệ thống, vận hành, bảo mật và tuân thủ. Nếu không có một người được chỉ đích danh trong công ty bạn chịu trách nhiệm về kết quả và có thẩm quyền gỡ vướng cho cả năm nhóm đó, dự án sẽ đình trệ ngay tuần sau khi bàn giao. Vendor nào cũng từng chứng kiến kịch bản này diễn ra.
- Không có tiêu chí thành công đo lường được. Nếu "hoạt động tốt" không được định nghĩa bằng con số (tỷ lệ ảo giác, độ chính xác gọi tool, tỷ lệ giảm tải, độ trễ phản hồi, tỷ lệ xử lý thành công), bạn sẽ không thể đánh giá được bất kỳ ai bàn giao thứ gì. Bạn sẽ cãi nhau về cảm tính trên Slack cho đến khi có ai đó bị sa thải. Loạt bài liên tục của MIT Sloan Management Review về kết quả AI doanh nghiệp đặt tỷ lệ thất bại ở mức trên 80%, một pattern mà nghiên cứu AI tại nơi làm việc năm 2024 của BCG cũng ghi nhận, và tiêu chí thành công mơ hồ là nguyên nhân đóng góp lớn nhất.
- Workflow đang biến động. Nếu quy trình con người nền tảng đang được thiết kế lại ngay lúc này (công cụ mới, cơ cấu team mới, SOP mới), thì xây agent trên đó chẳng khác nào xây trên cát. Hãy đợi bụi lắng, rồi tự động hóa phiên bản đã ổn định. Ba tháng kiên nhẫn tiết kiệm được chín tháng làm lại.
- "AI như một phản ứng lo âu" thay vì chiến lược. Nếu dự án tồn tại vì ban quản trị hỏi "câu chuyện AI của chúng ta là gì?" và ai đó hoảng lên, thì kết quả sẽ là một kiosk demo-ware, chứ không phải một hệ thống làm được việc. Bạn có thể nhận ra dự án này qua các triệu chứng: ngân sách không có người chịu trách nhiệm, deadline gắn với kỳ họp ban quản trị tiếp theo, và từ "mang tính chuyển đổi" nằm trong bản tóm tắt một trang. Hãy nói to điều này lên. Bản thân bạn trong tương lai sẽ cảm ơn bạn.
Nếu bất kỳ điều nào trong số này đúng, con đường rẻ nhất là trì hoãn 60 ngày và sửa điều kiện tiên quyết. Cứ thuê vendor để "bắt đầu cho nhanh" là cách những tấm séc sáu chữ số được ký cho những hệ thống không ai dùng.
Stack thực tế năm 2026: Framework, bộ nhớ, tool, observability
Stack agent năm 2026 có bốn lớp: framework để điều phối (LangGraph, CrewAI hoặc OpenAI Agents SDK), tích hợp tool qua Model Context Protocol (MCP), kiến trúc bộ nhớ kết hợp cửa sổ context và vector store, cùng lớp eval + observability (Langfuse, LangSmith, Arize Phoenix). Nếu vendor không thể nêu được lựa chọn của mình ở từng lớp và giải thích lý do, thì họ chưa từng bàn giao một hệ thống nào.
Framework: LangGraph vs CrewAI vs OpenAI Agents SDK
Phiên bản ngắn gọn và thành thật về quan điểm framework của chúng tôi:
| Framework | Phù hợp nhất cho | Khi nào chúng tôi bỏ qua |
|---|---|---|
| LangGraph | Phân nhánh phức tạp, workflow nhiều bước, kiểm soát trạng thái chi tiết | Agent đơn giản 1-2 tool, nơi sự rườm rà của graph làm chậm tiến độ |
| CrewAI | Hệ thống đa agent theo vai trò (nghiên cứu → viết → biên tập) | Bất cứ thứ gì cần state machine chặt chẽ hoặc guardrail nặng |
| OpenAI Agents SDK | Prototype nhanh, team đã dùng OpenAI, voice Realtime | Chiến lược model đa vendor hoặc model mở tự host |
Theo kinh nghiệm của chúng tôi, chúng tôi chọn LangGraph khi workflow có phân nhánh thực sự và cần checkpoint trạng thái giữa các bước; tài liệu LangGraph chính thức là nguồn tham khảo chuẩn mực. Chúng tôi chọn OpenAI Agents SDK khi tốc độ bàn giao quan trọng hơn tính di động; tài liệu OpenAI Agents SDK bao quát chi tiết về handoff, tool và tracing. CrewAI phù hợp nhất khi bạn thực sự xây một crew agentic AI — một team nghiên cứu, một pipeline nội dung — và phép ẩn dụ vai trò ánh xạ được vào công việc. Cũng đáng xem: AutoGen và Pydantic AI, trong đó Pydantic AI là lựa chọn của chúng tôi khi output cấu trúc an toàn kiểu (type-safe) là yêu cầu không thể thương lượng. Bài viết chuyên sâu của chúng tôi so sánh LangGraph, CrewAI và OpenAI Agents SDK đi qua chi tiết các tiêu chí ra quyết định.
Dưới đây là hình dáng thực tế của một vòng lặp agent LangGraph nhỏ, với các node lập kế hoạch (plan), hành động (act) và phản tư (reflect):
from langgraph.graph import StateGraph, END
from typing import TypedDict
class State(TypedDict):
goal: str
scratch: list
done: bool
def plan(s): return {"scratch": s["scratch"] + [llm_plan(s["goal"])]}
def act(s): return {"scratch": s["scratch"] + [call_tools(s["scratch"][-1])]}
def reflect(s):
ok = llm_check(s["goal"], s["scratch"])
return {"done": ok}
g = StateGraph(State)
g.add_node("plan", plan); g.add_node("act", act); g.add_node("reflect", reflect)
g.set_entry_point("plan")
g.add_edge("plan", "act"); g.add_edge("act", "reflect")
g.add_conditional_edges("reflect", lambda s: END if s["done"] else "plan")
agent = g.compile()Mười lăm dòng, nhưng mọi agent production chúng tôi bàn giao đều trông giống một phiên bản được gia cố kỹ hơn của hình dáng này.
Tích hợp tool: Model Context Protocol (MCP)
Model Context Protocol là chuẩn mở mà Anthropic giới thiệu cuối năm 2024 để kết nối LLM với tool, dữ liệu và dịch vụ. OpenAI và Google đã áp dụng trong năm 2025, và đến tháng 4 năm 2026, đây là cách mặc định mà các team nghiêm túc dùng để kết nối tool cho agent. Vì sao nó quan trọng? Bạn có thể thay nhà cung cấp tool, hoặc model nền tảng, mà không phải viết lại agent. Tài liệu MCP của Anthropic là nguồn tham khảo chuẩn mực. Nếu bạn đang xây bất cứ thứ gì không tầm thường, hãy bỏ qua schema tool độc quyền và đi theo hướng MCP-native. Về các lựa chọn ở tầng thấp hơn, bài viết của chúng tôi về thư viện function calling có bảng so sánh.
Kiến trúc bộ nhớ
Bộ nhớ agent chia thành ba lớp trong production:
- Bộ nhớ làm việc: chính là cửa sổ context, được quản lý bằng các pattern kỹ thuật context
- Bộ nhớ ngữ nghĩa: vector store (Pinecone, pgvector, Qdrant) cho truy xuất kiểu RAG
- Bộ nhớ tình huống: lịch sử hội thoại, log gọi tool, các quyết định trước đó (Letta, Zep, LangMem)
Hầu hết các dự án agent đều đánh giá thấp tốc độ mà bộ nhớ tình huống trở thành yếu tố giới hạn. Khi agent chạy nhiều ngày với người dùng thực, trạng thái "chúng ta đã quyết định gì vào thứ Ba" còn quan trọng hơn cả tìm kiếm vector. Hãy chọn công cụ cho cuộc chơi dài.
Đánh giá và observability
Đây là nơi gần như mọi vendor đều im lặng, và cũng là nơi các kỹ sư cấp cao phán đoán xem bạn có thực sự biết mình đang làm gì hay không. Trong stack của chúng tôi: Langfuse hoặc LangSmith cho tracing, Arize Phoenix hoặc Braintrust cho pipeline eval, và Ragas khi agent có thành phần RAG nặng. Những yếu tố cơ bản của một bộ eval gồm bộ dữ liệu vàng, chấm điểm bằng LLM-as-judge, theo dõi độ chính xác gọi tool và trình phát hiện ảo giác. Tài liệu Langfuse là điểm khởi đầu tốt. Để có cái nhìn rộng hơn, hãy xem hướng dẫn observability cho agent và bài vỡ lòng của chúng tôi về cách đánh giá độ tin cậy của agent. Nếu bạn đang tự hỏi "làm sao thêm thứ này vào ứng dụng hiện có?", bài viết của chúng tôi về cách thêm tính năng AI bao quát lộ trình cải tạo.
Phát triển AI agent tốn bao nhiêu tiền?
Chi phí phát triển AI agent năm 2026 thường rơi vào ba mức: $15K-$40K cho agent workflow đơn giản bàn giao trong 4-6 tuần, $40K-$120K cho agent đa bước theo yêu cầu có bộ nhớ và tích hợp bàn giao trong 8-14 tuần, và $120K-$400K+ cho hệ thống đa agent doanh nghiệp có tuân thủ và SLA bàn giao trong 4-9 tháng. Chi phí vận hành liên tục từ $500-$15K/tháng tùy mức.
Các khoảng dưới đây bám theo những gì chúng tôi thấy qua các dự án khách hàng và dải giá công khai của các công ty như EffectiveSoft và Appinventiv. Chi phí được quyết định bởi bốn yếu tố: số lượng tích hợp, custom hay nền tảng, yêu cầu tuân thủ, và mức vận hành liên tục mà bạn sẽ chi trả.
| Mức | Phạm vi | Khoảng giá | Thời gian | Vận hành liên tục |
|---|---|---|---|---|
| Agent workflow đơn giản | Một LLM, 1-2 tool, bộ nhớ phiên | $15K-$40K | 4-6 tuần | $500-$2K/tháng |
| Agent đa bước theo yêu cầu | Suy luận đa bước, bộ nhớ, 3-6 tích hợp, eval | $40K-$120K | 8-14 tuần | $2K-$6K/tháng |
| Hệ thống đa agent doanh nghiệp | Điều phối, SSO, tuân thủ, SLA, trực sự cố | $120K-$400K+ | 4-9 tháng | $6K-$15K/tháng |
Chi phí vận hành liên tục là nơi hầu hết người mua bị bất ngờ. Khoản chi hàng tháng chia thành chi tiêu API LLM (thường là khoản lớn nhất, và đáng để đọc ghi chú của chúng tôi về cách giảm chi phí API LLM), công cụ observability, thời gian eval và giám sát, cùng nhân sự trực sự cố khi agent tiếp xúc với khách hàng.
Vài lời về yếu tố địa lý, vì AI agent development India là từ khóa tìm kiếm không chịu biến mất: các agency cấp cao ở Mỹ/châu Âu thường tính giá gấp 1,5-2,5 lần mức nearshore, và các đơn vị offshore thường ở mức 0,4-0,6 lần. Chênh lệch này phản ánh trình độ của kỹ sư AI, mức độ am hiểu các chế độ tuân thủ của Mỹ/châu Âu, và khoảng thời gian làm việc đồng bộ theo múi giờ với team của bạn khi có sự cố. Nếu việc bàn giao từ Mỹ/châu Âu quan trọng với bạn, hãy lọc onshore hoặc nearshore từ sớm — yếu tố địa lý thay đổi mọi thứ về thời gian phản hồi khi xảy ra sự cố production.
"Ongoing monthly ops cost by tier (midpoint)"
Bảng dữ liệu
| "Monthly cost ($)" | "Monthly ops" |
|---|---|
| "Simple workflow agent" | 1250 |
| "Custom multi-step agent" | 4000 |
| "Enterprise multi-agent system" | 10500 |
Timeline: 30 / 60 / 90 ngày thực sự trông như thế nào
90 ngày đầu tiên thực tế trông như sau: khám phá và prototype lát cắt dọc trước Ngày 30, bản alpha nội bộ với tool thật và bộ eval trước Ngày 60, và triển khai production với observability và guardrail trước Ngày 90. Nhanh hơn nghĩa là đang cắt xén eval. Chậm hơn cho thấy scope creep, quyền truy cập dữ liệu không rõ ràng, hoặc vướng mắc review bảo mật mà vendor không báo trước đủ sớm.
Ngày 1-30, khám phá và prototype. Định hình bài toán, kiểm toán dữ liệu, đề xuất kiến trúc, và một agent demo hoạt động được trên phạm vi hẹp. Bạn nên thấy một prototype chạy được và một kế hoạch eval bằng văn bản vào cuối tháng đầu tiên. Nếu không, dự án đã chệch hướng.
Ngày 31-60, mở rộng phạm vi và eval. Agent tích hợp tool và API thật, bộ eval hoàn chỉnh đi vào hoạt động, và team đang lặp cải tiến trên các chế độ lỗi cụ thể. Bản phát hành alpha cho người dùng nội bộ diễn ra trong giai đoạn này. Đây là tháng lộn xộn nhất; phần lớn các vấn đề khó nổi lên giữa Ngày 35 và Ngày 50.
Ngày 61-90, gia cố và production. Guardrail, observability, giới hạn tốc độ, quản lý secrets, và triển khai production. Tài liệu bàn giao hoặc khởi động vận hành liên tục diễn ra trong hai tuần cuối.
Điều gì làm trật bánh lộ trình 90 ngày? Theo thứ tự tần suất: quyền truy cập dữ liệu chưa được giải quyết (bạn hứa API sẽ sẵn sàng; nhưng chưa), chu kỳ review bảo mật (team an ninh thông tin của bạn chưa dành ngân sách thời gian), và scope creep ("nó có thể xử lý thêm một việc nhỏ này nữa không?"). Hãy chỉ định người chịu trách nhiệm cho từng rủi ro trong ba rủi ro đó ngay Ngày 1.
Cách đánh giá một agency phát triển AI agent
Cách nhanh nhất để tách agency thật khỏi agency PowerPoint là đặt tám câu hỏi kỹ thuật cụ thể trong cuộc gọi discovery. Câu trả lời mơ hồ cho những câu này là yếu tố loại trừ. Vendor thật đã bàn giao đủ nhiều agent production để có quan điểm, và có bằng chứng để chứng minh.
Đây là danh sách chúng tôi sẽ đưa cho bất kỳ người mua nào đang lọc danh sách vendor:
- "Cho tôi xem bộ eval agent của anh. Anh theo dõi chỉ số nào và ngưỡng bao nhiêu?" Nếu họ không có, họ không biết các agent trước đây của mình có hoạt động hay không.
- "Anh sẽ dùng framework nào (LangGraph, CrewAI, OpenAI Agents SDK, hay tự xây) và tại sao, cho use case cụ thể của tôi?" Vendor trả lời "cái nào phù hợp nhất" mà không nêu tên cụ thể nào thì chưa từng đưa ra lựa chọn này trước đây.
- "Chiến lược giảm ảo giác trong production của anh là gì?" Câu trả lời đúng phải bao gồm output có ràng buộc, xác minh bằng tool, kiểm tra LLM-as-judge và leo thang cho con người — chứ không phải "chúng tôi dùng GPT-5."
- "Anh xử lý lỗi gọi tool và thử lại như thế nào?" Exponential backoff, circuit breaker và graceful degradation đều phải được nhắc đến.
- "Ai sở hữu code, model, prompt và bộ dữ liệu eval khi chúng tôi kết thúc hợp đồng?" Câu trả lời thành thật là bạn. Nếu họ vòng vo, hãy bước đi.
- "Cho tôi xem một agent production anh đã bàn giao, không phải demo. Tỷ lệ pass eval của nó là bao nhiêu?" Demo thì dễ. Chỉ số production thì không.
- "Stack observability của anh là gì? Langfuse, LangSmith hay Arize?" Xem bài so sánh của chúng tôi về công cụ đánh giá LLM và nền tảng observability AI để biết câu trả lời tốt nghe như thế nào.
- "Anh xử lý tuân thủ (SOC 2, HIPAA, GDPR) trong chính kiến trúc như thế nào, chứ không chỉ trong hợp đồng vendor?" Định tuyến dữ liệu, che giấu PII, phạm vi log và thời gian lưu trữ đều phải cụ thể.
Cờ đỏ trong câu trả lời: timeline mơ hồ, không có bộ eval, không minh bạch về quyền sở hữu, "chúng tôi dùng GPT-4" như một câu trả lời stack hoàn chỉnh, và case study không có con số. Tại Techsy, chúng tôi khuyến khích mọi khách hàng tiềm năng hỏi chúng tôi chính những câu này — đặc biệt là câu #5 và #6 — vì hai câu đó tách agency thật khỏi slide deck nhanh nhất.
Cờ đỏ: Dấu hiệu một agency sẽ hứa quá lời
Pattern của một vendor chưa từng bàn giao agent production nhất quán đến kinh ngạc. Nếu bạn thấy từ hai trong sáu cờ đỏ này trở lên trong cuộc gọi đầu tiên, kỳ vọng điều chỉnh theo rủi ro là một ngân sách bị đốt và một prototype demo-ware. Hãy bước tiếp.
- Tuyên bố "độ chính xác 100%" hoặc "ảo giác bằng không". Bất khả thi với trình độ hiện tại của LLM. Chạy ngay đi, đừng đi bộ. Các benchmark ảo giác được công bố trong Stanford HAI AI Index cho thấy ngay cả những model tốt nhất cũng ở mức ảo giác 2-8% trên các tác vụ hẹp.
- Không trưng ra bộ eval. Nếu họ không đo được agent của chính mình, họ không thể cho bạn biết agent của bạn có hoạt động hay không.
- Câu trả lời framework mơ hồ. "Chúng tôi dùng công cụ tốt nhất cho công việc" mà không có gì cụ thể nghĩa là họ chưa từng đưa ra quyết định này trước đây.
- Không có cuộc trò chuyện thành thật về giới hạn. "Chúng tôi làm được mọi thứ" là mật mã cho "chúng tôi chưa từng chạm tới production."
- Case study không có chỉ số. Logo và lời chứng thực "rất hài lòng" không phải bằng chứng. Tỷ lệ pass eval và con số giảm tải mới là bằng chứng.
- Không có tech lead được chỉ đích danh cho dự án của bạn. Nếu họ không cho bạn biết kỹ sư nào sẽ chịu trách nhiệm phần xây dựng của bạn, bạn sẽ nhận đội B sau khi hợp đồng được ký.
Cách Techsy tiếp cận phát triển AI agent
Tại Techsy, các dự án AI agent consulting và xây dựng của chúng tôi đi theo cùng quy trình sáu giai đoạn mà chúng tôi mô tả ở trên: khám phá, kiến trúc và kế hoạch eval, xây dựng, bàn giao kèm observability, rồi vận hành và cải tiến lặp. Chúng tôi chọn LangGraph khi workflow cần phân nhánh phức tạp, OpenAI Agents SDK khi tốc độ bàn giao thắng thế, và Pydantic AI khi output cấu trúc phải an toàn kiểu từ đầu đến cuối. Langfuse là mặc định của chúng tôi cho tracing và eval.
Về quan điểm stack: chúng tôi chạy MCP-native cho tích hợp tool, mặc định dùng pgvector cho bộ nhớ ngữ nghĩa trừ khi quy mô buộc phải khác, và coi eval là hạng mục bàn giao của Ngày 1, chứ không phải thứ "có thì tốt" ở Giai đoạn 2. Với các phạm vi enterprise AI agent development có SSO, SOC 2 hoặc ràng buộc cư trú dữ liệu, chúng tôi mang đến các pattern triển khai từ các dự án triển khai agent doanh nghiệp của mình. Với các team sản phẩm đang đưa phát triển AI agent theo yêu cầu vào ứng dụng hiện có, chúng tôi bắt đầu nhỏ và đo đạc mạnh tay.
Những gì chúng tôi cụ thể không làm: chúng tôi không nhận các dự án mà bất kỳ yếu tố nào trong năm yếu tố loại trừ ở phần "khi nào KHÔNG nên thuê" đang đúng. Nếu định nghĩa bài toán của bạn còn mơ hồ, workflow đang biến động, hoặc không có một người chịu trách nhiệm duy nhất trong nội bộ, chúng tôi sẽ bảo bạn trì hoãn 60 ngày và sửa điều kiện tiên quyết trước. Như vậy rẻ hơn cho bạn và tốt hơn cho tỷ lệ thành công của chúng tôi.
Nếu bạn đã vượt qua các yếu tố loại trừ và muốn có một kiến trúc hoạt động được, hãy nhận review kiến trúc AI agent miễn phí. 30 phút, không slide deck.
Câu hỏi thường gặp
Phát triển AI agent là gì? Phát triển AI agent là quá trình xây dựng các hệ thống vận hành bằng LLM, tự chủ theo đuổi mục tiêu thông qua lập kế hoạch, sử dụng tool, bộ nhớ và tự sửa lỗi. Khác với chatbot, agent thực hiện hành động trên các hệ thống thực — gọi API, đọc cơ sở dữ liệu, và lặp vòng cho đến khi mục tiêu hoàn thành hoặc leo thang cho con người. Xem bài vỡ lòng của chúng tôi về use case AI agent cho doanh nghiệp để có ví dụ.
Phát triển AI agent tốn bao nhiêu tiền năm 2026? Agent workflow đơn giản tốn $15K-$40K. Agent đa bước theo yêu cầu có bộ nhớ và tích hợp tốn $40K-$120K. Hệ thống đa agent doanh nghiệp có tuân thủ và SLA tốn $120K-$400K+. Vận hành liên tục thêm $500-$15K/tháng tùy mức, chi tiêu API LLM và nhu cầu trực sự cố.
Phát triển AI agent mất bao lâu? Agent workflow đơn giản bàn giao trong 4-6 tuần. Agent đa bước theo yêu cầu mất 8-14 tuần. Hệ thống doanh nghiệp kéo dài 4-9 tháng. Lộ trình 90 ngày thực tế sẽ có prototype trước Ngày 30, bản alpha nội bộ trước Ngày 60, và triển khai production có observability trước Ngày 90.
Công ty phát triển AI agent là gì? Công ty phát triển AI agent là đơn vị dịch vụ thiết kế, xây dựng và triển khai các hệ thống tự chủ vận hành bằng LLM cho khách hàng. Công ty tốt bao quát toàn bộ vòng đời: khám phá, kiến trúc, xây dựng, eval, triển khai và vận hành. Công ty tốt nhất còn cho bạn biết khi nào không nên thuê họ — đó là tín hiệu chất lượng rõ ràng nhất.
Làm sao chọn được công ty phát triển AI agent? Hãy yêu cầu bộ eval của họ với chỉ số và ngưỡng cụ thể, lựa chọn framework cho use case của bạn kèm lý do, một agent production họ đã bàn giao kèm tỷ lệ pass, stack observability, và ai sở hữu code khi bạn kết thúc hợp đồng. Câu trả lời mơ hồ cho bất kỳ câu nào trong năm câu này đều là yếu tố loại trừ.
AI agent có thể tích hợp với CRM, ERP và các hệ thống hiện có không? Có. Agent tích hợp với Salesforce, HubSpot, SAP, NetSuite, ServiceNow, Zendesk và hầu hết các hệ thống doanh nghiệp lớn thông qua OAuth, API key hoặc service account — ngày càng được chuẩn hóa qua Model Context Protocol. Độ phức tạp tích hợp tăng theo yêu cầu xác thực và khối lượng dữ liệu, chứ không chỉ theo số lượng hệ thống.
Khác biệt giữa AI agent và chatbot là gì? Chatbot phản ứng: bạn gửi tin nhắn, nó trả lời. AI agent theo đuổi mục tiêu: nó lập kế hoạch, gọi tool, dùng bộ nhớ và tự sửa lỗi qua nhiều bước mà không cần được nhắc cho từng hành động. Chatbot trả lời; agent làm việc. Phép thử thực tế: nó có thể thay mặt bạn thực hiện hành động trên các hệ thống thực không?
Tôi cần phát triển custom hay có thể dùng nền tảng như Zapier Agents? Dùng nền tảng khi use case của bạn phổ biến, có dưới hai tích hợp, và không cần tính năng tuân thủ. Đi custom khi bạn có từ ba tích hợp trở lên, dữ liệu bị quản lý, workflow đặc thù, hoặc trải nghiệm người dùng khác biệt. Nền tảng khởi đầu nhanh hơn; custom mang lại giá trị dài hạn ở chiều sâu tích hợp và quyền sở hữu.
Nên dùng framework nào: LangGraph, CrewAI hay OpenAI Agents SDK? LangGraph phù hợp workflow phân nhánh phức tạp với kiểm soát trạng thái chi tiết. CrewAI phù hợp hệ thống đa agent theo vai trò như pipeline nghiên cứu-viết-biên tập. OpenAI Agents SDK phù hợp prototype nhanh và các team đã cam kết với stack của OpenAI. Bài so sánh LangGraph vs CrewAI vs OpenAI Agents SDK đầy đủ của chúng tôi đi qua chi tiết các tiêu chí ra quyết định.
Khác biệt giữa agentic AI và RAG là gì? RAG (retrieval-augmented generation) nạp các tài liệu liên quan vào context của LLM để cải thiện câu trả lời. Agentic AI dùng RAG như một trong nhiều tool, bên cạnh API, cơ sở dữ liệu và các agent khác. RAG trả lời câu hỏi; agentic AI thực hiện hành động. Hầu hết agent production kết hợp cả hai: RAG cho kiến thức, tool cho hành động, bộ nhớ cho trạng thái giữa các lượt.
Phiên bản ngắn gọn
2026 là năm agentic AI chuyển từ thí điểm sang production. Những vendor sẽ bàn giao được trong sự chuyển dịch đó là những người nêu được tên stack của mình, cho bạn xem eval, và nói cho bạn biết khi nào không nên thuê họ. Framework quan trọng, giá cả thành thật quan trọng, và việc biết khi nào nên trì hoãn dự án 60 ngày còn quan trọng hơn cả hai điều kia.
Nếu bạn đã vượt qua các yếu tố loại trừ và muốn nghe góc nhìn của người xây dựng cho use case cụ thể của mình, hãy nhận review kiến trúc AI agent miễn phí. Chúng tôi sẽ nói với bạn điều đó ngay cả khi chúng tôi không phải người viết bài này.