
6 Framework Voice Agent Mã Nguồn Mở Tốt Nhất Năm 2026 (Xếp Hạng)
Quý trước, chúng tôi đã triển khai ba voice agent qua điện thoại trên Pipecat, sau đó xây lại một cái trên LiveKit Agents khi khách hàng tăng từ 20 lên 400 cuộc gọi đồng thời. Cả hai đều là framework voice agent mã nguồn mở. Không có cái nào là "tốt nhất." Mỗi cái giỏi ở một việc khác nhau, và chọn sai sẽ khiến bạn mất hàng tuần.
Bảng xếp hạng này dựa trên những gì thực sự được đưa vào sản xuất, không phải những gì đọc hay trong README. Chúng tôi đã kéo số liệu GitHub trực tiếp vào ngày 14 tháng 7 năm 2026: Pipecat đạt 13.416 sao, LiveKit Agents đạt 11.356, và TEN Framework đạt 10.898. Sao không kể hết câu chuyện, nên chúng tôi còn cân nhắc hoạt động commit, hỗ trợ điện thoại, điều khoản giấy phép, và cách mỗi framework chịu tải dưới lưu lượng cuộc gọi thực tế.
Câu trả lời nhanh: Với hầu hết các đội ngũ trong năm 2026, Pipecat là framework voice agent mã nguồn mở mạnh nhất nhờ thư viện tích hợp lớn và nhịp phát triển gần như hàng ngày. LiveKit Agents thắng ở quy mô và điện thoại gốc, TEN Framework thắng ở điều phối đồ thị đa phương thức, và Bolna thắng ở tốc độ đưa một agent điện thoại lên sóng trong một buổi chiều.
Nếu bạn muốn mua một sản phẩm hoàn chỉnh thay vì tự lắp ráp, các bài so sánh của chúng tôi về các nền tảng quản lý như ElevenLabs, Vapi và Synthflow và Retell AI vs Vapi vs Bland là điểm khởi đầu phù hợp hơn. Mới biết đến lĩnh vực này? Hãy bắt đầu với AI voice agent thực chất là gì.
Cách chúng tôi xếp hạng các framework này
Chúng tôi chấm điểm từng framework dựa trên năm yếu tố mà một dự án thực sự sống hay chết phụ thuộc vào: mức độ phát triển tích cực (số commit trong 90 ngày gần nhất), độ rộng của các tích hợp STT/LLM/TTS, hỗ trợ điện thoại (có thể trả lời một số điện thoại thực không), điều khoản giấy phép, và hành vi khi chạy đồng thời. Dưới đây là danh sách rút gọn trong một cái nhìn tổng quan.
| Hạng | Framework | Sao (T7/2026) | Giấy phép | Ngôn ngữ | Điện thoại | Phù hợp nhất cho |
|---|---|---|---|---|---|---|
| 1 | Pipecat | 13.416 | BSD-2-Clause | Python | Twilio, Daily, Telnyx | Triển khai sản xuất toàn diện |
| 2 | LiveKit Agents | 11.356 | Apache-2.0 | Python, Node | SIP gốc + số điện thoại | Quy mô và thời gian thực |
| 3 | TEN Framework | 10.898 | Apache-2.0 (lai) | C, Go, Python, JS | Qua Agora RTC | Đa phương thức và edge |
| 4 | Bolna | 695 | MIT | Python | Twilio, Plivo, Exotel, SIP | Agent điện thoại nhanh |
| 5 | FastRTC | 4.618 | MIT | Python | WebRTC (tự cung cấp) | Prototype và demo |
| 6 | Vocode | 3.773 | MIT | Python | Twilio, Vonage | Tham khảo, kèm lưu ý |
1. Pipecat — lựa chọn toàn diện tốt nhất
Pipecat, được xây dựng bởi đội ngũ đứng sau Daily, là một framework Python mô hình hóa cuộc hội thoại dưới dạng pipeline: âm thanh đi vào, chảy qua speech-to-text, mô hình ngôn ngữ, và text-to-speech, rồi âm thanh đi ra. Mô hình tư duy này dễ hiểu, và nó đã đạt phiên bản ổn định v1.0 vào tháng 4 năm 2026.
Điều tạo nên sự khác biệt là thư viện tích hợp. Deepgram, AssemblyAI, OpenAI, Gemini, Cartesia, ElevenLabs, và hàng chục nhà cung cấp khác đã được kết nối sẵn, nên việc đổi nhà cung cấp TTS chỉ là thay đổi một dòng thay vì viết lại từ đầu. Điện thoại hoạt động qua Twilio, Daily, hoặc Telnyx. Với 13.416 sao và commit được đẩy lên gần như mỗi ngày, nó cũng có động lực phát triển mạnh nhất trong danh sách này.
Sự đánh đổi: vì Pipecat cho bạn các mảnh ghép thay vì một agent hoàn chỉnh, bạn phải tự sở hữu logic điều phối. Không có trình kéo-thả. Bạn viết Python. Với một đội ngũ đã quen code, đó là tính năng, không phải lỗi.
Chọn cái này nếu: bạn muốn một nền tảng trung lập với nhà cung cấp, đạt chuẩn sản xuất, hỗ trợ mô hình rộng nhất và bạn thoải mái viết Python. Đây là điểm khởi đầu mặc định của chúng tôi cho hầu hết các dự án khách hàng.
2. LiveKit Agents — xây cho quy mô và thời gian thực
LiveKit Agents tiếp cận theo hướng khác. Thay vì pipeline tuyến tính, agent của bạn tham gia một phòng với tư cách người tham gia qua WebRTC, cùng công nghệ đứng sau các cuộc gọi kiểu Zoom. Kiến trúc đó là lý do nó tỏa sáng khi bạn cần độ trễ thấp và nhiều cuộc hội thoại đồng thời.
Câu chuyện lớn của năm 2026 là điện thoại. LiveKit đã ra mắt SIP và số điện thoại gốc, nên cuộc gọi đến và đi không còn cần cầu nối Twilio ở giữa nữa. Nó cũng hỗ trợ chính thức cho OpenAI Realtime API và, từ phiên bản 1.5.x, có công cụ Model Context Protocol gốc và xử lý ngắt lời thích ứng. Bạn có thể đọc chi tiết trong tài liệu LiveKit Agents. Nếu bạn muốn hiểu Realtime API mà nó bao bọc, chúng tôi có bài riêng về OpenAI Realtime API cho voice agent.
Vì nó chạy trên máy chủ media WebRTC mã nguồn mở của LiveKit, bạn có thể tự host toàn bộ stack. Đường cong học tập dốc hơn Pipecat, và tư duy phòng-người tham gia cần một chút thời gian để quen.
Chọn cái này nếu: bạn dự kiến có đồng thời thực sự, muốn điện thoại gốc không cần cầu nối, hoặc bạn đang dựng một agent OpenAI Realtime phải chịu được lưu lượng tăng đột biến.
3. TEN Framework — đa phương thức và dựa trên đồ thị
TEN Framework (Transformative Extensions Network), được hỗ trợ bởi Agora, mô tả agent của bạn dưới dạng đồ thị các node: STT, LLM, công cụ, bộ nhớ, thị giác. Bạn soạn đồ thị trong trình xây dựng workflow, và TEN thực thi nó. Đây là tùy chọn linh hoạt nhất ở đây cho bất kỳ thứ gì vượt ra ngoài giọng nói thuần túy, và lõi C++ của nó được tối ưu cho âm thanh độ trễ thấp.
Nó cũng hỗ trợ nhiều ngôn ngữ lập trình nhất trong danh sách này, với extension bằng C, Go, Python, JavaScript, và TypeScript, cùng các connector có sẵn cho Dify và Coze. Trang Agora TEN Framework là tổng quan rõ ràng nhất về những gì nó có thể làm.
Hai lưu ý. Thứ nhất, giấy phép là dạng lai: phần lớn framework là Apache-2.0, nhưng có thêm hạn chế ở một số thư mục nhất định, nên hãy đọc LICENSE trước khi phát hành thương mại. Thứ hai, truyền tải thời gian thực phụ thuộc vào mạng của Agora, nghĩa là cần một Agora App ID và, vượt qua gói miễn phí, sẽ có chi phí sử dụng Agora.
Chọn cái này nếu: bạn đang xây agent đa phương thức (giọng nói kèm thị giác hoặc avatar), bạn coi trọng việc soạn theo đồ thị, hoặc bạn muốn hiệu năng âm thanh cấp thấp nhất có sẵn trong mã nguồn mở.
4. Bolna — con đường nhanh nhất đến một agent điện thoại
Bolna nhỏ hơn (695 sao) và có quan điểm thiết kế rõ ràng hơn ba cái đứng đầu, và đó chính xác là thế mạnh của nó. Nó ưu tiên điện thoại trước. Trong khi các framework khác bắt bạn tự lắp ráp phần gọi điện, Bolna cung cấp sẵn: Twilio cho cuộc gọi toàn cầu, Plivo và Exotel cho Ấn Độ, và SIP trunk tùy chỉnh, tất cả được cấu hình trong một định nghĩa agent kiểu JSON thay vì code.
Thiết lập theo cấu hình đó nghĩa là bạn có thể có một agent điện thoại gọi đến hoặc gọi đi trả lời cuộc gọi thực nhanh hơn gần như bất kỳ thứ gì khác ở đây. Bên dưới, nó điều phối các nhà cung cấp ASR, LLM và TTS qua websocket, nên bạn vẫn chọn mô hình riêng. Nhịp phát triển vẫn tích cực đến giữa năm 2026.
Cái giá của tốc độ đó là cộng đồng nhỏ hơn và ít tích hợp hơn Pipecat hay LiveKit. Nếu bạn gặp trường hợp biên, khả năng cao bạn là người đầu tiên mở issue. Với các dự án nặng về điện thoại, hãy cân nhắc nó cùng các tùy chọn trong bài so sánh điện thoại voice agent của chúng tôi.
Chọn cái này nếu: use case của bạn là cuộc gọi điện thoại trước tiên (nhắc lịch hẹn, gọi ra xác minh, hỗ trợ gọi đến) và bạn muốn bỏ qua hoàn toàn phần hạ tầng điện thoại.
5. FastRTC — tùy chọn prototype nhẹ nhàng
FastRTC, từ đội ngũ Hugging Face và Gradio, không phải một framework agent đầy đủ, và đó là chủ đích. Nó là một thư viện Python cho âm thanh và video thời gian thực qua WebRTC hoặc websocket. Bạn tự mang STT, LLM và TTS của mình, và FastRTC xử lý lớp truyền tải streaming chỉ với vài dòng code.
Cho một proof of concept, một bản demo, hoặc một nghiên cứu nhanh, sự tối giản đó là một món quà. Bạn có thể dựng một prototype biết nói trong một buổi chiều mà không cần cam kết với các quy ước của một framework nặng nề. Nó kết hợp tự nhiên với hệ sinh thái Hugging Face, nên các mô hình mở rất dễ cắm vào.
Mặt trái là bạn phải tự chịu trách nhiệm cho mọi thứ mà một framework thường cung cấp: phát hiện lượt nói, xử lý ngắt lời, điện thoại, quản lý trạng thái. Nó co xuống rất đẹp nhưng mở rộng lên rất đau đớn.
Chọn cái này nếu: bạn đang làm prototype, giảng dạy, hoặc xây một bản demo trên trình duyệt, và bạn muốn kiểm soát tối đa với chi phí framework tối thiểu.
6. Vocode — quan trọng về mặt lịch sử, kèm lưu ý về bảo trì
Vocode đã góp phần định nghĩa cả thể loại này. Thiết kế STT/LLM/TTS mô-đun và điện thoại Twilio, Vonage tích hợp sẵn khiến nó trở thành một trong những framework giọng nói mã nguồn mở thực sự dùng được đầu tiên, và với 3.773 sao, nó vẫn xuất hiện trong nhiều hướng dẫn.
Đây là phần thành thật, và là lý do nó xếp cuối: lõi mã nguồn mở đã im ắng. Commit cuối cùng vào vocode-core được đẩy lên từ tháng 11 năm 2024, và kho chỉ có hai issue đang mở, điều thường báo hiệu sự chú ý đã chuyển sang sản phẩm hosted của công ty thay vì một backlog lành mạnh. Code vẫn chạy được, và thiết kế đáng để nghiên cứu, nhưng bạn sẽ xây trên một nền tảng không ai tích cực vá lỗi.
Chọn cái này nếu: bạn đang nghiên cứu kiến trúc voice-agent, đang bảo trì một dự án Vocode hiện có, hoặc bạn đặc biệt muốn các mẫu thiết kế của nó và chấp nhận rằng bạn sẽ tự bảo trì phần nền.
Cũng đáng biết
Một vài công cụ nằm ngay ngoài bảng xếp hạng nhưng thuộc về radar của bạn:
- OpenAI Agents SDK (hơn 27.900 sao) có extension voice-pipeline. Nó là một SDK agent đa dụng chứ không ưu tiên giọng nói, nhưng là lựa chọn hợp lý nếu bạn đã chuẩn hóa trên đó.
- Gabber là một framework đa phương thức mới hơn cho các agent biết nhìn, nghe và nói, nhắm đến use case màn hình và camera.
- Jambonz là một hạ tầng điện thoại mã nguồn mở. Nó không xây bộ não agent, nhưng là cách cấp nhà mạng để kết nối bất kỳ framework nào với mạng điện thoại thực.
- Rasa (hơn 21.000 sao) vẫn là ông lớn cho hội thoại doanh nghiệp và NLU trên cả văn bản lẫn giọng nói, dù vận hành nó phức tạp hơn bất kỳ cái nào ở trên.
- Ultravox là một mô hình ngôn ngữ giọng nói nhanh, không phải framework điều phối, nên hãy xem nó như một thành phần cắm được thay vì một đối thủ cạnh tranh.
Chúng tôi thực sự sẽ dùng gì cho dự án khách hàng
Tại Techsy, chúng tôi xây voice agent cho khách hàng B2B, nên đây là thực tế không hào nhoáng đằng sau bảng xếp hạng.
Stack mặc định của chúng tôi là Pipecat kết nối Deepgram Nova-3 cho speech-to-text, GPT-4o-mini cho mô hình ngôn ngữ, và Cartesia Sonic cho text-to-speech. Khi phát hiện lượt nói đã được tinh chỉnh, độ trễ giọng-nói-đến-giọng-nói thường nằm trong khoảng 0,7 đến 1,1 giây, đủ gần với hội thoại tự nhiên để người gọi không còn nhận ra. Đẩy bất kỳ thành phần nào sang mô hình chậm hơn và bạn sẽ cảm nhận ngay lập tức.
Điện thoại là nơi các dự án trở nên lộn xộn. Chúng tôi đã chạy hai mô hình trong sản xuất: một SIP trunk Twilio được cầu nối vào SIP gốc của LiveKit cho hỗ trợ gọi đến lưu lượng cao, và Plivo tích hợp sẵn của Bolna khi khách hàng chỉ cần cuộc gọi nhắc nhở gọi ra. Hướng LiveKit tốn nhiều giờ kỹ thuật hơn ban đầu, nhưng nó ổn định khi 300 cuộc gọi đến trong cùng một phút. Bolna giúp bạn lên sóng trước thứ Sáu.
Bài toán tự host khiến nhiều người vấp. Chạy STT và TTS cục bộ trên một GPU A10G duy nhất tốn khoảng $0,50 đến $0,90 mỗi giờ bất kể có cuộc gọi nào đến hay không. API tính phí theo phút như Deepgram và Cartesia không tốn gì khi nhàn rỗi nhưng cộng dồn nhanh khi vượt vài nghìn phút mỗi tháng. Dưới khoảng 15.000 phút hàng tháng, API gần như luôn thắng, và đó là những gì chúng tôi khuyên cho hầu hết khách hàng. Chúng tôi chọn LiveKit thay vì Pipecat chủ yếu khi số cuộc gọi đồng thời vượt qua vài trăm.
Nếu câu hỏi xây-hay-mua vẫn còn bỏ ngỏ ở phía bạn, chúng tôi đi qua toàn bộ phân tích chi phí trong bài hướng dẫn xây hay mua AI voice agent. Và nếu bạn muốn một đội ngũ lo phần độ trễ, điện thoại và mở rộng quy mô cho bạn, đó chính xác là những gì chúng tôi làm tại dịch vụ voice agent của Techsy.
Cách chọn trong một phút
Bỏ qua tê liệt phân tích. Đây là quyết định ở dạng gạch đầu dòng:
- Bạn muốn lựa chọn mặc định an toàn nhất: Pipecat.
- Bạn cần đồng thời thực sự hoặc điện thoại gốc: LiveKit Agents.
- Bạn đang làm đa phương thức (giọng nói kèm thị giác hoặc avatar): TEN Framework.
- Bạn cần agent điện thoại lên sóng tuần này: Bolna.
- Bạn đang làm prototype hoặc giảng dạy: FastRTC.
- Bạn muốn mua thay vì xây: một nền tảng quản lý như Vapi, Retell, hoặc Synthflow, không phải framework.
Câu hỏi thường gặp
Framework voice agent mã nguồn mở là gì?
Đó là một codebase có thể tự host, kết nối speech-to-text, mô hình ngôn ngữ và text-to-speech để phần mềm có thể thực hiện một cuộc hội thoại bằng giọng nói. Khác với các nền tảng quản lý, bạn chạy nó trên hạ tầng riêng, chọn mô hình riêng, và chỉ trả tiền cho các dịch vụ nền tảng thay vì phí cộng thêm theo phút.
Framework voice agent mã nguồn mở nào có độ trễ thấp nhất?
TEN Framework dẫn đầu về hiệu năng pipeline âm thanh thô nhờ lõi C++, nhưng trong thực tế, độ trễ mạng và mô hình chi phối tổng thời gian. Một stack Pipecat hoặc LiveKit được tinh chỉnh tốt trên mô hình nhanh thường đạt 0,7 đến 1,1 giây giọng-nói-đến-giọng-nói, tương đương TEN trong hầu hết các triển khai thực tế.
Mã nguồn mở có thực sự rẻ hơn Vapi hay Retell không?
Không phải luôn luôn. Mã nguồn mở loại bỏ phí cộng thêm theo phút của nền tảng, nhưng bạn gánh chi phí kỹ thuật, hosting và bảo trì. Dưới vài nghìn phút gọi mỗi tháng, một nền tảng quản lý thường rẻ hơn khi tính cả thời gian lập trình viên. Vượt qua hàng chục nghìn phút, tự host một framework sẽ tiết kiệm hơn.
Các framework này có thể trả lời cuộc gọi điện thoại thực không?
Có. Pipecat kết nối qua Twilio, Daily, hoặc Telnyx; LiveKit Agents có SIP và số điện thoại gốc; Bolna tích hợp sẵn Twilio, Plivo và Exotel; và Vocode hỗ trợ Twilio và Vonage. FastRTC tập trung vào trình duyệt và cần một cầu nối bên ngoài như Jambonz cho mạng điện thoại.
Tôi có cần chuyên môn machine learning để sử dụng chúng không?
Không. Bạn cần kỹ năng kỹ thuật phần mềm, chủ yếu là Python. Phần nặng (phiên âm, suy luận, tổng hợp giọng nói) do các mô hình bạn cắm vào qua API xử lý. Bạn đang điều phối các dịch vụ, không phải huấn luyện mô hình, trừ khi bạn chủ động chọn tự host các mô hình trọng số mở.
Framework nào tốt nhất cho người mới bắt đầu?
Pipecat, vì mô hình pipeline của nó dễ hiểu nhất và tài liệu cùng ví dụ của nó đầy đủ nhất. FastRTC là lựa chọn thứ hai tốt nếu bạn muốn bắt đầu nhỏ hơn nữa và hiểu lớp truyền tải thô trước khi áp dụng một framework đầy đủ.
Các framework giọng nói mã nguồn mở đã sẵn sàng cho sản xuất trong năm 2026 chưa?
Ba cái đứng đầu đã sẵn sàng. Pipecat đạt v1.0, LiveKit Agents đang ở phiên bản 1.5.x, và TEN Framework đang vận hành các triển khai thương mại qua Agora. Rủi ro chính không phải ở bản thân các framework mà ở tình trạng bảo trì của các dự án nhỏ hơn, đó là lý do chúng tôi đánh dấu lõi Vocode đã đình trệ.
Nó khác gì so với một TTS API như ElevenLabs?
Một TTS API chỉ chuyển văn bản thành giọng nói, đó là một thành phần. Một framework voice agent điều phối toàn bộ vòng lặp: nó lắng nghe, phiên âm, gửi văn bản đến mô hình ngôn ngữ, nhận phản hồi, và đọc lại, đồng thời quản lý ngắt lời và luân phiên lượt nói. Framework gọi TTS API, không phải ngược lại.
Về tác giả
Mert Batur Gurbuz là Đồng sáng lập của Techsy.io, nơi đội ngũ triển khai AI agent, hệ thống tự động hóa, và pipeline voice/SDR cho khách hàng B2B. Anh đang học tại University of Birmingham và viết về stack công cụ LLM mà đội ngũ Techsy thực sự sử dụng trong sản xuất. Kết nối trên LinkedIn.