Tín hiệu tháng 8/2026: nhóm repo voice agent mã nguồn mở đã bước qua ngưỡng “đồ chơi demo” để thành hạ tầng sản xuất thật. Pipecat (Daily maintain) đang ở khoảng 14.5k sao, viết bằng Python, license BSD-2-Clause và vừa chạm mốc v1.0. Ngay cạnh đó là LiveKit Agents (~11.356 sao, Apache-2.0, Python/Node, dòng release 1.5.x), TEN Framework (~10.898 sao, Apache-2.0, đa ngôn ngữ C/Go/Python/JS), FastRTC (~4.618 sao, MIT), Vocode (~3.773 sao, MIT) và Bolna (~695 sao, MIT). Số liệu tổng hợp từ trang GitHub chính chủ và bảng so sánh framework voice agent 2026 — mức ghi nhận, có thể lệch vài phần trăm theo ngày.
Điều đáng chú ý không phải con số sao, mà là hình dạng thị trường phía sau nó: khi năm khung xương realtime cùng vượt vài nghìn sao trong 12 tháng, đó là tín hiệu nhu cầu “trợ lý biết nói” đang rời khỏi phòng lab và đi vào tổng đài, quầy đặt lịch, hotline bán hàng. Với người xây, câu hỏi không còn là “công nghệ có sẵn chưa” mà là “đóng gói phần nào để bán, và bán cho ai”.
Đọc license trước khi bàn kiếm tiền
Đây là bước nhiều người bỏ qua rồi trả giá sau. Toàn bộ cụm repo dẫn đầu đều dùng giấy phép permissive: Pipecat là BSD-2-Clause; LiveKit Agents và TEN Framework là Apache-2.0; FastRTC, Vocode, Bolna là MIT. Cả ba loại giấy phép này đều cho phép bạn self-host, sửa mã, đóng gói lại và bán — kể cả bán dưới thương hiệu riêng — miễn giữ thông báo bản quyền gốc. Apache-2.0 còn kèm điều khoản cấp quyền sáng chế, nhẹ gánh pháp lý hơn cho sản phẩm thương mại. Nói cách khác: về mặt license, không có rào cản nào ngăn bạn dựng một dịch vụ voice agent thu phí trên nền các repo này.
Nhưng “được phép bán” không đồng nghĩa “biên lợi nhuận đẹp”. Chi phí thật của voice agent không nằm ở framework (framework miễn phí), mà ở ba lớp model chạy phía dưới: nhận dạng giọng nói (STT), mô hình ngôn ngữ (LLM) và tổng hợp giọng nói (TTS). Mỗi phút hội thoại realtime đốt token ở cả ba lớp, cộng độ trễ phải giữ dưới ngưỡng ~800ms để nghe tự nhiên. Đây mới là nơi quyết định bạn lời hay lỗ, và cũng là điểm khiến khách hàng cần bạn: họ không muốn tự tối ưu chuỗi STT-LLM-TTS. Chốt lại phần license: bạn tự do về mặt pháp lý, ràng buộc thật nằm ở kinh tế vận hành — và đó là chỗ bạn tạo giá trị.
Bức tranh thị trường Việt: ai đang cần một cái miệng biết nói?
Ở Việt Nam, nhu cầu voice agent tập trung vào các nghiệp vụ lặp đi lặp lại qua điện thoại: xác nhận đơn COD cho shop thương mại điện tử, nhắc lịch và đặt hẹn phòng khám, hỏi đáp FAQ cho dịch vụ, sàng lọc lead trước khi chuyển sale. Đây là những cuộc gọi mà nhân sự làm vừa chán vừa đắt, và tỷ lệ nghe máy thấp. Một agent nói tiếng Việt tự nhiên, xử lý được 60-70% cuộc gọi tuyến đầu, là thứ SME sẵn sàng trả tiền theo tháng.
Rào cản kỹ thuật lớn nhất và cũng là con hào của bạn: chất lượng STT/TTS tiếng Việt. Các framework trên không tự lo phần tiếng Việt; bạn phải ghép model giọng Việt phù hợp và tinh chỉnh để giảm đọc sai số, tên riêng, địa chỉ. Ai làm tốt khâu bản địa hoá này sẽ khó bị một bản demo tiếng Anh copy-paste đè bẹp.
Khung cơ hội: xây gì, bán cho ai, validate thế nào
Hướng 1 — Voice bot xác nhận đơn cho shop TMĐT. Xây gì: agent gọi ra tự động xác nhận đơn COD, hỏi địa chỉ, chốt giờ giao, đẩy kết quả vào bảng đơn. Dùng Pipecat hoặc LiveKit Agents làm lõi realtime, ghép STT/TTS tiếng Việt, nối một LLM nhỏ để hiểu ý định. Bán cho ai: shop 200-2.000 đơn/tháng đang tốn người trực điện thoại. Thời gian MVP: 2-3 tuần cho luồng gọi ra một kịch bản. Cạm bẫy: đọc sai địa chỉ/số điện thoại phá hỏng trải nghiệm — phải có bước xác nhận lại từng trường; và quy định gọi tự động (đừng spam ngoài giờ). Có thể ghép chung với một MCP server nối CRM để ghi nhận trạng thái đơn ngay trong lúc gọi.
Hướng 2 — Lễ tân giọng nói cho phòng khám/dịch vụ. Xây gì: agent nghe máy 24/7, trả lời giờ mở cửa, bảng giá, và đặt lịch hẹn. Điểm cộng lớn nếu ghép nền tri thức để trả lời đúng nghiệp vụ thay vì bịa. Bán cho ai: phòng khám nhỏ, spa, trung tâm dạy học — nơi bỏ lỡ cuộc gọi là bỏ lỡ khách. Thời gian MVP: 2-3 tuần nếu tái dùng kiến trúc đặt lịch có sẵn; tham khảo cách dựng stack trợ lý AI đặt lịch cho phòng khám nhỏ. Cạm bẫy: agent “nói dối” khi không biết — bắt buộc grounding câu trả lời vào dữ liệu thật, có thể dùng một lớp RAG chi phí thấp cho tài liệu nội bộ để agent tra cứu trước khi phát ngôn.
Hướng 3 — Bán “engine” thay vì bán “app”. Xây gì: đóng gói một pipeline STT-LLM-TTS tiếng Việt tối ưu độ trễ + chi phí, phát hành dạng API/SDK để agency và dev khác cắm vào sản phẩm của họ. Bạn không bán tới người dùng cuối mà bán tới người xây. Bán cho ai: agency chuyển đổi số, đội startup cần voice nhưng không muốn tự tối ưu. Thời gian MVP: 4-6 tuần vì phải làm chuẩn về đo lường độ trễ, ghi âm, tính cước theo phút. Cạm bẫy: đây là mô hình hạ tầng — bạn cạnh tranh trực tiếp với nhà cung cấp lớn, nên phải thắng bằng giá tiếng Việt và hỗ trợ tận nơi, không thắng bằng “có tính năng”.
Ba con số cần theo dõi để không đốt tiền oan
Trước khi viết dòng code nào, hãy chốt ba chỉ số vận hành: chi phí mỗi phút hội thoại (cộng cả STT + LLM + TTS, thường là biến số lớn nhất), độ trễ đầu-cuối (mục tiêu dưới ~800ms để không “cấn” nhịp nói), và tỷ lệ giải quyết tự động (bao nhiêu % cuộc gọi agent xử lý trọn không cần người). Ba con số này quyết định mô hình giá: nếu chi phí mỗi phút quá cao so với giá nhân sự tổng đài, sản phẩm không có cửa dù công nghệ đẹp. Hãy đo trên chính kịch bản tiếng Việt của khách, đừng tin benchmark tiếng Anh.
Cách validate rẻ trong 2 tuần
Đừng dựng full sản phẩm rồi mới đi hỏi thị trường. Cách rẻ: dựng một luồng gọi ra một kịch bản (ví dụ xác nhận đơn), tự bỏ tiền chạy thử 100-200 cuộc gọi thật cho một shop quen, rồi đo ba con số ở trên và nghe khách phàn nàn ở đâu. Nếu tỷ lệ giải quyết tự động vượt ~50% và khách nói “cái này đỡ cho em thật”, bạn có tín hiệu để tính giá theo phút hoặc theo tháng. Nếu khách chỉ khen “hay đấy” mà không hỏi giá, đó là tín hiệu chưa đủ đau — chuyển kịch bản khác. Voice agent thắng thua ở chỗ có giải quyết được một nỗi đau vận hành cụ thể hay không, không ở chỗ giọng có “mượt” hay không.
Câu hỏi thường gặp
Các framework voice agent mã nguồn mở này có được bán lại không?
Được. Pipecat (BSD-2-Clause), LiveKit Agents và TEN Framework (Apache-2.0), FastRTC/Vocode/Bolna (MIT) đều là giấy phép permissive, cho phép self-host, chỉnh sửa và đóng gói thương mại miễn giữ thông báo bản quyền gốc. Ràng buộc thật là chi phí model STT/LLM/TTS chạy phía dưới, không phải giấy phép.
Nên chọn Pipecat hay LiveKit Agents?
Cả hai đều Python và đã đủ chín cho sản xuất. Pipecat thiên về pipeline hội thoại linh hoạt; LiveKit Agents mạnh về hạ tầng realtime/telephony và có sẵn hệ sinh thái media. Với dự án đầu tay ở Việt Nam, hãy chọn cái nào bạn nối STT/TTS tiếng Việt vào nhanh nhất và đo được độ trễ sớm nhất, thay vì chọn theo số sao.
Chi phí lớn nhất khi vận hành voice agent là gì?
Là chi phí model theo phút hội thoại: cộng gộp nhận dạng giọng nói, LLM và tổng hợp giọng nói. Framework miễn phí nhưng mỗi phút gọi realtime đều tốn token ở ba lớp đó. Đây là lý do bạn phải đo chi phí/phút trước khi định giá.
Rào cản khó nhất khi làm voice agent tiếng Việt?
Chất lượng STT/TTS tiếng Việt và việc đọc đúng số, tên riêng, địa chỉ. Các framework không tự lo phần này; ai bản địa hoá tốt sẽ có lợi thế khó sao chép. Đây vừa là rào cản vừa là con hào cạnh tranh của bạn.
Bao lâu thì có MVP để đi bán?
Một luồng gọi ra/nghe máy cho một kịch bản duy nhất mất khoảng 2-3 tuần. Mô hình bán “engine”/API cho dev khác mất 4-6 tuần vì phải chuẩn hoá đo lường, ghi âm và tính cước. Nên bắt đầu bằng một kịch bản hẹp, validate bằng cuộc gọi thật rồi mới mở rộng.
— AIToEarn Radar. Tín hiệu AI → cơ hội builder. Số liệu sao là mức ghi nhận tại thời điểm viết, hãy kiểm lại trên GitHub trước khi đưa vào kế hoạch kinh doanh.
