Tín hiệu: chi phí gọi API mô hình ngôn ngữ lớn (LLM) đang trở thành một khoản “âm thầm ăn mòn” biên lợi nhuận của rất nhiều doanh nghiệp vừa và nhỏ tại Việt Nam. Một team chỉ cần vài luồng chatbot, vài pipeline tóm tắt tài liệu và một con agent chạy nền là hoá đơn OpenAI, Anthropic hay Google mỗi tháng có thể nhảy từ vài triệu lên vài chục triệu đồng mà không ai kiểm soát nổi từng đồng đi đâu. Đây chính là khoảng trống mở ra một dịch vụ rất “builder”: audit và tối ưu chi phí LLM cho doanh nghiệp.
Điểm tựa kỹ thuật cho dịch vụ này không phải thứ bạn phải tự viết từ đầu. Một công cụ tham chiếu đáng chú ý là LiteLLM — một gateway mã nguồn mở viết bằng Python, đóng vai trò lớp trung gian gọi hơn 100 nhà cung cấp LLM qua một cú pháp chuẩn OpenAI duy nhất, kèm theo tính năng theo dõi chi phí (cost tracking), đặt hạn mức (budget), định tuyến (routing) và log token theo từng key. Ghi nhận đầu 09/2026, LiteLLM là một trong những dự án gateway được cộng đồng dùng nhiều nhất cho bài toán quản trị chi phí đa nhà cung cấp. Bên cạnh nó là các công cụ observability như Langfuse để soi từng trace, từng token và chi phí thực tế của mỗi lượt gọi.
Phân tích license trước khi bàn kiếm tiền
Đây là bước nhiều người bỏ qua nhưng lại quyết định bạn có được phép dựng dịch vụ thương mại hay không. Cả LiteLLM và Langfuse đều theo mô hình open-core: phần lõi phát hành theo giấy phép MIT, còn một số tính năng “enterprise” nằm trong thư mục riêng (ví dụ enterprise/ của LiteLLM, hay ee/ của Langfuse) chịu một license thương mại riêng biệt.
Ý nghĩa thực tế: bạn hoàn toàn được self-host phần lõi MIT, chỉnh sửa, đóng gói và bán dịch vụ triển khai cũng như vận hành trên nền đó — MIT cho phép sử dụng thương mại, chỉ cần giữ lại thông báo bản quyền. Nhưng nếu bạn muốn bật các tính năng nằm trong thư mục enterprise (ví dụ SSO nâng cao, một số cơ chế quản trị nhiều nhóm), bạn phải mua license enterprise hoặc tự viết lại chức năng tương đương. Ranh giới an toàn cho một dịch vụ tư vấn: bán công sức audit, cấu hình, tích hợp và đào tạo dựa trên phần MIT; không bán lại phần enterprise như thể nó là của bạn. Đây là khác biệt sống còn giữa “làm dịch vụ hợp lệ” và “vi phạm bản quyền tính năng thương mại”.
Vì sao đây là cơ hội thật, không phải trend ảo
Ba lý do khiến bài toán chi phí LLM đủ “đau” để người ta trả tiền. Thứ nhất, giá token dao động rất mạnh giữa các model: một tác vụ đơn giản chạy nhầm trên model cao cấp có thể đắt gấp 10–30 lần so với chạy trên model nhỏ mà chất lượng gần như không đổi. Thứ hai, phần lớn doanh nghiệp Việt gọi thẳng một model duy nhất cho mọi việc, không phân tầng, không cache — trong khi thực tế 40–70% lưu lượng có thể hạ cấp xuống model rẻ hơn hoặc trả về từ cache. Thứ ba, không ai đo được. Không có dashboard chi phí theo phòng ban, theo tính năng, theo khách hàng, nên mọi quyết định cắt giảm đều là cảm tính.
Một dịch vụ audit tốt biến ba điểm mù này thành con số cụ thể: hoá đơn tháng đang là bao nhiêu, đi vào đâu, và nếu áp dụng định tuyến + cache + prompt gọn hơn thì tiết kiệm được khoảng bao nhiêu phần trăm. Kinh nghiệm chung của các đội tối ưu chi phí cho thấy mức tiết kiệm 30–60% là hoàn toàn khả thi chỉ bằng thay đổi định tuyến và cache, chưa cần đổi nhà cung cấp. Cách tiếp cận này rất gần với tinh thần chọn hạ tầng rẻ mà hiệu quả, giống như khi chúng tôi phân tích vector store mã nguồn mở cho startup RAG — cùng một triết lý: dùng đúng công cụ cho đúng quy mô, đừng trả tiền cho thứ mình không cần.
XÂY GÌ · BÁN CHO AI · VALIDATE
Hướng 1 — Gói “Audit chi phí LLM” một lần (dịch vụ tư vấn)
Xây gì: một quy trình audit chuẩn hoá. Cắm LiteLLM làm proxy trước mọi lời gọi LLM của khách trong 1–2 tuần để thu log token và chi phí thực, dựng dashboard chi phí theo tính năng và theo model, rồi xuất báo cáo chỉ ra: đâu là luồng đắt nhất, tác vụ nào đang chạy sai model, chỗ nào nên cache. MVP của gói này rất nhẹ: khoảng 1–2 tuần để dựng bộ template báo cáo, script cắm proxy và checklist tối ưu.
Bán cho ai: các công ty đã đưa AI vào sản phẩm và bắt đầu thấy hoá đơn “phình” — startup SaaS, agency đang chạy nhiều automation, phòng sản phẩm của doanh nghiệp lớn. Giá gói audit một lần có thể đặt ở mức tham khảo 10–30 triệu đồng tuỳ quy mô, dễ chốt vì khách nhìn thấy ROI ngay khi bạn chỉ ra khoản tiết kiệm lớn hơn phí dịch vụ.
Cạm bẫy: đừng hứa con số tiết kiệm khi chưa có log thật. Luôn audit trước, cam kết sau. Và phải xử lý dữ liệu nhạy cảm: nhiều prompt chứa thông tin khách hàng, nên cần thoả thuận bảo mật và tuỳ chọn tự host proxy trong hạ tầng của khách thay vì đẩy log ra ngoài.
Hướng 2 — LLM Gateway vận hành theo tháng (managed service)
Xây gì: sau khi audit, bạn ở lại vận hành. Dựng một cổng LLM tự host cho khách với định tuyến thông minh (câu dễ đẩy model rẻ, câu khó mới lên model cao cấp), cache ngữ nghĩa, hạn mức theo phòng ban và cảnh báo khi chi phí vượt ngưỡng. Đây là phần biến audit một lần thành doanh thu định kỳ. MVP vận hành cần thêm khoảng 2–3 tuần để dựng cơ chế cảnh báo, phân quyền key và quy trình trực sự cố.
Bán cho ai: chính những khách đã audit ở Hướng 1, cộng thêm các đội không có người chuyên trách hạ tầng AI. Mô hình giá theo tháng (retainer) hoặc chia sẻ một phần khoản tiết kiệm sẽ tạo dòng tiền ổn định.
Cạm bẫy: gateway trở thành điểm nghẽn duy nhất — nếu nó sập, mọi tính năng AI của khách sập theo. Phải thiết kế dự phòng, fallback sang gọi trực tiếp khi cần, và giám sát độ trễ. Việc chọn nền tảng đóng gói để vận hành lâu dài cũng đáng cân nhắc kỹ, tương tự bài toán chúng tôi mổ xẻ trong so sánh framework AI agent tự host để đóng gói bán.
Hướng 3 — Sản phẩm hoá thành dashboard chi phí cho ngách Việt
Xây gì: đóng gói phần dashboard chi phí thành một sản phẩm nhẹ, giao diện tiếng Việt, tích hợp sẵn với các nhà cung cấp phổ biến và xuất báo cáo cho kế toán. Đây là bước từ dịch vụ lên sản phẩm, dùng lại phần lõi MIT nhưng thêm lớp trải nghiệm và báo cáo phù hợp doanh nghiệp Việt. MVP sản phẩm thực tế cần 4–6 tuần vì phải làm phần onboarding, phân quyền và xuất hoá đơn.
Bán cho ai: các doanh nghiệp muốn tự quản chi phí AI mà không thuê người ngoài, hoặc các agency muốn có công cụ trắng nhãn để phục vụ khách của họ. Tư duy đóng gói và thương mại hoá công cụ AI này đi cùng mạch với bài cách kiếm tiền từ công cụ AI tự động hoá nội dung.
Cạm bẫy: đây là hướng nặng vốn nhất và cạnh tranh với chính các nền tảng open-core khi họ bung tính năng miễn phí. Chỉ nên chọn hướng này sau khi đã có vài khách trả tiền ở Hướng 1 và 2, tức là đã validate nhu cầu bằng doanh thu thật chứ không phải bằng giả định.
Cách validate nhanh trước khi đổ công sức
Đừng viết dòng code sản phẩm nào trước khi có tín hiệu. Cách rẻ nhất: lấy 5–10 doanh nghiệp trong mạng lưới đang dùng AI, đề nghị audit miễn phí hoặc chi phí thấp cho 2–3 khách đầu để đổi lấy quyền dùng làm case study. Nếu chỉ riêng bản báo cáo audit đã khiến họ muốn trả tiền để bạn ở lại tối ưu, bạn có một dịch vụ thật. Nếu họ gật gù rồi im lặng, nhu cầu chưa đủ đau — quay lại chọn ngách khác. Chỉ số cần theo dõi rất đơn giản: tỷ lệ khách sau audit đồng ý ký gói vận hành, và mức tiết kiệm trung bình bạn tạo ra so với phí dịch vụ.
Câu hỏi thường gặp
Tôi không rành hạ tầng, có làm dịch vụ này được không?
Được, nếu bạn bắt đầu từ Hướng 1. Gói audit một lần thiên về đọc log, phân tích và viết báo cáo hơn là dựng hệ thống phức tạp. LiteLLM cắm như một proxy đứng trước ứng dụng, phần khó nhất là hiểu luồng gọi của khách chứ không phải viết code mới. Bạn có thể học phần vận hành sâu hơn sau khi đã có khách đầu tiên.
Dùng công cụ mã nguồn mở để làm dịch vụ có hợp pháp không?
Phần lõi MIT của LiteLLM và Langfuse cho phép sử dụng thương mại, kể cả bán dịch vụ triển khai và vận hành. Điều cần tránh là bán lại hoặc kích hoạt các tính năng nằm trong thư mục enterprise mà không mua license tương ứng. Nói ngắn gọn: bán công sức và chuyên môn của bạn thì thoải mái, “mượn” tính năng thương mại của người khác thì không.
Tiết kiệm 30–60% chi phí có phải phóng đại không?
Đó là khoảng ước lượng tham khảo, không phải cam kết. Mức tiết kiệm thực tế phụ thuộc vào việc khách đang lãng phí bao nhiêu: một team chạy mọi thứ trên model cao cấp không cache sẽ có dư địa rất lớn, còn một team đã tối ưu sẵn thì dư địa nhỏ. Nguyên tắc là chỉ đưa con số sau khi đã đo log thật của khách, không hứa trước.
Rào cản lớn nhất khi bán dịch vụ này ở Việt Nam là gì?
Là niềm tin về dữ liệu. Proxy chi phí nhìn thấy toàn bộ prompt và phản hồi, trong đó có thể có thông tin khách hàng. Giải pháp là ưu tiên phương án tự host trong hạ tầng của chính doanh nghiệp, ký thoả thuận bảo mật rõ ràng và minh bạch về việc log được lưu ở đâu, trong bao lâu.
Chốt lại cho builder
Chi phí LLM là một bài toán vừa kỹ thuật vừa tài chính, và phần lớn doanh nghiệp Việt đang giải nó bằng cảm tính. Bạn không cần phát minh công nghệ mới — công cụ lõi đã có sẵn và miễn phí theo MIT. Cái bạn bán là khả năng biến hoá đơn mờ mịt thành con số rõ ràng và khoản tiết kiệm đo được. Bắt đầu bằng một gói audit gọn trong 1–2 tuần, chốt 2–3 khách đầu để lấy case study, rồi mới quyết định có leo lên vận hành theo tháng hay sản phẩm hoá. Đó là con đường ít rủi ro nhất để đi từ tín hiệu tới doanh thu thật.
— AIToEarn Radar
