Tóm tắt điều hành
Tín hiệu rõ nhất trên GitHub hôm nay không nằm ở một model mới bóng bẩy, mà ở lớp hạ tầng giúp builder chạy AI ngay trên máy của mình để cắt hoá đơn token. Những repo đứng đầu về sức hút cộng đồng — công cụ chạy model cục bộ, engine suy luận, framework serving — đang gom về mình lượng sao khổng lồ, cho thấy nhu cầu tự chủ chi phí và dữ liệu đã thành xu hướng chính chứ không còn là chuyện của dân nghiên cứu.
Với người kiếm tiền từ AI, đây là một cánh cửa cụ thể: thay vì phụ thuộc hoàn toàn vào API trả tiền theo token, bạn có thể dựng lớp suy luận riêng, đóng gói thành dịch vụ triển khai on-premise, hoặc bán ứng dụng AI chạy offline cho nhóm khách coi trọng bảo mật. Bản tin hôm nay điểm bảy repo mã nguồn mở đang định hình cuộc dịch chuyển “AI về máy nhà” và góc builder đằng sau từng cái tên.
Bản đồ xu hướng
Ba năm qua, mặc định của người làm sản phẩm AI là gọi API đám mây. Nhưng khi ứng dụng chạy thật, hoá đơn token phình lên theo lưu lượng, và không phải khách nào cũng chấp nhận đẩy dữ liệu nhạy cảm ra ngoài. Chính hai áp lực đó — chi phí và quyền riêng tư — đang đẩy sức chú ý về lớp công cụ tự host.
Bức tranh hôm nay có thể chia làm ba tầng. Tầng “chạy dễ” dành cho người dùng cuối và builder muốn dựng nhanh: cài một lệnh, có ngay model chạy cục bộ. Tầng “suy luận lõi” là các engine tối ưu để model chạy được trên phần cứng phổ thông, kể cả máy không GPU rời. Và tầng “serving quy mô” phục vụ nhiều người dùng đồng thời với chi phí GPU tối ưu, dành cho ai muốn tự vận hành một API mô hình thay cho dịch vụ trả phí. Ba tầng này ghép lại thành một stack hoàn chỉnh để đưa AI rời khỏi đám mây.
Điểm đáng chú ý cho builder Việt: mỗi tầng đều là một loại dịch vụ bán được. Có người bán trải nghiệm cài đặt, có người bán tối ưu hiệu năng, có người bán vận hành endpoint chia sẻ. Mỗi repo có trang phân tích riêng trong kho tri thức AIToEarn — bấm vào tên repo để đọc chi tiết cách khai thác.
Cụm công nghệ trong ngày
AI chạy trên máy cá nhân
Đây là cụm gần người dùng nhất: cài đặt gọn, giao diện thân thiện, chạy offline hoàn toàn. ollama/ollama biến việc tải và chạy một model mở thành một dòng lệnh, kèm API tương thích OpenAI để lập trình viên cắm thẳng vào ứng dụng cũ. janhq/jan đi xa hơn với một ứng dụng desktop thay thế ChatGPT chạy 100% offline, phù hợp người dùng cuối. Còn mozilla-ai/llamafile gói cả model lẫn runtime vào một file chạy được, xoá gần hết ma sát cài đặt.
Suy luận LLM lõi
Bên dưới các công cụ tiện dụng là những engine làm phần việc nặng. ggml-org/llama.cpp là lớp nền tảng cho phép model lượng tử hoá chạy trên CPU, GPU đủ loại và cả chip Apple; rất nhiều app “chạy AI cục bộ” thực chất dựa trên nó. ml-explore/mlx tối ưu riêng cho chip Apple silicon, mở khả năng vừa chạy vừa tinh chỉnh model ngay trên MacBook.
Serving LLM quy mô
Khi ứng dụng có nhiều người dùng, bài toán chuyển từ “chạy được” sang “phục vụ nhiều request rẻ và nhanh”. vllm-project/vllm nổi bật với kỹ thuật PagedAttention giúp tiết kiệm bộ nhớ và tăng throughput. sgl-project/sglang tối ưu cache tiền tố và sinh có cấu trúc, hợp với các tác vụ agent gọi model liên tục. Đây là tầng để builder tự dựng một endpoint LLM riêng.
Repo đáng chú ý
Mỗi repo dưới đây có một trang phân tích riêng trong kho tri thức AIToEarn — bấm vào tên repo để đọc chi tiết, xem hướng ứng dụng và cách kiếm tiền.
ollama/ollama
Công cụ chạy LLM cục bộ chỉ với một lệnh, gói sẵn model và API tương thích OpenAI. ⭐ 181k (ghi nhận). Góc kiếm tiền: nhận triển khai AI on-premise cho công ty cần giữ dữ liệu trong tường lửa và tính phí theo dự án.
ggml-org/llama.cpp
Engine suy luận LLM viết bằng C/C++, chạy model GGUF lượng tử hoá trên gần như mọi phần cứng. ⭐ 129k (ghi nhận). Góc kiếm tiền: nhận job tối ưu và lượng tử hoá model để khách chạy AI rẻ trên hạ tầng có sẵn.
vllm-project/vllm
Engine serving throughput cao với PagedAttention, phục vụ nhiều người dùng đồng thời. ⭐ 91k (ghi nhận). Góc kiếm tiền: vận hành một endpoint LLM chia sẻ cho nhiều khách nhỏ và ăn chênh lệch chi phí hạ tầng.
janhq/jan
Ứng dụng thay thế ChatGPT chạy 100% offline trên máy tính, mã nguồn kiểm tra được. ⭐ 44.6k (ghi nhận). Góc kiếm tiền: tuỳ biến và gắn thương hiệu riêng cho doanh nghiệp cần trợ lý AI nội bộ, tính phí cài đặt và hỗ trợ.
sgl-project/sglang
Framework serving hiệu năng cao với RadixAttention, tối ưu cache tiền tố và sinh có cấu trúc. ⭐ 31.7k (ghi nhận). Góc kiếm tiền: cung cấp dịch vụ serving low-latency cho các đội làm agent cần model phản hồi nhanh.
ml-explore/mlx
Framework mảng tối ưu cho chip Apple silicon, chạy và fine-tune model ngay trên Mac. ⭐ 27.5k (ghi nhận). Góc kiếm tiền: làm ứng dụng AI desktop cho người dùng Mac chú trọng riêng tư, bán theo license.
Cơ hội triển khai
Thứ nhất, dịch vụ “AI trong tường lửa”: nhiều phòng khám, văn phòng luật, công ty tài chính nhỏ muốn dùng trợ lý AI nhưng không được đẩy dữ liệu ra cloud. Ghép ollama hoặc Jan với một lớp tài liệu nội bộ, bạn có một sản phẩm triển khai tại chỗ bán được ngay, tính phí cài đặt và bảo trì. Tham khảo cách đóng gói ở Trợ lý AI nội bộ cho ngành nhạy cảm dữ liệu.
Thứ hai, endpoint LLM chia sẻ: dựng vLLM hoặc SGLang trên một máy GPU thuê, phục vụ nhiều khách nhỏ chung một hạ tầng, bán theo dung lượng và ăn chênh lệch so với API đám mây. Đây là mô hình vốn nhẹ, biên lợi nhuận đến từ tối ưu vận hành.
Thứ ba, gói tối ưu chi phí: nhiều đội đang trả tiền API quá mức cho những tác vụ đơn giản. Một dịch vụ tư vấn chuyển các tác vụ nhẹ sang model cục bộ chạy bằng llama.cpp, giữ lại API cho phần khó, có thể cắt đáng kể hoá đơn hàng tháng của khách. Xem thêm hướng đóng gói ở Playbook đóng gói và bán MCP server cho SME.
Rủi ro cần theo dõi
Về phần cứng và chi phí ẩn: tự host không miễn phí — GPU, điện, vận hành đều tốn. Trước khi tư vấn khách bỏ API, hãy tính điểm hoà vốn thực tế theo lưu lượng; ở lưu lượng thấp, API đám mây vẫn có thể rẻ hơn.
Về license và model: engine (llama.cpp MIT, vLLM và SGLang Apache-2.0, Jan Apache-2.0) thường thoáng, nhưng trọng số model bạn nạp vào lại có giấy phép riêng, đôi khi hạn chế dùng thương mại. Luôn kiểm tra license của model, không chỉ của công cụ.
Về vận hành và kỳ vọng: chạy model cục bộ đòi hỏi kỹ năng vận hành thật (giám sát, cập nhật, xử lý sự cố). Đừng bán lời hứa “cài xong là xong”; phần giá trị lâu dài — và doanh thu định kỳ — nằm ở hỗ trợ và tối ưu liên tục.
Danh sách đầy đủ
- ollama/ollama — chạy LLM cục bộ một lệnh, API tương thích OpenAI — ⭐ 181k — cụm AI chạy trên máy cá nhân
- ggml-org/llama.cpp — engine suy luận LLM bằng C/C++ cho GGUF — ⭐ 129k — cụm Suy luận LLM lõi
- vllm-project/vllm — engine serving throughput cao, PagedAttention — ⭐ 91k — cụm Serving LLM quy mô
- janhq/jan — ứng dụng thay ChatGPT chạy 100% offline — ⭐ 44.6k — cụm AI chạy trên máy cá nhân
- sgl-project/sglang — framework serving RadixAttention — ⭐ 31.7k — cụm Serving LLM quy mô
- ml-explore/mlx — framework mảng cho Apple silicon — ⭐ 27.5k — cụm Suy luận LLM lõi
- mozilla-ai/llamafile — gói model và runtime vào một file chạy được — ⭐ 26k — cụm AI chạy trên máy cá nhân
Muốn biến những công cụ này thành dịch vụ bán được? Xem thêm Tổng hợp giải pháp và Phân tích ý tưởng để có khung triển khai và định giá.
— Ban biên tập AIToEarn.
