llama.cpp là engine suy luận LLM viết bằng C/C++, chạy model định dạng GGUF đã lượng tử hoá trên CPU, GPU NVIDIA/AMD hay chip Apple. Là lớp nền tảng phía dưới rất nhiều công cụ chạy AI cục bộ hiện nay.
Ứng dụng
- Chạy model AI trên phần cứng phổ thông, cả máy không có GPU rời
- Nhúng suy luận LLM vào phần mềm hoặc thiết bị nhúng
- Tối ưu chi phí bằng cách lượng tử hoá model xuống 4-bit
Hướng kiếm tiền: Nhận job tối ưu và triển khai model lượng tử hoá cho khách cần chạy AI rẻ trên hạ tầng có sẵn.
⭐ 129k (ghi nhận) · nhóm: Suy luận LLM · license: MIT
Được nhắc trong bản tin
Đi tiếp: Xem Tổng hợp giải pháp để đóng gói repo này thành dịch vụ.
