vLLM là engine phục vụ (serving) LLM cho throughput cao và tiết kiệm bộ nhớ nhờ kỹ thuật PagedAttention, phục vụ nhiều người dùng đồng thời. Là lựa chọn phổ biến để tự vận hành API mô hình quy mô lớn.
Ứng dụng
- Tự dựng API LLM riêng thay cho gọi API trả tiền theo token
- Phục vụ nhiều request đồng thời với chi phí GPU tối ưu
- Chạy model mở cỡ lớn trên cụm GPU nội bộ
Hướng kiếm tiền: Vận hành một endpoint LLM chia sẻ cho nhiều khách nhỏ, bán theo dung lượng và ăn chênh lệch chi phí hạ tầng.
⭐ 91k (ghi nhận) · nhóm: Serving LLM · license: Apache-2.0
Được nhắc trong bản tin
Đi tiếp: Xem Tổng hợp giải pháp để đóng gói repo này thành dịch vụ.
