SGLang là framework phục vụ hiệu năng cao cho mô hình ngôn ngữ và đa phương thức, nổi bật với RadixAttention giúp cache tiền tố và sinh có cấu trúc. Hướng tới tốc độ và độ ổn định khi tự host model.
Ứng dụng
- Serving model với prompt lặp lại nhiều để tận dụng cache
- Chạy tác vụ sinh có ràng buộc cấu trúc (JSON, schema)
- Tối ưu latency cho ứng dụng agent gọi model liên tục
Hướng kiếm tiền: Cung cấp dịch vụ serving low-latency cho các đội làm agent cần model phản hồi nhanh và ổn định.
⭐ 31.7k (ghi nhận) · nhóm: Serving LLM · license: Apache-2.0
Được nhắc trong bản tin
Đi tiếp: Xem Tổng hợp giải pháp để đóng gói repo này thành dịch vụ.
