SGLang là một khung máy chủ suy luận nguồn mở được thiết kế để tăng tốc độ xử lý suy luận cho các mô hình ngôn ngữ quy mô lớn (LLM).
SGLang là máy chủ suy luận LLM do UC Berkeley phát triển, có tính năng tái sử dụng bộ đệm KV bằng RadixAttention và tạo đầu ra có cấu trúc tốc độ cao, đồng thời được cho là được áp dụng rộng rãi như một giải pháp thay thế cho vLLM. Trong hoạt động thực tế kể từ năm 2026, có thể tăng thông lượng bằng cách chia sẻ tiền tố nhắc chung cho nhiều yêu cầu trong bộ đệm, nhưng rất khó điều chỉnh việc quản lý bộ nhớ tùy thuộc vào kiểu máy và kích thước lô, đồng thời người ta đã chỉ ra rằng có những cạm bẫy trong OOM nếu bạn đánh giá sai mức sử dụng GPU VRAM. Về cách chọn trong trường, người ta thường nói rằng SGLang được sử dụng làm nền tảng API nội bộ để xử lý đầu ra có cấu trúc và ngữ cảnh dài, còn vLLM hoặc TGI được sử dụng khi bạn muốn thiết lập nhanh chóng điểm cuối tương thích OpenAI cho mục đích chung. Về mặt chi phí, phí theo giờ của phiên bản GPU chiếm ưu thế và không có phí cấp phép cho chính máy chủ suy luận, vì vậy tối ưu hóa chi phí bằng cách sử dụng nguồn mở là mục tiêu chính. Hoạt động đòi hỏi kiến thức về giám sát và tự động điều chỉnh quy mô với Kubernetes, v.v. và có vẻ như nhiều nhóm nhỏ sẽ cân nhắc so sánh nó với các dịch vụ suy luận được quản lý trước khi quyết định tự mình vận hành nó.