SLM là một mô hình ngôn ngữ nhẹ, giữ số lượng tham số dưới hàng tỷ. Nó hoạt động với chi phí thấp hơn và độ trễ thấp hơn so với LLM quy mô lớn như GPT-4, khiến nó phù hợp để tích hợp vào các thiết bị biên và môi trường tại chỗ.
SLM (Mô hình ngôn ngữ nhỏ) là thuật ngữ chung cho các mô hình ngôn ngữ có tham số khoảng 1B đến 13B. Các ví dụ đại diện bao gồm Phi-3, Gemma và Mistral 7B và chi phí suy luận có thể giảm xuống khoảng 1/10 đến 1/100 so với các LLM quy mô cực lớn như GPT-4o và Claude 3 Opus.
Tại nơi làm việc vào năm 2026, thiết kế `` giao mọi nhiệm vụ cho lớp GPT-4 '' sẽ được xem xét lại và các cấu hình kết hợp sử dụng SLM và LLM riêng biệt sẽ trở thành xu hướng chủ đạo. Trong các nghiên cứu điển hình do ReviewAI điều tra, một số công ty được phát hiện đã giảm 60-80% chi phí API hàng tháng bằng cách giảm tải các nhiệm vụ lặp đi lặp lại như phân loại biểu mẫu tiêu chuẩn, phản hồi Câu hỏi thường gặp nội bộ và hoàn thành mã cho SLM.
Cạm bẫy trong hoạt động thực tế là việc xác định sự phù hợp của nhiệm vụ. SLM yếu trong các bản tóm tắt văn bản dài, lý luận nhiều giai đoạn và trộn đa ngôn ngữ và nếu bạn cố gắng thay thế chúng bằng SLM, độ chính xác sẽ bị giảm đáng kể. Xét về giá thị trường, loại API đám mây (Mistral, v.v.) có giá 0,1 đến 0,3 đô la cho mỗi mã thông báo 1 triệu, trong khi loại lưu trữ nội bộ có phí máy chủ GPU (300.000 đến 500.000 yên Nhật mỗi tháng cho H100). Phương pháp lựa chọn tiêu chuẩn trong trường này dựa trên ba trục: yêu cầu về độ trễ, hạn chế về quyền riêng tư và tần suất lặp lại.