Lượng tử hóa là công nghệ nén các tham số trọng lượng của mô hình AI xuống độ chính xác bit thấp, cải thiện tốc độ suy luận và giảm mức sử dụng bộ nhớ.
Lượng tử hóa là phương pháp giúp giảm đáng kể chi phí suy luận mô hình bằng cách chuyển đổi các trọng số và hàm kích hoạt mạng thần kinh từ dấu phẩy động 32 bit (FP32) sang các định dạng có độ chính xác thấp hơn như số nguyên 8 bit (INT8) và 4 bit (NF4). Kể từ năm 2026, đây gần như là một bước thiết yếu khi chạy cục bộ các mô hình nguồn mở dựa trên LLaMA và Mistral, đồng thời định dạng GGUF (llama.cpp) và thư viện BitsAndBytes được sử dụng rộng rãi trong lĩnh vực này. Từ quan điểm hoạt động thực tế của ReviewAI, việc lựa chọn Q4_K_M và Q5_K_M là điểm đưa ra quyết định thường xuyên nhất và Q5_K_M là lựa chọn tiêu chuẩn nếu bạn muốn giảm thiểu sự suy giảm độ chính xác và phù hợp với môi trường có VRAM 16GB trở xuống. Điều đáng tiếc là "do bỏ qua đánh giá sau khi lượng tử hóa, bạn nhận ra rằng hiệu suất thực tế mà độ chính xác giảm từ 10% trở lên đối với một tác vụ cụ thể". Kể từ năm 2026, ngoài việc lượng tử hóa trọng lượng như AWQ và GPTQ, lượng tử hóa bộ nhớ đệm KV sẽ được phổ biến rộng rãi, cải thiện đáng kể hiệu quả bộ nhớ khi xử lý các ngữ cảnh dài. Về mặt chi phí, nếu bạn sử dụng GPU của riêng mình, việc lắp model 70B vào 48GB VRAM (tương đương với H100) trong Q4 và vận hành nó mà không mất phí API là thực tế.