ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

AWQ (lượng tử hóa nhận biết kích hoạt)

AWQ là phương pháp lượng tử hóa LLM duy trì độ chính xác chỉ cho các trọng số quan trọng dựa trên việc phân phối các giá trị kích hoạt và giảm số bit cho các trọng số khác.

AWQ (Activation-aware Weight Quantization) được coi là một trong những phương pháp lượng tử hóa giúp nén trọng lượng của LLM xuống còn khoảng 4 bit. Bằng cách quan sát trước độ lớn của các giá trị kích hoạt và lượng tử hóa đồng thời bảo vệ các chuỗi trọng số có tác động lớn đến đầu ra, người ta cho rằng việc ngăn chặn sự suy giảm độ chính xác dễ dàng hơn so với lượng tử hóa đơn giản như GPTQ và được sử dụng rộng rãi trong các khung suy luận. Trong hoạt động thực tế kể từ năm 2026, người ta đã chỉ ra một cạm bẫy là tốc độ nén càng cao thì độ chính xác càng bị suy giảm rõ rệt trong các nhiệm vụ lý luận câu dài và hướng dẫn nhiều giai đoạn sau đó, đồng thời người ta cho rằng việc xác minh bằng cách so sánh đầu ra trước và sau khi lượng tử hóa là điều cần thiết. Về mặt chi phí, mặc dù việc giảm kích thước mô hình có thể giảm đáng kể chi phí lưu trữ và sử dụng GPU VRAM, nhưng không thể bỏ qua số giờ công cần thiết để lượng tử hóa và xác minh. Đối với phương pháp lựa chọn tại hiện trường, việc kiểm tra hành vi trước tiên với lượng tử hóa nhẹ hơn như 16bit hoặc INT8 được coi là thực tế, sau đó dần dần chuyển sang lượng tử hóa có trọng số như AWQ nếu hạn chế về chi phí lớn.

Thuật ngữ liên quan