ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

MLA (Chú ý nhiều tiềm ẩn)

MLA (sự chú ý tiềm ẩn nhiều đầu) là phiên bản cải tiến của cơ chế chú ý, nén bộ đệm KV thành các vectơ tiềm ẩn thứ hạng thấp trong quá trình suy luận của Transformer, giảm mức sử dụng bộ nhớ và chi phí tính toán.

MLA là một phương pháp nén các khóa/giá trị được giữ riêng cho từng đầu trong Chú ý nhiều đầu (MHA) tiêu chuẩn thành các vectơ tiềm ẩn cấp thấp và sau đó khôi phục chúng trong quá trình suy luận. Nó đã được đề xuất trong DeepSeek-V2 và được cho là được thiết kế để đạt được độ chính xác tương tự hoặc cao hơn với ít bộ đệm KV hơn GQA và MQA. Trong suy luận ngữ cảnh dài, dung lượng bộ nhớ trong bộ đệm KV ảnh hưởng đến chi phí suy luận và số lượng GPU, do đó, có thể sẽ có sự khác biệt giữa thành công và thất bại trong hoạt động thực tế vào năm 2026, khi độ dài ngữ cảnh sẽ đạt tới hàng trăm nghìn mã thông báo. Những cạm bẫy trong lĩnh vực này là không thể đạt được hiệu quả giảm bộ nhớ theo lý thuyết trừ khi hỗ trợ hạt nhân chuyên dụng ở phía công cụ suy luận, chẳng hạn như vLLM hoặc SGLang, đã bắt kịp và độ chính xác đó có xu hướng giảm đi nếu lượng tử hóa vectơ tiềm ẩn được thực hiện một cách thô thiển. Khi chọn một nền tảng nội bộ, thông lệ tiêu chuẩn trước tiên là không chỉ kiểm tra các giá trị lý thuyết của mô hình mà còn kiểm tra xem công cụ suy luận bạn dự định sử dụng có được tối ưu hóa cho MLA hay không.

Thuật ngữ liên quan