ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Chú ý chìm

Mức độ chú ý là một hiện tượng trong cơ chế tự chú ý của Transformer trong đó trọng lượng chú ý tập trung vào một mã thông báo cụ thể (thường là mã thông báo đầu tiên) mặc dù nó ít liên quan đến ngữ nghĩa.

Mức độ chú ý là một hiện tượng được báo cáo trong nghiên cứu Truyền phát LLM vào năm 2023 và được cho là đề cập đến thực tế là trong cơ chế tự chú ý của LLM dựa trên Transformer, các mã thông báo cụ thể ở gần đầu tiếp tục nhận được trọng số chú ý cao bất kể tầm quan trọng về mặt ngữ nghĩa của chúng. Điều này được giải thích là do do đặc tính chuẩn hóa của softmax nên cần có một nơi để “vứt bỏ” sự chú ý. Khi giảm bộ đệm KV bằng cách sử dụng suy luận ngữ cảnh dài, người ta biết rằng nếu chỉ còn lại các mã thông báo chú ý này, chất lượng đầu ra sẽ không giảm đáng kể ngay cả khi bối cảnh cũ bị loại bỏ và đây là cơ sở của StreamingLLM và các kỹ thuật hiệu quả tiếp theo. Trong hoạt động thực tế kể từ năm 2026, nhiều mô hình và khung tuyên bố hỗ trợ ngữ cảnh dài thực hiện nén bộ nhớ đệm KV dựa trên thuộc tính này. Vì vậy, khi tự mình triển khai quản lý ngữ cảnh, sẽ có một rủi ro là nếu bạn xử lý sai mức chú ý, độ chính xác theo dõi ngữ cảnh sẽ giảm để đổi lấy việc giảm chi phí. Khi chọn một mô hình hoặc thư viện trong trường, bạn nên sử dụng điểm chuẩn để kiểm tra xem tính nhất quán của phản hồi trong bối cảnh dài có thực sự được duy trì hay không và không đưa ra quyết định chỉ dựa trên giá trị thị trường của số lượng mã thông báo.

Thuật ngữ liên quan