ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Chú ý thưa thớt

Chú ý thưa thớt là phương pháp trong đó cơ chế tự chú ý của Transformer không tính toán tất cả các cặp token mà thu hẹp lại một phần quan trọng để giảm lượng tính toán và bộ nhớ.

Sự chú ý thưa thớt đề cập đến một nhóm các phương pháp chỉ tập trung tính toán vào một phần cặp mã thông báo bằng cách sử dụng cửa sổ cục bộ, đơn vị khối, định tuyến có thể học được, v.v., trái ngược với sự chú ý hoàn toàn thông thường (tính toán tất cả các mã thông báo so với tất cả các mã thông báo, trong đó số lượng phép tính tăng theo bình phương của độ dài chuỗi). Sau nghiên cứu về Longformer và BigBird, người ta nói rằng trong những năm gần đây, các kiến ​​trúc LLM vốn kết hợp phân tán đã được áp dụng rộng rãi. Mục đích là để giảm chi phí tính toán và mức sử dụng bộ nhớ khi xử lý các cửa sổ ngữ cảnh dài và người ta nói rằng độ phức tạp tính toán có thể được đưa đến gần hơn với O(n log n) hoặc O(n) từ O(n2). Tuy nhiên, trong hoạt động thực tế kể từ năm 2026, sẽ luôn có sự đánh đổi giữa độ chính xác và thông lượng, điều này có thể sẽ là một cạm bẫy. Người ta nói rằng nếu độ chính xác của việc xác định các mã thông báo quan trọng thấp thì thông tin trong ngữ cảnh dài có thể bị bỏ qua, dẫn đến chất lượng câu trả lời thấp hơn so với mô hình chú ý đầy đủ. Về cách chọn mô hình trong hiện trường, hướng dẫn thực tế là sử dụng các mô hình thưa thớt cho các ứng dụng định hướng chi phí không yêu cầu tham chiếu từng từ nghiêm ngặt, chẳng hạn như tóm tắt tài liệu dài và quy trình RAG cũng như các mô hình chú ý đầy đủ cho các ứng dụng yêu cầu tính toàn diện, chẳng hạn như chăm sóc pháp lý và y tế.

Thuật ngữ liên quan