ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Bộ đệm KV

Bộ đệm KV là công nghệ tốc độ cao lưu trữ ma trận khóa (K) và giá trị (V) của cơ chế tự chú ý trong bộ nhớ mà không tính toán lại chúng trong quá trình suy luận LM.

Một công nghệ lưu trữ các ma trận khóa (K) và giá trị (V) được tạo bởi cơ chế tự chú ý trong bộ nhớ trong mô hình ngôn ngữ quy mô lớn (LLM) dựa trên Transformer. Vì việc tính toán lại ma trận K và V cho tất cả mã thông báo mỗi khi mã thông báo được tạo đòi hỏi chi phí tính toán rất lớn nên bộ nhớ đệm KV sẽ sử dụng lại các mã thông báo trước đây để cải thiện đáng kể tốc độ suy luận.

Cạm bẫy lớn nhất trong hoạt động thực tế vào năm 2026 là mức tiêu thụ bộ nhớ. Chỉ duy trì bối cảnh 128k token trong mô hình lớp GPT-4 đã tiêu tốn hàng chục GB VRAM và có nhiều trường hợp trong lĩnh vực này thường xuyên xảy ra lỗi OOM do thiếu VRAM. Là một biện pháp đối phó, các phương pháp tiết kiệm bộ nhớ như FlashAttention, PagedAttention (vLLM) và lượng tử hóa INT8/FP8 KV đang trở nên phổ biến và điều quan trọng là phải chọn chúng tùy theo ứng dụng.

Xét về giá thị trường, GPU loại A100 80GB có thể duy trì bộ đệm KV đầy đủ có giá từ vài trăm đến vài nghìn yên Nhật mỗi giờ trên đám mây. Việc áp dụng phương pháp cửa sổ trượt và KV lượng tử hóa có hiệu quả để tối ưu hóa chi phí và ReviewAI sử dụng hiệu suất bộ đệm KV làm chỉ báo quan trọng về tính thực tiễn khi đánh giá các công cụ AI agent xử lý ngữ cảnh văn bản dài.

Thuật ngữ liên quan