PagedAttention là cơ chế quản lý bộ đệm KV cho suy luận LLM theo đơn vị khối bằng phương pháp phân trang của hệ điều hành, ngăn chặn sự phân mảnh bộ nhớ và tăng hiệu quả xử lý.
PagedAttention là một phương pháp quản lý bộ đệm KV được tạo trong quá trình suy luận các mô hình ngôn ngữ quy mô lớn theo đơn vị khối có kích thước cố định, tương tự như công nghệ phân trang trong bộ nhớ ảo của HĐH và được cho là được sử dụng bởi một số công cụ suy luận như vLLM. Các phương pháp thông thường dự trữ trước các khu vực liền kề có xu hướng tạo ra các khu vực không được sử dụng và dẫn đến phân mảnh bộ nhớ, nhưng việc phân chia khối được cho là giúp giảm lãng phí và tăng số lượng yêu cầu có thể được xử lý đồng thời (kích thước lô). Trong hoạt động thực tế kể từ năm 2026, cách sử dụng bộ nhớ GPU sẽ liên quan trực tiếp đến số lượng máy chủ = chi phí, vì vậy khi chọn nền tảng suy luận, việc nó có hỗ trợ PagedAttention hay không là một trong những yếu tố sẽ ảnh hưởng đến giá mua sắm GPU trên thị trường. Tuy nhiên, cần phải nhận thức được những cạm bẫy của bối cảnh dài và các cuộc đối thoại nhiều lượt, có thể khiến chi phí quản lý khối và sự phân mảnh xảy ra lần nữa cũng như sự khác biệt khi triển khai tùy thuộc vào mô hình hoặc khung.