FlashAttention là thuật toán sử dụng hệ thống phân cấp bộ nhớ GPU để thực thi cơ chế chú ý của Transformer ở tốc độ cao và ít bộ nhớ hơn. Giảm đáng kể chi phí tính toán khi xử lý ngữ cảnh dài.
FlashAttention là thuật toán tối ưu hóa tính toán sự chú ý cho GPU được công bố bởi Tri Dao et al. vào năm 2022. Máy biến áp thông thường tiêu thụ VRAM tỷ lệ với bình phương độ dài chuỗi, khiến việc học và suy luận trong các bối cảnh dài trở thành nút thắt cổ chai. FlashAttention cải tiến ở chỗ nó sử dụng phương pháp xếp lớp để giảm thiểu truyền dữ liệu giữa HBM (bộ nhớ băng thông cao) của GPU và SRAM trên chip, tuyến tính hóa việc sử dụng bộ nhớ theo độ dài chuỗi trong khi vẫn giữ nguyên kết quả tính toán về mặt số lượng.
Kể từ năm 2026, nó đã phát triển thành FlashAttention-3 và đã được tích hợp vào PyTorch, vLLM và Hugging Face Transformers. Khi đánh giá hoạt động thực tế của API LLM bằng ReviewAI, liệu FlashAttention có hiệu quả ở phần phụ trợ hay không là một chỉ báo quan trọng liên quan trực tiếp đến tốc độ suy luận và chi phí. Dựa trên ước tính của thị trường trong lĩnh vực này, đã có báo cáo rằng chi phí suy luận của cùng một mô hình khác nhau từ 2 đến 4 lần giữa các môi trường tương thích với FlashAttention (H100/A100) và các môi trường không tương thích với FlashAttention. Những lợi ích có thể nhận thấy rõ khi cửa sổ ngữ cảnh là 32K trở lên và kích thước lô tối đa trong quá trình tinh chỉnh cũng tăng lên đáng kể. Mặt khác, trong bối cảnh ngắn hạn, chi phí thực hiện có thể phản tác dụng nên cần lựa chọn tùy theo mục đích.