GQA (chú ý truy vấn được nhóm) là một loại cơ chế chú ý trong đó nhiều đầu truy vấn chia sẻ khóa và giá trị trong các nhóm để giảm mức sử dụng bộ nhớ và chi phí tính toán trong quá trình suy luận.
GQA (Chú ý truy vấn được nhóm) là một phương pháp trong đó nhiều đầu truy vấn được nhóm thành một số nhóm nhỏ trong cơ chế chú ý của Transformer, đồng thời các khóa và giá trị được chia sẻ trong nhóm. Trong khi Multi-Head Warning (MHA) có các khóa/giá trị riêng cho từng đầu thì GQA chia sẻ chúng theo nhóm, giúp giảm đáng kể dung lượng bộ nhớ của bộ đệm KV và tăng tốc độ suy luận. Tính đến năm 2026, nhiều LLM trọng lượng mở lớn, chẳng hạn như các mẫu Llama 2/3 và Mistral, đã áp dụng nó và nó được cho là đã trở thành tiêu chuẩn ngành trên thực tế. Trong hoạt động thực tế, mặc dù chi phí suy luận giảm khi số lượng nhóm giảm, người ta cho rằng chất lượng đầu ra có xu hướng giảm nhẹ nếu quá gần với Chú ý đa truy vấn (MQA), vì vậy tại hiện trường cần chọn số lượng nhóm có sự cân bằng giữa chất lượng và chi phí. Đặc biệt, đối với các ứng dụng RAG và agent xử lý ngữ cảnh dài, việc mở rộng bộ đệm KV có xu hướng là một vấn đề lớn về hiệu suất thị trường và việc lựa chọn mô hình áp dụng GQA sẽ ảnh hưởng đến chi phí cơ sở hạ tầng của toàn bộ dịch vụ.