Needle in a Haystack là một phương pháp đánh giá để đo lường xem liệu LLM có thể trích xuất chính xác thông tin cụ thể từ các văn bản dài hay không. Hiệu suất hiệu quả của cửa sổ ngữ cảnh có thể được hiển thị bằng cách nhúng vị trí và được sử dụng làm chỉ báo tham chiếu cho thiết kế RAG.
Needle in a Haystack (NIAH) là một phương pháp do Gregory Kamradt công bố trong đánh giá Claude 2.1 nhằm kiểm tra một cách có hệ thống xem liệu một mô hình có thể trả lời chính xác một sự kiện (kim) ẩn trong một lượng lớn văn bản giả (haystack) hay không. Bằng cách vẽ bản đồ nhiệt trên hai trục: độ dài tài liệu (số lượng mã thông báo) và vị trí nhúng thông tin (bắt đầu, giữa, cuối), có thể hình dung được độ chính xác giảm ở đâu.
Tính đến năm 2026, cạm bẫy lớn nhất trong lĩnh vực này là ``độ dài ngữ cảnh danh nghĩa ≠ hiệu suất hiệu quả.'' Ngay cả trong các mô hình tuyên bố có 1 triệu mã thông báo, đã có nhiều báo cáo về hiện tượng ``thiếu'' trong đó tỷ lệ câu trả lời đúng giảm đáng kể ở gần giữa (50-70% tổng số) và đây là điểm kiểm tra đầu tiên khi độ chính xác của hệ thống RAG chậm chạp.
Về chi phí, chi phí API có thể lên tới hàng chục nghìn yên Nhật chỉ bằng cách thử nghiệm 128 nghìn mã thông báo ở nhiều địa điểm và nhiều lần. Trong hoạt động thực tế của ReviewAI, việc thực hành ``các bài kiểm tra toàn thời gian mỗi tháng một lần và đánh giá hàng ngày được thay thế bằng các tờ giấy ngắn 16K'' đang được thiết lập. Khi lựa chọn một mô hình, nguyên tắc vàng trong lĩnh vực này là ưu tiên hàng đầu cho điểm NIAH dựa trên dữ liệu nội bộ so với số liệu chính thức.