ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

BEIR (Điểm chuẩn hiệu suất tìm kiếm)

BEIR là một tiêu chuẩn đánh giá nhằm đo lường độ chính xác của mô hình tìm kiếm không có lần chụp nào trong nhiều nhiệm vụ với các đặc điểm khác nhau, chẳng hạn như trả lời câu hỏi và xác minh thực tế.

BEIR đã được đề xuất làm chuẩn mực để đánh giá tìm kiếm không có kết quả bao gồm 18 tác vụ tìm kiếm khác nhau (trả lời câu hỏi, xác minh thực tế, phát hiện câu hỏi trùng lặp, v.v.) và được coi là một trong những tiêu chuẩn ngành để đo lường hiệu suất tổng quát của các mô hình nhúng và các thành phần tìm kiếm RAG. Do có vấn đề về độ chính xác của một tập dữ liệu nên hiệu suất sẽ giảm ngay khi trường thay đổi, do đó, tính năng này là so sánh điểm trung bình (nDCG@10, v.v.) trên nhiều miền. Tuy nhiên, người ta đã chỉ ra rằng trong hoạt động thực tế kể từ năm 2026, ngay cả một mô hình có điểm BEIR cao cũng sẽ yếu so với thuật ngữ kỹ thuật hoặc cấu trúc tài liệu theo miền cụ thể của công ty và độ chính xác của nó có thể thấp hơn mong đợi khi được tích hợp vào đường dẫn RAG thực tế. Ngoài ra, về mặt chi phí đánh giá, việc tái tạo đầy đủ tất cả 18 nhiệm vụ sẽ tốn kém về mặt tính toán, do đó, nó được áp dụng rộng rãi trong lĩnh vực này để chỉ trích xuất một tập hợp con gần với miền của công ty và tạo ra một điểm chuẩn duy nhất. Khi thực hiện lựa chọn, điều quan trọng là không chỉ kiểm tra điểm tổng thể mà còn kiểm tra điểm riêng lẻ cho các nhiệm vụ gần với dữ liệu của công ty bạn.

Thuật ngữ liên quan