BBH là một bộ chỉ số đánh giá chỉ trích xuất 23 nhiệm vụ khó mà LLM thông thường có tỷ lệ trả lời đúng trung bình thấp hơn mức trung bình của con người từ BIG-Bench, bao gồm hơn 200 nhiệm vụ.
BBH được cho là một tập hợp con được lựa chọn cẩn thận gồm 23 nhiệm vụ từ BIG-Bench, bao gồm nhiều nhiệm vụ khác nhau mà LLM vào thời điểm đó có tỷ lệ trả lời đúng thấp hơn mức trung bình đối với con người nếu không có lời nhắc Chuỗi Tư duy (CoT). Nó chủ yếu liên quan đến các vấn đề không thể giải quyết bằng cách nhớ lại kiến thức đơn giản, chẳng hạn như suy luận logic, phán đoán nhân quả và thao tác ký hiệu nhiều bước, và được đặc trưng bởi thực tế là điểm số thay đổi rất nhiều tùy thuộc vào việc có sử dụng chuỗi gợi ý suy nghĩ hay không. Nó được trích dẫn rộng rãi trong các tài liệu nghiên cứu và thẻ mô hình như một chỉ số đo lường khả năng suy luận cơ bản của một mô hình, nhưng một số chỉ ra rằng trong hoạt động thực tế vào năm 2026, nhiều mô hình hàng đầu sẽ đạt điểm cao và khả năng phân biệt đối xử của nó với tư cách là một chỉ báo đang giảm dần. Khi sử dụng nó để lựa chọn mô hình tại hiện trường, thông thường là không dựa vào điểm độc lập BBH mà tiến hành xác minh riêng bằng cách sử dụng các tác vụ tương tự như trường hợp sử dụng của riêng bạn (tóm tắt, phân loại, suy luận nhiều giai đoạn giống như agent, v.v.). Nếu bạn chạy quy trình đánh giá của riêng mình, điểm số có thể dao động hàng chục điểm tùy thuộc vào định dạng lời nhắc (có hoặc không có vài lần bắn/CoT), do đó, cần phải lặp lại thử nghiệm trong nhiều điều kiện để có cảm nhận về thị trường, đồng thời phải tính đến chi phí tính toán và số giờ công khi đưa ra lựa chọn.