Phân tích lỗi là một quá trình đánh giá nhằm thu thập và phân loại lỗi đầu ra theo mô hình AI, xác định các kiểu nguyên nhân và cải thiện độ chính xác.
Phân tích lỗi là một phương pháp đánh giá để kiểm tra các lỗi riêng lẻ trong đầu ra của mô hình LLM và ML, tạo mẫu và xác định nguyên nhân gốc rễ. Nó được sử dụng cho mục đích trực quan hóa các chế độ lỗi không thể nhìn thấy chỉ bằng các chỉ báo độ chính xác. Cụ thể, thông lệ là thu thập mẫu câu trả lời sai, phân loại chúng thành các loại nguyên nhân (thiếu kiến thức, hiểu sai hướng dẫn, ảo giác, định dạng sai, v.v.), sau đó ưu tiên các biện pháp đối phó từ các danh mục thường gặp nhất. Trong hoạt động thực tế vào năm 2026, người ta đã chỉ ra rằng sẽ có trường hợp ngừng cải tiến bằng cách chỉ xem điểm đánh giá tự động và những lỗi chỉ xảy ra với các mẫu đầu vào cụ thể sẽ bị bỏ qua. Việc kiểm tra lỗi mẫu theo cách thủ công rất tốn kém, do đó, nó được áp dụng rộng rãi để tự động sàng lọc ban đầu bằng cách sử dụng các công cụ phân tích nhật ký và đánh giá LLM, đồng thời hạn chế xem xét thủ công đối với các mẫu có tầm quan trọng cao. Khi chọn một công cụ, việc dễ dàng tìm kiếm, phân loại và chia sẻ nhật ký giữa các nhóm được coi là yếu tố quyết định giá trị thị trường trong sử dụng thực tế.