ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

BERTScore (đánh giá độ tương tự về ngữ nghĩa)

BERTScore là chỉ số đánh giá đo lường chất lượng ngữ nghĩa của việc tạo văn bản bằng cách sử dụng tính năng nhúng ngữ cảnh của BERT. Nó gần với giác quan của con người hơn so với BLEU/ROUGE trên bề mặt và có thể cho điểm cao khi diễn giải và diễn đạt đồng nghĩa.

BERTScore là thước đo đánh giá được đề xuất bởi Zhang et al. vào năm 2019, chuyển đổi mã thông báo của từng câu ứng cử viên và câu tham chiếu thành các phần nhúng BERT, thực hiện đối sánh tham lam bằng cách sử dụng độ tương tự cosine và tính toán độ chính xác, thu hồi và F1. Trong khi BLEU/ROUGE thông thường dựa vào việc kết hợp chuỗi hời hợt, điểm mạnh lớn nhất của BERTScore là nó có thể mang lại điểm số cao phù hợp ngay cả đối với các cách diễn đạt tương đương về mặt ngữ nghĩa.

Trong các hoạt động thực tế tại hiện trường vào năm 2026, nó sẽ được áp dụng rộng rãi để đánh giá chất lượng phản hồi LLM và xác minh đầu ra hệ thống RAG. Nhược điểm là chi phí tính toán cao và việc đánh giá hàng trăm trường hợp không có GPU có thể dẫn đến độ trễ vài phút. Tiếp theo, các kết quả rất khác nhau tùy thuộc vào loại mô hình BERT (khuyến nghị roberta-large), do đó, điều cần thiết là phải sửa cùng một mô hình để so sánh giữa các nhóm. Hơn nữa, ngay cả khi mức độ tương tự về ngữ nghĩa cao, độ chính xác thực tế không được đảm bảo, do đó, việc tự tin thái quá trong việc phát hiện ảo giác đều bị cấm.

Theo ý tưởng chung về cách chọn bằng ReviewAI, thư viện `bert-score` của mã nguồn mở (miễn phí) là đủ để kiểm tra đơn giản. Trong quy trình đánh giá LLM thực tế, cấu hình hai giai đoạn kết hợp với LLM với tư cách là người đánh giá, với BERTScore làm bộ lọc chính và GPT-4o làm ý kiến ​​thứ hai, sẽ là ý kiến ​​thực tế vào năm 2026. Thực tiễn tốt nhất trong lĩnh vực này là ưu tiên xem xét các mẫu dưới ngưỡng thay vì chấm điểm tất cả các trường hợp.

Thuật ngữ liên quan