ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

BLEU (đánh giá dịch máy)

BLEU là chỉ số đánh giá tự động chấm điểm chất lượng của bản dịch máy và tạo văn bản bằng cách so sánh nó với bản dịch tham chiếu của con người.

BLEU (Nghiên cứu đánh giá song ngữ) là thước đo đánh giá so sánh văn bản do mô hình tạo ra với câu tham chiếu do con người tạo ra và tính điểm từ 0 đến 1 dựa trên tỷ lệ trùng khớp n-gram. Nó được IBM đề xuất vào năm 2002 và đã trở thành tiêu chuẩn công nghiệp để đánh giá tự động dịch máy.

Trong hoạt động thực tế vào năm 2026, mặc dù BLEU “nhanh và rẻ” nhưng nó lại ẩn chứa một cạm bẫy chết người. Ngay cả khi nó có điểm cao, điều đó không nhất thiết có nghĩa là nó chính xác về mặt ngữ nghĩa và nó dễ bị thay đổi về cách diễn đạt và trật tự từ. Trong lĩnh vực này, có cảm giác chung rằng ``BLEU 0,4 hoặc cao hơn là điểm đậu'', nhưng nếu áp dụng trực tiếp vào việc đánh giá các câu được tạo ra bởi LLM, việc đánh giá quá cao và đánh giá thấp sẽ thường xuyên xảy ra.

Từ quan điểm của ReviewAI, số trường hợp BLEU được sử dụng một mình trong các hoạt động thực tế đang giảm dần và xu hướng vào năm 2026 là kết hợp nó với BERTScore và ROUGE hoặc bổ sung nó với LLM-với tư cách là thẩm phán. Mặc dù nó vẫn hiệu quả trong những trường hợp bạn muốn giảm chi phí bằng cách kiểm soát chất lượng của các tác vụ dịch thuật và tóm tắt nhưng nó không phù hợp để đánh giá chatbot hoặc tạo văn bản dài. Khi chọn một công cụ, lý thuyết tại chỗ là trước tiên hãy sắp xếp những gì bạn muốn đo lường và sau đó chọn các chỉ báo.

Thuật ngữ liên quan