ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

COMET (đánh giá chất lượng dịch máy)

COMET là chỉ số đánh giá tự động sử dụng việc nhúng các mô hình đa ngôn ngữ được đào tạo trước để chấm điểm chất lượng dịch máy có mối tương quan cao với đánh giá của con người.

COMET (Số liệu được tối ưu hóa đa ngôn ngữ để đánh giá bản dịch) là số liệu đánh giá tự động cho bản dịch máy được phát triển bởi Unbabel. Văn bản gốc, văn bản được dịch bằng máy và bản dịch tham chiếu thủ công được nhập vào mô hình đa ngôn ngữ được đào tạo trước (dựa trên XLM-R) và mức độ gần gũi về ngữ nghĩa được tính điểm hồi quy. Trong các nhiệm vụ đánh giá của WMT (Hội nghị quốc tế về dịch máy), BLEU được cho là có mối tương quan cao hơn với đánh giá của con người so với BLEU, được đo bằng cách so khớp n-gram và được áp dụng rộng rãi như một tiêu chuẩn ngành để đánh giá chất lượng dịch thuật. Trong hoạt động thực tế kể từ năm 2026, chi phí suy luận GPU có thể sẽ trở thành một cạm bẫy. Trong khi BLEU chỉ yêu cầu so sánh chuỗi nhẹ thì COMET liên quan đến suy luận của một mô hình lớn, do đó chi phí tính toán và thời gian xử lý có thể đáng kể khi đánh giá một số lượng lớn tài liệu cùng một lúc. Vì giá trị tuyệt đối của điểm thay đổi tùy theo phiên bản mô hình và dữ liệu huấn luyện nên lý thuyết trường là tránh so sánh giữa các mô hình COMET khác nhau và chỉ thực hiện so sánh tương đối khi sử dụng cùng một mô hình và trong cùng điều kiện. Nguyên tắc lựa chọn là sử dụng BLEU kết hợp với các bản dịch có nhiều ngôn ngữ thiểu số hoặc thuật ngữ kỹ thuật và tạo ra một hệ thống không bỏ sót bất kỳ sự cố nào về ý nghĩa.

Thuật ngữ liên quan