Điểm F1 là chỉ số đánh giá là mức trung bình hài hòa của độ chính xác và khả năng thu hồi của mô hình phân loại. Nếu một trong hai giá trị này thấp, giá trị sẽ giảm đáng kể, vì vậy nó được sử dụng rộng rãi để đánh giá hiệu suất của dữ liệu không cân bằng.
Điểm F1 là chỉ số là mức trung bình hài hòa của độ chính xác (tỷ lệ dự đoán được dự đoán là đúng) và tỷ lệ thu hồi (tỷ lệ dự đoán được dự đoán là đúng trong số những dự đoán thực sự đúng) trong một nhiệm vụ phân loại. Công thức tính là 2×P×R→(P+R), nằm trong khoảng từ 0 đến 1, với 1 là giá trị cao nhất.
Trong lĩnh vực đánh giá mô hình AI, luôn có sự cân bằng giữa độ chính xác và khả năng thu hồi. Đối với các bộ lọc thư rác, cần phải đưa ra các quyết định như ``Tôi muốn giảm số lần bỏ lỡ'' → nhấn mạnh tỷ lệ thu hồi và đối với chẩn đoán y tế, ``Tôi muốn tránh kết quả dương tính giả'' → nhấn mạnh tỷ lệ chính xác. Điểm F1 thể hiện sự thỏa hiệp giữa cả hai dưới dạng một giá trị duy nhất, nhưng nếu có sự mất cân bằng đáng kể về lớp, thì tiêu chuẩn cho hoạt động thực tế vào năm 2026 là sử dụng Macro F1, Weighted F1 và AUC của đường cong PR cùng nhau.
F1 cũng đóng vai trò hàng đầu trong bối cảnh đánh giá LLM và được sử dụng rộng rãi để đo lường chất lượng phản hồi của hệ thống RAG và hiệu suất của các mô hình phát hiện ảo giác. Trong các khảo sát thực địa của ReviewAI, có nhiều trường hợp “các phán đoán được đưa ra chỉ dựa trên điểm F1 và sau đó phải gánh chịu hậu quả”, và thực tế là sự thiên vị đối với tầng lớp đa số bị che giấu, đặc biệt là với dữ liệu không cân bằng ngay cả ở F1 = 0,8, được nêu ra nhiều lần như một điểm thận trọng.
Theo ước tính chung, các nền tảng ML thương mại như Dataiku và Amazon Bedrock đạt tiêu chuẩn với tính toán tự động và trực quan hóa F1, đồng thời chi phí triển khai thường nằm trong khoảng 100.000 đến 300.000 yên Nhật mỗi tháng. Đối với cấp độ phát triển cá nhân, nó có sẵn miễn phí với scikit-learn.