Quản lý dữ liệu học tập là một loạt các nhiệm vụ thu thập, chọn lọc và làm sạch dữ liệu được sử dụng để đào tạo mô hình AI nhằm cải thiện chất lượng và tính đa dạng của dữ liệu cũng như chuẩn bị dữ liệu ở trạng thái phù hợp cho việc học.
Quản lý dữ liệu đào tạo là một khái niệm tiêu chuẩn ngành đề cập đến quá trình cải thiện chất lượng của các tập dữ liệu được sử dụng để đào tạo trước và tinh chỉnh các mô hình ngôn ngữ và mô hình tạo hình ảnh quy mô lớn. Nó được cho là bao gồm các bước như chống trùng lặp, loại bỏ tiếng ồn, xác minh bản quyền/giấy phép, phát hiện và sửa sai lệch cũng như kiểm tra chất lượng của nhãn và chú thích. Ý tưởng rằng hiệu suất của mô hình sẽ được xác định không chỉ bằng cách tăng lượng dữ liệu mà bằng “có thể thu thập bao nhiêu dữ liệu chất lượng cao” sẽ được chấp nhận rộng rãi trong các hoạt động thực tế vào năm 2026 và xu hướng ngày càng nhấn mạnh đến tính đa dạng và độ chính xác đối với lượng dữ liệu. Cạm bẫy chi phí trong lĩnh vực này bao gồm thực tế là ngay cả khi việc quản lý được tự động hóa, nó không thể thay thế hoàn toàn việc đánh giá thủ công và dữ liệu miền càng chuyên biệt thì giá trị thị trường của chú thích càng cao, khiến nhiều khả năng cần phải đảm bảo ngân sách bao gồm cả việc thuê ngoài. Ngoài ra, nếu dữ liệu có rủi ro về bản quyền được sử dụng để đào tạo mà không loại bỏ nó một cách thỏa đáng thì sau này có thể cần phải đào tạo lại trên quy mô lớn và người ta đã chỉ ra rằng điều quan trọng là phải thiết kế quản trị dữ liệu trước. Khi chọn một công cụ, tiêu chí lựa chọn thường là liệu nó có thể tự động hóa toàn bộ quy trình hay không và liệu nó có thể được liên kết với cơ sở hạ tầng dữ liệu hiện có hay không.