Tăng cường dữ liệu là một phương pháp tiền xử lý cho máy học nhằm tăng hiệu suất tổng quát hóa của mô hình bằng cách áp dụng các phép biến đổi như xoay, đảo ngược và thêm nhiễu vào dữ liệu huấn luyện có sẵn.
Tăng cường dữ liệu là một kỹ thuật tiền xử lý tiêu chuẩn trong lĩnh vực học sâu, vì đây là phương pháp làm tăng sự biến đổi của dữ liệu huấn luyện một cách giả tạo bằng cách xoay, lật và cắt hình ảnh, diễn giải văn bản và chuyển đổi cao độ của âm thanh, từ đó ngăn chặn việc trang bị quá mức mô hình và cải thiện hiệu suất tổng quát hóa. Trong hoạt động thực tế kể từ năm 2026, có một nhược điểm đã biết là nếu loại mở rộng hoặc tham số không chính xác thì các mẫu không thực tế, sai lệch so với dữ liệu thực tế sẽ được tạo ra, dẫn đến giảm độ chính xác. Đặc biệt trong các lĩnh vực có sự phân phối nhạy cảm, chẳng hạn như hình ảnh y tế hoặc dữ liệu tài chính, người ta đã chỉ ra rằng việc áp dụng quá nhiều mở rộng có thể dẫn đến nhiễu học, làm giảm hiệu suất dự đoán trong môi trường sản xuất. Về chi phí, việc mở rộng dữ liệu tổng hợp sử dụng thế hệ AI có xu hướng tăng phí sử dụng GPU và giá thị trường có thể tăng từ vài lần đến vài chục lần so với phép biến đổi hình học đơn giản. Chính sách được áp dụng rộng rãi trong lĩnh vực này là trước tiên hãy thử chuyển đổi hình học và màu sắc nhẹ, sau đó dần dần giới thiệu các tiện ích mở rộng nâng cao dựa trên mô hình tổng quát tùy thuộc vào lượng dữ liệu và độ phức tạp của nhiệm vụ.