Song song dữ liệu là một phương pháp học phân tán trong đó các bản sao của cùng một mô hình được đặt trên nhiều GPU và dữ liệu huấn luyện được chia thành các lô và gán cho từng GPU để xử lý song song.
Song song dữ liệu là một phương pháp học phân tán điển hình trong đó một bản sao hoàn chỉnh của mô hình được đặt trên nhiều GPU/TPU, một lô nhỏ được chia và gán cho từng thiết bị, các phép tính độ dốc được thực hiện song song và sau đó độ dốc được đồng bộ hóa bằng cách sử dụng All-Reduce và trọng số được cập nhật. Đây là một khái niệm trái ngược với mô hình song song, vốn phân chia mô hình và trong hoạt động thực tế, một cấu hình kết hợp cả hai được áp dụng rộng rãi. Trong lĩnh vực này kể từ năm 2026, thông lệ tiêu chuẩn là trước tiên phải thử song song dữ liệu cho các mô hình có thể vừa với bộ nhớ GPU và các thư viện như PyTorch DDP và DeepSpeed's ZeRO được sử dụng tiêu chuẩn. Những cạm bẫy bao gồm thực tế là khi số lượng GPU tăng lên, chi phí truyền thông cũng tăng lên, gây khó khăn cho việc đạt được tỷ lệ tuyến tính dự kiến và cần phải điều chỉnh tốc độ học khi kích thước lô tăng lên. Chi phí của GPU đám mây tăng tỷ lệ thuận với số lượng GPU, do đó, thông lệ trong lĩnh vực này là chọn một hệ thống mở rộng quy mô theo từng giai đoạn đồng thời xem xét hiệu quả chi phí.