ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

FSDP (Song song dữ liệu được phân chia hoàn toàn)

FSDP là một phương pháp học phân tán lưu trữ các tham số mô hình, độ dốc và trạng thái tối ưu hóa trên nhiều GPU, đồng thời thu thập và tìm hiểu các phần chỉ cần trong quá trình tính toán.

FSDP là một phương pháp học tập phân tán do PyTorch cung cấp và có đặc điểm là lưu trữ các tham số mô hình, độ dốc và trạng thái tối ưu hóa theo từng đoạn (phân đoạn) trên mỗi thiết bị thay vì sao chép chúng sang tất cả GPU. DDP truyền thống sao chép toàn bộ mô hình trên mỗi GPU, điều này có xu hướng tiêu tốn bộ nhớ, nhưng FSDP được áp dụng rộng rãi như một phương pháp cho phép học các mô hình lớn hơn với cùng số lượng GPU thông qua phân mảnh. Trong hoạt động thực tế kể từ năm 2026, sẽ có những tình huống trong đó thông lượng sẽ thấp hơn DDP do chi phí liên lạc tăng lên và một cạm bẫy đã biết là độ chi tiết của sharding và cài đặt tìm nạp trước sẽ cần phải được điều chỉnh tại chỗ. Ngoài ra, do giả định rằng nhiều mô-đun lớp A100/H100 sẽ được gói cùng nhau nên chi phí của GPU đám mây có xu hướng dao động từ hàng trăm nghìn yên Nhật đến vài triệu yên Nhật mỗi tháng và những người trong lĩnh vực này thường đưa ra đánh giá dựa trên giá trị thị trường, chẳng hạn như PEFT như LoRA cho các ứng dụng quy mô nhỏ và FSDP cho các yêu cầu học tập quy mô lớn.

Thuật ngữ liên quan