ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

AdamW (thuật toán tối ưu hóa)

AdamW là một phương pháp tối ưu hóa cải tiến giúp tách tính toán giảm trọng số của thuật toán tối ưu hóa Adam khỏi cập nhật độ dốc, giúp việc ngăn chặn quá mức dễ dàng hơn.

AdamW là một thuật toán tối ưu hóa thường được sử dụng để đào tạo các mô hình deep learning. Nó khắc phục vấn đề Adam trộn chính quy L2 vào độ dốc và áp dụng phân rã trọng số một cách độc lập với cập nhật độ dốc. Điều này giúp cải thiện hiệu suất khái quát hóa và được cho là được áp dụng rộng rãi làm tùy chọn mặc định để đào tạo trước và tinh chỉnh các mô hình Transformer. Một nhược điểm trong hoạt động thực tế là sự kết hợp giữa tốc độ học và giá trị giảm trọng số thay đổi rất nhiều tùy thuộc vào kích thước mô hình và nếu các giá trị cho các mô hình khác được sử dụng như hiện tại thì độ hội tụ sẽ trở nên không ổn định và tình trạng trang bị quá mức có xu hướng trở nên tồi tệ hơn. Tại hiện trường, với mục đích tinh chỉnh ở quy mô nhỏ, hãy bắt đầu với các giá trị mặc định như Hugging Face và khi quy mô của quá trình học trước trở nên đắt hơn, cần phải đưa ra quyết định điều chỉnh quá trình khởi động và giảm trọng lượng riêng lẻ. Tính đến năm 2026, các công cụ phái sinh của AdamW như Lion và Sophia đang được đề xuất ở giai đoạn nghiên cứu, nhưng AdamW vẫn được định vị là tiêu chuẩn trên thực tế về giá thị trường cho hoạt động thực tế.

Thuật ngữ liên quan