Muon là một thuật toán tối ưu hóa để huấn luyện trước các mô hình ngôn ngữ quy mô lớn áp dụng cập nhật độ dốc trực giao của ma trận trọng số lớp ẩn bằng cách sử dụng phép lặp Newton-Schulz.
Muon là một thuật toán tối ưu hóa sử dụng phép lặp Newton-Schulz để cập nhật trực giao độ dốc trên ma trận trọng số hai chiều của các lớp ẩn và được đề xuất thay thế cho AdamW vào cuối năm 2024. Muon được cho là có thể giảm tổn thất chỉ với một số bước nhỏ và đã thu hút được sự chú ý kể từ khi được áp dụng trong cuộc thi tốc độ học tập nanoGPT, cũng như các ví dụ về việc nó được sử dụng để đào tạo trước các mô hình ngôn ngữ quy mô lớn như Kimi của Moonshot AI đã được xuất bản. Trong hoạt động thực tế kể từ năm 2026, cấu hình kết hợp sử dụng AdamW cho các trọng số một chiều, không vuông góc như lớp nhúng và lớp đầu ra sẽ phổ biến và các thiết kế tối ưu hóa tất cả các tham số chỉ sử dụng Muon sẽ chiếm thiểu số trong lĩnh vực này. Tốc độ học tập và các giá trị khởi động tối ưu khác với AdamW, do đó, điều đáng tiếc khi giới thiệu nó là nếu bạn chuyển trực tiếp nó sang một đường dẫn học tập hiện có thì chi phí tìm kiếm siêu tham số sẽ tăng lên. Mặc dù chi phí tính toán của quá trình trực giao không thể bị bỏ qua, nhưng trong nhiều trường hợp, nó có thể được bù đắp bằng tốc độ hội tụ. Thuật toán này thường được coi là một lựa chọn khi đào tạo trước một mô hình quy mô lớn mới.