Chuẩn hóa lớp là phương pháp chuẩn hóa điều chỉnh đầu ra của mỗi lớp của mạng thần kinh thành giá trị trung bình bằng 0 và phương sai 1 cho mỗi mẫu để ổn định quá trình học và tăng tốc độ hội tụ.
Chuẩn hóa lớp (LayerNorm) là một phương pháp tiêu chuẩn giúp chuẩn hóa đầu ra của từng lớp trên cơ sở từng mẫu trong một lô để ngăn chặn sự biến mất và phân kỳ độ dốc cũng như ổn định quá trình học. Phương pháp này được sử dụng rộng rãi trong các mô hình ngôn ngữ dựa trên Transformer vì nó không phụ thuộc vào kích thước lô. Trong hoạt động thực tế kể từ năm 2026, cấu hình Pre-LN, đặt quá trình chuẩn hóa trước kết nối dư, được cho là ổn định hơn Post-LN và trong lĩnh vực mô hình quy mô lớn, nó đang được thay thế bằng RMSNorm, giúp giảm chi phí tính toán. Một điều đáng tiếc là nếu bạn thay đổi vị trí hoặc phương pháp chuẩn hóa khi tinh chỉnh một mô hình đã huấn luyện hiện có, thì bạn có thể sẽ cần phải điều chỉnh lại tốc độ học, vì vậy, trong thực tế, thông thường bạn nên tuân theo cấu hình của mô hình ban đầu. Mặc dù bản thân chi phí tính toán của việc chuẩn hóa lớp là nhỏ nhưng việc tích lũy độ trễ suy luận không thể bỏ qua đối với các mô hình có số lượng lớp lớn và khi chọn mô hình và ước tính chi phí, không chỉ nên so sánh kích thước của các lớp ẩn mà cả phương pháp chuẩn hóa.