FP8 là công nghệ lượng tử hóa thể hiện số mô hình AI ở định dạng dấu phẩy động 8 bit. Nó đạt được cả tốc độ tính toán và tiết kiệm bộ nhớ so với FP32/BF16 thông thường, giảm đáng kể chi phí học tập và suy luận cho các mô hình quy mô lớn.
FP8 (dấu phẩy động 8 bit) là định dạng số biểu thị các tham số mô hình AI và giá trị kích hoạt trong 8 bit. Có hai loại: E4M3 (4 bit số mũ, 3 bit số mũ) và E5M2 (5 bit số mũ, 2 bit số mũ), loại trước nhấn mạnh độ chính xác và loại sau nhấn mạnh tính ổn định trong học tập và được sử dụng tùy theo mục đích. Các GPU NVIDIA H100 trở lên có hỗ trợ riêng về phần cứng và bạn có thể mong đợi cải thiện thông lượng gấp đôi so với BF16.
Kể từ năm 2026, vấn đề "tràn số" là cạm bẫy thường xuyên xảy ra trong hoạt động thực tế. Mặc dù E5M2 có phạm vi biểu thức rộng nhưng độ chính xác của các giá trị nhỏ lại giảm, do đó việc điều chỉnh tỷ lệ gradient trong quá trình học là điều cần thiết. Sự suy giảm điểm chuẩn do lỗi lượng tử hóa trong quá trình suy luận trung bình là khoảng 0,5 đến 2%, nhưng có những trường hợp sự suy giảm trong các nhiệm vụ toán học và lý luận dạng dài là hơn 5%.
Về mặt chi phí, việc học FP8 với một H100 SXM (80GB) có quy mô lô hiệu quả xấp xỉ gấp đôi so với BF16 và khi xem xét đơn giá đám mây ($2-3/giờ), việc tinh chỉnh lớp 70B đã trở thành hiện thực. Trong lĩnh vực này, cách tiếp cận hai bước là tiêu chuẩn: ``Đầu tiên kiểm tra hoạt động với BF16, sau đó chuyển sang FP8 để tối ưu hóa chi phí.'' Thư viện TransformerEngine (thông qua PyTorch) được phát triển tốt nhất và có nhiều ví dụ ứng dụng cho hệ thống LLaMA và Mistral.