Hiệu quả của mã thông báo là một chỉ số cho thấy mức độ hiệu suất và kết quả có thể được trích xuất trên mỗi số lượng mã thông báo được sử dụng cho đầu vào/đầu ra cho LLM.
Hiệu quả của mã thông báo là một khái niệm thể hiện mức độ có thể thu được kết quả có độ chính xác cao từ số lượng mã thông báo đầu vào và đầu ra được xử lý bởi LLM và được sử dụng rộng rãi trong ngành như một trục đánh giá để lựa chọn mô hình và thiết kế nhanh chóng. Vì số lượng mã thông báo là tiêu chuẩn để thanh toán API nên người ta nói rằng chi phí sẽ thấp hơn nếu có thể đạt được chất lượng đầu ra tương tự với ít mã thông báo hơn. Trong hoạt động thực tế kể từ năm 2026, các thiết kế nhập toàn bộ bối cảnh dài và các ví dụ về vài cảnh quay dư thừa đã được chỉ ra là những cạm bẫy sẽ làm tăng chi phí trước khi cải thiện độ chính xác. Các lựa chọn tại chỗ thường bao gồm việc sử dụng RAG để thu hẹp và chỉ truyền thông tin liên quan, giữ lời nhắc ngắn gọn và sử dụng lại cửa sổ ngữ cảnh của mô hình bằng chức năng bộ nhớ đệm. Nói chung, các mô hình trong đó đơn giá của mã thông báo đầu ra cao hơn đơn giá của mã thông báo đầu vào là phổ biến, do đó, các thiết kế giảm dư thừa đầu ra có xu hướng được nhấn mạnh từ góc độ tối ưu hóa chi phí.