Mã thông báo mỗi giây (thông lượng) là chỉ báo hiệu suất cho biết số lượng mã thông báo mà LLM có thể tạo và xử lý trong một giây. Giá trị càng lớn thì phản hồi càng nhanh, phù hợp với các ứng dụng thời gian thực và xử lý hàng loạt khối lượng lớn.
Token mỗi giây (TPS) là một chỉ số quan trọng dùng để định lượng tốc độ suy luận của LLM và có hai loại: "TPS thế hệ" (tốc độ đầu ra) và "TPS xử lý" (tốc độ xử lý đầu vào). Tiêu chuẩn ngành là 20 đến 50 TPS làm hướng dẫn cho "phản hồi thoải mái" và AI bằng giọng nói cũng như việc hoàn thành mã thời gian thực thực sự yêu cầu 100 TPS trở lên.
Trong hoạt động thực tế kể từ năm 2026, TPS của API đám mây sẽ thay đổi rất nhiều tùy thuộc vào kích thước mô hình, số lượng yêu cầu đồng thời và khu vực. Trong quá trình xác minh ReviewAI, người ta đã xác nhận rằng ngay cả với cùng một mô hình, tỷ lệ giảm xuống dưới 1/3 so với tỷ lệ bình thường trong giờ bận rộn và chỉ một số ít nhà cung cấp nêu rõ TPS là SLA. Về mặt chi phí, nếu cố gắng đảm bảo TPS cao, bạn sẽ phải chịu thêm chi phí cho "khung thông lượng chuyên dụng" và mức chênh lệch so với mức thanh toán theo mức sử dụng có thể từ hàng chục nghìn đến hàng trăm nghìn yên Nhật mỗi tháng.
Giá thị trường để chọn tại chỗ: 30 đến 60 TPS là đủ cho chatbot và hệ thống tạo văn bản, và cần 100 TPS trở lên cho AI giọng nói và dịch thời gian thực. Điều quan trọng nữa là phải đánh giá không chỉ riêng TPS mà còn cả độ trễ cho đến khi mã thông báo đầu tiên đến (TTFT); ngay cả khi TPS cao, nếu TTFT dài, tốc độ cảm nhận sẽ không được cải thiện.