TTFT là thời gian từ khi gửi yêu cầu đến LLM đến khi nhận được token đầu tiên. Chỉ báo cốt lõi về tốc độ phản hồi xác định thời gian chờ mà người dùng cho là "đáp ứng".
TTFT (Time To First Token) là chỉ báo độ trễ từ khi gửi yêu cầu API đến nhận mã thông báo phản hồi đầu tiên. Cùng với thông lượng (số lượng mã thông báo được tạo mỗi giây), đây là chỉ báo chính xác định tốc độ cảm nhận của LLM.
Đối với giao diện người dùng trò chuyện, thời gian thoải mái từ 500 mili giây trở xuống được coi là dòng thoải mái và tỷ lệ bỏ qua tăng sau 2 giây. Trong thực tế vận hành vào năm 2026, sẽ không có gì lạ khi TTFT biến động 2 đến 3 lần tùy theo nhà cung cấp và múi giờ ngay cả với cùng một mô hình.
Cạm bẫy trong lĩnh vực này là mối tương quan với độ dài ngữ cảnh. Lời nhắc hệ thống càng lớn thì TTFT càng lớn do chi phí xây dựng bộ đệm KV. Khi đánh giá ReviewAI, chúng tôi đã xác nhận các trường hợp TTFT nhận được tăng 1,5 lần khi sử dụng hơn 2.000 mã thông báo. Trong hệ thống RAG, việc thiết kế nhúng các tài liệu được truy xuất khi chúng có xu hướng trở thành nút thắt cổ chai và cần phải có sự kết hợp giữa các chiến lược nén và bộ nhớ đệm tóm tắt.
Tính đến tháng 6 năm 2026, giá thị trường là 200-800 mili giây đối với GPT-4o, 150-600 mili giây đối với Claude và 100-500 mili giây đối với Gemini. Nếu bạn muốn rút ngắn TTFT, hãy tránh API hàng loạt và đảm bảo bật tính năng nhận phát trực tuyến.