ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Độ trễ

Độ trễ là thời gian phản hồi giữa việc gửi yêu cầu đến mô hình AI và nhận phản hồi đầu tiên.

Độ trễ là một trong những chỉ số quan trọng nhất quyết định chất lượng trải nghiệm của hệ thống AI. Nói chung, nó được đo trên hai trục: "Thời gian đến mã thông báo đầu tiên (TTFT)" và "Thời gian đến mã thông báo cuối cùng (TTLT)". TTFT liên quan trực tiếp đến trải nghiệm phát trực tuyến và biểu thị thời gian để người dùng cảm thấy trải nghiệm phát trực tuyến đang "chuyển động".

Trong hoạt động thực tế vào năm 2026, sẽ có sự cân bằng giữa độ thông minh của mô hình và độ trễ. Các mô hình Frontier như GPT-5 và Claude Opus có độ chính xác suy luận cao nhưng TTFT trung bình là 2 đến 5 giây. Mặt khác, các mẫu Haiku/Flash nhẹ có thể đạt tốc độ 500 mili giây trở xuống. Trong các ứng dụng mà hiệu suất thời gian thực là rất quan trọng, chẳng hạn như chatbot và AI giọng nói, thông lệ tiêu chuẩn tại hiện trường là ưu tiên độ trễ hơn độ chính xác.

Một cạm bẫy phổ biến là khoảng cách giữa giá trị danh nghĩa của nhà cung cấp và giá trị thực tế. Không có gì lạ khi có sự chênh lệch từ 2 đến 3 lần tùy thuộc vào thời gian tải và khoảng cách địa lý. Khi xác minh bằng ReviewAI, chúng tôi đã xác nhận các trường hợp TTFT dao động đáng kể tùy thuộc vào thời gian trong ngày ngay cả với cùng một mô hình. Về mặt chi phí, các gói API chuyên về độ trễ thấp thường có giá gấp 1,5 đến 2 lần giá tiêu chuẩn nên điều quan trọng là phải sử dụng chúng một cách hợp lý tùy theo mục đích.

Thuật ngữ liên quan