Chi phí suy luận là chỉ số quản lý chi phí cho các dịch vụ AI, đề cập đến các chi phí tính toán như phí xử lý mã thông báo và phí sử dụng GPU xảy ra mỗi khi mô hình AI tạo sinh phản hồi.
Chi phí suy luận là thuật ngữ chung cho chi phí phát sinh khi mô hình AI xử lý một yêu cầu trong API LLM hoặc môi trường tự lưu trữ và được cho là được xác định bởi số lượng mã thông báo đầu vào/đầu ra x đơn giá, thời gian vận hành GPU/phiên bản, tính khả dụng của bộ nhớ đệm, v.v. Đây là một chỉ báo quan trọng xác định tỷ suất lợi nhuận gộp (COGS) của SaaS và ngay cả trong các gói có phí cố định hàng tháng, vẫn có các chi phí API trả theo mức sử dụng diễn ra ngầm, do đó, có một nguy cơ là tỷ lệ chi phí sẽ tăng nhiều hơn dự kiến nếu mức sử dụng tăng nhanh. Trong hoạt động thực tế kể từ năm 2026, việc giảm chi phí đơn vị bằng cách chuyển từ mô hình hiệu suất cao sang mô hình giá thấp, nén mã thông báo prompt, sử dụng bộ đệm và xử lý hàng loạt sẽ là tiêu chuẩn để tối ưu hóa chi phí tại chỗ và điều quan trọng là phải hiểu giá thị trường khi chọn mô hình. Nó được áp dụng rộng rãi để đánh giá sự cân bằng giữa độ chính xác và chi phí và sử dụng kích thước mô hình tối ưu cho từng trường hợp sử dụng.