Khởi động nguội là sự chậm trễ trong phản hồi ban đầu xảy ra cho đến khi mô hình AI không hoạt động được đưa đến trạng thái có thể đưa ra suy luận với yêu cầu tiếp theo.
Khởi động nguội là thuật ngữ cơ sở hạ tầng chung đề cập đến độ trễ từ khi mô hình AI bị tạm dừng (thu nhỏ) mà không được gọi trong một khoảng thời gian nhất định trên nền tảng không có máy chủ hoặc phiên bản GPU theo yêu cầu, cho đến khi nhận được yêu cầu tiếp theo, tải trọng số, triển khai chúng vào bộ nhớ GPU và sẵn sàng suy luận. Người ta biết rộng rãi rằng kích thước mô hình càng lớn và hình ảnh lượng tử hóa và vùng chứa càng nặng thì độ trễ sẽ càng dài và có thể dao động từ vài giây đến hàng chục giây. Trong các hoạt động thực tế kể từ năm 2026, cấu hình tránh khởi động nguội bằng cách duy trì các phiên bản luôn bật (ấm) sẽ phổ biến, nhưng điều này sẽ phát sinh chi phí dự phòng, do đó, sự cân bằng giữa ``độ trễ'' và ``chi phí'' sẽ trở thành một vấn đề lớn trong lĩnh vực này đối với các điểm cuối thực hiện ít yêu cầu hơn. Nói chung, quyết định chọn khởi động liên tục hay cho phép khởi động nguội và chuyển sang thanh toán theo yêu cầu tùy thuộc vào các biến thể lưu lượng truy cập dự kiến và yêu cầu SLA, đồng thời, phương pháp được đề xuất trong trường này trước tiên là đo lường mức phân bổ yêu cầu trong các mùa chậm và bận rộn, sau đó chọn cấu hình.