Định tuyến mô hình là một hệ thống tự động định tuyến các tác vụ đến mô hình phù hợp nhất trong số nhiều mô hình AI, tùy thuộc vào nội dung và độ khó của tác vụ đầu vào.
Định tuyến mô hình là công nghệ tối ưu hóa sự cân bằng giữa chất lượng phản hồi và chi phí bằng cách gán các mô hình nhẹ, chi phí thấp cho các câu hỏi đơn giản và các mô hình hiệu suất cao cho lý luận và mã hóa phức tạp. Khi việc sử dụng API LLM tiếp tục mở rộng, chi phí xử lý tất cả các yêu cầu sử dụng mô hình hàng đầu sẽ tăng lên, do đó các cơ chế tự động chọn mô hình dựa trên phân loại độ khó của nhiệm vụ và lượng ngữ cảnh đang được áp dụng rộng rãi. Trong hoạt động thực tế tính đến năm 2026, những cạm bẫy đã được chỉ ra, chẳng hạn như độ chính xác định tuyến thấp sẽ khiến các tác vụ đơn giản được chuyển sang các mô hình đắt tiền, làm tăng chi phí nhiều hơn dự kiến và ngược lại, nếu các tác vụ phức tạp được chuyển sang các mô hình nhẹ, chất lượng đầu ra sẽ giảm và ảo giác sẽ tăng lên. Khi chọn một mô hình tại hiện trường, người ta thường áp dụng một phương pháp trước tiên là phân loại các nhiệm vụ chính theo mức độ khó, sau đó điều chỉnh chúng từng bước trong khi xác minh các ngưỡng bằng nhật ký. Tâm lý thị trường là bằng cách giới thiệu định tuyến, có thể duy trì chất lượng trong khi vẫn giữ chi phí trung bình ở mức thấp và việc sử dụng nhiều mô hình cùng nhau đang trở nên phổ biến.