Đánh giá quỹ đạo là phương pháp đánh giá lịch sử của chuỗi hành động và quyết định (gọi công cụ và các bước suy luận) do AI agent thực hiện để đạt được mục tiêu của mình.
Đánh giá quỹ đạo là một phương pháp đánh giá không chỉ đầu ra cuối cùng của AI agent mà còn đánh giá tiến trình đạt được mục tiêu: sự phù hợp của việc lựa chọn công cụ, thứ tự các bước và liệu có sự lặp lại hoặc trật bánh không cần thiết hay không và được áp dụng rộng rãi như một trục đánh giá tiêu chuẩn ngành. Sức mạnh của nó được cho là khả năng nhìn thấu các trường hợp “tình cờ có được câu trả lời đúng”, điều này không thể thấy được trong các đánh giá đầu ra đơn lẻ thông thường. Tuy nhiên, trong hoạt động thực tế kể từ năm 2026, nhật ký cần đánh giá sẽ tăng lên do các AI agent có nhiều bước hơn và chi phí cho việc chấm điểm tuần tự bằng cách sử dụng LLM với tư cách là giám khảo sẽ cao hơn đáng kể so với đánh giá đầu ra, đây là một cạm bẫy trong lĩnh vực này. Nói chung, thay vì đánh giá từng bước mọi lúc, việc sử dụng kết hợp lấy mẫu và chấm điểm dựa trên quy tắc để giảm chi phí được coi là thực tế hơn.