Suy nghĩ quá mức là hiện tượng trong đó mô hình AI lãng phí mã thông báo và thời gian bằng cách lặp lại quá trình suy luận dài không cần thiết cho các câu hỏi mà ban đầu có thể được trả lời một cách đơn giản.
Suy nghĩ quá mức đề cập đến một hiện tượng trong đó LLM dành riêng cho lý luận tạo ra chuỗi suy nghĩ dài không cần thiết và lặp lại quá nhiều bước suy nghĩ ngay cả đối với những câu hỏi đơn giản thường có thể được trả lời trong vài giây. Về mặt học thuật, người ta đã chỉ ra rằng việc lý luận nội bộ càng kéo dài thì càng có nhiều khả năng đưa ra những câu trả lời sai. Trong hoạt động thực tế kể từ năm 2026, nhiều API sẽ tính phí mã thông báo suy nghĩ ở cùng đơn giá với mã thông báo đầu ra, do đó, thời gian suy nghĩ càng kéo dài thì chi phí sẽ càng tăng, điều này có thể sẽ là một cạm bẫy trong lĩnh vực này. Người ta nói rằng không có gì lạ khi các dịch vụ tăng chi phí lên nhiều lần chỉ bằng cách sử dụng chế độ suy luận và trong thực tế, một thiết kế định tuyến trong đó ``chế độ suy luận chỉ được sử dụng cho các nhiệm vụ phức tạp và các truy vấn thông thường được phân phối cho các mô hình nhẹ'' và các hoạt động đặt giới hạn trên cho lượng suy nghĩ bằng cách sử dụng các tham số như Reason_effort được áp dụng rộng rãi.