Ngân sách suy nghĩ là giới hạn trên về số lượng mã thông báo suy luận nội bộ mà LLM có thể sử dụng trước khi đưa ra câu trả lời cuối cùng. Con số càng lớn thì khả năng chống lại các vấn đề phức tạp càng cao nhưng chi phí API cũng sẽ tăng tương ứng.
Ngân sách tư duy là giới hạn trên về số lượng mã thông báo mà LLM tăng cường khả năng suy luận, chẳng hạn như Claude Extended Thought và chuỗi OpenAI o1/o3, phân bổ cho quy trình "suy ngẫm" nội bộ trước khi tạo ra câu trả lời cuối cùng. Suy nghĩ bên trong này thường bị ẩn khỏi người dùng, nhưng nó là một tham số quan trọng ảnh hưởng trực tiếp đến cả chất lượng suy luận của mô hình và chi phí đầu ra.
Trong thực tế vận hành vào năm 2026, việc điều chỉnh ngân sách có tính toán sẽ là điểm điều chỉnh quan trọng nhất ảnh hưởng đến hiệu quả chi phí. Trong API Claude, bạn có thể chỉ định giới hạn trên bằng cách sử dụng tham số budget_tokens và theo nguyên tắc chung, nên sử dụng 4.000 đến 8.000 mã thông báo cho QA đơn giản và 16.000 đến 32.000 mã thông báo được đề xuất cho việc tạo mã phức tạp và suy luận nhiều bước. Thử nghiệm ReviewAI cũng đã xác nhận các trường hợp trong đó chi phí của cùng một nhiệm vụ tăng từ 5 đến 10 lần nếu giới hạn trên tăng lên một cách mù quáng, do đó nên chuyển đổi động theo độ khó của nhiệm vụ. Điều đáng ngại là “tăng ngân sách không nhất thiết sẽ tăng độ chính xác” và trong những nhiệm vụ đơn giản, có những trường hợp việc suy nghĩ quá nhiều dẫn đến việc tạo ra các câu trả lời vòng vo. Cách thực hành tốt nhất là thiết kế các cấu hình agent có khả năng điều chỉnh linh hoạt trên cơ sở mỗi lệnh gọi.