Phân cấp lệnh là nguyên tắc thiết kế cho phép mô hình AI ưu tiên các lệnh từ nhiều nguồn đầu vào, chẳng hạn như hệ thống, nhà phát triển và người dùng, đồng thời ngăn các lệnh cấp thấp hơn ghi đè các quy tắc cấp cao hơn.
Hệ thống phân cấp lệnh là một khung ưu tiên nhiều nguồn hướng dẫn, chẳng hạn như lời nhắc hệ thống, lời nhắc của nhà phát triển và thông tin đầu vào của người dùng, để ngăn các lệnh cấp thấp hơn ghi đè các quy tắc cấp cao hơn. Nó được OpenAI đề xuất vào năm 2024 và được cho là đã được áp dụng rộng rãi như một lý thuyết cơ bản cho các biện pháp đối phó với việc tiêm và bẻ khóa kịp thời. Trong các hoạt động thực tế kể từ năm 2026, một thiết kế trong đó khi agent tải nội dung của một công cụ hoặc trang web bên ngoài, các hướng dẫn kết hợp trong đó sẽ được xử lý với mức độ ưu tiên thấp hơn hướng dẫn người dùng sẽ trở thành tiêu chuẩn trong trường. Mặt khác, trong các mô hình có ranh giới phân cấp không rõ ràng, các trường hợp đã được chỉ ra trong đó các hướng dẫn độc hại được nhúng vào giữa một bối cảnh dài có thể bỏ qua các quy tắc cấp cao hơn và điều nguy hiểm là chi phí kiểm tra và số giờ xác minh sẽ tăng lên. Khi chọn một công cụ, chi phí sẽ thay đổi tùy thuộc vào mức độ cố định của lời nhắc hệ thống và sự hiện diện hay vắng mặt của các chức năng lan can cũng như mức độ triển khai các lớp lọc bổ sung nội bộ.