Suy luận ẩn là công nghệ sử dụng TEE, mã hóa đồng cấu, v.v. để thực hiện các phép tính mô hình AI trong khi vẫn giữ kín dữ liệu đầu vào khỏi các nhà cung cấp dịch vụ suy luận.
Suy luận riêng tư đề cập đến một cơ chế sử dụng các công nghệ như TEE (Môi trường thực thi tin cậy), mã hóa đồng cấu và tính toán bảo mật của nhiều bên để thực hiện xử lý suy luận trong khi giữ bí mật đầu vào và đầu ra của mô hình AI ngay cả với nhà cung cấp đám mây. Với nhu cầu xử lý LLM ngày càng tăng đối với dữ liệu có tính bảo mật cao như hồ sơ y tế và hợp đồng, người ta cho rằng đến năm 2026, nhiều nhà cung cấp đám mây sẽ áp dụng GPU tương thích với phương pháp Điện toán đám mây riêng của Apple và Điện toán bí mật của NVIDIA. Tuy nhiên, trong hoạt động thực tế tại hiện trường, suy luận thông qua TEE có xu hướng gặp phải nhược điểm là hiệu suất sử dụng GPU giảm, dẫn đến độ trễ và chi phí sử dụng cao hơn so với suy luận thông thường. Khi thực hiện lựa chọn, nó được cho là đã được áp dụng rộng rãi trong lĩnh vực này để giới thiệu nó theo từng giai đoạn, bắt đầu từ các lĩnh vực kinh doanh nơi tính bảo mật là cần thiết để tuân thủ các quy định và để kiểm tra các thông số kỹ thuật về phạm vi đảm bảo (dù nó chỉ bao gồm tính bảo mật đầu vào hay liệu nó có bao gồm việc bảo vệ trọng lượng mô hình) để đổi lấy chi phí tăng lên hay không.