Độc tính là chỉ số đánh giá nhằm định lượng mức độ gây hại như phân biệt đối xử, bạo lực, quấy rối, v.v. có trong các văn bản do AI tạo sinh.
Điểm gây hại là chỉ số đánh giá nhằm định lượng mức độ gây hại của các biểu hiện phân biệt đối xử, biểu hiện bạo lực, quấy rối, khuyến khích việc tự làm hại bản thân, v.v. có trong các văn bản do AI tạo sinh với điểm từ 0 đến 1 (hoặc 0 đến 100). Các phương pháp như API phối cảnh của Google và API kiểm duyệt của OpenAI, tính toán điểm cho nhiều danh mục như bạo lực, biểu hiện tình dục và lời nói căm thù, được cho là đã được áp dụng rộng rãi. Vấn đề lớn nhất trong vận hành thực tế là việc đặt ngưỡng; nếu quá nghiêm ngặt, các cuộc thảo luận hợp pháp và thậm chí cả tư vấn y tế và pháp lý có thể bị chặn do nhầm lẫn, trong khi nếu quá lỏng lẻo, nội dung có hại có thể lọt vào. Trong lĩnh vực này, tiêu chuẩn đến năm 2026 là sử dụng hệ thống hai giai đoạn, trong đó các ngưỡng được điều chỉnh cho từng ngành và ứng dụng, đồng thời được sử dụng cùng với hoạt động đánh giá của con người. Mặc dù bản thân API kiểm duyệt có thể được giới thiệu với chi phí thấp, nhưng chi phí vận hành của việc kiểm tra lại nhật ký dương tính giả theo cách thủ công có xu hướng trở thành gánh nặng đối với các hoạt động thực tế, do đó, khi đưa ra lựa chọn, cần phải so sánh không chỉ giá thị trường của chính API mà còn cả số giờ đánh giá.