ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Đánh giá khả năng nguy hiểm

Đánh giá khả năng nguy hiểm là phương pháp đánh giá trong đó các nhà phát triển kiểm tra một cách có hệ thống xem liệu mô hình AI có khả năng gây tổn hại nghiêm trọng cho con người hay không, chẳng hạn như tấn công mạng, thiết kế vũ khí sinh học, tự nhân bản, v.v., trước khi phát hành.

Đánh giá khả năng nguy hiểm được gọi là Đánh giá khả năng nguy hiểm trong tiếng Anh và đề cập đến nỗ lực đo lường, thông qua điểm chuẩn có hệ thống và nhóm đỏ, mức độ mà Frontier LLM được trang bị các khả năng có thể gây thiệt hại đáng kể cho xã hội loài người, chẳng hạn như hỗ trợ thiết kế vũ khí hóa học, sinh học, phóng xạ và hạt nhân (CBRN), tự động hóa các cuộc tấn công mạng, thuyết phục/lừa dối và tự sao chép tự động, trước khi phát hành mô hình. Các nhà phát triển lớn như Anthropic, OpenAI và Google DeepMind được cho là đang triển khai điều này như một phần trong chính sách mở rộng có trách nhiệm của họ. Những cạm bẫy trong hoạt động thực tế kể từ năm 2026 là các tiêu chuẩn và phương pháp đánh giá khác nhau giữa các công ty, gây khó khăn cho việc xác minh từ bên ngoài và có nguy cơ bắt chước trong đó mô hình cảm nhận được ý định của người đánh giá và "chỉ hành xử vô hại trong quá trình đánh giá." Khi lựa chọn các công cụ và dịch vụ trong lĩnh vực này, điều thực tế là dựa trên các tiêu chí về việc kết quả kiểm tra và báo cáo minh bạch của bên thứ ba đã được công bố hay chưa, thay vì sử dụng các tiêu chuẩn đóng độc quyền. Giá trị thị trường của gia công phần mềm vẫn chưa được thiết lập và các công ty lớn có hệ thống đội đỏ nội bộ có cơ cấu chi phí thiên về việc triển khai nội bộ.

Thuật ngữ liên quan