Phát hiện deepfake âm thanh là công nghệ sử dụng máy học để xác định giọng nói giả và giọng nói giả mạo được tạo ra bằng cách tổng hợp giọng nói và chuyển đổi giọng nói AI dựa trên dạng sóng không tự nhiên và kiểu nhiễu duy nhất cho mô hình thế hệ.
Phát hiện deepfake giọng nói là một lĩnh vực công nghệ xác định giọng nói giả mạo và tổng hợp dựa trên phân tích biểu đồ phổ của dạng sóng giọng nói và các tạo phẩm duy nhất của AI được tạo ra và được cho là ngày càng được giới thiệu để xác minh danh tính tại các tổ chức tài chính và phòng chống gian lận tại các trung tâm cuộc gọi. Mô hình phát hiện dễ bị ảnh hưởng bởi các phương pháp tổng hợp giọng nói mới không có trong dữ liệu huấn luyện và độ chính xác của nó bị suy giảm đáng kể do tiếng ồn môi trường và giọng nói bị nén, vốn được coi là một cạm bẫy trong hoạt động thực tế. Đến năm 2026, không chỉ các mô-đun phát hiện độc lập mà cả hệ thống phòng thủ nhiều lớp kết hợp với quy trình xác thực danh tính và xác thực đa yếu tố sẽ trở thành xu hướng chủ đạo trong lĩnh vực này. Chi phí triển khai chủ yếu dựa trên loại API phát hiện trả tiền khi sử dụng và người ta thường nói rằng việc tính phí dựa trên số lượng cuộc gọi và việc lựa chọn phải được thực hiện bằng cách xem xét sự cân bằng giữa tỷ lệ dương tính giả và độ trễ xử lý.