Trích xuất loa mục tiêu là một công nghệ xử lý âm thanh giúp tách và trích xuất giọng nói của một loa mục tiêu cụ thể khỏi các giọng nói được phát ra đồng thời bởi nhiều loa.
Trích xuất người nói mục tiêu (TSE) là một công nghệ học sâu sử dụng các mẫu giọng nói của người nói mục tiêu đã được đăng ký trước (âm thanh đăng ký) làm manh mối để chỉ tách biệt lời nói của người nói đó trong môi trường có giọng nói của nhiều người nói chồng lên nhau. Không giống như tính năng ``tách loa'', tách tất cả các loa mà không biết số lượng hoặc sự phân biệt các loa, ưu điểm thực tế là có thể xác định được mục tiêu trước tiên. Người ta nói rằng nó ngày càng được sử dụng như một công cụ tiền xử lý trong các tình huống không thể tránh khỏi tiếng ồn và nhiều người nói, chẳng hạn như phiên âm cuộc họp, ghi âm các cuộc phỏng vấn y tế và phân tích cuộc gọi tại trung tâm cuộc gọi. Kể từ năm 2026, nó thường sẽ được cung cấp dưới dạng API đám mây với mức phí trả theo mức sử dụng dựa trên thời gian xử lý và số lượng người nói, đồng thời điều này sẽ đóng vai trò là hướng dẫn về giá thị trường, nhưng người ta biết rằng độ chính xác của quá trình trích xuất sẽ giảm đáng kể nếu chất lượng âm thanh đăng ký thấp, vốn là một trở ngại đã biết trong hoạt động thực tế. Việc trích xuất không chính xác có thể xảy ra khi chất lượng giọng nói của loa nền tương tự như loa mục tiêu hoặc trong trường hợp khoảng cách đến micrô dao động, do đó, cơ sở lựa chọn, bao gồm cả cân nhắc về chi phí, là xác nhận độ chính xác trong PoC với âm thanh gần với môi trường ghi âm thực tế trước khi đưa vào.