Nhận dạng người nói là công nghệ AI giúp xác định và đối chiếu ''ai đang nói'' từ dữ liệu giọng nói, xác định và phân loại các cá nhân dựa trên mẫu giọng nói của người nói.
Nhận dạng người nói là công nghệ phân tích bản in giọng nói (đặc điểm âm thanh) để xác định ai đang nói và được sử dụng trong nhiều lĩnh vực, bao gồm phân chia người nói (ghi nhật ký người nói) khi tạo biên bản cuộc họp, xác minh danh tính tại trung tâm cuộc gọi và ứng dụng Thoại qua IP. Về mặt kỹ thuật, cách phân loại tiêu chuẩn ngành là nhận dạng người nói (xác định một người) và xác minh người nói (xác định xem người nói có phải là cùng một người hay không) được chia thành hai loại. Trong hoạt động thực tế kể từ năm 2026, người ta đã chỉ ra rộng rãi rằng độ chính xác sẽ giảm đáng kể trong các tình huống như âm thanh hội nghị có nhiều người nói cùng lúc, môi trường có nhiều tiếng ồn xung quanh và giọng nói có phương ngữ hoặc giọng nặng. Ngoài ra, khi số lượng người nói tăng lên, tỷ lệ nhận dạng sai có xu hướng tăng lên, do đó người ta cho rằng việc thiết kế trước luồng đăng ký giọng nói sẽ ảnh hưởng đến độ chính xác tại hiện trường. Về chi phí triển khai, mặc dù có thể dễ dàng bắt đầu với hình thức trả tiền theo mức sử dụng nếu đó là API loại SaaS, nhưng việc xây dựng tại chỗ hoặc tinh chỉnh một mô hình duy nhất có xu hướng tốn kém. Khi chọn một giải pháp trong lĩnh vực này, trước tiên bạn nên làm rõ trường hợp sử dụng của công ty bạn (theo biên bản hoặc để xác thực cá nhân), tiến hành PoC quy mô nhỏ để xác minh tính chính xác và sau đó giới thiệu nó một cách nghiêm túc.