VAD là công nghệ chỉ tự động trích xuất những phần có lời nói của con người từ luồng âm thanh. Nó phân biệt giọng nói với sự im lặng/tiếng ồn môi trường, đồng thời cải thiện độ chính xác của hệ thống nhận dạng giọng nói và giảm chi phí tính toán.
VAD (Phát hiện hoạt động giọng nói) là thuật toán chỉ phát hiện "khoảng thời gian mọi người đang nói chuyện" từ dữ liệu âm thanh liên tục như đầu vào micrô và loại bỏ sự im lặng, tiếng ồn xung quanh và âm thanh môi trường. Nó hoạt động như một cổng được đặt trước công cụ nhận dạng giọng nói (STT), đạt được cả độ chính xác và tốc độ bằng cách bỏ qua quá trình xử lý ở những phần không cần thiết.
Silero VAD (giấy phép MIT, model nhẹ vài MB trở xuống) và Google VAD với WebRTC tích hợp sẽ được sử dụng phổ biến trong các hoạt động thực tế vào năm 2026. Điểm mạnh của Silero VAD là xử lý và hỗ trợ theo thời gian thực cho các thiết bị biên và theo thông lệ, hãy thử điều này trước tiên trong hiện trường. Trong các đám mây thương mại, Azure Speech Services và NVIDIA Riva cung cấp VAD có độ chính xác cao và giá thị trường là hàng chục nghìn yên Nhật cho 1.000 giờ xử lý mỗi tháng.
Cạm bẫy là đặt ra một ngưỡng. Độ nhạy được điều chỉnh cho văn phòng yên Nhật tĩnh thường gây ra kết quả dương tính giả trong môi trường ồn ào. Bởi vì độ chính xác của STT xuôi dòng thay đổi tùy thuộc vào việc các âm thanh phụ như "eh" và "ah" đặc trưng của tiếng Nhật được coi là lời nói hay im lặng, nên việc điều chỉnh riêng lẻ tại chỗ là điều cần thiết. Độ trễ cũng rất quan trọng; Cửa sổ phát hiện càng dài thì độ chính xác càng cao nhưng nhịp độ cuộc trò chuyện sẽ bị gián đoạn. Khi ReviewAI đánh giá các công cụ AI bằng giọng nói, chúng tôi nhấn mạnh sự cân bằng giữa độ chính xác và độ trễ của VAD như một chỉ số cốt lõi của trải nghiệm hội thoại theo thời gian thực.