Mô hình nhận dạng giọng nói nguồn mở của OpenAI. Hỗ trợ 99 ngôn ngữ và có độ chính xác cao trong tiếng Nhật.
Whisper là mô hình nhận dạng giọng nói mã nguồn mở được OpenAI phát hành vào năm 2022, hỗ trợ 99 ngôn ngữ và có độ chính xác tiếng Nhật cao. Vì nó có thể được vận hành cục bộ (giấy phép MIT) nên có nhu cầu cao về việc tự lưu trữ biên bản cuộc họp/dịch vụ ghi chép. Vào năm 2026, Whisper Large-v3 sẽ là phiên bản tiêu chuẩn và phiên bản nhẹ Whisper-Turbo sẽ phiên âm một giờ âm thanh trong 1-2 phút. API thương mại là OpenAI với giá 0,006 USD/phút. Các đối thủ cạnh tranh bao gồm AssemblyAI / Deepgram / ElevenLabs Scribe. Trong thực tế hoạt động, có nhiều trường hợp kết hợp ``chép lại low-down với Whisper → tóm tắt với ChatGPT + chép âm theo phút'' làm giảm 90% số phút làm việc.