ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Quang phổ Mel

Biểu đồ phổ mel là một đặc điểm âm thanh hai chiều giúp phân chia các thành phần tần số của dạng sóng âm thanh bằng cách sử dụng thang đo mel tương tự như đặc điểm thính giác của con người và thể hiện nó dọc theo trục thời gian.

Biểu đồ phổ mel là biểu diễn hai chiều về thời gian và tần số thu được bằng cách phân tách tần số dạng sóng âm thanh bằng cách sử dụng biến đổi Fourier thời gian ngắn (STFT), chia nó thành các nhóm bằng cách sử dụng ngân hàng bộ lọc thang đo mel để phù hợp với xu hướng thính giác của con người để cảm nhận tần số âm trầm là tần số âm bổng nhỏ và thô và chuyển đổi nó thành biên độ logarit. Nó được sử dụng làm tiêu chuẩn công nghiệp trong nhiều mô hình AI giọng nói, chẳng hạn như nhận dạng giọng nói, tổng hợp giọng nói (TTS), nhận dạng người nói và tìm kiếm thông tin âm nhạc, dưới dạng các tính năng trung gian cho đầu vào hoặc đầu ra thay vì dạng sóng thô. Một nhược điểm trong hoạt động thực tế là độ chính xác giảm đi đáng kể nếu các tham số như độ rộng cửa sổ STFT, độ dài bước nhảy, số thùng Mel và tốc độ lấy mẫu lệch giữa quá trình học và suy luận, vì vậy khi sử dụng mô hình được huấn luyện trước, cần phải đảm bảo rằng các điều kiện tiền xử lý giống nhau. Kể từ năm 2026, nhiều dịch vụ TTS và nhân bản giọng nói sẽ có cấu hình hai giai đoạn trong đó biểu đồ phổ mel được chuyển đến bộ phát âm dưới dạng biểu diễn trung gian, vì vậy, khi chọn một mô hình tại hiện trường, điều quan trọng là phải kiểm tra khả năng tương thích của nó với bộ phát âm sẽ được kết hợp. Bản thân quá trình xử lý có thể được thực hiện với chi phí thấp bằng cách sử dụng thư viện như librosa, nhưng cần lưu ý rằng chi phí tính toán GPU/CPU sẽ tăng lên khi chuyển đổi hàng loạt một lượng lớn âm thanh.

Thuật ngữ liên quan