Ước tính cao độ là công nghệ ước tính tần số cơ bản (F0) từ dạng sóng của giọng nói hoặc giai điệu âm nhạc và trích xuất cao độ của giọng nói hoặc giai điệu dưới dạng dữ liệu số hoặc chuỗi thời gian.
Ước tính cao độ là công nghệ liên tục phát hiện tần số cơ bản (F0) từ tín hiệu âm thanh dọc theo trục thời gian và là cơ sở cho nhiều ứng dụng như phân tích giọng hát, phiên âm nhạc tự động, chuyển đổi giọng nói, chấm điểm karaoke và ứng dụng chỉnh âm. Theo truyền thống, các thuật toán như YIN và CREPE đã được áp dụng rộng rãi làm tiêu chuẩn ngành, nhưng trong những năm gần đây, các mô hình dựa trên deep learning đã trở nên vượt trội về độ chính xác ước tính khi có nhiễu và hợp âm. Cạm bẫy trong hoạt động thực tế kể từ năm 2026 là ngay cả khi đạt được độ chính xác cao với nguồn âm thanh khô của một nốt duy nhất, độ chính xác thường sẽ giảm đáng kể với dữ liệu trường thực tế liên quan đến hợp âm, nhiều loa, âm vang và dải tần số thấp (lỗi quãng tám), vì vậy cần phải kiểm tra nó trong các điều kiện nguồn âm thanh mà công ty bạn xử lý trước khi giới thiệu. Về chi phí, nếu bạn chạy cục bộ các thuật toán nguồn mở thì hầu như không có thêm chi phí, nhưng nếu bạn đưa hiệu suất thời gian thực và suy luận GPU làm yêu cầu thì phí sử dụng API đám mây và phí phiên bản GPU có xu hướng tăng lên. Về cách chọn một trong lĩnh vực này, hướng dẫn thực tế là chọn thuật toán học sâu cho các ứng dụng yêu cầu độ chính xác cao, chẳng hạn như chuyển đổi giọng nói và phân tích giọng hát, đồng thời chọn thuật toán cổ điển nhẹ cho các ứng dụng như bộ chỉnh đơn giản và ứng dụng ưu tiên xử lý thời gian thực.