Căn chỉnh bắt buộc là một công nghệ xử lý âm thanh giúp tương quan tạm thời với dữ liệu âm thanh và văn bản được phiên âm của nó trên cơ sở từ/âm vị, đồng thời tự động tạo dấu thời gian chính xác cho mỗi quãng phát âm.
Căn chỉnh cưỡng bức là công nghệ sử dụng mô hình âm thanh nhận dạng giọng nói để khớp tạm thời với các dạng sóng âm thanh và văn bản được phiên âm hiện có ở cấp độ từ/âm vị, đồng thời tính toán dấu thời gian bắt đầu và kết thúc cho từng phần. Nó được cho là được sử dụng rộng rãi trong việc tạo phụ đề, đồng bộ hóa phiên âm podcast, đồng bộ hóa lời bài hát, đánh giá cách phát âm, v.v. Nó thường được cung cấp trong các công cụ nguồn mở như Montreal Forced Aligner hoặc như một tính năng đồng hành với API nhận dạng giọng nói. Trong hoạt động thực tế kể từ năm 2026, độ chính xác căn chỉnh có thể giảm đi đáng kể nếu có sự khác biệt giữa văn bản được chép lại và cách phát âm thực tế (ngập ngừng, diễn giải, đưa vào BGM) và điều đáng tiếc là việc định dạng văn bản và loại bỏ tiếng ồn sẽ là công việc tiên quyết tại hiện trường. Mặc dù chi phí triển khai có thể được giữ ở mức thấp nếu nó được tích hợp đơn giản vào cơ sở hạ tầng ASR/phụ đề hiện có, nhưng giá thị trường sẽ tăng vọt nếu cần hỗ trợ đa ngôn ngữ hoặc học một mẫu âm thanh độc đáo, vì vậy trước tiên cần xác định xem liệu nó có thể được bao phủ bởi hệ thống hiện tại hay không.