Dấu thời gian từng từ là công nghệ ghi lại thời gian bắt đầu và kết thúc của mỗi từ tính bằng mili giây khi phiên âm âm thanh.
Dấu thời gian từng từ trong nhận dạng giọng nói (ASR) là một tính năng được cung cấp dưới dạng tùy chọn API trong các mô hình chính như Whisper. Ngoài tính năng phiên âm theo từng câu, tính năng này còn trả về thời gian bắt đầu và kết thúc phát âm của mỗi từ với độ chính xác đến mili giây. Nó được sử dụng rộng rãi để tự động tạo phụ đề, đồng bộ hóa chú thích trong phần mềm chỉnh sửa video và tạo bản ghi có thể tìm kiếm được cho podcast. Trong thực tế sử dụng kể từ năm 2026, ranh giới các từ có thể sẽ thay đổi ở những vị trí mà các loa chồng lên nhau hoặc trong giọng nói nhanh hoặc giọng phương ngữ, và nếu được sử dụng làm phụ đề thì có nguy cơ là thời gian hiển thị sẽ thay đổi. Xét về giá thị trường, các API phiên âm có dấu thời gian từng từ thường được cung cấp với giá vài yên Nhật mỗi phút âm thanh và chi phí cũng tương đương với phiên âm thông thường. Khi chọn tại chỗ, người ta cho rằng phương pháp này không chỉ hiệu quả khi so sánh độ chính xác mà còn khả năng chống phát hiện sai ở các phần im lặng và phần nhạc cũng như tính linh hoạt của định dạng đầu ra (SRT/VTT/JSON).