Phát hiện từ đánh thức là cơ chế trong đó thiết bị liên tục giám sát đầu vào micrô và chỉ bắt đầu xử lý nhận dạng giọng nói ngay khi thiết bị phát hiện một từ đánh thức cụ thể, chẳng hạn như "OK Google" hoặc "Hey Siri".
Phát hiện từ đánh thức là cơ chế trong đó loa thông minh hoặc thiết bị IoT liên tục giám sát đầu vào micrô và chỉ bắt đầu nhận dạng giọng nói chính thức và xử lý truyền qua đám mây ngay khi phát hiện một từ đánh thức cụ thể như "OK Google" hoặc "Alexa". Nó được cho là công nghệ cơ bản cho giao diện người dùng giọng nói giúp tiết kiệm năng lượng và bảo vệ quyền riêng tư. Cốt lõi của công nghệ là giữ cho một mô hình nhẹ, trên thiết bị luôn hoạt động và cân bằng giữa dương tính giả (phản hồi với các âm thanh không liên quan) và dương tính giả (không phản hồi với cuộc gọi). Trong hoạt động thực tế vào năm 2026, người ta cho rằng sẽ thường xuyên xảy ra các vấn đề tại hiện trường, chẳng hạn như giảm độ chính xác trong môi trường ồn ào, giọng nói hoặc giọng trầm và kích hoạt sai trong các tình huống có nhiều người nói cùng lúc. Ngoài chi phí cấp phép cho chip nhúng và SDK, phí trả theo mức sử dụng cho API nhận dạng giọng nói trên đám mây ảnh hưởng đến giá thành thị trường của sản phẩm, vì vậy khi chọn một từ đánh thức duy nhất, cần phải xem xét lượng thời gian cần thiết để điều chỉnh.