Mô hình ngôn ngữ đeo mặt nạ là một mô hình ngôn ngữ được huấn luyện bằng phương pháp học cố ý ẩn một số từ trong câu và dự đoán các từ ẩn từ ngữ cảnh xung quanh.
Một phương pháp học trước như BERT thu được sự hiểu biết ngữ cảnh hai chiều bằng cách che giấu một phần của câu và khôi phục nó khỏi ngữ cảnh xung quanh. Không giống như các hệ thống GPT dự đoán từ tiếp theo theo một hướng, nó có thể sử dụng thông tin theo cả hai hướng, giúp nó trở nên mạnh mẽ cho các tác vụ hiểu ngữ cảnh như phân loại, tìm kiếm và tạo nhúng. Mặt khác, nó không phù hợp với các tác vụ tạo văn bản tự nhiên và hiện nay xu hướng chủ đạo của AI đàm thoại đã chuyển sang các loại bộ giải mã, trong sử dụng thực tế, nó chủ yếu được sử dụng để hiểu các truy vấn của công cụ tìm kiếm và làm cấu trúc bên trong của các mô hình nhúng RAG. Kể từ năm 2026, chi phí để tự học mô hình ngôn ngữ mặt nạ sẽ không thấp và trong lĩnh vực này, việc tinh chỉnh và sử dụng các mô hình được đào tạo trước hiện có đã trở nên phổ biến. Khi thực hiện lựa chọn, quy tắc cơ bản trước tiên là xác định xem nó có được sử dụng để tạo hay không, sau đó chọn loại mặt nạ cho mục đích nhúng/phân loại và loại bộ giải mã cho mục đích tương tác/tạo.