Mô hình cấp byte là mô hình ngôn ngữ xử lý văn bản dưới dạng chuỗi byte UTF-8 mà không chia nó thành mã thông báo từ phụ.
Mô hình cấp byte là thuật ngữ chung cho các mô hình ngôn ngữ học và suy luận bằng cách sử dụng chuỗi byte UTF-8 làm đầu vào trực tiếp mà không cần thông qua trình mã thông báo từ phụ như BPE. Mặc dù về mặt lý thuyết, việc xử lý các từ không xác định, văn bản đa ngôn ngữ, chữ tượng hình và ký hiệu đặc biệt sẽ mạnh mẽ hơn vì nó loại bỏ nhu cầu về danh sách từ vựng, nhưng người ta cho rằng số byte cần thiết để diễn đạt cùng một câu có xu hướng vượt quá số lượng mã thông báo, làm tăng độ dài chuỗi và có xu hướng lấn át cửa sổ ngữ cảnh. Trong hoạt động thực tế, việc tăng độ dài chuỗi này có liên quan trực tiếp đến phí API và độ trễ suy luận, do đó, trong các ngôn ngữ như tiếng Nhật, nơi một ký tự có nhiều byte, điều này có thể dễ dàng dẫn đến tăng chi phí, được coi là một cạm bẫy lớn trong lĩnh vực này. Kể từ năm 2026, người ta nói rằng các thiết kế ngăn chặn độ dài chuỗi hiệu quả thông qua nén sẽ trở thành xu hướng chủ đạo và quyết định đưa ra lựa chọn sẽ phụ thuộc vào việc ưu tiên độ mạnh cho nhiều ngôn ngữ và các từ có tần số thấp hay giá trị thị trường trưởng thành và thông lượng của các mô hình dựa trên mã thông báo hiện có.