Trình mã thông báo là một thuật toán chia văn bản thành các đơn vị nhỏ nhất (mã thông báo) mà LLM có thể xử lý. Tiếng Nhật có xu hướng tiêu thụ token nhiều hơn tiếng Anh 2-3 lần, điều này ảnh hưởng trực tiếp đến chi phí API và độ dài ngữ cảnh.
Tokenizer là một mô-đun chuyển đổi văn bản ngôn ngữ tự nhiên thành một chuỗi "mã thông báo" mà LLM có thể xử lý. Mỗi mô hình sử dụng một phương pháp duy nhất, chẳng hạn như BPE (Mã hóa cặp byte) cho hệ thống GPT và SentencePiece cho hệ thống LLaMA và số lượng mã thông báo sẽ khác nhau tùy thuộc vào mô hình ngay cả đối với cùng một câu.
Cạm bẫy lớn nhất trong hoạt động thực tế tính đến năm 2026 là chi phí học tiếng Nhật. Trong tiếng Anh, một từ thường khớp với một mã thông báo, nhưng trong tiếng Nhật, một ký tự thường được chia thành nhiều mã thông báo và không có gì lạ khi cùng một nội dung có số mã thông báo nhiều gấp hai đến ba lần so với tiếng Anh. Giá trung bình cho đầu vào Claude 3.5 Sonnet là 3 USD cho mỗi 1 triệu token, nhưng trong lĩnh vực sử dụng nhiều tiếng Nhật, chi phí hàng tháng có thể cao hơn dự kiến từ 2 đến 3 lần.
Điều quan trọng cần cân nhắc khi chọn một mã trong trường là "khớp mã thông báo của API bạn đang sử dụng với logic tính toán trước". Cả Anthropic và OpenAI đều cung cấp API đếm mã thông báo chính thức và phương pháp cơ bản là luôn ước tính trước khi thiết kế các lời nhắc dài hoặc khối RAG. Trong RAG, nếu các đoạn được chia dựa trên số lượng ký tự, thì các đoạn bị hỏng có ý nghĩa bị cắt giữa chừng có thể sẽ bị ảnh hưởng và cũng có những ví dụ về ReviewAI trong đó việc chuyển sang phân vùng dựa trên ranh giới mã thông báo sẽ cải thiện độ chính xác.