Tạo khối liên tục là phương pháp trong đó máy chủ suy luận LLM xử lý các yêu cầu mới bằng cách chèn chúng vào các đơn vị mã thông báo bất cứ lúc nào mà không cần đợi hoàn thành từng yêu cầu riêng lẻ.
Phân nhóm liên tục là một phương pháp trong đó khi xử lý nhiều yêu cầu cùng một lúc trong suy luận LLM, các yêu cầu mới sẽ được chèn từng bước bất kỳ lúc nào mà không cần đợi quá trình tạo từng yêu cầu hoàn tất và được cho là được áp dụng tiêu chuẩn bởi các công cụ suy luận chính như vLLM và TGI. Với tính năng tạo khối tĩnh thông thường, một yêu cầu có phản hồi ngắn buộc phải đợi cho đến khi thế hệ dài nhất trong cùng một lô kết thúc, điều này khiến GPU không hoạt động. Tuy nhiên, việc tạo khối liên tục được biết đến rộng rãi như một công nghệ giúp giảm lãng phí này và tăng thông lượng. Trong hoạt động thực tế kể từ năm 2026, độ trễ có thể trở nên không ổn định tùy thuộc vào thiết kế quản lý bộ nhớ đệm KV và kiểm soát mức độ ưu tiên, đồng thời tại hiện trường, người ta cho rằng ngày càng có nhiều trường hợp vận hành kết hợp với điều chỉnh kích thước lô theo yêu cầu phân bổ độ dài và quản lý bộ nhớ dựa trên phân trang. Khi sử dụng LLM có tính phí API, hiệu quả của việc tối ưu hóa này liên quan trực tiếp đến chi phí GPU và phí sử dụng, do đó, điều quan trọng là phải kiểm tra sự khác biệt khi triển khai của công cụ suy luận khi chọn mô hình hoặc dịch vụ.