Phân tách điền trước/Giải mã là kiến trúc suy luận trong đó quá trình xử lý nhắc (Prefill) và tạo tuần tự (Giải mã) trong suy luận LLM được phân tách và thực thi trên các nhóm GPU riêng biệt.
Phân tách điền trước/giải mã (Suy luận phân tán) là kiến trúc trong đó hai giai đoạn tạo nên suy luận LLM, Điền trước, xử lý các lời nhắc theo đợt và chiếm ưu thế trong lượng tính toán, và Giải mã, tạo ra mã thông báo tuần tự và chi phối băng thông bộ nhớ, được phân tách và thực thi trên các cụm GPU riêng biệt. Đặc tính tính toán của cả hai giai đoạn khác nhau đáng kể và hiệu quả xử lý hàng loạt có xu hướng giảm nếu chúng được trộn lẫn trên cùng một GPU, vì vậy ưu điểm của việc tách chúng ra là chúng có thể được cấu hình với cấu hình phần cứng tối ưu cho từng giai đoạn. Nó đã được áp dụng rộng rãi bởi các nền tảng suy luận lớn như vLLM và NVIDIA Dynamo và dự kiến sẽ là một trong những cấu hình tiêu chuẩn cho các dịch vụ suy luận quy mô lớn vào năm 2026. Trong hoạt động thực tế, việc chuyển bộ nhớ đệm KV từ phía Điền trước sang phía Giải mã có xu hướng trở thành nút cổ chai và người ta cho rằng có một cạm bẫy khi lợi ích của việc phân tách sẽ bị bù đắp nếu băng thông mạng mỏng. Ngoài ra, do hai hệ thống cụm chuyên dụng được duy trì nên chi phí của GPU nhàn rỗi có xu hướng tương đối cao đối với lưu lượng truy cập cỡ nhỏ đến trung bình và thông lệ trong lĩnh vực này là chỉ xem xét việc triển khai sau khi đã thu thập được số lượng yêu cầu.