TensorRT-LLM là một công cụ suy luận mã nguồn mở giúp tăng tốc suy luận mô hình ngôn ngữ quy mô lớn (LLM) được tối ưu hóa cho GPU NVIDIA.
TensorRT-LLM là một công cụ suy luận nguồn mở do NVIDIA cung cấp và là công nghệ dựa trên TensorRT kết hợp tối ưu hóa tính toán cho LLM (kết hợp hạt nhân, lượng tử hóa, Batching trong chuyến bay, v.v.) để cải thiện thông lượng suy luận và độ trễ trên GPU NVIDIA. Là một tiêu chuẩn ngành, nó được coi là một trong những lựa chọn để lưu trữ suy luận nội bộ, cùng với vLLM và Ollama. Trong hoạt động thực tế kể từ năm 2026, sẽ cần phải xây dựng trước động cơ cho kiến trúc GPU cho từng kiểu máy, đây là một cạm bẫy rất dễ xảy ra tại hiện trường vì việc xây dựng lại giờ công và chi phí thử nghiệm sẽ phát sinh mỗi khi cập nhật mô hình hoặc thay đổi thế hệ GPU. Ngoài ra, vì nó không chạy trên bất kỳ thứ gì khác ngoài GPU NVIDIA nên chi phí phiên bản GPU đám mây là chi phí tương đối chính và đối với khối lượng yêu cầu nhỏ, chi phí này có xu hướng đắt so với giá thị trường của phí API. Về cách lựa chọn trong lĩnh vực này, nó được coi là một ứng cử viên nếu bạn có ý định xử lý lượng lớn lưu lượng truy cập bằng cơ sở hạ tầng của riêng mình và sẽ tiếp tục sử dụng GPU NVIDIA, nếu không thì việc sử dụng API suy luận được quản lý sẽ được ưu tiên.