llama.cpp là một công cụ suy luận nguồn mở C/C++ được tối ưu hóa để chạy mô hình LLaMA của Meta ở tốc độ cao ngay cả trên CPU.
llama.cpp là một công cụ suy luận LLM được triển khai trong C/C++ và tính năng của nó là có thể lượng tử hóa mô hình và chạy nhẹ trên CPU. Vì LLM có thể chạy cục bộ trên PC và điện thoại thông minh không có GPU nên nó được cho là sẽ được áp dụng rộng rãi trong các trường hợp bạn muốn tránh phí API trên đám mây hoặc như một tùy chọn để vận hành tại chỗ tại các trang web nơi dữ liệu bí mật không thể được phát hành ra bên ngoài. Trong hoạt động thực tế kể từ năm 2026, mặc dù tốc độ suy luận và mức sử dụng bộ nhớ sẽ cải thiện khi số lượng bit lượng tử hóa giảm xuống, nhưng sẽ có sự đánh đổi sẽ làm giảm độ chính xác của phản hồi và người ta đã chỉ ra rằng nếu lượng tử hóa 4 bit trở xuống dễ dàng được áp dụng cho mục đích kinh doanh thì sẽ khó nhận thấy sự suy giảm chất lượng. Ngoài ra, cần có một mức độ kiến thức vận hành nhất định để điều chỉnh khả năng tương thích của mô hình và cài đặt giảm tải GPU, đồng thời chi phí học tập xây dựng ban đầu sẽ cao hơn so với việc sử dụng API đám mây, điều này cần được cân nhắc khi đưa ra lựa chọn. Về hiệu suất thị trường, bản thân chi phí hoạt động của suy luận gần như bằng 0, không bao gồm chi phí phần cứng và có thể sẽ vượt trội hơn so với việc thanh toán API cho các công cụ nội bộ và mục đích xác minh với lượng lưu lượng truy cập nhỏ, nhưng cần có thiết kế khả năng mở rộng riêng biệt để truy cập đồng thời trên quy mô lớn.