HELM là một khung đánh giá mở được phát triển bởi một nhóm nghiên cứu tại Đại học Stanford nhằm đánh giá chéo hiệu suất của LLM bằng nhiều chỉ số như độ chính xác, công bằng, mạnh mẽ và hiệu quả.
HELM (Đánh giá toàn diện các mô hình ngôn ngữ) là khung đánh giá LLM do CRFM tại Đại học Stanford đề xuất và được đặc trưng bằng cách cho điểm không chỉ độ chính xác mà còn nhiều kịch bản và chỉ số như tính công bằng, mạnh mẽ, độc tính, hiệu quả và hiệu chuẩn. Khung này ra đời từ nhận thức rằng điểm cao trên một điểm chuẩn duy nhất không đảm bảo chất lượng trong hoạt động thực tế và nó cho phép bạn hình dung những sự cân bằng chẳng hạn như ''độ chính xác cao nhưng điểm công bằng thấp cho các thuộc tính cụ thể'' khi chọn một mô hình. Người ta nói rằng vào năm 2026, thay vì sử dụng đánh giá toàn diện như HELM cho các quyết định sản xuất, nó sẽ được áp dụng rộng rãi để chỉ chọn những nhiệm vụ gần với trường hợp sử dụng của công ty. Lý do là việc đánh giá đầy đủ đòi hỏi chi phí tính toán và thời gian đánh giá cao, đồng thời việc lựa chọn mô hình thường yêu cầu chi phí API từ hàng chục đến hàng trăm đô la và thời gian thực hiện vài giờ. Khi chọn một mô hình tại hiện trường, tiêu chuẩn là sử dụng HELM hoặc bảng xếp hạng tương tự làm điểm bắt đầu, kết hợp với xác minh bổ sung bằng dữ liệu nội bộ.