Bảng xếp hạng Nejumi là một bảng xếp hạng chuẩn do Weights & Biases công bố để so sánh hiệu suất của LLM Nhật Bản.
Bảng xếp hạng Nejumi là một chuẩn mực đánh giá chéo các mô hình ngôn ngữ quy mô lớn (LLM) của Nhật Bản trong nhiều nhiệm vụ như hiểu tiếng Nhật, chất lượng phản hồi và độ an toàn, xếp hạng và xuất bản chúng, đồng thời được sử dụng rộng rãi làm điểm tham chiếu để lựa chọn LLM ở Nhật Bản. Nó được đặc trưng bởi thực tế là các mô hình ở nước ngoài như mô hình GPT, Gemini và Claude được so sánh với các mô hình LLM trong nước bằng cùng một tiêu chí. Trong hoạt động thực tế tính đến năm 2026, ngay cả những mẫu xe có thứ hạng cao trên bảng xếp hạng cũng được cho là yếu kém về thuật ngữ kỹ thuật và tài liệu nội bộ thuộc miền của công ty và trong nhiều trường hợp không thể sử dụng cho hoạt động kinh doanh như hiện tại. Khi lựa chọn mô hình tại hiện trường, cần đánh giá không chỉ điểm số trên bảng xếp hạng mà còn cả độ chính xác khi kết hợp RAG và tinh chỉnh, chi phí khi sử dụng API và độ trễ. Về giá thị trường, đơn giá API có xu hướng cao hơn đối với các mẫu cao cấp hơn và điều quan trọng là phải đưa ra lựa chọn có tính đến sự cân bằng giữa chi phí và độ chính xác.