ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Từ điển thuật ngữ AI

1.363 thuật ngữ được giải thích ngắn gọn bằng tiếng Việt — đủ để hiểu tài liệu kỹ thuật mà không cần tra thêm.

AIME (điểm chuẩn toán học)

AIME là chuẩn mực đo lường khả năng suy luận toán học nâng cao của các mô hình AI, được phỏng theo Kỳ thi tuyển sinh Toán học Hoa…

ARC-AGI (Băng ghế suy luận mục đích chung)

ARC-AGI là điểm chuẩn công khai do François Chollet thiết kế để đo lường khả năng suy luận có mục đích chung của AI. Nó bao gồm…

ARC-AGI-2 (Bàn suy luận mục đích chung Phiên bản thứ 2)

ARC-AGI-2 là phiên bản cải tiến của tiêu chuẩn ARC-AGI, đo lường khả năng suy luận trừu tượng của AI bằng cách sử dụng các câu đố…

AUC-ROC (diện tích dưới đường cong ROC)

AUC-ROC là chỉ số đánh giá thể hiện hiệu suất phân loại của mô hình học máy dưới dạng số từ 0 đến 1 và có nghĩa là khu vực dưới…

AgentBench (Băng đánh giá agent)

AgentBench là điểm chuẩn sử dụng LLM (Mô hình ngôn ngữ quy mô lớn) để hoạt động như một agent trong nhiều môi trường như mã hóa,…

AgentHarm (Ghế an toàn cho agent)

AgentHarm là một điểm chuẩn đo lường mức độ các AI agent thực hiện các nhiệm vụ có hại gồm nhiều bước như gian lận và tấn công…

Aider Polyglot (biên soạn thảo mã)

Aider Polyglot là benchmark chỉnh sửa code đa ngôn ngữ được công bố bởi công cụ lập trình cặp AI Aider.

Arena-Hard (băng đối thoại khó)

Arena-Hard là một chuẩn mực so sánh và đánh giá chất lượng phản hồi của LLM bằng cách sử dụng tập hợp các lời nhắc có độ khó cao…

BBH (BIG-Băng ghế cứng)

BBH là một bộ chỉ số đánh giá chỉ trích xuất 23 nhiệm vụ khó mà LLM thông thường có tỷ lệ trả lời đúng trung bình thấp hơn mức…

BEIR (Điểm chuẩn hiệu suất tìm kiếm)

BEIR là một tiêu chuẩn đánh giá nhằm đo lường độ chính xác của mô hình tìm kiếm không có lần chụp nào trong nhiều nhiệm vụ với…

BERTScore (đánh giá độ tương tự về ngữ nghĩa)

BERTScore là chỉ số đánh giá đo lường chất lượng ngữ nghĩa của việc tạo văn bản bằng cách sử dụng tính năng nhúng ngữ cảnh của…

BFCL (đánh giá cuộc gọi chức năng)

BFCL là điểm chuẩn đánh giá lệnh gọi hàm nhằm đo lường xem LLM (Mô hình ngôn ngữ quy mô lớn) có thể gọi chính xác các công cụ và…

BLEU (đánh giá dịch máy)

BLEU là chỉ số đánh giá tự động chấm điểm chất lượng của bản dịch máy và tạo văn bản bằng cách so sánh nó với bản dịch tham chiếu…

Biên giới hiệu suất chi phí (Pareto Frontier)

Đường biên chi phí-hiệu quả là một đường chỉ kết nối những kết hợp tốt hơn bất kỳ lựa chọn nào khác trong sự đánh đổi giữa độ…

Băng ghế dự bị đầu cuối

Terminal-Bench là một tiêu chuẩn đánh giá nhằm đo lường mức độ AI agent có thể tự động thực hiện các nhiệm vụ thực tế trên thiết…

Bảng xếp hạng Nejumi (Đánh giá LLM tiếng Nhật)

Bảng xếp hạng Nejumi là một bảng xếp hạng chuẩn do Weights & Biases công bố để so sánh hiệu suất của LLM Nhật Bản.

COMET (đánh giá chất lượng dịch máy)

COMET là chỉ số đánh giá tự động sử dụng việc nhúng các mô hình đa ngôn ngữ được đào tạo trước để chấm điểm chất lượng dịch máy…

CSAT (AI đáp ứng sự hài lòng của khách hàng)

CSAT là chỉ số thể hiện bằng số lượng mức độ hài lòng của người dùng với các dịch vụ hỗ trợ khách hàng như chatbot AI và dịch vụ…

ChartQA (Biên tập hiểu biết về biểu đồ)

ChartQA là một tiêu chuẩn trả lời câu hỏi bằng hình ảnh nhằm đo lường xem liệu mô hình AI có thể đọc chính xác các con số và xu…

Chi phí cho mỗi nhiệm vụ

Đơn giá cho mỗi nhiệm vụ là chỉ số đánh giá cho biết tổng chi phí để AI hoàn thành một nhiệm vụ cụ thể.

Chân trời thời gian nhiệm vụ (METR Time Horizon)

Khoảng thời gian nhiệm vụ là chỉ số hiệu suất biểu thị độ dài của nhiệm vụ mà AI agent có thể hoàn thành với xác suất 50% trong…

Chỉ số trí tuệ phân tích nhân tạo

Chỉ số thông minh phân tích nhân tạo là chỉ số đánh giá tích hợp nhiều kết quả điểm chuẩn của bên thứ ba và thể hiện hiệu suất…

Cohen's Kappa (thỏa thuận giữa các bên)

Cohen's Kappa là một chỉ số thống kê được tính bằng cách trừ đi mức độ trùng hợp do ngẫu nhiên từ mức độ phù hợp giữa các phán…

Con ngườiEval

Điểm chuẩn thành thạo mã hóa Python từ OpenAI. 164 nhiệm vụ thực hiện chức năng.

Câu trả lời liên quan

Mức độ liên quan của câu trả lời là chỉ số đánh giá RAG để đo lường mức độ chính xác của các câu trả lời do LLM tạo ra tương ứng…

DocVQA (Biên tập hiểu tài liệu)

DocVQA là chuẩn mực đo lường khả năng hiểu tài liệu và độ chính xác OCR của mô hình AI bằng cách đặt câu hỏi và trả lời các câu…

DuyệtComp (Băng ghế năng lực duyệt)

DuyệtComp là một điểm chuẩn đo lường khả năng của một AI agent trong việc tự mình tìm kiếm và duyệt web để tìm thấy thông tin…

ELYZA-tasks-100 (Hướng dẫn tiếng Nhật sau khi đánh giá)

ELYZA-tasks-100 là điểm chuẩn đánh giá khả năng LLM của Nhật Bản thực hiện theo các hướng dẫn phức tạp bằng cách sử dụng 100…

Entropy ngữ nghĩa (chỉ số phát hiện ảo giác)

Entropy ngữ nghĩa là một chỉ mục tập hợp nhiều câu trả lời LLM cho cùng một câu hỏi thành các đơn vị ngữ nghĩa và phát hiện khả…

FID (chỉ số đánh giá tạo ảnh)

FID là chỉ số đánh giá khách quan chất lượng của mô hình tạo hình ảnh bằng cách định lượng sự khác biệt trong phân bố đặc điểm…

FactScore (Đánh giá tính xác thực của văn bản dài)

FactScore là chỉ số đánh giá tính xác thực, chia nhỏ một câu dài thành các sự kiện đơn giản và so sánh từng sự kiện với nguồn…

FrontierMath (bảng hàm khó nhất)

FrontierMath là chuẩn mực khó nhất đo lường khả năng suy luận của các mô hình AI sử dụng các bài toán có độ khó cao mà ngay cả…

GAIA (Băng ghế trợ lý AI đa năng)

GAIA là tiêu chuẩn đánh giá dựa trên độ khó dành cho các trợ lý AI có mục đích chung được phát triển bởi Meta AI và các công ty…

GDPval (bảng giá trị kinh tế)

GDPval là tiêu chuẩn được OpenAI công bố vào năm 2025 để đo lường mức độ mô hình AI có thể thực hiện các nhiệm vụ tạo ra giá trị…

GPQA

GPQA là chuẩn đánh giá nhằm đo lường khả năng suy luận của AI với các câu hỏi khó cấp độ sau đại học về sinh học, vật lý và hóa…

GSM8K (bảng suy luận số học)

GSM8K là chuẩn mực đo lường khả năng suy luận nhiều bước của các mô hình ngôn ngữ quy mô lớn, bao gồm 8.500 bài toán đố cấp tiểu…

GenEval (Băng ghế phù hợp với hướng dẫn tạo hình ảnh)

GenEval là một tiêu chuẩn đánh giá nhằm đo lường mức độ chính xác mà AI tạo hình ảnh có thể phản ánh các hướng dẫn nhanh chóng…

Giá mỗi triệu token

Giá trên một triệu mã thông báo là chỉ số đánh giá biểu thị phí sử dụng API LLM xét theo số lượng trên một triệu mã thông báo…

HELM (Khung đánh giá toàn diện)

HELM là một khung đánh giá mở được phát triển bởi một nhóm nghiên cứu tại Đại học Stanford nhằm đánh giá chéo hiệu suất của LLM…

HealthBench (Băng ghế phản ứng y tế)

HealthBench là một tiêu chuẩn đánh giá được thiết kế để đo lường mức độ chính xác và an toàn của các mô hình ngôn ngữ quy mô lớn…

HellaSwag (băng ghế lý luận thông thường)

HellaSwag là một chuẩn mực đo lường khả năng suy luận thông thường của mô hình AI bằng cách yêu cầu người dùng chọn từ bốn câu tự…

Heron-Bench (Băng ghế hiểu biết hình ảnh của Nhật Bản)

Heron-Bench là điểm chuẩn đánh giá khả năng hiểu hình ảnh bằng tiếng Nhật của VLM (Mô hình ngôn ngữ trực quan) bằng cách sử dụng…

Hiệu chuẩn (Hiệu chỉnh / ECE)

Hiệu chuẩn là một chỉ số cho thấy kết quả đầu ra xác suất (độ tin cậy) dự đoán của mô hình phù hợp với tỷ lệ chính xác thực tế…

Hiệu quả mã thông báo

Hiệu quả của mã thông báo là một chỉ số cho thấy mức độ hiệu suất và kết quả có thể được trích xuất trên mỗi số lượng mã thông…

IFEval (hướng dẫn theo băng ghế dự bị)

IFEval là một tiêu chuẩn tuân theo hướng dẫn để chấm điểm một cách máy móc mức độ chính xác mà một mô hình ngôn ngữ quy mô lớn có…

JGLUE (Tiêu chuẩn hiểu tiếng Nhật)

JGLUE là một nhóm các bộ dữ liệu chuẩn được phát triển bởi Đại học Tokyo, Đại học Waseda và Yahoo để đo lường khả năng hiểu ngôn…

JHumanEval (Băng ghế tạo mã tiếng Nhật)

JHumanEval là một tiêu chuẩn đánh giá được tạo ra để đo lường hiệu suất của AI tạo mã trong môi trường nhận xét và chuỗi tài liệu…

JMMLU (Tiêu chuẩn kiến ​​thức tiếng Nhật)

JMMLU là chuẩn mực đo lường kiến ​​thức và khả năng hiểu biết của sinh viên LLM Nhật Bản với các câu hỏi 4 lựa chọn thuộc 56 lĩnh…

JMTEB (Băng ghế đánh giá nhúng của Nhật Bản)

JMTEB là điểm chuẩn đánh giá hiệu suất của các mô hình nhúng văn bản tiếng Nhật qua nhiều tác vụ như tìm kiếm, phân loại, phân…

JQaRA (tìm kiếm tiếng Nhật/đánh giá RAG)

JQaRA là tập dữ liệu chuẩn được xuất bản để đo lường độ chính xác tìm kiếm của hệ thống RAG Nhật Bản.

Kim trong Haystack (Đánh giá tìm kiếm theo ngữ cảnh dài)

Needle in a Haystack là một phương pháp đánh giá để đo lường xem liệu LLM có thể trích xuất chính xác thông tin cụ thể từ các văn…

Kiểm soát kiểu (sửa định dạng câu trả lời)

Kiểm soát phong cách là một phương pháp đánh giá chỉ đo lường chất lượng nội dung bằng cách hiệu chỉnh thống kê độ lệch do trang…

Kiểm tra hồi quy nhanh chóng

Kiểm tra hồi quy nhanh chóng là một phương pháp đánh giá tự động xác minh, bằng cách sử dụng bộ sưu tập trường hợp kiểm thử được…

Kết hợp chính xác

Kết hợp chính xác là thước đo đánh giá xác định xem đầu ra của mô hình có giống từng từ với nhãn hoặc chuỗi tham chiếu chính xác…

Kỳ thi cuối cùng của nhân loại (HLE)

HLE là bộ benchmark cực khó được ra mắt vào năm 2025 bởi Scale AI và Trung tâm An toàn AI (CAIS) nhằm đo lường giới hạn suy luận…

LLM-với tư cách là Thẩm phán

LLM-as-a-Judge là một phương pháp đánh giá trong đó chất lượng đầu ra của một LLM được một LLM khác tự động chấm điểm. Được sử…

LegalBench (Băng ghế lý luận pháp lý)

LegalBench là một chuẩn mực mở nhằm đo lường khả năng suy luận pháp lý của các mô hình ngôn ngữ quy mô lớn, bao gồm 162 loại…

LiveBench (băng ghế toàn diện chống ô nhiễm)

LiveBench là một điểm chuẩn toàn diện giúp đánh giá chéo LLM trong nhiều lĩnh vực như lý luận, toán học và mã hóa, đồng thời cập…

LiveCodeBench (Bộ mã chuẩn về khả năng chịu ô nhiễm)

LiveCodeBench là một điểm chuẩn liên tục thu thập các vấn đề mới từ các trang lập trình cạnh tranh như LeetCode và đánh giá khách…

LongBench (băng ghế ngữ cảnh dài)

LongBench là một chuẩn mực đa tác vụ, đa ngôn ngữ nhằm đo lường mức độ chính xác mà các mô hình ngôn ngữ quy mô lớn có thể hiểu…

MBPP (Băng ghế tạo mã Python)

MBPP là điểm chuẩn đánh giá nhằm đo lường độ chính xác khi tạo mã của các mô hình AI ở định dạng pass@k bằng cách sử dụng bộ bài…

MGSM (Ghế toán đa ngôn ngữ)

MGSM là chuẩn mực đo lường khả năng suy luận toán học đa ngôn ngữ của LLM bằng cách dịch chuẩn bài toán từ tiếng Anh GSM8K sang…

MLPerf (Băng ghế hiệu suất học máy)

MLPerf là ​​bộ điểm chuẩn tiêu chuẩn ngành để so sánh tốc độ học/suy luận và hiệu suất năng lượng của các mô hình học máy trong…

MMAU (Bàn hiểu giọng nói/âm thanh)

MMAU là một nhiệm vụ trả lời câu hỏi bao gồm ba lĩnh vực: giọng nói, âm thanh môi trường và âm nhạc, đồng thời là điểm chuẩn cho…

MMLU

Hiểu ngôn ngữ đa nhiệm lớn. Điểm chuẩn đánh giá kiến ​​thức LLM của 57 lĩnh vực và 15.000 câu hỏi.

MMLU-Pro (Băng kiến ​​thức khó)

MMLU-Pro là tiêu chuẩn đánh giá LLM khiến tiêu chuẩn MMLU hiện tại trở nên khó khăn hơn, tăng số lượng lựa chọn lên 10 và nhấn…

MMMU (Băng ghế hiểu biết đa phương thức)

MMMU là chuẩn mực đo lường khả năng hiểu biết toàn diện về AI đa phương thức bằng cách sử dụng các câu hỏi chuyên ngành cấp đại…

MOS (điểm ý kiến ​​trung bình)

MOS là chỉ số đánh giá nhằm định lượng chất lượng của giọng nói tổng hợp và nội dung được tạo ra theo thang điểm từ 1 đến 5 dựa…

MRCR (Băng ghế tìm kiếm nhiều tham chiếu)

MRCR (Băng truy xuất nhiều tham chiếu) là chỉ số đánh giá ngữ cảnh dài nhằm đo lường xem liệu LLM có thể phân biệt và trích xuất…

MRR (Xếp hạng ngược trung bình)

MRR (Xếp hạng đối ứng trung bình) là chỉ số đánh giá để truy xuất thông tin là đối ứng của thứ hạng trong đó câu trả lời đúng…

MT-Bench (bàn đánh giá đối thoại)

MT-Bench là điểm chuẩn tiêu chuẩn trong đó GPT-4 tự động chấm điểm khả năng đối thoại nhiều giai đoạn của LLM. Lý luận, viết mã,…

MTEB (Băng ghế đánh giá mô hình nhúng)

MTEB là điểm chuẩn so sánh chéo hiệu suất của nhiều tác vụ như tìm kiếm, phân loại và phân cụm các mô hình nhúng.

Ma trận nhầm lẫn

Ma trận nhầm lẫn là một chỉ số đánh giá so sánh kết quả dự đoán của mô hình phân loại với các nhãn chính xác thực tế và sắp xếp…

MultiChallenge (bàn đánh giá nhiều lượt)

MultiChallenge là một tiêu chuẩn đánh giá nhằm đo lường xem liệu một mô hình ngôn ngữ quy mô lớn có thể ghi nhớ chính xác các…

NDCG (Tăng tích lũy chiết khấu chuẩn hóa)

NDCG là chỉ số đánh giá được thiết kế để mang lại điểm số cao hơn cho kết quả xếp hạng tìm kiếm và đề xuất vì các mục có mức độ…

OSWorld (Băng ghế vận hành hệ điều hành)

OSWorld là một tiêu chuẩn đánh giá nhằm đo lường xem AI agent có thể tự động thực hiện các hoạt động tệp và ứng dụng trong môi…

Phân tích lỗi

Phân tích lỗi là một quá trình đánh giá nhằm thu thập và phân loại lỗi đầu ra theo mô hình AI, xác định các kiểu nguyên nhân và…

RAGAS (Khung đánh giá RAG)

RAGAS là một khung nguồn mở tự động đánh giá chất lượng phản hồi của hệ thống RAG. Giám khảo LLM sẽ chấm điểm bốn chỉ số về độ…

ROUGE (chỉ số đánh giá tóm tắt)

ROUGE là chỉ mục đánh giá tóm tắt tự động chấm điểm các văn bản được tạo bởi LLM hoặc dịch máy dựa trên tỷ lệ khớp n-gram với văn…

RULER (băng đánh giá bối cảnh dài)

RULER là điểm chuẩn đo lường mức độ chính xác của mô hình ngôn ngữ quy mô lớn (LLM) thực sự có thể xử lý thông tin với độ dài ngữ…

Recall@k (thu hồi truy xuất)

Recall@k là chỉ số đánh giá đo lường tỷ lệ phần trăm các mục liên quan là câu trả lời đúng nằm trong k kết quả hàng đầu của hệ…

SWE-Lancer (Băng ghế mã giá trị kinh tế)

SWE-Lancer là chuẩn mực đo lường khả năng phát triển phần mềm của các mô hình AI về mặt giá trị kinh tế, dựa trên các dự án…

SWE-bench Pro (bảng mã phiên bản khó)

SWE-bench Pro là một tiêu chuẩn đánh giá khả năng mã hóa ở quy mô thực tế khó hơn, được tạo ra sau khi SWE-bench cũ được xác minh…

SWE-bench đã được xác minh (Băng ghế dự bị đã được xác minh)

SWE-bench Verify là chỉ số đánh giá mã hóa nhằm đo lường mức độ AI có thể giải quyết các vấn đề sửa lỗi trong kho GitHub thực…

SciCode (băng ghế tạo mã khoa học)

SciCode là điểm chuẩn kiểm tra khả năng tạo mã thực tế của LLM trong các lĩnh vực nghiên cứu khoa học như vật lý, hóa học và sinh…

SelfCheckGPT (phương pháp phát hiện ảo giác)

SelfCheckGPT là phương pháp phát hiện ảo giác (kết quả đầu ra khác với thực tế) bằng cách so sánh độ phân tán của nhiều câu trả…

SimpleQA (điểm chuẩn thực tế)

SimpleQA là một tiêu chuẩn được OpenAI công bố vào năm 2024 nhằm đo lường tỷ lệ câu trả lời đúng và xu hướng ảo giác (câu trả lời…

SỰ THẬT Nối đất

FACTS Grounding là một điểm chuẩn do Google DeepMind công bố vào năm 2024 nhằm đo lường mức độ chặt chẽ của các câu trả lời LLM…

Sự bối rối (bối rối)

Sự bối rối là một chỉ số đánh giá cho thấy bằng số lượng mức độ chính xác mà một mô hình ngôn ngữ có thể dự đoán văn bản. Giá trị…

Sự chung thủy

Độ trung thực là thước đo đo lường độ chính xác của văn bản do AI tạo sinh dựa trên tài liệu nguồn và ngữ cảnh được cung cấp.

TOÁN (điểm chuẩn toán học)

MATH là bộ dữ liệu điểm chuẩn bao gồm 12.500 bài toán cấp độ thi cấp trung học (mức độ khó từ 1 đến 5) và được sử dụng rộng rãi…

TTFT (Thời gian đến mã thông báo đầu tiên)

TTFT là thời gian từ khi gửi yêu cầu đến LLM đến khi nhận được token đầu tiên. Chỉ báo cốt lõi về tốc độ phản hồi xác định thời…

TheAgentCompany (băng ghế agent thực tế)

TheAgentCompany là một tiêu chuẩn yêu cầu các AI agent LLM hoàn thành 175 nhiệm vụ thực tế trong một công ty phần mềm mô phỏng và…

Triển khai bóng

Đánh giá bóng là một phương pháp đánh giá chạy các mô hình và lời nhắc mới song song với lưu lượng truy cập trực tiếp, đồng thời…

TruthfulQA (TruthfulBench)

TruthfulQA (Tiêu chuẩn trung thực) là một tiêu chuẩn đo lường xem liệu một mô hình ngôn ngữ quy mô lớn có thể trả lại câu trả lời…

Trôi mô hình (suy giảm hiệu suất)

Trôi mô hình là hiện tượng trong đó độ chính xác dự đoán và chất lượng đầu ra của mô hình AI trong quá trình sản xuất suy giảm…

Tập dữ liệu vàng (thu thập dữ liệu chính xác)

Bộ dữ liệu vàng là tập hợp dữ liệu đánh giá với các câu trả lời mô hình được tạo thủ công để đo lường độ chính xác đầu ra của AI.

Tỷ lệ chính xác

Độ chính xác là chỉ số đánh giá cho biết tỷ lệ phần trăm các trường hợp được dự đoán chính xác trên tổng số dự đoán do mô hình…

Tỷ lệ lệch (tỷ lệ tự phân giải)

Tỷ lệ sai lệch (tỷ lệ tự giải quyết) là chỉ số hỗ trợ khách hàng cho biết tỷ lệ phần trăm câu hỏi của khách hàng được giải quyết…

Tỷ lệ thành công nhiệm vụ

Tỷ lệ thành công của nhiệm vụ là tốc độ mà một loạt nhiệm vụ được giao cho AI agent có thể được hoàn thành một cách chính xác mà…

Tỷ lệ tấn công thành công

Tỷ lệ tấn công thành công là tỷ lệ phần trăm các lần thử trong đó đầu vào thù địch, chẳng hạn như lời nhắc bẻ khóa, bỏ qua các…

Tỷ lệ ảo giác

Tỷ lệ ảo giác là một chỉ số đánh giá định lượng tốc độ AI tạo sinh thông tin khác với thực tế. Là chỉ số cơ bản để đo lường độ…

VBench (Băng ghế đánh giá tạo video)

VBench là một tiêu chuẩn đánh giá nguồn mở nhằm chấm điểm một cách định lượng nhiều khía cạnh của AI tạo video, chẳng hạn như…

Vending-Bend (bàn hoạt động dài hạn)

Vending-Bench là điểm chuẩn kiểm tra khả năng ra quyết định nhất quán của AI agent trong một khoảng thời gian dài bằng cách mô…

Video-MME (Biên tập hiểu video)

Video-MME là điểm chuẩn đo lường khả năng hiểu video của các mô hình AI đa phương thức bằng cách sử dụng nhiều video ngắn đến dài…

WER (tỷ lệ lỗi từ)

WER (tỷ lệ lỗi từ) là chỉ số đánh giá tiêu chuẩn ngành nhằm định lượng độ chính xác của nhận dạng giọng nói, phiên âm và dịch…

WebArena (Băng ghế hoạt động web)

WebArena là một tiêu chuẩn đánh giá nhằm đo lường mức độ mà các AI agent có thể tự động thực hiện các nhiệm vụ như mua sắm, đặt…

WildBench (bảng đánh giá thực tế)

WildBench là điểm chuẩn đánh giá chấm điểm chất lượng phản hồi LLM bằng cách sử dụng danh sách kiểm tra cho từng tác vụ, dựa trên…

Xu hướng vị trí

Xu hướng vị trí là một hiện tượng trong đánh giá LLM và xếp hạng tìm kiếm trong đó kết quả đánh giá và lựa chọn bị sai lệch dựa…

Xếp hạng Elo

Xếp hạng Elo là một hệ thống tính điểm sử dụng phương pháp định lượng sức mạnh tương đối được phát triển trong cờ vua để đánh giá…

băng ghế dự bị SWE

SWE-bench là điểm chuẩn tiêu chuẩn ngành để đánh giá AI mã hóa nhằm đo lường xem liệu AI có thể tự động khắc phục các sự cố thực…

llm-jp-eval (công cụ đánh giá LLM của Nhật Bản)

llm-jp-eval là một khai thác đánh giá nguồn mở do tập đoàn LLM-jp phát hành, cho phép bạn đánh giá chéo hiệu suất của LLM Nhật…

mã thông báo mỗi giây (thông lượng)

Mã thông báo mỗi giây (thông lượng) là chỉ báo hiệu suất cho biết số lượng mã thông báo mà LLM có thể tạo và xử lý trong một…

pass@k (chỉ số đánh giá tạo mã)

pass@k là chỉ số đánh giá cho biết xác suất để ít nhất một trong k mẫu mã được tạo bởi AI tạo mã vượt qua tất cả các bài kiểm tra…

pass^k (số liệu nhất quán)

pass^k là chỉ số đánh giá tính nhất quán để đo lường độ tin cậy bằng cách yêu cầu một mô hình AI tổng quát thực hiện cùng một…

Ô nhiễm điểm chuẩn

Ô nhiễm điểm chuẩn là hiện tượng dữ liệu đánh giá bài kiểm tra bị trộn lẫn vào dữ liệu huấn luyện của mô hình AI, khiến điểm hiệu…

Ý nghĩa thống kê (khoảng tin cậy của đánh giá)

Ý nghĩa thống kê là một tiêu chuẩn thống kê cho biết liệu sự khác biệt trong kết quả đánh giá của mô hình AI và thử nghiệm A/B có…

Điểm CLIP (căn chỉnh văn bản hình ảnh)

Điểm CLIP là chỉ số đánh giá nhằm định lượng mức độ khớp ngữ nghĩa giữa hình ảnh được tạo và mô tả văn bản.

Điểm F1

Điểm F1 là chỉ số đánh giá là mức trung bình hài hòa của độ chính xác và khả năng thu hồi của mô hình phân loại. Nếu một trong…

Điểm chuẩn

Điểm chuẩn là một bộ tiêu chí đánh giá nhằm định lượng hiệu suất của mô hình AI bằng cách sử dụng các nhiệm vụ kiểm tra được tiêu…

Điểm độc tính (Độ độc)

Độc tính là chỉ số đánh giá nhằm định lượng mức độ gây hại như phân biệt đối xử, bạo lực, quấy rối, v.v. có trong các văn bản do…

Đánh giá con người

Đánh giá thủ công là phương pháp đánh giá mô hình trong đó con người trực tiếp chấm điểm và đánh giá chất lượng đầu ra của văn…

Đánh giá phiếu tự đánh giá (tiêu chí chấm điểm)

Đánh giá phiếu tự đánh giá là một phương pháp chấm điểm các kết quả đầu ra và sản phẩm phân phối của AI bằng cách sử dụng nhiều…

Đánh giá quỹ đạo (đánh giá lịch sử hành vi)

Đánh giá quỹ đạo là phương pháp đánh giá lịch sử của chuỗi hành động và quyết định (gọi công cụ và các bước suy luận) do AI agent…

Đánh giá trực tuyến

Đánh giá trực tuyến là phương pháp theo dõi và đánh giá liên tục chất lượng phản hồi của mô hình AI đối với đầu vào thực tế của…

Đấu trường LM (Đấu trường Chatbot)

Xếp hạng đánh giá con người LLM dựa trên phiếu bầu của người dùng. Xếp hạng các mô hình theo xếp hạng Elo.

Độ bão hòa điểm chuẩn (Saturation)

Bão hòa điểm chuẩn là một hiện tượng trong đó, khi hiệu suất của các mô hình AI được cải thiện, điểm số của các mô hình hàng đầu…

Độ chính xác & Thu hồi

Độ chính xác và thu hồi là hai chỉ số đo lường độ chính xác dự đoán của mô hình phân loại. Độ chính xác là trục đánh giá cho biết…

Độ chính xác của trích dẫn

Độ chính xác của trích dẫn là chỉ số đánh giá nhằm đo lường xem nội dung của các trích dẫn và nguồn có trong câu trả lời do AI…

Độ chính xác của việc lựa chọn công cụ

Độ chính xác của việc lựa chọn công cụ là chỉ số đánh giá cho thấy tốc độ mà AI agent có thể chọn đúng công cụ trong số nhiều…

Độ trễ

Độ trễ là thời gian phản hồi giữa việc gửi yêu cầu đến mô hình AI và nhận phản hồi đầu tiên.

Độ trễ P95 (độ trễ đuôi)

Độ trễ P95 là giá trị nằm ở phân vị thứ 95 tính từ dưới lên khi thời gian phản hồi yêu cầu được sắp xếp theo thứ tự thời gian…

τ-bench (băng đánh giá agent)

τ-bench là điểm chuẩn đánh giá thống kê khả năng sử dụng công cụ và thực hiện các tác vụ nhiều bước của AI agent trong một tình…

τ2-bench (băng đánh giá agent)

τ²-bench là một tiêu chuẩn đánh giá nhằm đo lường mức độ chính xác của AI agent có thể thực hiện các nhiệm vụ kết hợp nhiều lượt…