ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Từ điển thuật ngữ AI

1.363 thuật ngữ được giải thích ngắn gọn bằng tiếng Việt — đủ để hiểu tài liệu kỹ thuật mà không cần tra thêm.

ABCI (Cơ sở hạ tầng điện toán AIST AI)

ABCI là nền tảng điện toán AI (siêu máy tính) lớn nhất Nhật Bản được xây dựng và vận hành bởi Viện Khoa học và Công nghệ Công…

AI hiến pháp

AI hiến pháp là một phương pháp đào tạo gợi ra những phản ứng an toàn và có đạo đức bằng cách đưa ra cho mô hình AI một danh sách…

AI trên thiết bị

AI trên thiết bị là công nghệ suy luận và thực thi trực tiếp mô hình AI trên chính thiết bị đó (điện thoại thông minh, PC, thiết…

API hàng loạt (suy luận hàng loạt không đồng bộ)

API hàng loạt là phương pháp sử dụng API LLM để xử lý một số lượng lớn yêu cầu suy luận một cách không đồng bộ và ưu tiên chi phí…

AWQ (lượng tử hóa nhận biết kích hoạt)

AWQ là phương pháp lượng tử hóa LLM duy trì độ chính xác chỉ cho các trọng số quan trọng dựa trên việc phân phối các giá trị kích…

AdamW (thuật toán tối ưu hóa)

AdamW là một phương pháp tối ưu hóa cải tiến giúp tách tính toán giảm trọng số của thuật toán tối ưu hóa Adam khỏi cập nhật độ…

Blackwell (thế hệ GPU NVIDIA)

Blackwell là tên của kiến ​​trúc GPU thế hệ tiếp theo được NVIDIA công bố vào năm 2024 và là một nền tảng bán dẫn được thiết kế…

Bỏ học

Dropout là một phương pháp chính quy hóa nhằm vô hiệu hóa các nút có xác suất nhất định trong quá trình huấn luyện mạng nơ-ron…

Bộ đệm KV

Bộ đệm KV là công nghệ tốc độ cao lưu trữ ma trận khóa (K) và giá trị (V) của cơ chế tự chú ý trong bộ nhớ mà không tính toán lại…

CUDA (Nền tảng tính toán song song GPU)

CUDA là mô hình lập trình và môi trường phát triển để thực hiện các phép tính song song trên GPU NVIDIA và được sử dụng rộng rãi…

Chuyên gia song song

Song song chuyên gia là một phương pháp học tập và suy luận phân tán, trong đó mỗi chuyên gia (mạng con chuyên gia) của mô hình…

Chuyển tiếp học tập

Học chuyển giao là một phương pháp học máy áp dụng kiến ​​thức của một mô hình được đào tạo về nhiệm vụ này sang nhiệm vụ liên…

Chú ý thưa thớt

Chú ý thưa thớt là phương pháp trong đó cơ chế tự chú ý của Transformer không tính toán tất cả các cặp token mà thu hẹp lại một…

Chưng cất

Chưng cất là một phương pháp học máy chuyển kiến ​​thức của "mô hình giáo viên" quy mô lớn sang "mô hình học sinh" quy mô nhỏ để…

Căn chỉnh AI (căn chỉnh giá trị)

Căn chỉnh AI là một quy trình thiết kế và công nghệ nhằm điều chỉnh đầu ra và hành vi của AI phù hợp với ý định, giá trị và tiêu…

Cơ chế chú ý

Một cơ chế tự động cân nhắc những gì cần tập trung vào trong chuỗi đầu vào. Cốt lõi của máy biến áp.

Cơ quan đăng ký mẫu

Cơ quan đăng ký mô hình là một cơ chế quản lý tập trung các phiên bản, siêu dữ liệu và số liệu đánh giá của các mô hình được đào…

Cửa hàng tính năng

Kho tính năng là một nền tảng quản lý tập trung các tính năng được sử dụng trong machine learning (dữ liệu đầu vào cho mô hình)…

DPO (Tối ưu hóa tùy chọn trực tiếp)

DPO (Tối ưu hóa tùy chọn trực tiếp) là một phương pháp tinh chỉnh nhằm tối ưu hóa trực tiếp LLM từ dữ liệu tùy chọn của con người…

DeepSpeed ​​​​(nền tảng học tập phân tán)

DeepSpeed ​​​​là thư viện tối ưu hóa suy luận và học tập phân tán được phát triển bởi Microsoft. Công nghệ phân vùng bộ nhớ có…

Dữ liệu tổng hợp

Dữ liệu tổng hợp là dữ liệu được AI tạo sinh một cách nhân tạo bằng cách bắt chước các đặc điểm thống kê của dữ liệu thực. Nó…

FLOP (các phép toán dấu phẩy động)

FLOP là một chỉ báo cho biết tổng số phép tính dấu phẩy động cần thiết cho việc học và suy luận mô hình AI. Nó được sử dụng làm…

FP8 (dấu phẩy động 8 bit)

FP8 là công nghệ lượng tử hóa thể hiện số mô hình AI ở định dạng dấu phẩy động 8 bit. Nó đạt được cả tốc độ tính toán và tiết…

FSDP (Song song dữ liệu được phân chia hoàn toàn)

FSDP là một phương pháp học phân tán lưu trữ các tham số mô hình, độ dốc và trạng thái tối ưu hóa trên nhiều GPU, đồng thời thu…

GENIAC (Bộ Kinh tế, Thương mại và Hỗ trợ Tài nguyên Máy tính)

GENIAC là một chương trình quốc gia trong đó Bộ Kinh tế, Thương mại và Công nghiệp và NEDO cung cấp tài nguyên tính toán (GPU,…

GGUF (định dạng mô hình lượng tử hóa)

GGUF là định dạng tệp lượng tử hóa các mô hình ngôn ngữ quy mô lớn và cho phép chúng chạy ở tốc độ cao trên CPU hoặc môi trường…

GPTQ (phương pháp lượng tử hóa sau đào tạo)

GPTQ là phương pháp lượng tử hóa sau đào tạo (PTQ), nén trọng số của mô hình ngôn ngữ được đào tạo quy mô lớn xuống còn khoảng 4…

GQA (hãy cẩn thận với việc nhóm các truy vấn)

GQA (chú ý truy vấn được nhóm) là một loại cơ chế chú ý trong đó nhiều đầu truy vấn chia sẻ khóa và giá trị trong các nhóm để…

GRPO (Tối ưu hóa chính sách tương đối của nhóm)

GRPO là viết tắt của Tối ưu hóa chính sách tương đối nhóm và là một phương pháp tinh chỉnh LLM bằng cách sử dụng học tăng cường.…

Giáo trình học

Curriculum Learning là một chiến lược học máy bao gồm việc đào tạo bằng cách tăng dần mức độ khó từ dữ liệu dễ học đến dữ liệu…

Giải mã suy đoán

Giải mã suy đoán là phương pháp tăng tốc LLM giúp tăng tốc độ suy luận từ 2 đến 4 lần bằng cách yêu cầu một mô hình lớn xác minh…

Giới hạn tỷ lệ

Giới hạn tốc độ là cơ chế đặt giới hạn trên cho số lượng yêu cầu API có thể được chấp nhận trong một khoảng thời gian nhất định…

Giữa buổi tập

Đào tạo giữa kỳ là một giai đoạn học tập bổ sung được xen kẽ giữa học tập sơ bộ và điều chỉnh hướng dẫn. Việc này được thực hiện…

Grocking (khái quát hóa đột ngột)

Grocking là một hiện tượng trong đó mạng lưới thần kinh tiếp tục học trong khi ghi nhớ dữ liệu huấn luyện và tại một thời điểm…

HBM (Bộ nhớ băng thông cao)

HBM là một tiêu chuẩn bộ nhớ đạt được khả năng truyền dữ liệu băng thông rộng bằng cách xếp chồng nhiều chip DRAM theo chiều dọc…

Hugging Face (nền tảng chia sẻ mô hình)

Hugging Face là một nền tảng đã trở thành tiêu chuẩn thực tế trong lĩnh vực máy học, cho phép mọi người xuất bản, tìm kiếm và…

Học liên kết

Học tập liên kết là một phương pháp học máy đảm bảo quyền riêng tư, huấn luyện một mô hình trong môi trường cục bộ của từng thiết…

Học tăng cường

Học tăng cường là một phương pháp học máy trong đó agent tự động học các hành vi nhằm tối đa hóa phần thưởng thông qua việc thử…

Học tập chính xác hỗn hợp

Học có độ chính xác hỗn hợp là phương pháp giúp tăng tốc độ tính toán và hiệu quả bộ nhớ bằng cách sử dụng có chọn lọc các phép…

Học tập tự giám sát

Học tự giám sát là phương pháp học tự động tạo ra các nhiệm vụ dự đoán từ chính cấu trúc của dữ liệu mà không cần gắn nhãn thủ…

Hỏa lực cao của Sakura (cơ sở GPU nội địa)

Sakura High Firepower là nền tảng đám mây GPU được cung cấp bởi Sakura Internet tại các trung tâm dữ liệu trong nước và đề cập…

Hợp nhất mô hình

Hợp nhất mô hình là công nghệ tích hợp toán học các tham số (trọng số) của nhiều mô hình AI được đào tạo và kết hợp các khả năng…

Khởi động nguội (độ trễ ban đầu trong suy luận)

Khởi động nguội là sự chậm trễ trong phản hồi ban đầu xảy ra cho đến khi mô hình AI không hoạt động được đưa đến trạng thái có…

Kích thước lô

Kích thước lô là số lượng mẫu dữ liệu huấn luyện được sử dụng để cập nhật một tham số trong mô hình học máy.

Kết nối GPU-GPU (NVLink / InfiniBand)

Kết nối GPU là một đường dây chuyên dụng để trao đổi dữ liệu ở tốc độ cao trên nhiều GPU và ví dụ điển hình là NVLink của NVIDIA…

LLMOps (Nền tảng vận hành LLM)

LLMOps là thuật ngữ chung để chỉ cơ sở hạ tầng và quy trình vận hành nhằm quản lý nhất quán việc phát triển, đánh giá, triển khai…

LPU (Đơn vị xử lý ngôn ngữ)

LPU (Bộ xử lý ngôn ngữ) là bộ xử lý chuyên dụng được phát triển bởi Groq, chuyên suy luận các mô hình ngôn ngữ quy mô lớn và là…

Lan truyền ngược

Lan truyền ngược lỗi là một thuật toán tiến hành học bằng cách tính toán độ dốc của trọng số của mỗi lớp trong khi truy tìm lỗi…

LiteLLM (API tích hợp/proxy LLM)

LiteLLM là API tích hợp/proxy LLM mã nguồn mở có thể gọi API từ nhiều nhà cung cấp LLM như OpenAI và Anthropic vào một giao diện…

LoRA (Thích ứng cấp thấp)

LoRA là một phương pháp tinh chỉnh nhằm đạt được khả năng thích ứng với một miền cụ thể với chi phí tính toán dưới 1% của tất cả…

Luật mở rộng quy mô

Luật mở rộng quy mô là một quy tắc thực nghiệm cho biết rằng khi kích thước mô hình, lượng dữ liệu và lượng tính toán tăng lên…

Làm mát bằng chất lỏng (làm mát trung tâm dữ liệu AI)

Làm mát bằng chất lỏng là phương pháp làm mát cho trung tâm dữ liệu AI, làm mát trực tiếp các thiết bị tạo ra nhiều nhiệt, chẳng…

Lượng tử hóa

Lượng tử hóa là công nghệ nén các tham số trọng lượng của mô hình AI xuống độ chính xác bit thấp, cải thiện tốc độ suy luận và…

MFU (Mô hình sử dụng FLOP)

MFU (tỷ lệ sử dụng FLOP mô hình) là tỷ lệ giữa hiệu suất tính toán có thể rút ra từ quá trình đào tạo mô hình thực tế với hiệu…

MLA (Chú ý nhiều tiềm ẩn)

MLA (sự chú ý tiềm ẩn nhiều đầu) là phiên bản cải tiến của cơ chế chú ý, nén bộ đệm KV thành các vectơ tiềm ẩn thứ hạng thấp…

MLOps (nền tảng vận hành máy học)

MLOps (Nền tảng vận hành máy học) là một hệ thống tự động hóa và quản lý liên tục quy trình từ phát triển mô hình máy học đến…

MN-Core (Trình tăng tốc AI trong nước)

MN-Core là một công cụ tăng tốc AI nội địa được phát triển bởi Preferred Networks chuyên xử lý deep learning.

MXFP4 (dấu phẩy động 4 bit)

MXFP4 là định dạng lượng tử hóa số nhẹ biểu thị các giá trị dấu phẩy động 4 bit kết hợp với hệ số tỷ lệ chung trong các khối.

MoE (Chuyên gia hỗn hợp)

MoE (Chuyên gia hỗn hợp) là một phương pháp thiết kế mạng thần kinh thưa thớt có nhiều mạng con chuyên biệt (chuyên gia) và chỉ…

Muon (thuật toán tối ưu hóa)

Muon là một thuật toán tối ưu hóa để huấn luyện trước các mô hình ngôn ngữ quy mô lớn áp dụng cập nhật độ dốc trực giao của ma…

Máy biến áp

Một cấu trúc mạng lưới thần kinh với cốt lõi là cơ chế tự chú ý. LLM / Hình ảnh / Âm thanh Nền tảng của mọi thứ.

Mô hình phần thưởng

Mô hình phần thưởng là mô hình tìm hiểu phản hồi của con người và cho điểm mức độ mong muốn của đầu ra AI.

Mất tăng đột biến (phân kỳ học tập)

Mất tăng đột biến là hiện tượng giá trị mất mát (mất mát) đột ngột tăng vọt trong quá trình học trước LLM, khiến việc học trở nên…

Mở rộng từ vựng (mở rộng mã thông báo tiếng Nhật)

Mở rộng từ vựng (mở rộng mã thông báo tiếng Nhật) là một điều chỉnh bổ sung các thuật ngữ kỹ thuật dành riêng cho tiếng Nhật,…

NPU (Đơn vị xử lý thần kinh)

NPU (đơn vị xử lý thần kinh) là một chip bán dẫn chuyên xử lý suy luận mạng thần kinh tốc độ cao. Nó được cài đặt trong điện…

NVFP4 (dấu phẩy động 4 bit)

NVFP4 là định dạng dữ liệu dấu phẩy động 4 bit (FP4) do NVIDIA đề xuất và là công nghệ giúp giảm lượng tính toán và mức sử dụng…

Nhà máy AI (Trung tâm dữ liệu GPU)

Nhà máy AI là một trung tâm dữ liệu cực lớn, tích hợp hàng chục nghìn đến hàng trăm nghìn GPU và được thiết kế đặc biệt để học và…

Ollama (thực thi LLM cục bộ)

Ollama là một công cụ thực thi cục bộ cho phép bạn tải xuống và chạy LLM trên PC hoặc máy chủ của riêng bạn.

PEFT (Tinh chỉnh hiệu quả tham số)

PEFT là một nhóm các phương pháp tinh chỉnh giúp điều chỉnh mô hình cho một nhiệm vụ cụ thể với chi phí thấp và trong thời gian…

PagedChú ý

PagedAttention là cơ chế quản lý bộ đệm KV cho suy luận LLM theo đơn vị khối bằng phương pháp phân trang của hệ điều hành, ngăn…

QAT (Học nhận thức lượng tử hóa)

QAT là một phương pháp học nhận biết lượng tử hóa, giả định lượng tử hóa bit thấp trong quá trình suy luận, điều chỉnh các tham…

QLoRA (LoRA lượng tử hóa)

QLoRA là một phương pháp học tập đơn giản áp dụng LoRA (thích ứng cấp thấp) cho mô hình ngôn ngữ quy mô lớn sau khi lượng tử hóa…

Quản lý dữ liệu học tập (Data Curation)

Quản lý dữ liệu học tập là một loạt các nhiệm vụ thu thập, chọn lọc và làm sạch dữ liệu được sử dụng để đào tạo mô hình AI nhằm…

RLAIF (Học tăng cường với phản hồi AI)

RLAIF là một phương pháp học trong đó một mô hình AI đưa ra đánh giá và phản hồi cho một AI khác, đồng thời sử dụng phương pháp…

RLHF (Học tăng cường với phản hồi của con người)

RLHF là một phương pháp học tăng cường sử dụng đánh giá và phản hồi của con người làm tín hiệu khen thưởng để điều chỉnh đầu ra…

RLVR (Học tăng cường với phần thưởng có thể xác minh)

RLVR là phương pháp sử dụng trình xác minh để chấm điểm đầu ra của các nhiệm vụ có thể tự động xác định câu trả lời đúng và sử…

ROCm (Nền tảng tính toán GPU AMD)

ROCm là một nền tảng tính toán nguồn mở để thực hiện các phép tính AI trên GPU AMD. Nó có khả năng cạnh tranh với CUDA của NVIDIA.

Ray (khung học tập/suy luận phân tán)

Ray là một khung xử lý phân tán mã nguồn mở do UC Berkeley phát triển, cho phép học tập phân tán và suy luận song song trong học…

RoPE (nhúng vị trí xoay)

RoPE là phương pháp mã hóa vị trí sử dụng LLM dựa trên Transformer để nhúng thông tin vị trí mã thông báo vào vectơ Truy vấn/Khóa…

Rubin (GPU thế hệ tiếp theo của NVIDIA)

Rubin là kiến ​​trúc GPU AI thế hệ tiếp theo được NVIDIA công bố là sản phẩm kế thừa của Blackwell và dự kiến ​​sẽ ra mắt tại các…

SGLang (máy chủ suy luận)

SGLang là một khung máy chủ suy luận nguồn mở được thiết kế để tăng tốc độ xử lý suy luận cho các mô hình ngôn ngữ quy mô lớn…

Sau đào tạo

Sau đào tạo là quá trình hoàn thiện trong đó SFT, RLHF, v.v. được áp dụng bổ sung cho LLM đã hoàn thành đào tạo trước để cải…

Softmax (chức năng softmax)

Softmax là một hàm chuyển đổi nhiều số thành phân bố xác suất có tổng bằng 1 và được sử dụng để phân loại mạng thần kinh và đầu…

Song song bối cảnh

Song song theo ngữ cảnh là một phương pháp song song hóa để phân chia một chuỗi đầu vào lớn giữa các GPU và xử lý chúng đồng thời…

Song song dữ liệu

Song song dữ liệu là một phương pháp học phân tán trong đó các bản sao của cùng một mô hình được đặt trên nhiều GPU và dữ liệu…

Song song đường ống

Song song đường ống là một phương pháp học và suy luận song song, chia mạng lưới thần kinh khổng lồ thành nhiều GPU theo từng lớp…

Sự lãng quên thảm khốc

Sự quên lãng nghiêm trọng là một hiện tượng trong đó khi mô hình AI thực hiện việc học bổ sung với các nhiệm vụ hoặc dữ liệu mới,…

Sự song song của tenxơ

Song song Tensor là một phương pháp song song hóa để phân chia các hoạt động ma trận trong một lớp của mạng lưới thần kinh khổng…

TPU (Bộ xử lý Tensor)

TPU là một con chip tùy chỉnh được Google phát triển dành riêng cho AI và học máy. Nó tăng tốc các hoạt động ma trận và đạt được…

TensorRT-LLM (công cụ suy luận NVIDIA)

TensorRT-LLM là một công cụ suy luận mã nguồn mở giúp tăng tốc suy luận mô hình ngôn ngữ quy mô lớn (LLM) được tối ưu hóa cho GPU…

Theo dõi thử nghiệm

Theo dõi thử nghiệm là một phương pháp vận hành ghi lại các điều kiện học tập, siêu tham số, chỉ báo đánh giá và các thành phần…

Thu thập thông tin chung (kho dữ liệu web quy mô lớn)

Common Crawl là một tổ chức phi lợi nhuận và lưu trữ dữ liệu định kỳ thu thập các trang web quy mô lớn trên Internet và cung cấp…

Tiêu thụ năng lượng AI (hạn chế năng lượng của trung tâm dữ liệu)

Mức tiêu thụ điện năng của AI đề cập đến lượng điện năng tiêu thụ bởi các trung tâm dữ liệu chịu trách nhiệm học tập và suy luận…

Trang bị quá mức

Quá khớp là hiện tượng trong đó một mô hình quá khớp với dữ liệu huấn luyện, dẫn đến hiệu suất tổng quát hóa giảm đáng kể đối với…

Triton (ngôn ngữ mô tả nhân GPU)

Triton là ngôn ngữ nguồn mở của OpenAI, cho phép bạn viết trực tiếp nhân tốc độ cao cho GPU bằng cú pháp giống Python.

Trộn liên tục

Tạo khối liên tục là phương pháp trong đó máy chủ suy luận LLM xử lý các yêu cầu mới bằng cách chèn chúng vào các đơn vị mã thông…

Tách trước/giải mã (Suy luận phân tán)

Phân tách điền trước/Giải mã là kiến ​​trúc suy luận trong đó quá trình xử lý nhắc (Prefill) và tạo tuần tự (Giải mã) trong suy…

Tăng cường dữ liệu

Tăng cường dữ liệu là một phương pháp tiền xử lý cho máy học nhằm tăng hiệu suất tổng quát hóa của mô hình bằng cách áp dụng các…

Tỷ lệ học tập

Tốc độ học tập là một siêu tham số xác định số lượng tham số được cập nhật trong quá trình học mạng nơ-ron.

YaRN (phần mở rộng độ dài ngữ cảnh)

YaRN là phương pháp nội suy và điều chỉnh mã hóa vị trí của Máy biến áp (RoPE) cho từng dải bước sóng, giúp mở rộng đáng kể độ…

bfloat16 (BF16)

bfloat16 (BF16) là định dạng dấu phẩy động 16 bit có 8 bit dành riêng cho phần số mũ, giống như FP32 và chỉ có 7 bit cho phần…

học máy

Thuật ngữ chung cho công nghệ AI tự động học các quy tắc từ dữ liệu. Học sâu và LLM cũng được đưa vào đây.

học sâu

Một phương pháp học máy sử dụng mạng lưới thần kinh nhiều lớp. Công nghệ cơ bản để nhận dạng LLM/hình ảnh/nhận dạng giọng nói.

kỷ nguyên

Kỷ nguyên là một đơn vị trong quá trình học máy trong đó toàn bộ tập dữ liệu huấn luyện được truyền qua mô hình một lần.

llama.cpp (công cụ suy luận)

llama.cpp là một công cụ suy luận nguồn mở C/C++ được tối ưu hóa để chạy mô hình LLaMA của Meta ở tốc độ cao ngay cả trên CPU.

tinh chỉnh

Một phương pháp chuyên môn hóa mô hình AI hiện có bằng cách đào tạo thêm mô hình đó bằng dữ liệu nội bộ.

vLLM (Máy chủ suy luận)

vLLM là một khung suy luận LLM mã nguồn mở. Nó đạt được thông lượng cao nhờ thuật toán PagedAttention độc đáo và có thể xây dựng…

Điều chỉnh hướng dẫn

Điều chỉnh hướng dẫn là một phương pháp thực hiện việc học bổ sung trên mô hình ngôn ngữ quy mô lớn được đào tạo trước bằng cách…

Điểm kiểm tra độ dốc

Điểm kiểm tra độ dốc là một phương pháp giúp giảm mức sử dụng bộ nhớ GPU bằng cách không lưu trữ các kích hoạt trung gian trong…

Đào tạo trước

Pre-learning là giai đoạn đào tạo trong đó một mô hình ngôn ngữ quy mô lớn được đào tạo bằng cách sử dụng một lượng lớn dữ liệu…

Đào tạo trước liên tục

Học trước liên tục là phương pháp thực hiện đào tạo trước bổ sung trên mô hình ngôn ngữ quy mô lớn được đào tạo bằng cách sử dụng…

Đám mây GPU (GPUaaS)

Đám mây GPU (GPUaaS) là dịch vụ cho phép bạn mượn bao nhiêu GPU hiệu suất cao mà bạn cần để học và suy luận AI qua đám mây mà…

Đèn FlashChú ý

FlashAttention là thuật toán sử dụng hệ thống phân cấp bộ nhớ GPU để thực thi cơ chế chú ý của Transformer ở ​​tốc độ cao và ít…

Định tuyến mô hình

Định tuyến mô hình là một hệ thống tự động định tuyến các tác vụ đến mô hình phù hợp nhất trong số nhiều mô hình AI, tùy thuộc…