BGE-M3 là mô hình nhúng đa ngôn ngữ được phát triển bởi Viện Trí tuệ nhân tạo Jiyuan Bắc Kinh (BAAI), mô hình hóa văn bản bằng hơn 100 ngôn ngữ và được sử dụng làm cơ sở cho tìm kiếm và RAG.
BGE-M3 được đặc trưng bởi khả năng xử lý đồng thời ba phương pháp trong một mô hình: Tìm kiếm dày đặc dựa trên sự giống nhau về ngữ nghĩa, Tìm kiếm thưa thớt mạnh mẽ dựa trên kết quả khớp từ khóa và tìm kiếm Multi-Vector dựa trên mức độ khớp ở nhiều vị trí. Là một mô hình nhúng hỗ trợ nhập văn bản dài bằng hơn 100 ngôn ngữ và lên tới 8192 mã thông báo, nó được cho là được áp dụng rộng rãi như một trong những nền tảng của RAG. Một trong những lý do khiến nó phổ biến là vì nó là mã nguồn mở và có thể được sử dụng miễn phí, giúp giảm chi phí dễ dàng hơn so với các API nhúng trả phí như OpenAI và Cohere. Tuy nhiên, trong hoạt động thực tế vào năm 2026, cạm bẫy là số lượng chiều của vectơ đầu ra lớn và chi phí lưu trữ và tìm kiếm ở phía cơ sở dữ liệu vectơ có thể sẽ tăng lên, đồng thời độ chính xác của tìm kiếm thưa thớt không ổn định như tiếng Anh ở các ngôn ngữ như tiếng Nhật nơi ranh giới từ không rõ ràng. Lựa chọn phổ biến nhất trong lĩnh vực này là sử dụng BGE-M3 nếu bạn có yêu cầu về hỗ trợ đa ngôn ngữ hoặc xử lý các đoạn văn bản dài và xem xét mô hình nhúng sản xuất trong nước nếu bạn ưu tiên chuyên môn hóa tiếng Nhật, trọng lượng nhẹ và độ trễ thấp.