ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Chống trùng lặp

Chống trùng lặp là quá trình phát hiện và loại bỏ các tài liệu/khối tài liệu giống hệt hoặc tương tự trong RAG hoặc cơ sở hạ tầng dữ liệu.

Chống trùng lặp là quá trình phát hiện các đoạn tài liệu giống hệt hoặc tương tự về mặt ngữ nghĩa và loại bỏ chúng khỏi các chỉ mục và dữ liệu huấn luyện. Nói chung, một phương pháp kết hợp phát hiện đối sánh chính xác bằng cách sử dụng giá trị băm và phát hiện đối sánh mờ dựa trên độ tương tự cosine của các vectơ nhúng được cho là được áp dụng rộng rãi. Trong hoạt động thực tế kể từ năm 2026, việc thiết lập ngưỡng tương tự được cho là cạm bẫy lớn nhất; nếu ngưỡng được đặt quá cao, các tài liệu có ý nghĩa khác nhau sẽ bị tích hợp sai và nếu ngưỡng được đặt quá thấp, các bản sao sẽ vẫn còn, làm tăng chi phí lưu trữ và tìm kiếm DB vectơ cũng như giảm độ chính xác của phản hồi. Đặc biệt, dữ liệu Câu hỏi thường gặp và hỗ trợ khách hàng có xu hướng tạo ra một số lượng lớn các câu hỏi tương tự với các cách diễn đạt khác nhau, đồng thời chi phí tìm kiếm và chất lượng câu trả lời được cho là rất khác nhau tùy thuộc vào thiết kế loại bỏ trùng lặp. Phương pháp lựa chọn tiêu chuẩn trong trường trước tiên là giảm nhiễu bằng cách loại bỏ đối sánh chính xác, sau đó thêm dần tính năng phát hiện trùng lặp gần đúng dựa trên nhúng. Sự đồng thuận chung là mặc dù nó thường được đưa vào như một tính năng tiêu chuẩn trong cơ sở dữ liệu vectơ chính và các công cụ cơ sở hạ tầng RAG và có thể được sử dụng mà không mất thêm chi phí, nhưng người ta nói rằng đối với dữ liệu quy mô lớn, không thể bỏ qua chi phí tính toán của việc xử lý hàng loạt để tính toán độ tương tự.

Thuật ngữ liên quan