Common Crawl là một tổ chức phi lợi nhuận và lưu trữ dữ liệu định kỳ thu thập các trang web quy mô lớn trên Internet và cung cấp chúng cho mọi người sử dụng miễn phí.
Common Crawl là một tổ chức phi lợi nhuận hoạt động từ năm 2008 và phát hành miễn phí hàng tỷ trang HTML và dữ liệu văn bản được thu thập bởi trình thu thập dữ liệu web của tổ chức này và được cho là đã được sử dụng như một thành phần chính của kho ngữ liệu đào tạo trước cho nhiều mô hình ngôn ngữ quy mô lớn, bao gồm cả GPT-3. Trong các hoạt động thực tế kể từ năm 2026, dữ liệu thô có lượng lớn nhiễu, trùng lặp, trang web chất lượng thấp và thư rác, do đó, dữ liệu này khó có thể được sử dụng cho mục đích học tập và phương pháp lựa chọn chung trong trường này là sử dụng một tập hợp con đã được tinh chỉnh thông qua lọc, loại bỏ trùng lặp và xác định ngôn ngữ, chẳng hạn như C4, RefinedWeb và FineWeb. Vì được lưu trữ trên AWS S3 nên bạn có thể tải xuống miễn phí, nhưng thực tế là việc tải xuống và xử lý trước hàng chục TB đến PB dữ liệu của riêng bạn đòi hỏi chi phí lưu trữ và tính toán đáng kể thường bị coi là chi phí. Do đó, đối với các cá nhân và nhóm nhỏ, việc sử dụng kho dữ liệu công cộng đã được tinh chỉnh sẽ thực tế hơn thay vì làm việc trực tiếp với các tệp WARC/WET thô.