
Common Crawl
United States"Web verilerine erişimi demokratikleştirmek"
Hakkında
Common Crawl, açık bir web tarama verisi deposunu sürdüren bir 501(c)(3) kar amacı gütmeyen kuruluştur. Bilgisayar bilimcisi Gil Elbaz tarafından 2008'de kurulduğundan bu yana, organizasyon sistematik olarak interneti taradı ve petabaytlarca ham HTML, meta veri ve çıkarılmış metni ücretsiz olarak kullanılabilir hale getirdi. Veriler Amazon Web Services'ın halka açık S3 kovalarında barındırılıyor; kullanıcılar yalnızca kendi hesaplama ve depolama maliyetlerini ödüyor. Common Crawl'ın veri kümesi, araştırmacılar, gazeteciler, yeni başlayanlar ve büyük yapay zeka laboratuvarları tarafından kullanılan en büyük açık erişilebilir web veri kümesidir. 2020'lerde GPT-3, GPT-4 ve LLaMA dahil olmak üzere büyük dil modellerinin birincil eğitim kaynağı haline geldi. The Markup ve Wired tarafından Kasım 2025'te yapılan bir inceleme, yapay zeka şirketlerinin verileri nasıl kullandığını inceledi ve rıza ve telif hakkı konusundaki tartışmaları alevlendirdi.
Misyon
Common Crawl'ın misyonu, interneti tarayarak ve elde edilen içeriği herkese ücretsiz olarak sağlayarak web verilerine erişimi demokratikleştirmektir. Amaç, web ölçeğinde veri analizinin önündeki engelleri kaldırmak, yeniliği teşvik etmek ve web'in açık bir tarihsel kaydını korumaktır.
Tarihçe
Gil Elbaz, açık web verilerinin sağlıklı bir internet için gerekli olduğuna olan inancıyla ilk tarayıcıyı 2007'de inşa etmeye başladı. Yaklaşık 2 milyar sayfa içeren ilk halka açık tarama veri kümesi 2008'de yayınlandı. İlk altyapı, bağışlanan sunuculara ve hibelere dayanıyordu. 2012'de Common Crawl, verileri halka açık S3 kovalarında barındırmak için Amazon Web Services ile ortaklık kurarak erişimi ücretsiz ve ölçeklenebilir hale getirdi. News Crawl veri kümesi 2015'te başlatıldı ve sürekli güncellenen bir haber makaleleri akışı sağladı. 2017'ye gelindiğinde veri kümesi 3,5 milyar sayfaya ulaşmıştı ve o zamanlar kamuya açık en büyük web veri kümesiydi. 2020'lerin başındaki yapay zeka patlaması talebi önemli ölçüde artırdı; Common Crawl, büyük dil modelleri için fiili eğitim veri kümesi haline geldi. 2025 tarihli bir incelemenin ortaya çıkardığı telif hakkı ve rıza endişelerine yanıt olarak, organizasyon bir çekilme sistemi ve daha iyi köken takibi geliştirme planlarını duyurdu.
Önemli Kişiler
Gil Elbaz
Founder and Chairman of the Board · 2008–present
Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.
Rich Skrenta
İcra Direktörü · 2024–present
Former CEO of Blekko; creator of the Elk Cloner virus.
Peter Norvig
Former Board Member · 2010–2020
Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.
Kilometre Taşları
2007
Gil Elbaz begins building the first web crawler.
2008
Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).
2012
Partnership with Amazon Web Services; data made available via public S3 buckets.
2015
Launch of the News Crawl dataset.
2017
Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.
2020
Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.
2022
Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).
2023
Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.
2025
The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.
Bölümler
Kuruluş Bilgisi
- Kuruluş
- +2008
- Merkez
- San Francisco, California, United States
- Ülke
- United States
- Executive Director
- Rich Skrenta
- Tür
- Non-profit
- Tür
- Non-profit
- Kuruluş
- +2008
- Ülke
- Amerika Birleşik Devletleri
- Kurucu
- Gil Elbaz
- Annual Budget
- $1–2 million
- Çalışanlar
- 5–10
- Data Size
- Petabytes
Finansal Bilgiler
- Gelir
- $0.0 billion
- Bütçe
- $1–2 million
- Çalışanlar
- 5–10
Resmi Web Sitesi
commoncrawl.org/
Topluluğa katıl
hayran tartışıyor