Last updated
    Common Crawl
    Non-profit

    Common Crawl

    United States flagUnited States

    "Web verilerine erişimi demokratikleştirmek"

    Founded +2008 San Francisco, California, United States Executive Director: Rich Skrenta
    Topluluk

    Hakkında

    Common Crawl, açık bir web tarama verisi deposunu sürdüren bir 501(c)(3) kar amacı gütmeyen kuruluştur. Bilgisayar bilimcisi Gil Elbaz tarafından 2008'de kurulduğundan bu yana, organizasyon sistematik olarak interneti taradı ve petabaytlarca ham HTML, meta veri ve çıkarılmış metni ücretsiz olarak kullanılabilir hale getirdi. Veriler Amazon Web Services'ın halka açık S3 kovalarında barındırılıyor; kullanıcılar yalnızca kendi hesaplama ve depolama maliyetlerini ödüyor. Common Crawl'ın veri kümesi, araştırmacılar, gazeteciler, yeni başlayanlar ve büyük yapay zeka laboratuvarları tarafından kullanılan en büyük açık erişilebilir web veri kümesidir. 2020'lerde GPT-3, GPT-4 ve LLaMA dahil olmak üzere büyük dil modellerinin birincil eğitim kaynağı haline geldi. The Markup ve Wired tarafından Kasım 2025'te yapılan bir inceleme, yapay zeka şirketlerinin verileri nasıl kullandığını inceledi ve rıza ve telif hakkı konusundaki tartışmaları alevlendirdi.

    Misyon

    Common Crawl'ın misyonu, interneti tarayarak ve elde edilen içeriği herkese ücretsiz olarak sağlayarak web verilerine erişimi demokratikleştirmektir. Amaç, web ölçeğinde veri analizinin önündeki engelleri kaldırmak, yeniliği teşvik etmek ve web'in açık bir tarihsel kaydını korumaktır.

    Tarihçe

    Gil Elbaz, açık web verilerinin sağlıklı bir internet için gerekli olduğuna olan inancıyla ilk tarayıcıyı 2007'de inşa etmeye başladı. Yaklaşık 2 milyar sayfa içeren ilk halka açık tarama veri kümesi 2008'de yayınlandı. İlk altyapı, bağışlanan sunuculara ve hibelere dayanıyordu. 2012'de Common Crawl, verileri halka açık S3 kovalarında barındırmak için Amazon Web Services ile ortaklık kurarak erişimi ücretsiz ve ölçeklenebilir hale getirdi. News Crawl veri kümesi 2015'te başlatıldı ve sürekli güncellenen bir haber makaleleri akışı sağladı. 2017'ye gelindiğinde veri kümesi 3,5 milyar sayfaya ulaşmıştı ve o zamanlar kamuya açık en büyük web veri kümesiydi. 2020'lerin başındaki yapay zeka patlaması talebi önemli ölçüde artırdı; Common Crawl, büyük dil modelleri için fiili eğitim veri kümesi haline geldi. 2025 tarihli bir incelemenin ortaya çıkardığı telif hakkı ve rıza endişelerine yanıt olarak, organizasyon bir çekilme sistemi ve daha iyi köken takibi geliştirme planlarını duyurdu.

    Önemli Kişiler

    Gil Elbaz

    Founder and Chairman of the Board · 2008–present

    Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.

    Rich Skrenta

    İcra Direktörü · 2024–present

    Former CEO of Blekko; creator of the Elk Cloner virus.

    Peter Norvig

    Former Board Member · 2010–2020

    Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.

    Kilometre Taşları

    2007

    Gil Elbaz begins building the first web crawler.

    2008

    Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).

    2012

    Partnership with Amazon Web Services; data made available via public S3 buckets.

    2015

    Launch of the News Crawl dataset.

    2017

    Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.

    2020

    Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.

    2022

    Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).

    2023

    Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.

    2025

    The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.

    Bölümler

    Crawling & Infrastructure EngineeringData Processing & QualityCommunity & OutreachAdministration & Finance

    Kuruluş Bilgisi

    Kuruluş
    +2008
    Merkez
    San Francisco, California, United States
    Ülke
    United States
    Executive Director
    Rich Skrenta
    Tür
    Non-profit
    Tür
    Non-profit
    Kuruluş
    +2008
    Ülke
    Amerika Birleşik Devletleri
    Kurucu
    Gil Elbaz
    Annual Budget
    $1–2 million
    Çalışanlar
    5–10
    Data Size
    Petabytes

    Finansal Bilgiler

    Gelir
    $0.0 billion
    Bütçe
    $1–2 million
    Çalışanlar
    5–10

    Resmi Web Sitesi

    commoncrawl.org/

    Topluluğa katıl

    hayran tartışıyor