Last updated
    Common Crawl
    Non-profit

    Common Crawl

    United States flagUnited States

    "Democratizzare l'accesso ai dati web"

    Founded +2008 San Francisco, California, United States Executive Director: Rich Skrenta

    Informazioni

    Common Crawl è un'organizzazione non profit 501(c)(3) che mantiene un archivio aperto di dati di web crawl. Dalla sua fondazione nel 2008 da parte del computer scientist Gil Elbaz, l'organizzazione ha scandagliato sistematicamente internet e reso disponibili gratuitamente petabyte di dati grezzi HTML, metadati e testo estratto. I dati sono ospitati nei bucket S3 pubblici di Amazon Web Services; gli utenti pagano solo i costi di calcolo e archiviazione. Il corpus di Common Crawl è il più grande set di dati web accessibile apertamente, utilizzato da ricercatori, giornalisti, startup e importanti laboratori di IA. Negli anni 2020 è diventata la fonte di addestramento primaria per i grandi modelli linguistici, tra cui GPT-3, GPT-4 e LLaMA. Un'indagine del novembre 2025 condotta da The Markup e Wired ha esaminato come le aziende di IA utilizzano i dati, scatenando dibattiti su consenso e copyright.

    Missione

    La missione di Common Crawl è democratizzare l'accesso ai dati web, scandagliando internet e fornendo il contenuto risultante gratuitamente a chiunque. L'obiettivo è abbassare le barriere all'analisi dei dati su scala web, promuovere l'innovazione e preservare una registrazione storica aperta del web.

    Storia

    Gil Elbaz iniziò a costruire il primo crawler nel 2007, spinto dalla convinzione che i dati aperti del web fossero essenziali per un internet sano. Il primo dataset di crawl pubblico, contenente circa 2 miliardi di pagine, fu rilasciato nel 2008. L'infrastruttura iniziale si basava su server donati e sovvenzioni. Nel 2012, Common Crawl collaborò con Amazon Web Services per ospitare i dati nei bucket S3 pubblici, rendendo l'accesso gratuito e scalabile. Il dataset News Crawl fu lanciato nel 2015, fornendo un feed continuamente aggiornato di articoli di notizie. Nel 2017 il corpus era cresciuto fino a 3,5 miliardi di pagine, il più grande set di dati web pubblicamente disponibile all'epoca. Il boom dell'IA dei primi anni 2020 aumentò drasticamente la domanda; Common Crawl divenne il corpus di addestramento de facto per i grandi modelli linguistici. In risposta alle preoccupazioni su copyright e consenso sollevate da un'indagine del 2025, l'organizzazione annunciò piani per sviluppare un sistema di opt-out e un migliore tracciamento della provenienza.

    Persone note

    Gil Elbaz

    Founder and Chairman of the Board · 2008–present

    Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.

    Rich Skrenta

    Direttore esecutivo · 2024–present

    Former CEO of Blekko; creator of the Elk Cloner virus.

    Peter Norvig

    Former Board Member · 2010–2020

    Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.

    Traguardi

    2007

    Gil Elbaz begins building the first web crawler.

    2008

    Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).

    2012

    Partnership with Amazon Web Services; data made available via public S3 buckets.

    2015

    Launch of the News Crawl dataset.

    2017

    Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.

    2020

    Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.

    2022

    Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).

    2023

    Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.

    2025

    The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.

    Dipartimenti

    Crawling & Infrastructure EngineeringData Processing & QualityCommunity & OutreachAdministration & Finance

    Info Organizzazione

    Fondata
    +2008
    Sede
    San Francisco, California, United States
    Paese
    United States
    Executive Director
    Rich Skrenta
    Tipo
    Non-profit
    Tipo
    Non-profit
    Fondata
    +2008
    Paese
    Stati Uniti
    Fondatore
    Gil Elbaz
    Annual Budget
    $1–2 million
    Dipendenti
    5–10
    Data Size
    Petabytes

    Finanze

    Entrate
    $0.0 billion
    Budget
    $1–2 million
    Dipendenti
    5–10

    Sito Ufficiale

    commoncrawl.org/

    Unisciti alla community

    fan che discutono