
Common Crawl
United States"Democratizzare l'accesso ai dati web"
Informazioni
Common Crawl è un'organizzazione non profit 501(c)(3) che mantiene un archivio aperto di dati di web crawl. Dalla sua fondazione nel 2008 da parte del computer scientist Gil Elbaz, l'organizzazione ha scandagliato sistematicamente internet e reso disponibili gratuitamente petabyte di dati grezzi HTML, metadati e testo estratto. I dati sono ospitati nei bucket S3 pubblici di Amazon Web Services; gli utenti pagano solo i costi di calcolo e archiviazione. Il corpus di Common Crawl è il più grande set di dati web accessibile apertamente, utilizzato da ricercatori, giornalisti, startup e importanti laboratori di IA. Negli anni 2020 è diventata la fonte di addestramento primaria per i grandi modelli linguistici, tra cui GPT-3, GPT-4 e LLaMA. Un'indagine del novembre 2025 condotta da The Markup e Wired ha esaminato come le aziende di IA utilizzano i dati, scatenando dibattiti su consenso e copyright.
Missione
La missione di Common Crawl è democratizzare l'accesso ai dati web, scandagliando internet e fornendo il contenuto risultante gratuitamente a chiunque. L'obiettivo è abbassare le barriere all'analisi dei dati su scala web, promuovere l'innovazione e preservare una registrazione storica aperta del web.
Storia
Gil Elbaz iniziò a costruire il primo crawler nel 2007, spinto dalla convinzione che i dati aperti del web fossero essenziali per un internet sano. Il primo dataset di crawl pubblico, contenente circa 2 miliardi di pagine, fu rilasciato nel 2008. L'infrastruttura iniziale si basava su server donati e sovvenzioni. Nel 2012, Common Crawl collaborò con Amazon Web Services per ospitare i dati nei bucket S3 pubblici, rendendo l'accesso gratuito e scalabile. Il dataset News Crawl fu lanciato nel 2015, fornendo un feed continuamente aggiornato di articoli di notizie. Nel 2017 il corpus era cresciuto fino a 3,5 miliardi di pagine, il più grande set di dati web pubblicamente disponibile all'epoca. Il boom dell'IA dei primi anni 2020 aumentò drasticamente la domanda; Common Crawl divenne il corpus di addestramento de facto per i grandi modelli linguistici. In risposta alle preoccupazioni su copyright e consenso sollevate da un'indagine del 2025, l'organizzazione annunciò piani per sviluppare un sistema di opt-out e un migliore tracciamento della provenienza.
Persone note
Gil Elbaz
Founder and Chairman of the Board · 2008–present
Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.
Rich Skrenta
Direttore esecutivo · 2024–present
Former CEO of Blekko; creator of the Elk Cloner virus.
Peter Norvig
Former Board Member · 2010–2020
Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.
Traguardi
2007
Gil Elbaz begins building the first web crawler.
2008
Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).
2012
Partnership with Amazon Web Services; data made available via public S3 buckets.
2015
Launch of the News Crawl dataset.
2017
Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.
2020
Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.
2022
Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).
2023
Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.
2025
The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.
Dipartimenti
Info Organizzazione
- Fondata
- +2008
- Sede
- San Francisco, California, United States
- Paese
- United States
- Executive Director
- Rich Skrenta
- Tipo
- Non-profit
- Tipo
- Non-profit
- Fondata
- +2008
- Paese
- Stati Uniti
- Fondatore
- Gil Elbaz
- Annual Budget
- $1–2 million
- Dipendenti
- 5–10
- Data Size
- Petabytes
Finanze
- Entrate
- $0.0 billion
- Budget
- $1–2 million
- Dipendenti
- 5–10
Sito Ufficiale
commoncrawl.org/
Unisciti alla community
fan che discutono