common-crawl.mdupdated 2026-08-011,848 chars

Common Crawl​(コモン・クロール)​— AIの​事前学習を​支える​オープン・ウェブアーカイブ

Common Crawl は、​公開ウェブの​ペタバイト規模の​スナップショットを​毎月​更新し無料公開する​ 501(c)(3)​(=米国の​非営利公益法人と​しての​税制上の​資格)の​組織である。​GPT-3・Llama・T5など、​大半の​大規模言語モデル​(LLM)に​とって​主要な​事前学習コーパス​(=モデルの​学習に​使う​大量の​テキストデータ集合)と​なっている。

何者か

Common Crawl は​2007年、​Gil Elbaz​(ギル・エルバズ)に​よって​創業された。​使命は​「ウェブ規模の​データを​大企業だけが​使える​ものにしない」ことに​ある。​アーカイブは​非圧縮で​10PB​(ペタバイト)を​超え、​毎月​約30〜50億ページ​(圧縮すると​約250GB)が​追加される。​言語学・ウェブ科学・NLP​(自然言語処理)​・医療疫学など、​1万件を​超える​論文で​公式に​引用されている。​データは​すべて​無料で、​登録も​不要である。

3つの​データ形式

Common Crawl は​3種類の​形式で​データを​公開する。​WARC​(Web ARChive)は​生の​HTTPレスポンスと​HTMLソースコードを​そのまま​収録した​形式で、​クローラーが​実際に​受け取った​内容に​最も​忠実である。​WAT​(Web ARChive Transformations)は​HTTPヘッダー・抽出リンク・レスポンスコードを​JSONで​記録した​メタデータログで、​WARCより​軽く、​リンクグラフ分析に​向く。​WET​(Web ARChive Extracted Text)は​HTMLタグを​完全に​除去した​純テキスト形式で、​LLMや​NLPの​パイプラインが​直接消費する​形式である。

アクセス方​法

アーカイブは​AWSの​オープンデータ支援プログラムを​通じて​S3​(s3://commoncrawl/、​リージョンは​us-east-1)に​格納されており、​AWS内からの​エグレス(データ転送)​費用は​ゼロである。​commoncrawl.org/get-startedから​通常の​HTTPSで​ダウンロードする​ことも​できる。​Common Crawl Index Server​(index.commoncrawl.org)を​使えば、​フルアーカイブを​ダウンロードせずに​「この​URLは​どの​クロールに​含まれているか」を​検索できる。​AWS Athena​(アテナ)は​インデックスを​分散データベースの​テーブルと​して​登録し、​ペタバイト規模の​データに​対しても​SQLクエリを​実行できる。

CCBotと​ペイウォール問題

CCBotは​Apache Nutch​(オープンソースの​クローラーフレームワーク)を​ベースに​した​Common Crawl独自の​クローラーである。​PageRankに​似た​スコアで​URLに​優先順位を​つけ、​robots.txt​(=ウェブサイトが​クロールの​ルールを​宣言する​標準ファイル)を​公式には​尊重している。​報告されている​問題と​して、​CCBotが​ペイウォール​(有料課金の​壁)を​突破してしまう点が​ある。​多くの​ニュースサイトは​購読チェックの​スクリプトを​実行する​前に​記事の​全文を​読み込む設計に​なっており、​CCBotは​課金壁が​発火する​前に​全文を​取得してしまう。​オプトアウト​(除外申請)の​登録制度は​あるが、​すでに​アーカイブされた​内容を​削除するのは​技術的に​難しい。​WARCファイルは​上書きできない​不変の​ファイル形式で​広範囲に​配布されている​ため、​新たな​オプトアウトは​今後の​クロールを​止められても、​過去の​記録は​削除できない。​New York Times を​はじめと​する​複数の​メディアが、​この​制約に​ついて​正式に​異議を​申し立てている。

Common Crawl は、​ごく​一部の​巨大テック企業に​しか​手が​届かなかった​ウェブ規模の​データアクセスを​民主化した。​しかし、​それを​学習に​使う​大規模言語モデルが​商業規模に​達するに​つれ、​コンテンツの​権利者との​同意・​除外を​めぐる​緊張は​避けられない​論点に​なっている。

出典・参考

148 notestil