Перейти к основному содержимому

Common Crawl

Common Crawl — некоммерческий фонд, с 2007 года систематически обходящий веб и публикующий свои дампы в открытом доступе на Amazon S3 и HTTP.

Что предоставляет​

  • Открытые WARC-снимки — ежемесячно, ~3–5 млрд страниц за месяц.
  • Метаданные обхода — список URL, доменов, языков.
  • WAT и WET форматы — извлечённый текст и метаданные без сырого HTTP.

Применение​

  • Исследования NLP и языковых моделей.
  • Анализ веба в масштабе (link analysis, web graph).
  • Исторические исследования — дампы доступны с 2008 года.

Отличие от Ruarxive​

Common Crawl не нацелен на полноту для конкретного сайта — он делает широкий обход с ограничениями по глубине и доменам. Для архивации отдельных ресурсов (что делает Ruarxive) Common Crawl не подходит.

Когда использовать​

  • Анализ больших корпусов веб-текстов.
  • Тренировка моделей машинного обучения.
  • Глобальная веб-аналитика.

Доступ​

# Пример загрузки дампа через aws-cli
aws s3 cp s3://commoncrawl/crawl-data/CC-MAIN-2024-10/segments/.../warc/CC-MAIN-...warc.gz .

Лицензия​

Данные Common Crawl распространяются под лицензией CC-BY 4.0 с указанием источника. Использование в коммерческих и некоммерческих целях — свободное.