Common Crawl
Common Crawl — некоммерческий фонд, с 2007 года систематически обходящий веб и публикующий свои дампы в открытом доступе на Amazon S3 и HTTP.
Что предоставляет
- Открытые WARC-снимки — ежемесячно, ~3–5 млрд страниц за месяц.
- Метаданные обхода — список URL, доменов, языков.
- WAT и WET форматы — извлечённый текст и метаданные без сырого HTTP.
Применение
- Исследования NLP и языковых моделей.
- Анализ веба в масштабе (link analysis, web graph).
- Исторические исследования — дампы доступны с 2008 года.
Отличие от Ruarxive
Common Crawl не нацелен на полноту для конкретного сайта — он делает широкий обход с ограничениями по глубине и доменам. Для архивации отдельных ресурсов (что делает Ruarxive) Common Crawl не подходит.
Когда использовать
- Анализ больших корпусов веб-текстов.
- Тренировка моделей машинного обучения.
- Глобальная веб-аналитика.
Доступ
# Пример загрузки дампа через aws-cli
aws s3 cp s3://commoncrawl/crawl-data/CC-MAIN-2024-10/segments/.../warc/CC-MAIN-...warc.gz .
Лицензия
Данные Common Crawl распространяются под лицензией CC-BY 4.0 с указанием источника. Использование в коммерческих и некоммерческих целях — свободное.