Загружаемые данные
В этом разделе собраны утилиты, которые систематически загружают структурированные данные по API: государственные порталы открытых данных, реестры, соцсети. В отличие от браузерных кроулеров, эти инструменты работают с формальными API, поэтому архив получается компактным и машиночитаемым.
Что внутри
- apibackuper — фреймворк для долгосрочного резервного копирования REST/GraphQL API. Поддерживает инкрементальные выгрузки, контроль версий и автоматическое расписание.
- apibackuper-configs — коллекция готовых конфигураций для конкретных сервисов: data.gov.ru, Госзакупки, ГАС «Управление», ЕИС и др.
- spcrawler — узкоспециализированный кроулер для сбора данных с платформы «Сбербанк-АСТ» и аналогичных торговых площадок.
Когда использовать
Если целевой ресурс предоставляет официальный API, всегда начинайте с этого раздела. Браузерная архивация (Browsertrix, wget) — запасной вариант на случай, когда API нет или он сильно ограничен по частоте запросов.
Связанные разделы
- Консервированное государство — архивы госорганов, собранные в том числе этими инструментами.
- Архивация крупномасштабных API — практический опыт работы с API объёмом в десятки ТБ.