Перейти к основному содержимому

Словарь терминов

Ключевые понятия цифровой архивации и проекта Ruarxive.

Форматы и стандарты​

WARC (Web ARChive)​

Стандартный формат для хранения HTTP-снимков веб-страниц. Файл содержит записи с заголовками запросов/ответов и телом ответа. Подробнее: WARC.

WACZ (Web Archive Collection Zipped)​

ZIP-обёртка над одним или несколькими WARC-файлами с индексами и метаданными. Подходит для воспроизведения в плеерах вроде ReplayWeb.page. Подробнее: WACZ.

CDX​

Индексный формат, описывающий содержимое WARC-файла. Каждая строка — одна запись: URL, временная метка, тип, хеш. Подробнее: WARC#метаданные.

CDXJ​

Расширение CDX в формате JSON Lines. Используется в WACZ-контейнерах.

PRONOM​

Реестр форматов файлов Национального архива Великобритании. Уникальный идентификатор — PUID (например, fmt/40 для Word 97–2003). Подробнее: Реестры форматов.

PUID​

PRONOM Unique Identifier — стабильный идентификатор формата файла.

Инструменты​

Heritrix​

Краулер Internet Archive, написанный на Java. Используется для масштабной архивации с генерацией WARC. Требует серьёзных ресурсов.

Browsertrix​

Современный краулер на базе Chrome от Webrecorder. Записывает трафик реального браузера в WACZ. Подробнее: Browsertrix.

HTTrack​

Бесплатный GUI-инструмент для зеркалирования сайтов. Подходит для начинающих.

Wpull​

Python-клон Wget с поддержкой WARC. Подробнее: make-copy-website.

Wget​

Классическая консольная утилита для скачивания файлов по HTTP/FTP. Подробнее: Wget.

yt-dlp​

Форк youtube-dl с поддержкой тысяч видеохостингов. Подробнее: Архивация видео.

Instaloader​

Python-утилита для Instagram-анализов. Подробнее: Архив инстаграм.

Siegfried​

Быстрый инструмент идентификации форматов файлов на Go. Подробнее: Идентификация форматов.

ReplayWeb.page​

Браузерный плеер для воспроизведения WARC/WACZ-архивов. Полностью клиентский, без отправки данных на сервер. Подробнее: Как открыть WARC.

Программные термины​

Краулер (web crawler)​

Программа, систематически обходящая веб-страницы и собирающая их содержимое.

Сид (seed)​

Начальный URL, с которого краулер начинает обход сайта.

Robots.txt​

Стандартный файл с указаниями для ботов о допустимых разделах сайта. Подробнее: Условия использования.

Wayback Machine​

Сервис Internet Archive для доступа к веб-архивам. Позволяет просматривать старые версии страниц.

DPN (Digital Preservation Network)​

Сеть организаций, занимающихся долгосрочным сохранением цифровых материалов.

Проект Ruarxive​

Проактивная архивация​

Архивация до исчезновения ресурса. Рекомендуемый подход.

Реактивная архивация​

Попытки архивировать после исчезновения. Часто малоэффективна.

Воздушная архивация (lightweight archiving)​

Малая выборка URL через API или CDN-кеши, без полного обхода.

Коллекция (collection)​

Группа архивов, объединённых тематически или принадлежащих одному проекту.

Юридические термины​

CC-BY 4.0​

Лицензия Creative Commons, разрешающая использование с указанием авторства.

ODbL​

Open Data Commons Open Database License — для структурированных данных.

GDPR​

General Data Protection Regulation — регламент ЕС по защите персональных данных.

152-ФЗ​

Федеральный закон РФ «О персональных данных».

Fair use / добросовестное использование​

Доктрина, допускающая ограниченное использование материалов без разрешения правообладателя в целях исследования, образования, критики. Подробнее: Авторское право.