В этом исследовании использовались оцифрованные архивные записи и имитированные запросы поиска в качестве единиц анализа. Архивные хранилища могут ограничивать доступ к чувствительным или культурно ограниченным записям. Соблюдайте правила доступа к репозиторию, процедуры институциональной безопасности данных и требования по деидентификации перед обработкой или распространением любых записей. Опасные химические, биологические, острые, радиоактивные или другие регулируемые лабораторные отходы не создавались в результате этого цифрового рабочего процесса.
Проектирование исследования и строительство корпуса
На рисунке 1 представлен полный рабочий процесс исследования, включая конструирование корпуса, маркировку ссылок, предварительную обработку изображений, генерацию и посткоррекцию OCR, визуальную классификацию, обогащение метаданных, построение индекса, оценку поиска, статистический анализ и упаковку воспроизводимости.
Строительство корпуса проводилось с 15 января по 30 апреля 2025 года, затем проектирование системы и отладка с 1 мая по 31 октября 2025 года. Корпус содержал 1600 оцифрованных архивных документов, отобранных из восьми хранилищ, представляющих государственные, городские, религиозные, музейные, университетские и библиотечные системы. Рамка для отбора проб была стратифицирована по классу хранилища и документов, чтобы сохранить архивную гетерогенность между рукописными письмами, бухгалтерскими книгами, картами, газетами, фотографиями с подписями, плакатами, реестрскими книгами и напечатанной перепиской.
Для каждой кандидатской записи журнал выбора фиксировал идентификатор репозитория или коллекции, идентификатор каталога, класс документа, приблизительный исторический период, контекст доминирующего языка, доступный формат изображения, разрешение изображения, количество страниц и исходные описательные поля. Включение требовало всего следующего: стабильного идентификатора каталога; как минимум одно изображение страницы в формате TIFF, JPEG или PNG; разрешение исходного изображения не менее 150 dpi; читаемый текстовый, табличный или документально-структурный контент; и назначение одному из восьми заранее определённых классов документов. Критериями исключения были точные дубликаты, пустые обратные страницы, изображения, обрезанные до такой степени, что отсутствовало более 30% области с текстом, а также записи, признанные нечитаемыми после ручной проверки.
Бенчмарк поиска содержал 420 коротких запросов на естественном языке, сгенерированных с 5 по 20 августа 2025 года. Генерация запросов следовала воспроизводимому шаблону: потребности в информации кандидатов отбирались из людей, учреждений, мест, дат, профессий, событий и тематических тем; Каждый запрос нормализовался до 2–9 слов; и соответствующие целевые записи были выявлены до сравнения систем. Каждый запрос оценивался при пяти условиях поиска, что дало 2 100 совпадающих наблюдений по состоянию запроса.
Эталонная маркировка и контроль качества
Маркировка справочных материалов проводилась с 1 мая по 15 июля 2025 года тремя аннотаторами: двумя сотрудниками архивного отдела с опытом в описательной каталогизации и одним исследователем цифровых гуманитарных наук, имеющим опыт оценки исторических документов. Руководство по аннотациям определяло классы документов, категории языка и контекста, исторические периоды, поля полноты метаданных, категории именованных сущностей и правила выбора регионов оценки OCR.
Для оценки OCR аннотаторы выбирали репрезентативные области с текстом, которые включали заголовки, имена, даты, институциональные термины, маргинальные заметки, табличные записи и, при наличии, шумные области макета. Если страница содержала несколько текстовых областей, выбранный регион должен был быть релевантным для поиска и содержать достаточно символов для вычисления CER и WR. Разногласия сначала были урегулированы в ходе обсуждения между двумя основными аннотаторами; Неразрешённые дела рассматривались исследователем цифровых гуманитарных наук.
Контроль качества использовал случайную подгруппу 12% записей. Межаннотаторское соглашение для основного типа документа было по kappa Коэна = 0,86, что подтверждает существенное согласие. Журнал рассмотрения сохранил оригинальные и окончательные метки, категорию разногласий и причину разрешения, чтобы будущие пользователи могли проверять определения классов и крайние случаи.
Предварительная обработка изображений
Все изображения обрабатывались на уровне записи с использованием Python 3.11.8 с OpenCV 4.9.0, Pillow 10.3.0 и NumPy 1.26.4. Каждая входная страница преобразовывалась в 8-битные оттенки серого, если только цвет не содержал семантическую информацию, такую как карты, плакаты, марки или цветные аннотации. Смещение оценивалось с помощью проекционных профилей и обнаружения линии Хафа; Deskewing применялся только при абсолютном углу смещения 1,5 градуса и ограничивался 8,0 градуса для предотвращения искажений.
Усиление контраста использовало адаптивную гистограммную эквализацию с ограниченным контрастом с clipLimit = 2.0 и tileGridSize = 8 × 8. Медианный фильтр с ядром 3 × 10−23 применялся только тогда, когда оценочное отношение фонового шума превышало 0,35. Изображения, полученные с частотой 150–299 dpi, были передискретированы до 300 dpi для оптического распознавания символов; Изображения, уже имевшие 300 dpi и выше, не увеличивались. Не использовалось никакое суперразрешение, генеративное восстановление или галлюцинации содержания.
Протяжение, затемнение краёв, неровная текстура бумаги, маргинальные штампы, почерк, линейки и границы таблиц сохранялись, если только это не мешало выбору региона OCR. Это правило сохраняло архивные доказательства, при этом достаточно стандартизировало входные изображения для воспроизводимого OCR и классификации.
Генерация баз OCR и посткоррекция
Базовый OCR был сгенерирован с помощью Tesseract OCR 5.3.0. Основной языковой пакет выбирался из языка каталога и видимого письма; Многоязычное декодирование включалось, если язык каталога и скрипт страницы не совпадали. Выходы OCR группировались на уровне записи и хранились с идентификаторами страниц, уверенностью в OCR, координатами ограничивающих рамок при доступности и сырым текстом до исправления.
Коррекция после OCR использовала трёхступенчатую консервативную процедуру. Во-первых, нормализация на уровне символов исправила частые путаницы в историческом распознавании, включая лигатуры, замены длинных s/short-s, фрагментированную пунктуацию и подстановку цифрами. Во-вторых, коррекция на уровне жетонов использовала кандидатов по дистанции редактирования и частотному ранжированию из архивно-специфического лексикона личных имён, топонимов, учреждений, административных терминов и исторических вариантов написания. В-третьих, последовательность на основе правил проверяет проверенные именованные сущности и даты на соответствие с доказательствами из контекста и метаданных.
Кандидаты на замену принимались только тогда, когда уверенность в апостериорной коррекции превышала 0,80; Замена именных организаций требовала уверенности не менее 0,85. Кандидаты ниже порога сохранялись в виде OCR-текста, но помечались для рассмотрения. CER рассчитывался как расстояние редактирования Левенштейна, делённое на количество символов в референсной транскрипции. WER использовал ту же формулу на уровне токенов. Воспоминание именованных сущностей рассчитывалось как правильно распознанные эталонные сущности, делённые на все опорные сущности в выбранной области оценки.
Визуальная классификация документов
Модуль визуальной классификации присваивал каждой записи один из восьми классов архивных документов: рукописное письмо, бухгалтерская книга, карта, газета, фотография с подписью, плакат, реестр и напечатанная переписка. Предсказанный тип документа использовался как сигнал поиска и фильтрации, а не как авторитетная замена архивной каталогизации.
Модель была реализована в PyTorch 2.2.2 и torchvision 0.17.2 с использованием предварительно обученной ImageNet основной системы EfficientNet-B3. Миниатюры на уровне записи были изменены до 384 x 384 пикселей. Для снижения утечек записи были разделены по репозиториям и классам документов на обучающие, валидационные и тестовые наборы в соотношении 70:15:15, что соответствует примерно 1 120, 240 и 240 записям.
Обучение использовало AdamW с начальной скоростью обучения = 1 × 10-4, снижением веса = 1 × 10−2, размером партии = 16, сглаживанием метки = 0,05, и ранней остановкой, когда потеря валидации не улучшалась в течение пяти последовательных эпох. Горизонтальное переворачивание было отключено, потому что зеркальные архивные макеты нереалистичны. Дополнение ограничивалось вращением от -3 до +3 градусов и вариацией яркости в пределах ±10%.
Эпохальная диагностика моделей суммирована в 20 обучающих строк, каждая из которых содержит потери в обучении, потери в валидации, точность обучения, точность валидации, макро-F1, взвешенно-F1, ROC-AUC и PR-AUC.
Рабочий процесс обогащения метаданных
Обогащение метаданных было разработано для повышения обнаружимости при сохранении архивного консерватизма. Существующие значения каталога сохранялись, если только не содержали явных противоречий, таких как невозможная дата или конфликт типов документов, подтверждённый как OCR, так и визуальными доказательствами. Поля обогащения кандидатов включали нормализованное название, тип документа, приблизительную дату, упоминания учреждения, географические упоминания, личные имена, тематические заголовки и ключевые слова.
Приоритет доказательств следовал фиксированному порядку: (1) существующие метаданные каталога, (2) скорректированный вывод OCR и (3) визуальное предсказание типа документа. Для предметных заголовков использовалось контролируемое сопоставление словарного запаса, а семантическое разложение ближайших соседей с преобразователями предложений 2.7.0 применялось только при косинусном сходстве не менее 0.72. Нормализация даты требовала уверенности не менее 0,85 или согласованности между OCR и метаданными. Каждое автоматически добавляемое поле сохраняло свой источник, уверенность и идентификатор правила.
Полнота метаданных определялась как количество заполненных основных описательных полей, делённое на количество применимых основных полей для этой записи. Совпадение по теме определялось как наличие хотя бы одной метки с контролируемым словарным запасом, подкреплённой данными на уровне записи и признанной релевантной для категории запроса.
Конструкция системы поиска
Было построено пять индексов поиска для выделения вклада модулей: базовое индексирование; только коррекция оптического распознавания символов; только визуальная классификация; только обогащение метаданных; и полная мультимодальная интеграция. Все индексы были созданы в поисковом программном обеспечении, указанном в Таблице материалов (версия 8.11.1) на уровне записи. Параметры BM25 были зафиксированы на k1 = 1,2 и b = 0,75 до оценки.
Базовый индекс использовал оригинальные метаданные и исходный OCR-текст. Условие OCR заменяло базовый OCR на исправленный OCR. Визуальное условие добавило априоры типа документа и повышение рейтинга с учётом класса. Условие метаданных добавляло обогащённые описательные поля. Полное мультимодальное условие сочетало скорректированные OCR, визуальные априоры и обогащённые метаданные. Веса полей фиксировались до тестирования: нормализованный заголовок = 3.0, тематические заголовки = 2.5, упоминания лица и учреждения = 2.2, упоминания места = 2.0, тип документа = 1.8, исправленный основной текст OCR = 1.0, и базовый основной текст OCR = 0.8, где это применимо.
Точное сопоставление фраз было включено для цитируемых запросов. Расширение запросов было разрешено только в условиях обогащения метаданных и полного мультимодального режима и ограничивалось принятыми синонимами контролируемого словарного запаса и вариантами предметных заголовков. Журналы поиска были созданы с 25 по 28 августа 2025 года в контейнерной среде Linux, указанной в Таблице материалов, с фиксированными семенами и замороженными индексными конфигурациями.
Проектирование запросов и показатели результатов
420 запросов представляли собой распространённые поисковые поведения в архиве, а не только по ключевым словам бенчмарковые запросы. Темы включали личные имена, учреждения, места, даты и диапазоны дат, профессии, события и тематические темы. Каждый запрос хранился с его нормализованной формулировкой, целевой набором записей, категорией темы-запросами и уровнем сложности.
Сложность оценивалась перед извлечением с учётом неоднозначности цели, лексической специфичности и ожидаемой частоты выражения. Суммарные баллы ниже 0,40 классифицировались как низкие сложности, от 0,40 до 0,69 — как средняя сложность, а баллы 0,70 и выше — как с высокой сложностью. Оценки релевантности были завершены до сравнения системы и затем сверялись с окончательной коллекцией.
Результаты поиска включали P@10, R@10, nDCG@10, время до первого релевантного результата и успешный поисковый показатель. P@10 была доля из десяти лучших записей, признанных релевантными. R@10 — доля всех известных релевантных записей, найденных в топ-10. nDCG@10 использовали градуированную релевантность, где это было возможно, и бинарную релевантность в остальном. Время до первого релевантного результата измерялось от отправки запроса до появления первой релевантной записи в ранжированном результате. Успешный поиск определялся как минимум один релевантный результат среди топ-10 записей.
Сбор статистики
Все анализы проводились с использованием версий программного обеспечения, указанных в Таблице материалов. Непрерывные результаты суммировались как среднее ± SD при приблизительном симметричном состоянии, а в противном случае — как медиана с межквартильным диапазоном. Категориальные результаты суммировались в виде подсчёта и процентов.
Нормальность парных различий оценивалась с помощью графиков теста Шапиро-Уилка и распределения. OCR и метаданные до/после сравнивались с парными тестостеронными тестами, когда парные различия были примерно нормальными, а в противном случае — с тестами с знакомым рангом Уилкоксона. Классификационные характеристики до и после тонкой настройки сравнивались с помощью теста МакНемара на паре правильных/неправильных меток. Совпадающие результаты забора из нескольких рук сравнивались с тестом Фридмана, за которыми следовали скорректированные по Хольму парные тесты Уилкоксона с знаковым рангом.
Все статистические тесты были двусторонними, и P < 0,05 считался статистически значимым. Доверительные интервалы были оценены с использованием 2000 перевыборок bootstrap с фиксированным случайным семем на 2025 году. Эффекты описывались в виде средних различий, совпадения шансов или ранговых размеров эффектов в зависимости от типа результата.
Воспроизводимость, объем и доступность ресурсов
Все параметры конвейера были зафиксированы до тестирования на поиск. Ни один параметр не был оптимизирован на хранящемся эталонном эталонном эталонном результате. Конфигурационные файлы, управляемые словаря, лексиконные таблицы, шаблоны запросов, отображения полей, руководства по аннотациям, статистические скрипты и скрипты генерации фигурок поддерживались в системе контроля версий, указанной в Таблице материалов с случайным началом 2025.
Для поддержки независимой валидации рабочая тетрадь по исходным данным включает де-идентификационную таблицу из 1600 записей с 17 переменными, используемыми для оптического распознавания символов, метаданных и анализа визуальной классификации. Производные таблицы 1, Таблицы 2, Таблицы 3, Таблицы 4 и Таблицы 5, сводки рисунков и источников, определения бенчмарков-запросов, резюме суждений по релевантности, суррогаты для поиска журнала, диагностика обучения, категории лексиконов, правила сопоставления словарного запаса и поля для руководства по аннотациям предоставляются в виде отдельных загружаемых таблиц или файлов материалов, где это применимо. Материалы, которые не могут быть публично распространены из-за ограничений репозитория, представлены в виде деидентифицированных полей метаданных и воспроизводимых выборочных полей.
Этот протокол оценивает поисково-ориентированное открытие, а не истинность исторических утверждений. Он не заменяет оценку архивариуса, оценку происхождения, проверку конфиденциальности или доступ к репозиториям.