$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Коррекция OCR улучшила транскрипцию, особенно в рукописных и табличных записях
Коррекция оптического распознавания символов улучшила качество транскрипции во всех восьми классах архивных документов (n = 1 600 записей). Средний WER снизился с 0,529 ± 0,172 до 0,384 ± 0,123, при среднем парном изменении −0,144 (95% ДИ, −0,149 до −0,139; Уилкоксон получил звание P < 0.001). Средний CER снизился с 0,377 ± 0,126 до 0,258 ± 0,086, при среднем парном изменении −0,119 (95% ДИ, −0,123 до −0,116; Уилкоксон получил звание P < 0,001). Таблица 2 показывает, что базовый WER был самым высоким для рукописных писем, бухгалтерских книг и реестров, что указывает на то, что самые визуально сложные записи также имели наибольшее первоначальное распознавание.
После коррекции WER снизился во всех классах документов. Наибольшие средние парные сокращения WER наблюдались в рукописных письмах (n = 262; −0,200; 95% CI, −0,213 до −0,188), бухгалтерских книгах (n = 263; −0,195; 95% CI, −0,206 до −0,183) и реестровых книгах (n = 194; −0,173; 95% CI, −0,187 до −0,160). CER следовал той же схеме, поддерживая интерпретацию, что модуль после коррекции в первую очередь приносил пользу сложным рукописным, табличным и смешанным макетным записям.
Воспоминание именованных сущностей также улучшилось для всех типов документов, как показано в таблице сводки. Наибольший рост наблюдался в рукописных письмах (0,302–0,440), бухгалтерских книгах (0,336–0,471) и реестрских книгах (0,369–0,504). Типизированная корреспонденция достигла самого высокого уровня памяти именованных сущностей после коррекции (0,646), но её абсолютный прирост был меньше, поскольку базовое распознавание уже было сильнее для этого класса. Рисунок 2 обобщает базовую связь CER-WER на уровне записи, связь между интенсивностью письма и пользой от коррекции, а также сдвиг после коррекции в обнаружимости на уровне записей.
Визуальная классификация документов в целом улучшилась, но прирост производительности был неравномерным между классами
Визуальная классификация документов улучшилась в целом на тестовом наборе из 1600 записей. Точность топ-1 выросла с 0,717 до 0,796 (абсолютное изменение — 0,079; МакНемар хи-квадрат = 27,33; P < 0,001), и средняя уверенность в прогнозах выросла с 0,736 ± 0,131 до 0,800 ± 0,108 (среднее парное изменение 0,064; 95% ДИ, 0,057–0,071; парный тестостерон P < 0,001). Как показано в таблице 3, семь из восьми классов улучшились после архивной точной настройки, с наибольшими приростами для карт, плакатов, газет и реестровых книг.
Типизированная корреспонденция не улучшилась существенно после тонкой настройки (0,796–0,791), что свидетельствует о стабильности базовых визуальных характеристик и о минимальном дополнительном разделении классов для этой категории.
Рисунок 3 подводит итоги визуальной классификации документов до и после архивно-специфической настройки; рабочая тетрадь с исходными данными перечисляет 20 эпох потерь и точности обучения/валидации, а также макро-F1, взвешенно-F1, ROC-AUC и PR-AUC диагностические резюме.
Обогащение метаданных улучшило описательную полноту во всех исторических периодах (n = 1 600 записей). Средняя полнота выросла с 0,657 ± 0,125 до 0,907 ± 0,070, при среднем парном изменении 0,250 (95% ДИ, 0,243–0,257; Уилкоксон получил звание P < 0.001). Как показано в таблице 4, базовая полнота была минимальной для 1850–1879 годов и увеличивалась в более поздние периоды до обогащения. Рисунок 4 подводит итоги улучшения полноты метаданных, новых полей метаданных по типу документа и улучшения соответствия тематических заголовков в исторические периоды.
После обогащения полнота увеличивалась во всех исторических периодах: 1850–1879 (n = 281; среднее изменение 0,207; 95% CI, 0,191–0,223), 1880–1909 (n = 474; среднее изменение, 0,236; 95% CI, 0,223–0,248), 1910–1939 (n = 549; среднее изменение 0,277; 95% CI, 0,265–0,288), и 1940–1969 (n = 296; среднее изменение 0,263; 95% CI, 0,247–0,279). Среднее количество населённых полей также стабильно увеличивалось в зависимости от периодов.
Параллельно сопоставление заголовков улучшалось. Базовые показатели совпадения варьировались от 64,3% до 69,4%, тогда как после обогащения — от 82,1% до 85,4%. Наибольшее абсолютное прирост произошло в самый ранний период (Delta = 0,178), что подтверждает ценность консервативного обогащения для записей с редким первоначальным описанием.
Производительность поиска улучшилась во всех улучшенных системах, с наибольшими приростами при полной мультимодальной интеграции
Эффективность восстановления улучшалась при каждом условии улучшения относительно исходного уровня, но величина улучшения варьировалась в зависимости от структурного крыла (n = 420 совпадающих эталонных запросов). Общие результаты извлечения приведены в таблице 5. Базовая эффективность была низкой: P@10 = 0,394, R@10 = 0,238, nDCG@10 = 0,392, среднее время до первого релевантного результата = 156,079 с, и процент успешного поиска = 5,0% (21/420; 95% ДИ, 3,3%–7,5%). Рисунок 5 обобщает результаты поиска по пяти экспериментальным группам систем, включая общие метрики поиска, показатели успеха на уровне темы и уровень сложности запросов.
Все три однокомпонентные системы по совокупности превосходили базовый показатель. Коррекция оптического распознавания символов увеличилась P@10 до 0,484, R@10 до 0,346 и nDCG@10 до 0,475, при этом время до первого релевантного результата сократилась до 124,261 с и увеличилась вероятность успешного поиска до 30,2% (127/420; 95% ДИ, 26,0%–34,8%). Визуальная классификация дала P@10 = 0,490, R@10 = 0,302, nDCG@10 = 0,478, среднее время до первого релевантного результата = 131,985 с, и процент успешного поиска = 22,9% (96/420; 95% ДИ, 19,1%–27,1%). Обогащение метаданных достигло наибольшей эффективности поиска по одному компоненту: P@10 = 0,507, R@10 = 0,347, nDCG@10 = 0,513, среднее время до первого релевантного результата = 117,474 с, а успешный уровень поиска составил 38,3% (161/420; 95% ДИ, 33,8%–43,1%).
Полная мультимодальная система показала лучшие результаты на всех точках извлечения. P@10 вырос с 0,394 на базовом уровне до 0,624, R@10 с 0,238 до 0,492 и nDCG@10 с 0,392 до 0,634. Среднее время до первого релевантного результата снизилось с 156,079 с до 58,485 с, а процент успешного поиска вырос с 5,0% до 95,5% (401/420; 95% ДИ, 93,0%–97,1%). Эти значения соответствуют абсолютному приросту 0,230 для P@10, 0,254 для R@10 и 0,242 для nDCG@10.
Поиск по теме также улучшился при полной мультимодальной интеграции. Показатели успешного поиска выросли по людям, учреждениям, местам, профессиям, событиям и тематическим темам, при этом категория профессий показала наибольший практический прирост — базовый уровень успеха составлял 0,0% и вырос до 90,0% при полном мультимодальном режиме. Запросы по названиям мест имели наивысшую базовую производительность, но всё равно выигрывали от мультимодальной интеграции.
Мультимодальные приобретения варьировались по документам, периодам и языковым слоям
Анализ подгрупп показал, что мультимодальные приросты были широко распределены по типам документов, историческим периодам и языковым контекстам, хотя степень улучшения варьировалась. Эта гетерогенность указывает на то, что рабочий процесс следует оценивать внутри каждой целевой коллекции, а не предполагать, что он даёт одинаковые результаты. Рисунок 6 показывает гетерогенность мультимодальных результатов поиска в зависимости от типа целевой документа, исторического периода и языкового контекста.
На уровне типа документа nDCG@10 улучшился во всех целевых классах. Фотографии с подписями, рукописные письма, карты, бухгалтерские книги и реестры показали значительный рост, тогда как газеты и печатная переписка улучшились более умеренно. Эти закономерности свидетельствуют о фактах, что записи с слабыми начальными метаданными или сложной визуальной структурой наибольшее преимущество получают от комбинированного текста, изображения и метаданных.
На историческом уровне R@10 увеличился с 0,175 до 0,429 в 1850–1879 годах и достиг 0,506 в 1880–1909 годах, 0,501 в 1910–1939 годах и 0,519 в 1940–1969 годах при полной мультимодальной интеграции. Прирост был схожим в абсолютном масштабе между периодами, что говорит о том, что обогащение и скорректированное распознавание помогли как ранним редким записям, так и более поздним записям с более богатыми базовыми метаданными.
Результаты языкового контекста показали похожую закономерность. P@10 при полном мультимодальном режиме достигал 0,607 для записей смешанного латинского алфавита, 0,628 для английского, 0,618 для французского, 0,661 для немецкого и 0,639 для португальского и испанского. Наибольшее прирост точности наблюдалось для записей смешанного латинского алфавита, которые имели наименьшую базовую точность.
Шаблоны на уровне компонентов: дополнительные вклады, а не избыточные
В совокупности результаты показывают, что компоненты протокола являются дополняющими, а не избыточными. Коррекция OCR улучшила распознаваемость текста, визуальная классификация добавила сигналы с учётом структуры документов, а обогащение метаданных расширило поисковый описательный слой. Полное мультимодальное условие дало самые сильные и стабильные результаты поиска, что подтверждает цель исследования — тестирование аудитируемого, ориентированного на поиск рабочих процессов для гетерогенных цифровых архивов.
Эти результаты подтверждают модель протокола, в которой мультимодальный искусственный интеллект дополняет архивный поиск, сохраняя при этом необходимость управления репозиториями, происхождения данных и экспертной валидации.
ДОСТУПНОСТЬ ДАННЫХ:
Де-идентификационный набор данных из 1600 записей, используемый для основного анализа, доступен на Zenodo как data.xlsx (https://doi.org/10.5281/zenodo.20774456).

Рисунок 1: Воспроизводимый рабочий процесс для мультимодального архивного обнаружения. (A) Построение корпуса на основе архивных записей на уровне репозитория с помощью скрининга включения/исключения. (B) Маркировка ссылок и контроль качества, включая тип документа, референсные регионы OCR, языковой контекст, исторический период и полноту метаданных. (C) Предобработка изображений, генерация и посткоррекция OCR, визуальная классификация документов и консервативное обогащение метаданных. (D) Построение индекса, оценка по пяти рукавам, статистический анализ и упаковка ресурсов. Сокращения: OCR, оптическое распознавание символов; CER, уровень ошибок символов; WER, уровень ошибок слов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 2: Структура ошибки оптического распознавания символов на уровне записи и обнаружимость после коррекции. (A) Базовый CER по сравнению с базовым WER для 1600 архивных записей, окрашенных по типу документа для репрезентативных классов. (B) Связь между масштабированной интенсивностью почерка и изменением WER после исправления; отрицательные значения указывают на снижение WER после коррекции. Прилегающая линия и серая полоса показывают линейный тренд и 95% доверительный интервал. (C) Балл обнаружения на уровне записи до и после исправления по типу документа, иллюстрирующий изменения в поисковых доказательствах после исправления. Сокращения: CER, уровень ошибки символа; WER, уровень ошибок слов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 3: Визуальная классификация документов до и после архивно-специфичной настройки. (A) Топ-1 точности по типу документа на исходном уровне и после тонкой настройки. (B) Распределения доверия для правильных и неправильных предсказаний в базовых и пост-настройках. (C) Матрица производительности на уровне класса, суммирующая точность топ-1 и среднюю апостериорную уверенность до и после настройки. Диагностические данные модели включают 20 эпох кривых потерь/точности, макро-F1, взвешенную F1, ROC-AUC и PR-AUC. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 4: Полнота метаданных и совпадение предметных заголовков после консервативного обогащения. (A) Полнота метаданных на уровне записи до и после обогащения. (B) Новые поля метаданных по типу документа. (C) Увеличение совпадения темы в исторические периоды. Полнота рассчитывалась как количество заполненных применимых основных полей, делённое на общее количество применимых основных полей. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 5: Производительность поиска по пяти экспериментальным веткам системы. (A) Общие показатели P@10, R@10, nDCG@10, времени до первого релевантного результата и успешного поиска по исходной точке, коррекции оптического распознавания символов, визуальной классификации, обогащения метаданных и полной мультимодальной интеграции. (B) Пузырьковый график успешного поиска по теме запроса и системному подразделению; Цвет указывает на системное рыча, а размер пузыря — на процент успеха. (C) P@10, R@10 и nDCG@10 по лёгким, средним и жёстким уровням сложности запросов. (D) Альтернативный вариант успешности на уровне темы, показывающий распределение успешных поисков по темам запросов и системным подразделениям. Сокращения: P@10, точность 10; R@10, отзыв в 10; nDCG@10, нормализованный дисконтированный кумулятивный прирост на уровне 10. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 6: Гетерогенность приростов мультимодального поиска между архивными подгруппами. (A) nDCG@10 по типу целевой документации и условиям поиска. (B) R@10 по историческому периоду и условиям поиска. (C) P@10 по контексту целевой языка и условиям поиска. Условия включают исходную линию, коррекцию OCR, визуальную классификацию, обогащение метаданных, полную мультимодальную интеграцию, OCR+текст, текст + визуальные + метаданные и визуальные + метаданные. На рисунке подчёркивается, что мультимодальные достижения широко распространены, но не одинаково по документам, периодам и языковым слоям. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
| Тип документа | N Records | Медианные страницы | Рукописные записи | Средний базовый уровень WER | Средний базовый уровень Метаданные Полнота | Средний базовый уровень Обнаружимость |
| | | (%) | | | |
| Рукописное письмо | 262 | 2 | 95 | 0.729 | 0.648 | 68.2 |
| Ledger | 263 | 7 | 63.5 | 0.679 | 0.674 | 72.2 |
| Карта | 102 | 1 | 2.9 | 0.457 | 0.552 | 74.1 |
| Газета | 261 | 8 | 0.8 | 0.495 | 0.66 | 75.5 |
| Фотография с подписью | 179 | 1 | 1.1 | 0.374 | 0.601 | 73.6 |
| Постер | 87 | 1 | 0 | 0.413 | 0.571 | 74.8 |
| Реестр | 194 | 10 | 18 | 0.616 | 0.703 | 71.3 |
| Напечатанная переписка | 252 | 3 | 4 | 0.315 | 0.689 | 76.4 |
Таблица 1: Характеристики архивной коллекции по типу документов. В таблице указано количество записей, медианное количество страниц, процент записей с почерком, средний базовый WER, средняя базовая полность метаданных и средний базовый балл обнаружения для каждого из восьми классов документов.
| Тип документа | Размер выборки | CER | CER | WER | WER | Именованный субъект Отзыв | Именованный субъект Отзыв | ΔWER |
| (n) | (Базовая линия) | (Пост) | (Базовая линия) | (Пост) | (Базовая линия) | (Пост) | |
| Рукописное письмо | 262 | 0.531 | 0.363 | 0.729 | 0.531 | 0.302 | 0.44 | −0,198 |
| Ledger | 263 | 0.49 | 0.326 | 0.679 | 0.485 | 0.336 | 0.471 | −0,194 |
| Карта | 102 | 0.322 | 0.228 | 0.457 | 0.347 | 0.38 | 0.503 | −0,11 |
| Газета | 261 | 0.354 | 0.256 | 0.495 | 0.381 | 0.436 | 0.558 | −0,114 |
| Фотография с подписью | 179 | 0.257 | 0.181 | 0.374 | 0.286 | 0.494 | 0.616 | −0,088 |
| Постер | 87 | 0.287 | 0.199 | 0.413 | 0.316 | 0.448 | 0.57 | −0,097 |
| Реестр | 194 | 0.442 | 0.293 | 0.616 | 0.439 | 0.369 | 0.504 | −0.177 |
| Напечатанная переписка | 252 | 0.219 | 0.155 | 0.315 | 0.232 | 0.524 | 0.646 | −.083 |
Таблица 2: Производительность OCR до и после коррекции по типу документа. CER и WER рассчитывались по референсным транскрипциям; Отзыв именованных субъектов рассчитывался на основе вручную помеченых лиц, место, учреждение и даты. Delta WER — это после коррекции WER минус базовый WER.
| Тип документа | n | Точность, Базовая линия | Точность, Пост | Уверенность, Базовая линия | Уверенность, Пост | Δaccuracy |
| Рукописное письмо | 262 | 0.615 | 0.645 | 0.616 | 0.655 | 0.03 |
| Ledger | 263 | 0.707 | 0.749 | 0.725 | 0.767 | 0.042 |
| Карта | 102 | 0.765 | 0.902 | 0.801 | 0.899 | 0.137 |
| Газета | 261 | 0.716 | 0.843 | 0.728 | 0.83 | 0.127 |
| Фотография с подписью | 179 | 0.815 | 0.869 | 0.824 | 0.89 | 0.054 |
| Постер | 87 | 0.771 | 0.903 | 0.792 | 0.889 | 0.132 |
| Реестр | 194 | 0.687 | 0.793 | 0.701 | 0.787 | 0.106 |
| Напечатанная переписка | 252 | 0.796 | 0.791 | 0.804 | 0.82 | -0.005 |
Таблица 3: Производительность визуальной классификации документов до и после архивно-специфической настройки. Таблица показывает размер выборки, точность топ-1, среднюю апостериорную уверенность и изменение точности в зависимости от типа документа. Диагностические данные включают 20 эпохальных рядов с макро-F1, взвешенным F1, ROC-AUC, PR-AUC, потерей в тренировках, потерей валидации, точностью обучения и точностью валидации.
| Полнота | Полнота | Населённые поля | Населённые поля | Тематика Матч | Тематика Матч | Δ полнота | Δ Тематический заголовок Матч |
| (Базовая линия) | (Пост) | (Базовая линия) | (Пост) | (Базовая линия) | (Пост) | | |
| 0.534 | 0.868 | 4.274 | 8.584 | 0.643 | 0.821 | 0.334 | 0.178 |
| 0.607 | 0.898 | 4.838 | 8.709 | 0.672 | 0.841 | 0.291 | 0.169 |
| 0.68 | 0.927 | 5.426 | 9.095 | 0.686 | 0.849 | 0.247 | 0.163 |
| 0.686 | 0.922 | 5.48 | 8.953 | 0.694 | 0.854 | 0.236 | 0.16 |
Таблица 4: Обогащение метаданных по историческим периодам. Полнота — это доля применимых основных описательных полей, заполняемых для записи; населенные поля указываются как средние подсчета; Совпадение по теме указывает, подтверждают ли данные на уровне записей хотя бы одну метку с контролируемым словарным запасом.
| Системный рычаг | n запросов | P@10 | R@10 | nDCG@10 | Пора начать с первой релевантностью Результат(ы) | Успешный коэффициент поиска |
| | | | | | (%) |
| Исходная линия | 420 | 0.394 | 0.238 | 0.392 | 156.079 | 5 |
| Коррекция OCR | 420 | 0.484 | 0.346 | 0.475 | 124.261 | 30.2 |
| Визуальная классификация | 420 | 0.49 | 0.302 | 0.478 | 131.985 | 22.9 |
| Обогащение метаданных | 420 | 0.507 | 0.347 | 0.513 | 117.474 | 38.3 |
| Полноценный мультимодаль | 420 | 0.624 | 0.492 | 0.634 | 58.485 | 95.5 |
Таблица 5: Эффективность поиска для пяти экспериментальных системных рук. P@10, R@10, nDCG@10, время до первого релевантного результата и успешная скорость поиска были рассчитаны по бенчмарку из 420 запросов в условиях согласованного запроса.