Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Исследовательская статья

Воспроизводимый мультимодальный рабочий процесс искусственного интеллекта для обнаружения исторических цифровых архивов

71 просмотров

DOI:

10.3791/71698

7 августа 2026 г.

В этой статье

Краткое содержание

Здесь мы представляем протокол для улучшения обнаружения в исторических цифровых архивах путём интеграции оптического распознавания символов после коррекции, визуальной классификации документов, обогащения метаданных и оценки поиска в аудируемый рабочий процесс.

Аннотация

Исторические цифровые архивы становятся всё более доступными для поиска, но обнаружение остаётся ограниченным, когда ошибки оптического распознавания символов, визуально разнородные типы документов и редкие метаданные обрабатываются отдельно. Целью данного исследования было разработать воспроизводимый протокол для оценки того, может ли консервативный мультимодальный рабочий процесс искусственного интеллекта улучшить архивный поиск без замены архивного обзора. Был собран корпус из 1600 оцифрованных архивных записей из восьми классов документов, и для сравнения пяти условий поиска использовался бенчмарк из 420 запросов: базовое индексирование, коррекция только оптического распознавания символов, только визуальная классификация, обогащение метаданных и полная мультимодальная интеграция. Результаты на уровне записей включали уровень ошибок символов (CER), уровень ошибок в словах (WER), воспоминание именованных объектов, точность классификации типов документов, уверенность предсказаний, полноту метаданных и совпадение заголовков предмета. Результаты на уровне запроса включали P@10, R@10, nDCG@10, время до первого релевантного результата и процент успешного поиска. Коррекция оптического распознавания символов наиболее сильно снизила WER для рукописных писем, бухгалтерских книг и реестров; визуальная настройка улучшила в основном точность классификации карт, плакатов, газет и реестрских книг; а обогащение метаданных увеличило полноту во всех исторических периодах. Полное мультимодальное условие достигло максимальной производительности поиска (P@10 = 0,624, R@10 = 0,492, nDCG@10 = 0,634) и сократило среднее время до первого релевантного результата с 156,079 с до 58,485 с. Эти результаты поддерживают модульный, поддающийся аудиту рабочий процесс, в котором текст, изображение и описательные сигналы комбинируются под явными порогами и человеческой проверкой.

Введение

Цифровые архивы быстро расширились и теперь поддерживают исследования в области истории, культурного наследия, государственного управления и цифровых гуманитарных наук. Однако доступ остаётся неравномерным, поскольку архивные записи часто сочетают в себе ухудшённый оптический вывод распознавания символов, визуально разнообразные макеты страниц, непоследовательные методы каталогизации и исторически изменчивые имена, места и учреждения. Эти ограничения влияют не только на качество транскрипции, но и на извлечение, фильтрацию и повторное использование оцифрованныхколлекций 1,2,3,4,5,6,7.

Существующие исследования искусственного интеллекта документов и архивного поиска улучшили отдельные компоненты, такие как оптическое распознавание символов после коррекции, классификация документов-изображений, нормализация метаданных, моделирование тем, вложение слов, нейронный поиск и практика управленияданными 8,9,10,11,12,13,14,15, 16,17,18,19,20,21,22,23,24,25. Тем не менее, многие архивные системы по-прежнему оценивают эти компоненты отдельно, что затрудняет определение, улучшает ли объединённый рабочий процесс обнаружение в реальных условиях поиска. Методологический пробел, который здесь устраняется, заключается в отсутствии воспроизводимого, поддающегося аудиту протокола, который связывает модули текста, изображений и метаданных для получения результатов в одном архивном рабочем процессе.

Основной целью было проверить, обеспечивают ли коррекция оптического распознавания символов, визуальная классификация документов и обогащение метаданных с ограничением правил дополняющие улучшения при оценке по одному и тому же ориентиру поиска.

Мы выдвинули гипотезу, что полное мультимодальное условие будет превосходить каждое отдельное условие, поскольку архивное обнаружение зависит от взаимодействия читаемого текста, визуально интерпретируемой структуры документа и поисковых описательных метаданных. Рабочий процесс был спроектирован консервативно: автоматизированные результаты могли обогащать индексы поиска, но прогнозы с низкой доверительностью отмечались для проверки, а не использовались как авторитетное архивное описание.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

В этом исследовании использовались оцифрованные архивные записи и имитированные запросы поиска в качестве единиц анализа. Архивные хранилища могут ограничивать доступ к чувствительным или культурно ограниченным записям. Соблюдайте правила доступа к репозиторию, процедуры институциональной безопасности данных и требования по деидентификации перед обработкой или распространением любых записей. Опасные химические, биологические, острые, радиоактивные или другие регулируемые лабораторные отходы не создавались в результате этого цифрового рабочего процесса.

Проектирование исследования и строительство корпуса

На рисунке 1 представлен полный рабочий процесс исследования, включая конструирование корпуса, маркировку ссылок, предварительную обработку изображений, генерацию и посткоррекцию OCR, визуальную классификацию, обогащение метаданных, построение индекса, оценку поиска, статистический анализ и упаковку воспроизводимости.

Строительство корпуса проводилось с 15 января по 30 апреля 2025 года, затем проектирование системы и отладка с 1 мая по 31 октября 2025 года. Корпус содержал 1600 оцифрованных архивных документов, отобранных из восьми хранилищ, представляющих государственные, городские, религиозные, музейные, университетские и библиотечные системы. Рамка для отбора проб была стратифицирована по классу хранилища и документов, чтобы сохранить архивную гетерогенность между рукописными письмами, бухгалтерскими книгами, картами, газетами, фотографиями с подписями, плакатами, реестрскими книгами и напечатанной перепиской.

Для каждой кандидатской записи журнал выбора фиксировал идентификатор репозитория или коллекции, идентификатор каталога, класс документа, приблизительный исторический период, контекст доминирующего языка, доступный формат изображения, разрешение изображения, количество страниц и исходные описательные поля. Включение требовало всего следующего: стабильного идентификатора каталога; как минимум одно изображение страницы в формате TIFF, JPEG или PNG; разрешение исходного изображения не менее 150 dpi; читаемый текстовый, табличный или документально-структурный контент; и назначение одному из восьми заранее определённых классов документов. Критериями исключения были точные дубликаты, пустые обратные страницы, изображения, обрезанные до такой степени, что отсутствовало более 30% области с текстом, а также записи, признанные нечитаемыми после ручной проверки.

Бенчмарк поиска содержал 420 коротких запросов на естественном языке, сгенерированных с 5 по 20 августа 2025 года. Генерация запросов следовала воспроизводимому шаблону: потребности в информации кандидатов отбирались из людей, учреждений, мест, дат, профессий, событий и тематических тем; Каждый запрос нормализовался до 2–9 слов; и соответствующие целевые записи были выявлены до сравнения систем. Каждый запрос оценивался при пяти условиях поиска, что дало 2 100 совпадающих наблюдений по состоянию запроса.

Эталонная маркировка и контроль качества

Маркировка справочных материалов проводилась с 1 мая по 15 июля 2025 года тремя аннотаторами: двумя сотрудниками архивного отдела с опытом в описательной каталогизации и одним исследователем цифровых гуманитарных наук, имеющим опыт оценки исторических документов. Руководство по аннотациям определяло классы документов, категории языка и контекста, исторические периоды, поля полноты метаданных, категории именованных сущностей и правила выбора регионов оценки OCR.

Для оценки OCR аннотаторы выбирали репрезентативные области с текстом, которые включали заголовки, имена, даты, институциональные термины, маргинальные заметки, табличные записи и, при наличии, шумные области макета. Если страница содержала несколько текстовых областей, выбранный регион должен был быть релевантным для поиска и содержать достаточно символов для вычисления CER и WR. Разногласия сначала были урегулированы в ходе обсуждения между двумя основными аннотаторами; Неразрешённые дела рассматривались исследователем цифровых гуманитарных наук.

Контроль качества использовал случайную подгруппу 12% записей. Межаннотаторское соглашение для основного типа документа было по kappa Коэна = 0,86, что подтверждает существенное согласие. Журнал рассмотрения сохранил оригинальные и окончательные метки, категорию разногласий и причину разрешения, чтобы будущие пользователи могли проверять определения классов и крайние случаи.

Предварительная обработка изображений

Все изображения обрабатывались на уровне записи с использованием Python 3.11.8 с OpenCV 4.9.0, Pillow 10.3.0 и NumPy 1.26.4. Каждая входная страница преобразовывалась в 8-битные оттенки серого, если только цвет не содержал семантическую информацию, такую как карты, плакаты, марки или цветные аннотации. Смещение оценивалось с помощью проекционных профилей и обнаружения линии Хафа; Deskewing применялся только при абсолютном углу смещения 1,5 градуса и ограничивался 8,0 градуса для предотвращения искажений.

Усиление контраста использовало адаптивную гистограммную эквализацию с ограниченным контрастом с clipLimit = 2.0 и tileGridSize = 8 × 8. Медианный фильтр с ядром 3 × 10−23 применялся только тогда, когда оценочное отношение фонового шума превышало 0,35. Изображения, полученные с частотой 150–299 dpi, были передискретированы до 300 dpi для оптического распознавания символов; Изображения, уже имевшие 300 dpi и выше, не увеличивались. Не использовалось никакое суперразрешение, генеративное восстановление или галлюцинации содержания.

Протяжение, затемнение краёв, неровная текстура бумаги, маргинальные штампы, почерк, линейки и границы таблиц сохранялись, если только это не мешало выбору региона OCR. Это правило сохраняло архивные доказательства, при этом достаточно стандартизировало входные изображения для воспроизводимого OCR и классификации.

Генерация баз OCR и посткоррекция

Базовый OCR был сгенерирован с помощью Tesseract OCR 5.3.0. Основной языковой пакет выбирался из языка каталога и видимого письма; Многоязычное декодирование включалось, если язык каталога и скрипт страницы не совпадали. Выходы OCR группировались на уровне записи и хранились с идентификаторами страниц, уверенностью в OCR, координатами ограничивающих рамок при доступности и сырым текстом до исправления.

Коррекция после OCR использовала трёхступенчатую консервативную процедуру. Во-первых, нормализация на уровне символов исправила частые путаницы в историческом распознавании, включая лигатуры, замены длинных s/short-s, фрагментированную пунктуацию и подстановку цифрами. Во-вторых, коррекция на уровне жетонов использовала кандидатов по дистанции редактирования и частотному ранжированию из архивно-специфического лексикона личных имён, топонимов, учреждений, административных терминов и исторических вариантов написания. В-третьих, последовательность на основе правил проверяет проверенные именованные сущности и даты на соответствие с доказательствами из контекста и метаданных.

Кандидаты на замену принимались только тогда, когда уверенность в апостериорной коррекции превышала 0,80; Замена именных организаций требовала уверенности не менее 0,85. Кандидаты ниже порога сохранялись в виде OCR-текста, но помечались для рассмотрения. CER рассчитывался как расстояние редактирования Левенштейна, делённое на количество символов в референсной транскрипции. WER использовал ту же формулу на уровне токенов. Воспоминание именованных сущностей рассчитывалось как правильно распознанные эталонные сущности, делённые на все опорные сущности в выбранной области оценки.

Визуальная классификация документов

Модуль визуальной классификации присваивал каждой записи один из восьми классов архивных документов: рукописное письмо, бухгалтерская книга, карта, газета, фотография с подписью, плакат, реестр и напечатанная переписка. Предсказанный тип документа использовался как сигнал поиска и фильтрации, а не как авторитетная замена архивной каталогизации.

Модель была реализована в PyTorch 2.2.2 и torchvision 0.17.2 с использованием предварительно обученной ImageNet основной системы EfficientNet-B3. Миниатюры на уровне записи были изменены до 384 x 384 пикселей. Для снижения утечек записи были разделены по репозиториям и классам документов на обучающие, валидационные и тестовые наборы в соотношении 70:15:15, что соответствует примерно 1 120, 240 и 240 записям.

Обучение использовало AdamW с начальной скоростью обучения = 1 × 10-4, снижением веса = 1 × 10−2, размером партии = 16, сглаживанием метки = 0,05, и ранней остановкой, когда потеря валидации не улучшалась в течение пяти последовательных эпох. Горизонтальное переворачивание было отключено, потому что зеркальные архивные макеты нереалистичны. Дополнение ограничивалось вращением от -3 до +3 градусов и вариацией яркости в пределах ±10%.

Эпохальная диагностика моделей суммирована в 20 обучающих строк, каждая из которых содержит потери в обучении, потери в валидации, точность обучения, точность валидации, макро-F1, взвешенно-F1, ROC-AUC и PR-AUC.

Рабочий процесс обогащения метаданных

Обогащение метаданных было разработано для повышения обнаружимости при сохранении архивного консерватизма. Существующие значения каталога сохранялись, если только не содержали явных противоречий, таких как невозможная дата или конфликт типов документов, подтверждённый как OCR, так и визуальными доказательствами. Поля обогащения кандидатов включали нормализованное название, тип документа, приблизительную дату, упоминания учреждения, географические упоминания, личные имена, тематические заголовки и ключевые слова.

Приоритет доказательств следовал фиксированному порядку: (1) существующие метаданные каталога, (2) скорректированный вывод OCR и (3) визуальное предсказание типа документа. Для предметных заголовков использовалось контролируемое сопоставление словарного запаса, а семантическое разложение ближайших соседей с преобразователями предложений 2.7.0 применялось только при косинусном сходстве не менее 0.72. Нормализация даты требовала уверенности не менее 0,85 или согласованности между OCR и метаданными. Каждое автоматически добавляемое поле сохраняло свой источник, уверенность и идентификатор правила.

Полнота метаданных определялась как количество заполненных основных описательных полей, делённое на количество применимых основных полей для этой записи. Совпадение по теме определялось как наличие хотя бы одной метки с контролируемым словарным запасом, подкреплённой данными на уровне записи и признанной релевантной для категории запроса.

Конструкция системы поиска

Было построено пять индексов поиска для выделения вклада модулей: базовое индексирование; только коррекция оптического распознавания символов; только визуальная классификация; только обогащение метаданных; и полная мультимодальная интеграция. Все индексы были созданы в поисковом программном обеспечении, указанном в Таблице материалов (версия 8.11.1) на уровне записи. Параметры BM25 были зафиксированы на k1 = 1,2 и b = 0,75 до оценки.

Базовый индекс использовал оригинальные метаданные и исходный OCR-текст. Условие OCR заменяло базовый OCR на исправленный OCR. Визуальное условие добавило априоры типа документа и повышение рейтинга с учётом класса. Условие метаданных добавляло обогащённые описательные поля. Полное мультимодальное условие сочетало скорректированные OCR, визуальные априоры и обогащённые метаданные. Веса полей фиксировались до тестирования: нормализованный заголовок = 3.0, тематические заголовки = 2.5, упоминания лица и учреждения = 2.2, упоминания места = 2.0, тип документа = 1.8, исправленный основной текст OCR = 1.0, и базовый основной текст OCR = 0.8, где это применимо.

Точное сопоставление фраз было включено для цитируемых запросов. Расширение запросов было разрешено только в условиях обогащения метаданных и полного мультимодального режима и ограничивалось принятыми синонимами контролируемого словарного запаса и вариантами предметных заголовков. Журналы поиска были созданы с 25 по 28 августа 2025 года в контейнерной среде Linux, указанной в Таблице материалов, с фиксированными семенами и замороженными индексными конфигурациями.

Проектирование запросов и показатели результатов

420 запросов представляли собой распространённые поисковые поведения в архиве, а не только по ключевым словам бенчмарковые запросы. Темы включали личные имена, учреждения, места, даты и диапазоны дат, профессии, события и тематические темы. Каждый запрос хранился с его нормализованной формулировкой, целевой набором записей, категорией темы-запросами и уровнем сложности.

Сложность оценивалась перед извлечением с учётом неоднозначности цели, лексической специфичности и ожидаемой частоты выражения. Суммарные баллы ниже 0,40 классифицировались как низкие сложности, от 0,40 до 0,69 — как средняя сложность, а баллы 0,70 и выше — как с высокой сложностью. Оценки релевантности были завершены до сравнения системы и затем сверялись с окончательной коллекцией.

Результаты поиска включали P@10, R@10, nDCG@10, время до первого релевантного результата и успешный поисковый показатель. P@10 была доля из десяти лучших записей, признанных релевантными. R@10 — доля всех известных релевантных записей, найденных в топ-10. nDCG@10 использовали градуированную релевантность, где это было возможно, и бинарную релевантность в остальном. Время до первого релевантного результата измерялось от отправки запроса до появления первой релевантной записи в ранжированном результате. Успешный поиск определялся как минимум один релевантный результат среди топ-10 записей.

Сбор статистики

Все анализы проводились с использованием версий программного обеспечения, указанных в Таблице материалов. Непрерывные результаты суммировались как среднее ± SD при приблизительном симметричном состоянии, а в противном случае — как медиана с межквартильным диапазоном. Категориальные результаты суммировались в виде подсчёта и процентов.

Нормальность парных различий оценивалась с помощью графиков теста Шапиро-Уилка и распределения. OCR и метаданные до/после сравнивались с парными тестостеронными тестами, когда парные различия были примерно нормальными, а в противном случае — с тестами с знакомым рангом Уилкоксона. Классификационные характеристики до и после тонкой настройки сравнивались с помощью теста МакНемара на паре правильных/неправильных меток. Совпадающие результаты забора из нескольких рук сравнивались с тестом Фридмана, за которыми следовали скорректированные по Хольму парные тесты Уилкоксона с знаковым рангом.

Все статистические тесты были двусторонними, и P < 0,05 считался статистически значимым. Доверительные интервалы были оценены с использованием 2000 перевыборок bootstrap с фиксированным случайным семем на 2025 году. Эффекты описывались в виде средних различий, совпадения шансов или ранговых размеров эффектов в зависимости от типа результата.

Воспроизводимость, объем и доступность ресурсов

Все параметры конвейера были зафиксированы до тестирования на поиск. Ни один параметр не был оптимизирован на хранящемся эталонном эталонном эталонном результате. Конфигурационные файлы, управляемые словаря, лексиконные таблицы, шаблоны запросов, отображения полей, руководства по аннотациям, статистические скрипты и скрипты генерации фигурок поддерживались в системе контроля версий, указанной в Таблице материалов с случайным началом 2025.

Для поддержки независимой валидации рабочая тетрадь по исходным данным включает де-идентификационную таблицу из 1600 записей с 17 переменными, используемыми для оптического распознавания символов, метаданных и анализа визуальной классификации. Производные таблицы 1, Таблицы 2, Таблицы 3, Таблицы 4 и Таблицы 5, сводки рисунков и источников, определения бенчмарков-запросов, резюме суждений по релевантности, суррогаты для поиска журнала, диагностика обучения, категории лексиконов, правила сопоставления словарного запаса и поля для руководства по аннотациям предоставляются в виде отдельных загружаемых таблиц или файлов материалов, где это применимо. Материалы, которые не могут быть публично распространены из-за ограничений репозитория, представлены в виде деидентифицированных полей метаданных и воспроизводимых выборочных полей.

Этот протокол оценивает поисково-ориентированное открытие, а не истинность исторических утверждений. Он не заменяет оценку архивариуса, оценку происхождения, проверку конфиденциальности или доступ к репозиториям.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Коррекция OCR улучшила транскрипцию, особенно в рукописных и табличных записях

Коррекция оптического распознавания символов улучшила качество транскрипции во всех восьми классах архивных документов (n = 1 600 записей). Средний WER снизился с 0,529 ± 0,172 до 0,384 ± 0,123, при среднем парном изменении −0,144 (95% ДИ, −0,149 до −0,139; Уилкоксон получил звание P < 0.001). Средний CER снизился с 0,377 ± 0,126 до 0,258 ± 0,086, при средн...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Этот протокол демонстрирует, что обнаружение в исторических цифровых архивах улучшалось наибольше, когда коррекция OCR, визуальное понимание документов и консервативное обогащение метаданных оценивались как связанные компоненты поиска, а не как отдельные технические улучшения. Наибольшие приросты OCR наблюдались в рукописных, табличных и реестровых материалах, что подтверждает ценность посткоррекции для классов документов, где базовое распознавание наименее слабое. В то же время остаточн...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Авторам нечего раскрывать.

Благодарности

Авторы искренне благодарят двух опытных сотрудников архивного отдела и профессионального исследователя цифровых гуманитарных наук за ценную помощь в аннотировании текста и контроле качества. Это исследование было финансово поддержано Планом проекта по науке и технологиям Провинциального архива провинции Цзянсу (Грант No 2024-9) для создания интеллектуальной системы устных архивов на основе речи, а также Планом развития традиционной китайской медицины провинции Цзянсу (Грант No MS2025025) для изучения наследования и развития школ ТКМ с архивной точки зрения.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
PythonPython Software Foundationv3.11.8; https://www.python.org/Сценарии рабочих процессов, обработка данных, коррекция оптического распознавания символов после обработки и статистическая поддержка
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/Статистический анализ и создание конечных фигур
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseractБазовое создание оптического распознавания символов
Языковые пакеты TesseractTesseract OCR ProjectЯзыковые пакеты, специфичные для исследования; https://github.com/tesseract-ocr/tessdataОсновное и смешанное расшифровывание оптического распознавания символов
OpenCVOpenCV Teamv4.9.0; https://opencv.org/Дескевинг, оценка шума и предварительная обработка изображений
PillowPython Imaging Library contributorsv10.3.0; https://python-pillow.org/Ввод/вывод изображений и нормализация формата
NumPyNumPy developersv1.26.4; https://numpy.org/Рассчитанные массивы для обработки изображений и метрик
pandaspandas development teamv2.2.2; https://pandas.pydata.org/Обработка табличных данных и экспортирование сводок
SciPySciPy developersv1.13.1; https://scipy.org/Статистические тесты и числовые утилиты
statsmodelsstatsmodels developersv0.14.2; https://www.statsmodels.org/Статистическое моделирование и поддержка сравнения пар
scikit-learnscikit-learn developersv1.4.2; https://scikit-learn.org/Метрики классификации, диагностика ROC/PR и утилиты валидации
rapidfuzzMax Bachmann и соавторыv3.9.0; https://github.com/rapidfuzz/RapidFuzzРанжирование кандидатов по расстоянию редактирования для корректировки оптического распознавания
spaCyExplosion AIv3.7.4; https://spacy.io/Обработка именованных сущностей с использованием настраиваемых лексиконов
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/Обучение классификатора визуальных документов
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/Реализация EfficientNet-B3 и преобразования изображений
Опора EfficientNet-B3torchvision / предварительно обученные веса ImageNetEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.htmlОпора для классификации визуальных документов
sentence-transformersUKP Lab / экосистема Hugging Facev2.7.0; https://www.sbert.net/Семантическое расширение для кандидатов с контролируемым словарным запасом
Поисковый движокElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchИндексация, поиск и ранжирование BM25
Контейнерный движокDocker Inc.Docker v26.1.1; https://www.docker.com/Контейнеризированная среда для поиска
Операционная система LinuxCanonicalUbuntu 22.04 LTS; https://ubuntu.com/Фиксированная операционная среда для поисковых задач
Система контроля версийGit projectGit v2.44.0; https://git-scm.com/Контроль версий для конфигурации, словарных запасов, сценариев и кода фигур
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/Рендеринг фигур на основе R
MatplotlibMatplotlib developersv3.8.4; https://matplotlib.org/Дополнительная визуализация и графики для контроля качества
Руководство по аннотациямАвторы5 разделов аннотаций; 8 меток классов документов; регионы OCR; метки сущностей; суждения о релевантности; правила разбирательстваОпределения классов документов, регионов OCR, сущностей, суждений о релевантности и разбирательства
Лексикон OCR, специфичный для архиваАвторы6 категорий лексикона: варианты имён, названия мест, названия учреждений, шаблоны дат, административные термины, аббревиатурыИмена, места, учреждения, административные термины и варианты написания
Сопоставление контролируемого словарного запасаАвторы / архивные репозитории5 правил сопоставления, связывающих сущности OCR, визуальный класс, ключевые слова заголовка, охват дат и тему запроса с полями метаданныхСопоставление предметных заголовков и семантическое расширение
Бенчмарк-набор запросовАвторы420 бенчмарк-запроса; 6 тем запросов; 3 уровня сложности; 8 целевых классов документов; 4 исторические периоды; 6 языковых контекстовБенчмарк поиска по пяти системным ветвям
Суждения о релевантностиАвторы / аннотаторы2100 строк запрос-система; 420 запросов x 5 системных ветвей; релевантные общие суммы, релевантные в топ-10, оценки релевантности и флаги успехаЭталон для P@10, R@10, nDCG@10 и успешной скорости поиска
Диагностика тренировкиАвторы20 эпох; потери на обучении; потери на валидации; точность обучения; точность валидации; макро-F1; взвешенная

Ссылки

  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги

234234OCR