Исследовательская статья

Воспроизводимый мультимодальный рабочий процесс искусственного интеллекта для обнаружения исторических цифровых архивов

DOI:

10.3791/71698

7 августа 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Здесь мы представляем протокол для улучшения обнаружения в исторических цифровых архивах путём интеграции оптического распознавания символов после коррекции, визуальной классификации документов, обогащения метаданных и оценки поиска в аудируемый рабочий процесс.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Исторические цифровые архивы становятся всё более доступными для поиска, но обнаружение остаётся ограниченным, когда ошибки оптического распознавания символов, визуально разнородные типы документов и редкие метаданные обрабатываются отдельно. Целью данного исследования было разработать воспроизводимый протокол для оценки того, может ли консервативный мультимодальный рабочий процесс искусственного интеллекта улучшить архивный поиск без замены архивного обзора. Был собран корпус из 1600 оцифрованных архивных записей из восьми классов документов, и для сравнения пяти условий поиска использовался бенчмарк из 420 запросов: базовое индексирование, коррекция только оптического распознавания символов, только визуальная классификация, обогащение метаданных и полная мультимодальная интеграция. Результаты на уровне записей включали уровень ошибок символов (CER), уровень ошибок в словах (WER), воспоминание именованных объектов, точность классификации типов документов, уверенность предсказаний, полноту метаданных и совпадение заголовков предмета. Результаты на уровне запроса включали P@10, R@10, nDCG@10, время до первого релевантного результата и процент успешного поиска. Коррекция оптического распознавания символов наиболее сильно снизила WER для рукописных писем, бухгалтерских книг и реестров; визуальная настройка улучшила в основном точность классификации карт, плакатов, газет и реестрских книг; а обогащение метаданных увеличило полноту во всех исторических периодах. Полное мультимодальное условие достигло максимальной производительности поиска (P@10 = 0,624, R@10 = 0,492, nDCG@10 = 0,634) и сократило среднее время до первого релевантного результата с 156,079 с до 58,485 с. Эти результаты поддерживают модульный, поддающийся аудиту рабочий процесс, в котором текст, изображение и описательные сигналы комбинируются под явными порогами и человеческой проверкой.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Цифровые архивы быстро расширились и теперь поддерживают исследования в области истории, культурного наследия, государственного управления и цифровых гуманитарных наук. Однако доступ остаётся неравномерным, поскольку архивные записи часто сочетают в себе ухудшённый оптический вывод распознавания символов, визуально разнообразные макеты страниц, непоследовательные методы каталогизации и исторически изменчивые имена, места и учреждения. Эти ограничения влияют не только на качество транскрипции, но и на извлечение, фильтрацию и повторное использование оцифрованныхколлекций 1,2,3,4,5,6,7.

Существующие исследования искусственного интеллекта документов и архивного поиска улучшили отдельные компоненты, такие как оптическое распознавание символов после коррекции, классификация документов-изображений, нормализация метаданных, моделирование тем, вложение слов, нейронный поиск и практика управленияданными 8,9,10,11,12,13,14,15, 16,17,18,19,20,21,22,23,24,25. Тем не менее, многие архивные системы по-прежнему оценивают эти компоненты отдельно, что затрудняет определение, улучшает ли объединённый рабочий процесс обнаружение в реальных условиях поиска. Методологический пробел, который здесь устраняется, заключается в отсутствии воспроизводимого, поддающегося аудиту протокола, который связывает модули текста, изображений и метаданных для получения результатов в одном архивном рабочем процессе.

Основной целью было проверить, обеспечивают ли коррекция оптического распознавания символов, визуальная классификация документов и обогащение метаданных с ограничением правил дополняющие улучшения при оценке по одному и тому же ориентиру поиска.

Мы выдвинули гипотезу, что полное мультимодальное условие будет превосходить каждое отдельное условие, поскольку архивное обнаружение зависит от взаимодействия читаемого текста, визуально интерпретируемой структуры документа и поисковых описательных метаданных. Рабочий процесс был спроектирован консервативно: автоматизированные результаты могли обогащать индексы поиска, но прогнозы с низкой доверительностью отмечались для проверки, а не использовались как авторитетное архивное описание.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании использовались оцифрованные архивные записи и имитированные запросы поиска в качестве единиц анализа. Архивные хранилища могут ограничивать доступ к чувствительным или культурно ограниченным записям. Соблюдайте правила доступа к репозиторию, процедуры институциональной безопасности данных и требования по деидентификации перед обработкой или распространением любых записей. Опасные химические, биологические, острые, радиоактивные или другие регулируемые лабораторные отходы не создавались в результате этого цифрового рабочего процесса.

Проектирование исследования и строительство корпуса

На рисунке 1 представлен полный рабочий процесс исследования, включая конструирование корпуса, маркировку ссылок, предварительную обработку изображений, генерацию и посткоррекцию OCR, визуальную классификацию, обогащение метаданных, построение индекса, оценку поиска, статистический анализ и упаковку воспроизводимости.

Строительство корпуса проводилось с 15 января по 30 апреля 2025 года, затем проектирование системы и отладка с 1 мая по 31 октября 2025 года. Корпус содержал 1600 оцифрованных архивных документов, отобранных из восьми хранилищ, представляющих государственные, городские, религиозные, музейные, университетские и библиотечные системы. Рамка для отбора проб была стратифицирована по классу хранилища и документов, чтобы сохранить архивную гетерогенность между рукописными письмами, бухгалтерскими книгами, картами, газетами, фотографиями с подписями, плакатами, реестрскими книгами и напечатанной перепиской.

Для каждой кандидатской записи журнал выбора фиксировал идентификатор репозитория или коллекции, идентификатор каталога, класс документа, приблизительный исторический период, контекст доминирующего языка, доступный формат изображения, разрешение изображения, количество страниц и исходные описательные поля. Включение требовало всего следующего: стабильного идентификатора каталога; как минимум одно изображение страницы в формате TIFF, JPEG или PNG; разрешение исходного изображения не менее 150 dpi; читаемый текстовый, табличный или документально-структурный контент; и назначение одному из восьми заранее определённых классов документов. Критериями исключения были точные дубликаты, пустые обратные страницы, изображения, обрезанные до такой степени, что отсутствовало более 30% области с текстом, а также записи, признанные нечитаемыми после ручной проверки.

Бенчмарк поиска содержал 420 коротких запросов на естественном языке, сгенерированных с 5 по 20 августа 2025 года. Генерация запросов следовала воспроизводимому шаблону: потребности в информации кандидатов отбирались из людей, учреждений, мест, дат, профессий, событий и тематических тем; Каждый запрос нормализовался до 2–9 слов; и соответствующие целевые записи были выявлены до сравнения систем. Каждый запрос оценивался при пяти условиях поиска, что дало 2 100 совпадающих наблюдений по состоянию запроса.

Эталонная маркировка и контроль качества

Маркировка справочных материалов проводилась с 1 мая по 15 июля 2025 года тремя аннотаторами: двумя сотрудниками архивного отдела с опытом в описательной каталогизации и одним исследователем цифровых гуманитарных наук, имеющим опыт оценки исторических документов. Руководство по аннотациям определяло классы документов, категории языка и контекста, исторические периоды, поля полноты метаданных, категории именованных сущностей и правила выбора регионов оценки OCR.

Для оценки OCR аннотаторы выбирали репрезентативные области с текстом, которые включали заголовки, имена, даты, институциональные термины, маргинальные заметки, табличные записи и, при наличии, шумные области макета. Если страница содержала несколько текстовых областей, выбранный регион должен был быть релевантным для поиска и содержать достаточно символов для вычисления CER и WR. Разногласия сначала были урегулированы в ходе обсуждения между двумя основными аннотаторами; Неразрешённые дела рассматривались исследователем цифровых гуманитарных наук.

Контроль качества использовал случайную подгруппу 12% записей. Межаннотаторское соглашение для основного типа документа было по kappa Коэна = 0,86, что подтверждает существенное согласие. Журнал рассмотрения сохранил оригинальные и окончательные метки, категорию разногласий и причину разрешения, чтобы будущие пользователи могли проверять определения классов и крайние случаи.

Предварительная обработка изображений

Все изображения обрабатывались на уровне записи с использованием Python 3.11.8 с OpenCV 4.9.0, Pillow 10.3.0 и NumPy 1.26.4. Каждая входная страница преобразовывалась в 8-битные оттенки серого, если только цвет не содержал семантическую информацию, такую как карты, плакаты, марки или цветные аннотации. Смещение оценивалось с помощью проекционных профилей и обнаружения линии Хафа; Deskewing применялся только при абсолютном углу смещения 1,5 градуса и ограничивался 8,0 градуса для предотвращения искажений.

Усиление контраста использовало адаптивную гистограммную эквализацию с ограниченным контрастом с clipLimit = 2.0 и tileGridSize = 8 × 8. Медианный фильтр с ядром 3 × 10−23 применялся только тогда, когда оценочное отношение фонового шума превышало 0,35. Изображения, полученные с частотой 150–299 dpi, были передискретированы до 300 dpi для оптического распознавания символов; Изображения, уже имевшие 300 dpi и выше, не увеличивались. Не использовалось никакое суперразрешение, генеративное восстановление или галлюцинации содержания.

Протяжение, затемнение краёв, неровная текстура бумаги, маргинальные штампы, почерк, линейки и границы таблиц сохранялись, если только это не мешало выбору региона OCR. Это правило сохраняло архивные доказательства, при этом достаточно стандартизировало входные изображения для воспроизводимого OCR и классификации.

Генерация баз OCR и посткоррекция

Базовый OCR был сгенерирован с помощью Tesseract OCR 5.3.0. Основной языковой пакет выбирался из языка каталога и видимого письма; Многоязычное декодирование включалось, если язык каталога и скрипт страницы не совпадали. Выходы OCR группировались на уровне записи и хранились с идентификаторами страниц, уверенностью в OCR, координатами ограничивающих рамок при доступности и сырым текстом до исправления.

Коррекция после OCR использовала трёхступенчатую консервативную процедуру. Во-первых, нормализация на уровне символов исправила частые путаницы в историческом распознавании, включая лигатуры, замены длинных s/short-s, фрагментированную пунктуацию и подстановку цифрами. Во-вторых, коррекция на уровне жетонов использовала кандидатов по дистанции редактирования и частотному ранжированию из архивно-специфического лексикона личных имён, топонимов, учреждений, административных терминов и исторических вариантов написания. В-третьих, последовательность на основе правил проверяет проверенные именованные сущности и даты на соответствие с доказательствами из контекста и метаданных.

Кандидаты на замену принимались только тогда, когда уверенность в апостериорной коррекции превышала 0,80; Замена именных организаций требовала уверенности не менее 0,85. Кандидаты ниже порога сохранялись в виде OCR-текста, но помечались для рассмотрения. CER рассчитывался как расстояние редактирования Левенштейна, делённое на количество символов в референсной транскрипции. WER использовал ту же формулу на уровне токенов. Воспоминание именованных сущностей рассчитывалось как правильно распознанные эталонные сущности, делённые на все опорные сущности в выбранной области оценки.

Визуальная классификация документов

Модуль визуальной классификации присваивал каждой записи один из восьми классов архивных документов: рукописное письмо, бухгалтерская книга, карта, газета, фотография с подписью, плакат, реестр и напечатанная переписка. Предсказанный тип документа использовался как сигнал поиска и фильтрации, а не как авторитетная замена архивной каталогизации.

Модель была реализована в PyTorch 2.2.2 и torchvision 0.17.2 с использованием предварительно обученной ImageNet основной системы EfficientNet-B3. Миниатюры на уровне записи были изменены до 384 x 384 пикселей. Для снижения утечек записи были разделены по репозиториям и классам документов на обучающие, валидационные и тестовые наборы в соотношении 70:15:15, что соответствует примерно 1 120, 240 и 240 записям.

Обучение использовало AdamW с начальной скоростью обучения = 1 × 10-4, снижением веса = 1 × 10−2, размером партии = 16, сглаживанием метки = 0,05, и ранней остановкой, когда потеря валидации не улучшалась в течение пяти последовательных эпох. Горизонтальное переворачивание было отключено, потому что зеркальные архивные макеты нереалистичны. Дополнение ограничивалось вращением от -3 до +3 градусов и вариацией яркости в пределах ±10%.

Эпохальная диагностика моделей суммирована в 20 обучающих строк, каждая из которых содержит потери в обучении, потери в валидации, точность обучения, точность валидации, макро-F1, взвешенно-F1, ROC-AUC и PR-AUC.

Рабочий процесс обогащения метаданных

Обогащение метаданных было разработано для повышения обнаружимости при сохранении архивного консерватизма. Существующие значения каталога сохранялись, если только не содержали явных противоречий, таких как невозможная дата или конфликт типов документов, подтверждённый как OCR, так и визуальными доказательствами. Поля обогащения кандидатов включали нормализованное название, тип документа, приблизительную дату, упоминания учреждения, географические упоминания, личные имена, тематические заголовки и ключевые слова.

Приоритет доказательств следовал фиксированному порядку: (1) существующие метаданные каталога, (2) скорректированный вывод OCR и (3) визуальное предсказание типа документа. Для предметных заголовков использовалось контролируемое сопоставление словарного запаса, а семантическое разложение ближайших соседей с преобразователями предложений 2.7.0 применялось только при косинусном сходстве не менее 0.72. Нормализация даты требовала уверенности не менее 0,85 или согласованности между OCR и метаданными. Каждое автоматически добавляемое поле сохраняло свой источник, уверенность и идентификатор правила.

Полнота метаданных определялась как количество заполненных основных описательных полей, делённое на количество применимых основных полей для этой записи. Совпадение по теме определялось как наличие хотя бы одной метки с контролируемым словарным запасом, подкреплённой данными на уровне записи и признанной релевантной для категории запроса.

Конструкция системы поиска

Было построено пять индексов поиска для выделения вклада модулей: базовое индексирование; только коррекция оптического распознавания символов; только визуальная классификация; только обогащение метаданных; и полная мультимодальная интеграция. Все индексы были созданы в поисковом программном обеспечении, указанном в Таблице материалов (версия 8.11.1) на уровне записи. Параметры BM25 были зафиксированы на k1 = 1,2 и b = 0,75 до оценки.

Базовый индекс использовал оригинальные метаданные и исходный OCR-текст. Условие OCR заменяло базовый OCR на исправленный OCR. Визуальное условие добавило априоры типа документа и повышение рейтинга с учётом класса. Условие метаданных добавляло обогащённые описательные поля. Полное мультимодальное условие сочетало скорректированные OCR, визуальные априоры и обогащённые метаданные. Веса полей фиксировались до тестирования: нормализованный заголовок = 3.0, тематические заголовки = 2.5, упоминания лица и учреждения = 2.2, упоминания места = 2.0, тип документа = 1.8, исправленный основной текст OCR = 1.0, и базовый основной текст OCR = 0.8, где это применимо.

Точное сопоставление фраз было включено для цитируемых запросов. Расширение запросов было разрешено только в условиях обогащения метаданных и полного мультимодального режима и ограничивалось принятыми синонимами контролируемого словарного запаса и вариантами предметных заголовков. Журналы поиска были созданы с 25 по 28 августа 2025 года в контейнерной среде Linux, указанной в Таблице материалов, с фиксированными семенами и замороженными индексными конфигурациями.

Проектирование запросов и показатели результатов

420 запросов представляли собой распространённые поисковые поведения в архиве, а не только по ключевым словам бенчмарковые запросы. Темы включали личные имена, учреждения, места, даты и диапазоны дат, профессии, события и тематические темы. Каждый запрос хранился с его нормализованной формулировкой, целевой набором записей, категорией темы-запросами и уровнем сложности.

Сложность оценивалась перед извлечением с учётом неоднозначности цели, лексической специфичности и ожидаемой частоты выражения. Суммарные баллы ниже 0,40 классифицировались как низкие сложности, от 0,40 до 0,69 — как средняя сложность, а баллы 0,70 и выше — как с высокой сложностью. Оценки релевантности были завершены до сравнения системы и затем сверялись с окончательной коллекцией.

Результаты поиска включали P@10, R@10, nDCG@10, время до первого релевантного результата и успешный поисковый показатель. P@10 была доля из десяти лучших записей, признанных релевантными. R@10 — доля всех известных релевантных записей, найденных в топ-10. nDCG@10 использовали градуированную релевантность, где это было возможно, и бинарную релевантность в остальном. Время до первого релевантного результата измерялось от отправки запроса до появления первой релевантной записи в ранжированном результате. Успешный поиск определялся как минимум один релевантный результат среди топ-10 записей.

Сбор статистики

Все анализы проводились с использованием версий программного обеспечения, указанных в Таблице материалов. Непрерывные результаты суммировались как среднее ± SD при приблизительном симметричном состоянии, а в противном случае — как медиана с межквартильным диапазоном. Категориальные результаты суммировались в виде подсчёта и процентов.

Нормальность парных различий оценивалась с помощью графиков теста Шапиро-Уилка и распределения. OCR и метаданные до/после сравнивались с парными тестостеронными тестами, когда парные различия были примерно нормальными, а в противном случае — с тестами с знакомым рангом Уилкоксона. Классификационные характеристики до и после тонкой настройки сравнивались с помощью теста МакНемара на паре правильных/неправильных меток. Совпадающие результаты забора из нескольких рук сравнивались с тестом Фридмана, за которыми следовали скорректированные по Хольму парные тесты Уилкоксона с знаковым рангом.

Все статистические тесты были двусторонними, и P < 0,05 считался статистически значимым. Доверительные интервалы были оценены с использованием 2000 перевыборок bootstrap с фиксированным случайным семем на 2025 году. Эффекты описывались в виде средних различий, совпадения шансов или ранговых размеров эффектов в зависимости от типа результата.

Воспроизводимость, объем и доступность ресурсов

Все параметры конвейера были зафиксированы до тестирования на поиск. Ни один параметр не был оптимизирован на хранящемся эталонном эталонном эталонном результате. Конфигурационные файлы, управляемые словаря, лексиконные таблицы, шаблоны запросов, отображения полей, руководства по аннотациям, статистические скрипты и скрипты генерации фигурок поддерживались в системе контроля версий, указанной в Таблице материалов с случайным началом 2025.

Для поддержки независимой валидации рабочая тетрадь по исходным данным включает де-идентификационную таблицу из 1600 записей с 17 переменными, используемыми для оптического распознавания символов, метаданных и анализа визуальной классификации. Производные таблицы 1, Таблицы 2, Таблицы 3, Таблицы 4 и Таблицы 5, сводки рисунков и источников, определения бенчмарков-запросов, резюме суждений по релевантности, суррогаты для поиска журнала, диагностика обучения, категории лексиконов, правила сопоставления словарного запаса и поля для руководства по аннотациям предоставляются в виде отдельных загружаемых таблиц или файлов материалов, где это применимо. Материалы, которые не могут быть публично распространены из-за ограничений репозитория, представлены в виде деидентифицированных полей метаданных и воспроизводимых выборочных полей.

Этот протокол оценивает поисково-ориентированное открытие, а не истинность исторических утверждений. Он не заменяет оценку архивариуса, оценку происхождения, проверку конфиденциальности или доступ к репозиториям.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Коррекция OCR улучшила транскрипцию, особенно в рукописных и табличных записях

Коррекция оптического распознавания символов улучшила качество транскрипции во всех восьми классах архивных документов (n = 1 600 записей). Средний WER снизился с 0,529 ± 0,172 до 0,384 ± 0,123, при среднем парном изменении −0,144 (95% ДИ, −0,149 до −0,139; Уилкоксон получил звание P < 0.001). Средний CER снизился с 0,377 ± 0,126 до 0,258 ± 0,086, при среднем парном изменении −0,119 (95% ДИ, −0,123 до −0,116; Уилкоксон получил звание P < 0,001). Таблица 2 показывает, что базовый WER был самым высоким для рукописных писем, бухгалтерских книг и реестров, что указывает на то, что самые визуально сложные записи также имели наибольшее первоначальное распознавание.

После коррекции WER снизился во всех классах документов. Наибольшие средние парные сокращения WER наблюдались в рукописных письмах (n = 262; −0,200; 95% CI, −0,213 до −0,188), бухгалтерских книгах (n = 263; −0,195; 95% CI, −0,206 до −0,183) и реестровых книгах (n = 194; −0,173; 95% CI, −0,187 до −0,160). CER следовал той же схеме, поддерживая интерпретацию, что модуль после коррекции в первую очередь приносил пользу сложным рукописным, табличным и смешанным макетным записям.

Воспоминание именованных сущностей также улучшилось для всех типов документов, как показано в таблице сводки. Наибольший рост наблюдался в рукописных письмах (0,302–0,440), бухгалтерских книгах (0,336–0,471) и реестрских книгах (0,369–0,504). Типизированная корреспонденция достигла самого высокого уровня памяти именованных сущностей после коррекции (0,646), но её абсолютный прирост был меньше, поскольку базовое распознавание уже было сильнее для этого класса. Рисунок 2 обобщает базовую связь CER-WER на уровне записи, связь между интенсивностью письма и пользой от коррекции, а также сдвиг после коррекции в обнаружимости на уровне записей.

Визуальная классификация документов в целом улучшилась, но прирост производительности был неравномерным между классами

Визуальная классификация документов улучшилась в целом на тестовом наборе из 1600 записей. Точность топ-1 выросла с 0,717 до 0,796 (абсолютное изменение — 0,079; МакНемар хи-квадрат = 27,33; P < 0,001), и средняя уверенность в прогнозах выросла с 0,736 ± 0,131 до 0,800 ± 0,108 (среднее парное изменение 0,064; 95% ДИ, 0,057–0,071; парный тестостерон P < 0,001). Как показано в таблице 3, семь из восьми классов улучшились после архивной точной настройки, с наибольшими приростами для карт, плакатов, газет и реестровых книг.

Типизированная корреспонденция не улучшилась существенно после тонкой настройки (0,796–0,791), что свидетельствует о стабильности базовых визуальных характеристик и о минимальном дополнительном разделении классов для этой категории.

Рисунок 3 подводит итоги визуальной классификации документов до и после архивно-специфической настройки; рабочая тетрадь с исходными данными перечисляет 20 эпох потерь и точности обучения/валидации, а также макро-F1, взвешенно-F1, ROC-AUC и PR-AUC диагностические резюме.

Обогащение метаданных улучшило описательную полноту во всех исторических периодах (n = 1 600 записей). Средняя полнота выросла с 0,657 ± 0,125 до 0,907 ± 0,070, при среднем парном изменении 0,250 (95% ДИ, 0,243–0,257; Уилкоксон получил звание P < 0.001). Как показано в таблице 4, базовая полнота была минимальной для 1850–1879 годов и увеличивалась в более поздние периоды до обогащения. Рисунок 4 подводит итоги улучшения полноты метаданных, новых полей метаданных по типу документа и улучшения соответствия тематических заголовков в исторические периоды.

После обогащения полнота увеличивалась во всех исторических периодах: 1850–1879 (n = 281; среднее изменение 0,207; 95% CI, 0,191–0,223), 1880–1909 (n = 474; среднее изменение, 0,236; 95% CI, 0,223–0,248), 1910–1939 (n = 549; среднее изменение 0,277; 95% CI, 0,265–0,288), и 1940–1969 (n = 296; среднее изменение 0,263; 95% CI, 0,247–0,279). Среднее количество населённых полей также стабильно увеличивалось в зависимости от периодов.

Параллельно сопоставление заголовков улучшалось. Базовые показатели совпадения варьировались от 64,3% до 69,4%, тогда как после обогащения — от 82,1% до 85,4%. Наибольшее абсолютное прирост произошло в самый ранний период (Delta = 0,178), что подтверждает ценность консервативного обогащения для записей с редким первоначальным описанием.

Производительность поиска улучшилась во всех улучшенных системах, с наибольшими приростами при полной мультимодальной интеграции

Эффективность восстановления улучшалась при каждом условии улучшения относительно исходного уровня, но величина улучшения варьировалась в зависимости от структурного крыла (n = 420 совпадающих эталонных запросов). Общие результаты извлечения приведены в таблице 5. Базовая эффективность была низкой: P@10 = 0,394, R@10 = 0,238, nDCG@10 = 0,392, среднее время до первого релевантного результата = 156,079 с, и процент успешного поиска = 5,0% (21/420; 95% ДИ, 3,3%–7,5%). Рисунок 5 обобщает результаты поиска по пяти экспериментальным группам систем, включая общие метрики поиска, показатели успеха на уровне темы и уровень сложности запросов.

Все три однокомпонентные системы по совокупности превосходили базовый показатель. Коррекция оптического распознавания символов увеличилась P@10 до 0,484, R@10 до 0,346 и nDCG@10 до 0,475, при этом время до первого релевантного результата сократилась до 124,261 с и увеличилась вероятность успешного поиска до 30,2% (127/420; 95% ДИ, 26,0%–34,8%). Визуальная классификация дала P@10 = 0,490, R@10 = 0,302, nDCG@10 = 0,478, среднее время до первого релевантного результата = 131,985 с, и процент успешного поиска = 22,9% (96/420; 95% ДИ, 19,1%–27,1%). Обогащение метаданных достигло наибольшей эффективности поиска по одному компоненту: P@10 = 0,507, R@10 = 0,347, nDCG@10 = 0,513, среднее время до первого релевантного результата = 117,474 с, а успешный уровень поиска составил 38,3% (161/420; 95% ДИ, 33,8%–43,1%).

Полная мультимодальная система показала лучшие результаты на всех точках извлечения. P@10 вырос с 0,394 на базовом уровне до 0,624, R@10 с 0,238 до 0,492 и nDCG@10 с 0,392 до 0,634. Среднее время до первого релевантного результата снизилось с 156,079 с до 58,485 с, а процент успешного поиска вырос с 5,0% до 95,5% (401/420; 95% ДИ, 93,0%–97,1%). Эти значения соответствуют абсолютному приросту 0,230 для P@10, 0,254 для R@10 и 0,242 для nDCG@10.

Поиск по теме также улучшился при полной мультимодальной интеграции. Показатели успешного поиска выросли по людям, учреждениям, местам, профессиям, событиям и тематическим темам, при этом категория профессий показала наибольший практический прирост — базовый уровень успеха составлял 0,0% и вырос до 90,0% при полном мультимодальном режиме. Запросы по названиям мест имели наивысшую базовую производительность, но всё равно выигрывали от мультимодальной интеграции.

Мультимодальные приобретения варьировались по документам, периодам и языковым слоям

Анализ подгрупп показал, что мультимодальные приросты были широко распределены по типам документов, историческим периодам и языковым контекстам, хотя степень улучшения варьировалась. Эта гетерогенность указывает на то, что рабочий процесс следует оценивать внутри каждой целевой коллекции, а не предполагать, что он даёт одинаковые результаты. Рисунок 6 показывает гетерогенность мультимодальных результатов поиска в зависимости от типа целевой документа, исторического периода и языкового контекста.

На уровне типа документа nDCG@10 улучшился во всех целевых классах. Фотографии с подписями, рукописные письма, карты, бухгалтерские книги и реестры показали значительный рост, тогда как газеты и печатная переписка улучшились более умеренно. Эти закономерности свидетельствуют о фактах, что записи с слабыми начальными метаданными или сложной визуальной структурой наибольшее преимущество получают от комбинированного текста, изображения и метаданных.

На историческом уровне R@10 увеличился с 0,175 до 0,429 в 1850–1879 годах и достиг 0,506 в 1880–1909 годах, 0,501 в 1910–1939 годах и 0,519 в 1940–1969 годах при полной мультимодальной интеграции. Прирост был схожим в абсолютном масштабе между периодами, что говорит о том, что обогащение и скорректированное распознавание помогли как ранним редким записям, так и более поздним записям с более богатыми базовыми метаданными.

Результаты языкового контекста показали похожую закономерность. P@10 при полном мультимодальном режиме достигал 0,607 для записей смешанного латинского алфавита, 0,628 для английского, 0,618 для французского, 0,661 для немецкого и 0,639 для португальского и испанского. Наибольшее прирост точности наблюдалось для записей смешанного латинского алфавита, которые имели наименьшую базовую точность.

Шаблоны на уровне компонентов: дополнительные вклады, а не избыточные

В совокупности результаты показывают, что компоненты протокола являются дополняющими, а не избыточными. Коррекция OCR улучшила распознаваемость текста, визуальная классификация добавила сигналы с учётом структуры документов, а обогащение метаданных расширило поисковый описательный слой. Полное мультимодальное условие дало самые сильные и стабильные результаты поиска, что подтверждает цель исследования — тестирование аудитируемого, ориентированного на поиск рабочих процессов для гетерогенных цифровых архивов.

Эти результаты подтверждают модель протокола, в которой мультимодальный искусственный интеллект дополняет архивный поиск, сохраняя при этом необходимость управления репозиториями, происхождения данных и экспертной валидации.

ДОСТУПНОСТЬ ДАННЫХ:

Де-идентификационный набор данных из 1600 записей, используемый для основного анализа, доступен на Zenodo как data.xlsx (https://doi.org/10.5281/zenodo.20774456).

figure-results-1
Рисунок 1: Воспроизводимый рабочий процесс для мультимодального архивного обнаружения. (A) Построение корпуса на основе архивных записей на уровне репозитория с помощью скрининга включения/исключения. (B) Маркировка ссылок и контроль качества, включая тип документа, референсные регионы OCR, языковой контекст, исторический период и полноту метаданных. (C) Предобработка изображений, генерация и посткоррекция OCR, визуальная классификация документов и консервативное обогащение метаданных. (D) Построение индекса, оценка по пяти рукавам, статистический анализ и упаковка ресурсов. Сокращения: OCR, оптическое распознавание символов; CER, уровень ошибок символов; WER, уровень ошибок слов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-2
Рисунок 2: Структура ошибки оптического распознавания символов на уровне записи и обнаружимость после коррекции. (A) Базовый CER по сравнению с базовым WER для 1600 архивных записей, окрашенных по типу документа для репрезентативных классов. (B) Связь между масштабированной интенсивностью почерка и изменением WER после исправления; отрицательные значения указывают на снижение WER после коррекции. Прилегающая линия и серая полоса показывают линейный тренд и 95% доверительный интервал. (C) Балл обнаружения на уровне записи до и после исправления по типу документа, иллюстрирующий изменения в поисковых доказательствах после исправления. Сокращения: CER, уровень ошибки символа; WER, уровень ошибок слов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-3
Рисунок 3: Визуальная классификация документов до и после архивно-специфичной настройки. (A) Топ-1 точности по типу документа на исходном уровне и после тонкой настройки. (B) Распределения доверия для правильных и неправильных предсказаний в базовых и пост-настройках. (C) Матрица производительности на уровне класса, суммирующая точность топ-1 и среднюю апостериорную уверенность до и после настройки. Диагностические данные модели включают 20 эпох кривых потерь/точности, макро-F1, взвешенную F1, ROC-AUC и PR-AUC. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-4
Рисунок 4: Полнота метаданных и совпадение предметных заголовков после консервативного обогащения. (A) Полнота метаданных на уровне записи до и после обогащения. (B) Новые поля метаданных по типу документа. (C) Увеличение совпадения темы в исторические периоды. Полнота рассчитывалась как количество заполненных применимых основных полей, делённое на общее количество применимых основных полей. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-5
Рисунок 5: Производительность поиска по пяти экспериментальным веткам системы. (A) Общие показатели P@10, R@10, nDCG@10, времени до первого релевантного результата и успешного поиска по исходной точке, коррекции оптического распознавания символов, визуальной классификации, обогащения метаданных и полной мультимодальной интеграции. (B) Пузырьковый график успешного поиска по теме запроса и системному подразделению; Цвет указывает на системное рыча, а размер пузыря — на процент успеха. (C) P@10, R@10 и nDCG@10 по лёгким, средним и жёстким уровням сложности запросов. (D) Альтернативный вариант успешности на уровне темы, показывающий распределение успешных поисков по темам запросов и системным подразделениям. Сокращения: P@10, точность 10; R@10, отзыв в 10; nDCG@10, нормализованный дисконтированный кумулятивный прирост на уровне 10. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-6
Рисунок 6: Гетерогенность приростов мультимодального поиска между архивными подгруппами. (A) nDCG@10 по типу целевой документации и условиям поиска. (B) R@10 по историческому периоду и условиям поиска. (C) P@10 по контексту целевой языка и условиям поиска. Условия включают исходную линию, коррекцию OCR, визуальную классификацию, обогащение метаданных, полную мультимодальную интеграцию, OCR+текст, текст + визуальные + метаданные и визуальные + метаданные. На рисунке подчёркивается, что мультимодальные достижения широко распространены, но не одинаково по документам, периодам и языковым слоям. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Тип документаN RecordsМедианные страницыРукописные записиСредний базовый уровень
WER
Средний базовый уровень
Метаданные
Полнота
Средний базовый уровень
Обнаружимость
(%)
Рукописное письмо2622950.7290.64868.2
Ledger263763.50.6790.67472.2
Карта10212.90.4570.55274.1
Газета26180.80.4950.6675.5
Фотография с подписью17911.10.3740.60173.6
Постер87100.4130.57174.8
Реестр19410180.6160.70371.3
Напечатанная переписка252340.3150.68976.4

Таблица 1: Характеристики архивной коллекции по типу документов. В таблице указано количество записей, медианное количество страниц, процент записей с почерком, средний базовый WER, средняя базовая полность метаданных и средний базовый балл обнаружения для каждого из восьми классов документов.

Тип документаРазмер выборкиCERCERWERWERИменованный субъект
Отзыв
Именованный субъект
Отзыв
ΔWER
(n)(Базовая линия)(Пост)(Базовая линия)(Пост)(Базовая линия)(Пост)
Рукописное письмо2620.5310.3630.7290.5310.3020.44−0,198
Ledger2630.490.3260.6790.4850.3360.471−0,194
Карта1020.3220.2280.4570.3470.380.503−0,11
Газета2610.3540.2560.4950.3810.4360.558−0,114
Фотография с подписью1790.2570.1810.3740.2860.4940.616−0,088
Постер870.2870.1990.4130.3160.4480.57−0,097
Реестр1940.4420.2930.6160.4390.3690.504−0.177
Напечатанная переписка2520.2190.1550.3150.2320.5240.646−.083

Таблица 2: Производительность OCR до и после коррекции по типу документа. CER и WER рассчитывались по референсным транскрипциям; Отзыв именованных субъектов рассчитывался на основе вручную помеченых лиц, место, учреждение и даты. Delta WER — это после коррекции WER минус базовый WER.

Тип документаnТочность,
Базовая линия
Точность,
Пост
Уверенность,
Базовая линия
Уверенность,
Пост
Δaccuracy
Рукописное письмо2620.6150.6450.6160.6550.03
Ledger2630.7070.7490.7250.7670.042
Карта1020.7650.9020.8010.8990.137
Газета2610.7160.8430.7280.830.127
Фотография с подписью1790.8150.8690.8240.890.054
Постер870.7710.9030.7920.8890.132
Реестр1940.6870.7930.7010.7870.106
Напечатанная переписка2520.7960.7910.8040.82-0.005

Таблица 3: Производительность визуальной классификации документов до и после архивно-специфической настройки. Таблица показывает размер выборки, точность топ-1, среднюю апостериорную уверенность и изменение точности в зависимости от типа документа. Диагностические данные включают 20 эпохальных рядов с макро-F1, взвешенным F1, ROC-AUC, PR-AUC, потерей в тренировках, потерей валидации, точностью обучения и точностью валидации.

ПолнотаПолнотаНаселённые поляНаселённые поляТематика
Матч
Тематика
Матч
Δ полнотаΔ Тематический заголовок
Матч
(Базовая линия)(Пост)(Базовая линия)(Пост)(Базовая линия)(Пост)
0.5340.8684.2748.5840.6430.8210.3340.178
0.6070.8984.8388.7090.6720.8410.2910.169
0.680.9275.4269.0950.6860.8490.2470.163
0.6860.9225.488.9530.6940.8540.2360.16

Таблица 4: Обогащение метаданных по историческим периодам. Полнота — это доля применимых основных описательных полей, заполняемых для записи; населенные поля указываются как средние подсчета; Совпадение по теме указывает, подтверждают ли данные на уровне записей хотя бы одну метку с контролируемым словарным запасом.

Системный рычагn запросовP@10R@10nDCG@10Пора начать с первой релевантностью
Результат(ы)
Успешный коэффициент поиска
(%)
Исходная линия4200.3940.2380.392156.0795
Коррекция OCR4200.4840.3460.475124.26130.2
Визуальная классификация4200.490.3020.478131.98522.9
Обогащение метаданных4200.5070.3470.513117.47438.3
Полноценный мультимодаль4200.6240.4920.63458.48595.5

Таблица 5: Эффективность поиска для пяти экспериментальных системных рук. P@10, R@10, nDCG@10, время до первого релевантного результата и успешная скорость поиска были рассчитаны по бенчмарку из 420 запросов в условиях согласованного запроса.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол демонстрирует, что обнаружение в исторических цифровых архивах улучшалось наибольше, когда коррекция OCR, визуальное понимание документов и консервативное обогащение метаданных оценивались как связанные компоненты поиска, а не как отдельные технические улучшения. Наибольшие приросты OCR наблюдались в рукописных, табличных и реестровых материалах, что подтверждает ценность посткоррекции для классов документов, где базовое распознавание наименее слабое. В то же время остаточная ошибка после исправления показывает, что очистка OCR не может рассматриваться как окончательная транскрипция и должна оставаться подлежащей аудиту.

Визуальные результаты классификации также требуют осторожной интерпретации. Тонкая настройка улучшила визуально отличительные классы, такие как карты, плакаты, газеты и реестрские книги, но прирост был меньшим для рукописных писем и бухгалтерских книг, где макеты пересекаются, а границы классов менее визуально разделены. Относительно небольшой размер корпуса означает, что производительность классификации следует интерпретировать как протокольные доказательства, а не как доказательство того, что производственная мультимодальная модель может быть обучена только на основе 1600 записей. Будущая валидация должна сравнивать EfficientNet-B3 с трансформерами документов, Vision Transformers, Swin Transformers, ConvNeXt и мультимодальными моделями основаниядокументов 8,11,12,13,14,15,16,17,18.

Обогащение метаданных значительно способствовало поиску, расширяя редкие описательные записи в поисковые поля, сохраняя при этом информацию о источниках и доверительности. Это открытие соответствует архивной потребности в более богатых точках доступа, но также увеличивает риски управления. Автоматизированное обогащение может усилить ошибки OCR, слишком агрессивно нормализовать исторически неоднозначные названия или ввести предвзятость, если контролируемый словарь неполный. По этой причине рабочий процесс использует пороги доверия, логирование источников и флаги рецензий, а не полностью автоматизированную замену каталожных записей.

Оценка поиска предоставляет доказательства эффектов дополнительных модулей, но имеет ограничения. В настоящем сравнении использовались исходные и внутренние условия абляции модулей; он не сравнивался с плотными системами получения и поздним взаимодействием, такими как ColBERT, гибридным редко-плотным извлечением, нейронным переранжированием или системами генерации с дополненнымпоиском 22,23,24. Эти подходы следует добавить в будущие исследования, чтобы определить, остаются ли наблюдаемые мультимодальные приросты конкурентоспособными по сравнению с текущими архитектурами поиска.

Реализация также требует внимания к утечке данных, вычислительным ограничениям и масштабируемости. Обогащение использовало оптические выводы распознавания символов, визуальные прогнозы и существующие метаданные, поэтому разделение обучения/валидации/тестирования и оценка запросов должны быть отделены от решений об обогащении. В будущих развертываниях следует отчитываться аппаратное обеспечение, время выполнения, использование памяти, размер индекса и стоимость за 1 000 записей. Подходы к восстановлению визуализации из соседних работ с компьютерным зрением, включая многомасштабные и ориентированные на внимание модели снятия окклюзии, могут вдохновлять будущие эксперименты с предобработкой, но их следует тщательно проверять, поскольку архивные процессы не должны галлюцинировать или изменять содержание доказательств26,27.

В целом, рабочий процесс лучше понимать как воспроизводимый протокол доступа, а не как замену архивного описания. Мультимодальный искусственный интеллект может улучшить обнаружение, если его результаты ограничены, регистрируются и пересматриваются, но архивариусы остаются необходимыми для оценки происхождения, принятия решений по управлению доступом и интерпретации исторически сложныхзаписей 21,25.

ВЫВОДЫ:
В этом исследовании проверилось, могут ли коррекция оптического распознавания символов, визуальная классификация документов и консервативное обогащение метаданных служить дополняющими компонентами поиска в исторических цифровых архивах. Протокол улучшил транскрипцию, классификацию, полноту метаданных и производительность агрегированного извлечения, сохраняя при этом чёткие пороги, логирование источников и меры безопасности при проверке человека. Таким образом, рабочий процесс следует использовать как аудируемый протокол поддержки доступа, а не как замену архивистского суждения или управления репозиториями.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторам нечего раскрывать.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы искренне благодарят двух опытных сотрудников архивного отдела и профессионального исследователя цифровых гуманитарных наук за ценную помощь в аннотировании текста и контроле качества. Это исследование было финансово поддержано Планом проекта по науке и технологиям Провинциального архива провинции Цзянсу (Грант No 2024-9) для создания интеллектуальной системы устных архивов на основе речи, а также Планом развития традиционной китайской медицины провинции Цзянсу (Грант No MS2025025) для изучения наследования и развития школ ТКМ с архивной точки зрения.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
PythonPython Software Foundationv3.11.8; https://www.python.org/Сценарии рабочих процессов, обработка данных, коррекция оптического распознавания символов после обработки и статистическая поддержка
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/Статистический анализ и создание конечных фигур
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseractБазовое создание оптического распознавания символов
Языковые пакеты TesseractTesseract OCR ProjectЯзыковые пакеты, специфичные для исследования; https://github.com/tesseract-ocr/tessdataОсновное и смешанное расшифровывание оптического распознавания символов
OpenCVOpenCV Teamv4.9.0; https://opencv.org/Дескевинг, оценка шума и предварительная обработка изображений
PillowPython Imaging Library contributorsv10.3.0; https://python-pillow.org/Ввод/вывод изображений и нормализация формата
NumPyNumPy developersv1.26.4; https://numpy.org/Рассчитанные массивы для обработки изображений и метрик
pandaspandas development teamv2.2.2; https://pandas.pydata.org/Обработка табличных данных и экспортирование сводок
SciPySciPy developersv1.13.1; https://scipy.org/Статистические тесты и числовые утилиты
statsmodelsstatsmodels developersv0.14.2; https://www.statsmodels.org/Статистическое моделирование и поддержка сравнения пар
scikit-learnscikit-learn developersv1.4.2; https://scikit-learn.org/Метрики классификации, диагностика ROC/PR и утилиты валидации
rapidfuzzMax Bachmann и соавторыv3.9.0; https://github.com/rapidfuzz/RapidFuzzРанжирование кандидатов по расстоянию редактирования для корректировки оптического распознавания
spaCyExplosion AIv3.7.4; https://spacy.io/Обработка именованных сущностей с использованием настраиваемых лексиконов
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/Обучение классификатора визуальных документов
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/Реализация EfficientNet-B3 и преобразования изображений
Опора EfficientNet-B3torchvision / предварительно обученные веса ImageNetEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.htmlОпора для классификации визуальных документов
sentence-transformersUKP Lab / экосистема Hugging Facev2.7.0; https://www.sbert.net/Семантическое расширение для кандидатов с контролируемым словарным запасом
Поисковый движокElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchИндексация, поиск и ранжирование BM25
Контейнерный движокDocker Inc.Docker v26.1.1; https://www.docker.com/Контейнеризированная среда для поиска
Операционная система LinuxCanonicalUbuntu 22.04 LTS; https://ubuntu.com/Фиксированная операционная среда для поисковых задач
Система контроля версийGit projectGit v2.44.0; https://git-scm.com/Контроль версий для конфигурации, словарных запасов, сценариев и кода фигур
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/Рендеринг фигур на основе R
MatplotlibMatplotlib developersv3.8.4; https://matplotlib.org/Дополнительная визуализация и графики для контроля качества
Руководство по аннотациямАвторы5 разделов аннотаций; 8 меток классов документов; регионы OCR; метки сущностей; суждения о релевантности; правила разбирательстваОпределения классов документов, регионов OCR, сущностей, суждений о релевантности и разбирательства
Лексикон OCR, специфичный для архиваАвторы6 категорий лексикона: варианты имён, названия мест, названия учреждений, шаблоны дат, административные термины, аббревиатурыИмена, места, учреждения, административные термины и варианты написания
Сопоставление контролируемого словарного запасаАвторы / архивные репозитории5 правил сопоставления, связывающих сущности OCR, визуальный класс, ключевые слова заголовка, охват дат и тему запроса с полями метаданныхСопоставление предметных заголовков и семантическое расширение
Бенчмарк-набор запросовАвторы420 бенчмарк-запроса; 6 тем запросов; 3 уровня сложности; 8 целевых классов документов; 4 исторические периоды; 6 языковых контекстовБенчмарк поиска по пяти системным ветвям
Суждения о релевантностиАвторы / аннотаторы2100 строк запрос-система; 420 запросов x 5 системных ветвей; релевантные общие суммы, релевантные в топ-10, оценки релевантности и флаги успехаЭталон для P@10, R@10, nDCG@10 и успешной скорости поиска
Диагностика тренировкиАвторы20 эпох; потери на обучении; потери на валидации; точность обучения; точность валидации; макро-F1; взвешенная

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

234234OCR

Похожие статьи