Artigo de investigação

Fluxo de Trabalho de Inteligência Artificial Multimodal Reproduzível para Descoberta de Arquivos Históricos Digitais

DOI:

10.3791/71698

7 de agosto de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aqui, apresentamos um protocolo para melhorar a descoberta em arquivos digitais históricos, integrando reconhecimento óptico de caracteres pós-correção, classificação visual de documentos, enriquecimento de metadados e avaliação de recuperação em um fluxo de trabalho auditável.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Arquivos digitais históricos estão cada vez mais pesquisáveis, mas a descoberta permanece limitada quando erros de reconhecimento óptico de caracteres, tipos de documentos visualmente heterogêneos e metadados escassos são tratados separadamente. Este estudo teve como objetivo desenvolver um protocolo reprodutível para avaliar se um fluxo de trabalho conservador de inteligência artificial multimodal pode melhorar a recuperação arquivística sem substituir a revisão por arquivistas. Um corpus de 1.600 registros arquivísticos digitalizados de oito classes de documentos foi montado, e um benchmark de 420 consultas foi usado para comparar cinco condições de recuperação: indexação de base, correção de reconhecimento óptico de caracteres isoladamente, classificação visual isolada, enriquecimento de metadados sozinho e integração multimodal completa. Os resultados em nível de registro incluíram taxa de erro de caracteres (CER), taxa de erro de palavra (WER), recordação de entidades nomeadas, precisão de classificação por tipo de documento, confiança na previsão, completude dos metadados e correspondência de títulos de assunto. Os resultados em nível de consulta incluíram P@10, R@10, nDCG@10, tempo até o primeiro resultado relevante e taxa de busca bem-sucedida. A correção por reconhecimento óptico de caracteres reduziu fortemente a WER para cartas manuscritas, livros-razão e livros de registro; o ajuste visual melhorou a precisão da classificação principalmente para mapas, cartazes, jornais e livros de registro; e o enriquecimento de metadados aumentou a completude em todos os períodos históricos. A condição multimodal completa alcançou o maior desempenho de recuperação (P@10 = 0,624, R@10 = 0,492, nDCG@10 = 0,634) e reduziu o tempo médio até o primeiro resultado relevante de 156,079 s para 58,485 s. Esses resultados suportam um fluxo de trabalho modular e auditável, no qual texto, imagem e sinais descritivos são combinados sob limiares explícitos e revisão humana.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os arquivos digitais expandiram-se rapidamente e agora apoiam pesquisas em história, patrimônio cultural, administração pública e humanidades digitais. No entanto, o acesso permanece desigual porque registros arquivísticos frequentemente combinam saídas degradadas de reconhecimento óptico de caracteres, layouts de página visualmente diversos, práticas de catalogação inconsistentes e nomes, lugares e instituições historicamente variáveis. Essas limitações afetam não apenas a qualidade da transcrição, mas também a recuperação, filtragem e reutilização posterior de coleçõesdigitalizadas 1,2,3,4,5,6,7.

Estudos existentes de inteligência artificial documental e recuperação arquivística melhoraram componentes individuais, como reconhecimento óptico de caracteres após correção, classificação de imagens de documento, normalização de metadados, modelagem de tópicos, embeddings de palavras, recuperação neural e prática de governançade dados 8,9,10,11,12,13,14,15, 16,17,18,19,20,21,22,23,24,25. No entanto, muitos sistemas arquivísticos ainda avaliam esses componentes separadamente, tornando difícil determinar se um fluxo de trabalho combinado melhora a descoberta em condições de busca realistas. A lacuna metodológica abordada aqui é a ausência de um protocolo reproduzível e auditável que conecte módulos de texto, imagem e metadados aos resultados de recuperação em um único fluxo de trabalho arquivístico.

O objetivo central foi testar se correção de reconhecimento óptico de caracteres, classificação visual de documentos e enriquecimento de metadados restritos por regras produzem melhorias complementares quando avaliadas em relação ao mesmo benchmark de recuperação.

Hipotetizamos que a condição multimodal completa superaria cada condição de componente único porque a descoberta arquivística depende da interação de texto legível, estrutura de documento visualmente interpretável e metadados descritivos pesquisáveis. O fluxo de trabalho foi projetado de forma conservadora: saídas automatizadas podiam enriquecer índices de recuperação, mas previsões de baixa confiança eram sinalizadas para revisão em vez de usadas como descrição arquivística autoritativa.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo utilizou registros arquivísticos digitalizados e consultas simuladas de recuperação como unidades de análise. Repositórios arquivísticos podem restringir o acesso a registros sensíveis ou culturalmente restritos. Siga as regras de acesso ao repositório, procedimentos institucionais de segurança de dados e requisitos de desidentificação antes de processar ou compartilhar qualquer registro. Nenhum lixo químico perigoso, biológicos, cortantes, radioativos ou outros resíduos laboratoriais regulados foi gerado por esse fluxo de trabalho digital.

Projeto do estudo e construção do corpus

A Figura 1 apresenta o fluxo de trabalho completo do estudo, incluindo construção de corpus, rotulagem de referência, pré-processamento de imagens, geração e pós-correção de OCR, classificação visual, enriquecimento de metadados, construção de índices, avaliação de recuperação, análise estatística e embalagem de reprodutibilidade.

A construção do corpus foi realizada de 15 de janeiro a 30 de abril de 2025, seguida pelo projeto e depuração do sistema de 1º de maio a 31 de outubro de 2025. O corpus continha 1.600 registros arquivísticos digitalizados, selecionados de oito depósitos que representam sistemas estaduais, municipais, religiosos, de museus, universitários e bibliotecarios. O quadro de amostragem foi estratificado por classe de repositório e documento para preservar a heterogeneidade arquivística entre cartas manuscritas, livros-caixa, mapas, jornais, fotografias com legendas, cartazes, livros de registro e correspondência datilografada.

Para cada registro candidato, o registro de seleção registrava o identificador do repositório ou coleção, identificador de catálogo, classe do documento, período histórico aproximado, contexto dominante do idioma, formato de imagem disponível, resolução da imagem, contagem de páginas e campos descritivos de referência. A inclusão exigia todos os seguintes fatores: um identificador estável de catálogo; pelo menos uma imagem de página em TIFF, JPEG ou PNG; resolução de imagem de origem de pelo menos 150 dpi; conteúdo textual, tabular ou estrutural documental legível; e atribuição a uma das oito classes de documentos predefinidas. Os critérios de exclusão eram duplicatas exatas, páginas reversas em branco, imagens cortadas a ponto de mais de 30% da área com texto estar faltando, e registros considerados ilegíveis após inspeção manual.

O benchmark de recuperação continha 420 consultas curtas em linguagem natural geradas entre 5 e 20 de agosto de 2025. A geração de consultas seguiu um modelo reproduzível: as necessidades de informação dos candidatos foram amostradas de pessoas, instituições, locais, períodos de datas, ocupações, eventos e temas atuais; cada consulta foi normalizada para 2–9 palavras; e registros relevantes ao alvo foram identificados antes da comparação do sistema. Cada consulta foi avaliada sob cinco condições de recuperação, produzindo 2.100 observações de condição de consulta correspondentes.

Rotulagem de referência e controle de qualidade

A rotulagem de referência foi realizada de 1º de maio a 15 de julho de 2025, por três anotadores: dois membros da equipe de arquivos com experiência em catalogação descritiva e um pesquisador de humanidades digitais com experiência em avaliação de documentos históricos. O guia de anotação definiu classes de documentos, categorias de contexto de idioma, bins de período histórico, campos de completude de metadados, categorias de entidades nomeadas e regras para selecionar regiões de avaliação de OCR.

Para avaliação de OCR, os anotadores selecionaram regiões representativas com texto que incluíam títulos, nomes, datas, termos institucionais, notas marginais, entradas tabulares e, quando presentes, áreas de layout ruidosas. Quando uma página continha múltiplas regiões de texto, a região selecionada precisava ser relevante para a recuperação e incluir caracteres suficientes para cálculos de CER e WER. As discordâncias eram inicialmente resolvidas por meio de discussões entre os dois principais anotadores; Casos não resolvidos foram julgados pelo pesquisador de humanidades digitais.

O controle de qualidade utilizou um subconjunto aleatório de 12% dos registros. O acordo entre anotadores para o tipo principal de documento era o kappa de Cohen = 0,86, apoiando um acordo substancial. O log de adjudicação manteve os rótulos original e final, a categoria de discordância e o motivo da resolução para que futuros usuários possam auditar definições de classes e casos extremos.

Pré-processamento de imagem

Todas as imagens foram processadas em nível de registro usando Python 3.11.8 com OpenCV 4.9.0, Pillow 10.3.0 e NumPy 1.26.4. Cada página de entrada era convertida para escala de cinza de 8 bits, a menos que a cor contenha informações semânticas, como mapas, cartazes, carimbos ou anotações codificadas por cores. O descompasso foi estimado usando perfis de projeção e detecção de linhas de Hough; Deskewing era aplicado apenas quando o ângulo absoluto de desvio ultrapassava 1,5 graus e era limitado a 8,0 graus para evitar distorção.

O aprimoramento de contraste utilizou equalização adaptativa de histogramas limitada por contraste com clipLimit = 2.0 e tileGridSize = 8 × 8. Um filtro mediano com um núcleo de 3 × 10−23 foi aplicado apenas quando a razão estimada de ruído de fundo excedeu 0,35. Imagens capturadas entre 150 e 299 dpi foram reamostradas para 300 dpi para reconhecimento óptico de caracteres; Imagens já a 300 dpi ou mais não foram ampliadas. Não foi usada super-resolução, restauração generativa ou alucinação de conteúdo.

O bleed-through, escurecimento das bordas, textura irregular do papel, carimbos marginais, caligrafia, linhas com regras e limites de tabela foram mantidos, a menos que impedissem a seleção de regiões OCR. Essa regra preservava evidências arquivísticas enquanto padronizava suficientemente as entradas de imagem para OCR reproduzível e classificação.

Geração de base OCR e pós-correção

O OCR de base foi gerado com o OCR Tesseract 5.3.0. O pacote de idiomas primários foi selecionado a partir do idioma do catálogo e do script visível; a decodificação multilíngue era ativada quando o idioma do catálogo e o script da página não coincidiam. As saídas do OCR eram agrupadas no nível do registro e armazenadas com identificadores de página, confiança do OCR, coordenadas da caixa delimitadora quando disponíveis e texto bruto antes da correção.

A correção pós-OCR utilizou um procedimento conservador em três estágios. Primeiro, a normalização em nível de caractere corrigiu confusões frequentes de reconhecimento histórico, incluindo ligaduras, substituições long-s/short-s, pontuação fragmentada e substituições dígito-letra. Segundo, a correção em nível de token utilizou candidatos de distância de edição e classificação de frequência a partir de um léxico específico do arquivo de nomes pessoais, nomes de lugares, instituições, termos administrativos e variantes históricas de ortografia. Terceiro, verificações de sequência baseadas em regras validaram entidades e datas nomeadas com base em evidências de contexto e metadados.

Substitutos candidatos foram aceitos apenas quando a confiança na correção posterior excedeu 0,80; Substituições de entidades nomeadas exigiam confiança de pelo menos 0,85. Candidatos abaixo do limite foram mantidos como texto do OCR, mas sinalizados para revisão. A CER foi calculada como a distância de edição de Levenshtein dividida pelo número de caracteres na transcrição de referência. A WER usava a mesma fórmula no nível do token. A recordação de entidades nomeadas foi calculada como entidades de referência corretamente reconhecidas divididas por todas as entidades de referência na região de avaliação selecionada.

Classificação visual de documentos

O módulo de classificação visual atribuía cada registro a uma das oito classes de documentos arquivísticos: carta manuscrita, livro-caixa, mapa, jornal, fotografia com legenda, pôster, livro de registro e correspondência datilografada. O tipo de documento previsto era usado como sinal de recuperação e filtragem, não como substituto autoritativo para a catalogação arquivística.

O modelo foi implementado no PyTorch 2.2.2 e no torchvision 0.17.2 usando uma espinha dorsal EfficientNet-B3 pré-treinada pelo ImageNet. As miniaturas em nível de registro foram redimensionadas para 384 x 384 pixels. Para reduzir vazamentos, os registros foram divididos por classe de repositório e documento em conjuntos de treinamento, validação e teste em uma proporção de 70:15:15, correspondendo a aproximadamente 1.120, 240 e 240 registros.

O treinamento usou AdamW com taxa inicial de aprendizado = 1 × 10-4, decaimento do peso = 1 × 10−2, tamanho do lote = 16, suavização de rótulos = 0,05 e parada precoce quando a perda de validação não melhorou por cinco épocas consecutivas. A inversão horizontal foi desativada porque layouts de arquivo espelhado não são realistas. O aumento foi limitado à rotação de -3 graus para +3 graus e variação de brilho dentro de ±10%.

Os diagnósticos de modelos em nível de época são resumidos em 20 linhas de treinamento, cada uma contendo perda de treinamento, perda de validação, precisão do treinamento, precisão de validação, macro-F1, F1 ponderado, ROC-AUC e PR-AUC.

Fluxo de trabalho de enriquecimento de metadados

O enriquecimento de metadados foi projetado para melhorar a descoberta enquanto preserva o conservadorismo arquivístico. Valores existentes do catálogo eram mantidos, a menos que contivessem uma contradição explícita, como uma data impossível ou um conflito do tipo documento confirmado tanto pelo OCR quanto por evidências visuais. Os campos de enriquecimento de candidatos incluíam título normalizado, tipo de documento, data aproximada, menções a instituições, menções geográficas, menções a nomes pessoais, títulos de assuntos e palavras-chave.

A prioridade das evidências seguia uma ordem fixa: (1) metadados existentes do catálogo, (2) saída corrigida do OCR e (3) previsão visual do tipo de documento. A correspondência controlada de vocabulário foi usada para títulos de assuntos, e a expansão semântica do vizinho mais próximo com transformadores de frase 2.7.0 foi usada apenas quando a similaridade do cosseno era pelo menos 0,72. A normalização de data exigiu confiança de pelo menos 0,85 ou concordância entre OCR e metadados. Cada campo adicionado automaticamente manteve sua fonte, confiança e identificador de regra.

Completude dos metadados foi definida como o número de campos descritivos centrais preenchidos dividido pelo número de campos centrais aplicáveis para aquele registro. A correspondência de título de assunto foi definida como a presença de pelo menos um rótulo de assunto de vocabulário controlado, apoiado por evidências de conteúdo em nível de registro e considerado relevante para a categoria de consulta.

Construção do sistema de recuperação

Cinco índices de recuperação foram construídos para isolar contribuições de módulos: indexação de linha de base; apenas correção de reconhecimento óptico de caracteres; apenas classificação visual; apenas enriquecimento de metadados; e integração multimodal completa. Todos os índices foram construídos no software de mecanismo de busca listado na Tabela de Materiais (versão 8.11.1) no nível de registro. Os parâmetros de BM25 foram fixados em k1 = 1,2 e b = 0,75 antes da avaliação.

O índice de referência usava metadados originais e texto OCR de referência. A condição de TOC substituiu o OCR de base por um TOC corrigido. A condição visual adicionou priors do tipo documento e aumentos de ranking conscientes da classe. A condição de metadados adicionou campos descritivos enriquecidos. A condição multimodal completa combinava OCR corrigido, priors visuais e metadados enriquecidos. Os pesos dos campos foram fixados antes do teste: título normalizado = 3,0, títulos de assunto = 2,5, menções a pessoas e instituições = 2,2, menções ao local = 2,0, tipo de documento = 1,8, texto do corpo do OCR corrigido = 1,0 e texto do corpo do OCR de base = 0,8, quando aplicável.

A correspondência exata de frases foi habilitada para consultas citadas. A expansão de consultas era permitida apenas nas condições de enriquecimento de metadados e multimodal completo, e era limitada a sinônimos aceitos de vocabulário controlado e variantes de cabeçalhos de assunto. Os registros de busca foram gerados de 25 a 28 de agosto de 2025, no ambiente Linux conteinerizado listado na Tabela de Materiais, com sementes fixas e configurações de índice congeladas.

Projeto de consulta e medidas de resultado

As 420 consultas representavam comportamentos comuns de busca arquivística, em vez de prompts de benchmark apenas com palavras-chave. Os temas incluíam nomes pessoais, instituições, lugares, datas e intervalos de datas, ocupações, eventos e temas temáticos. Cada consulta era armazenada com sua redação normalizada, conjunto de registros alvo, categoria de tópico de consulta e pontuação de dificuldade.

A dificuldade foi avaliada antes da coleta usando ambiguidade do alvo, especificidade lexical e frequência esperada de expressão. Pontuações compostas abaixo de 0,40 foram classificadas como de baixa dificuldade, de 0,40 a 0,69 como de dificuldade moderada, e de 0,70 ou superior como de alta dificuldade. Os julgamentos de relevância eram concluídos antes da comparação do sistema e depois verificados em relação à coleção finalizada.

Os desfechos da coleta incluíram P@10, R@10, nDCG@10, tempo até o primeiro resultado relevante e taxa de busca bem-sucedida. P@10 foi a proporção dos 10 melhores discos considerados relevantes. R@10 foi a proporção de todos os registros relevantes conhecidos recuperados entre os 10 primeiros. nDCG@10 usava relevância graduada quando disponível e relevância binária caso contrário. O tempo até o primeiro resultado relevante foi medido desde o envio da consulta até o primeiro registro relevante aparecer na saída ranqueada. Uma busca bem-sucedida foi definida como pelo menos um resultado relevante entre os 10 melhores registros.

Coleta de estatísticas

Todas as análises foram realizadas usando as versões de software listadas na Tabela de Materiais. Os resultados contínuos foram resumidos como média ± DS quando aproximadamente simétricos e como mediana com intervalo interquartil caso contrário. Os resultados categóricos foram resumidos como contagens e percentagens.

A normalidade das diferenças pareadas foi avaliada pelo teste de Shapiro-Wilk e pelos gráficos de distribuição. Os resultados pré/pós de TOC e metadados foram comparados com testes T pareados quando as diferenças pareadas eram aproximadamente normais e os testes de Wilcoxon assinados por rank fora do caso. O desempenho da classificação antes e após o ajuste fino foi comparado usando o teste de McNemar em rótulos pareados corretos/incorretos. Os resultados de coleta multi-braço pareados foram comparados com o teste de Friedman, seguido pelos testes de Wilcoxon por sinal ajustados por Holm.

Todos os testes estatísticos foram bilaterais, e P < 0,05 foi considerado estatisticamente significativo. Intervalos de confiança foram estimados usando 2.000 reamostras bootstrap, com a semente aleatória fixada em 2025. Os efeitos foram relatados como diferenças médias, razões de chances pareadas ou tamanhos de efeito baseados em classificação, de acordo com o tipo de desfecho.

Reprodutibilidade, escopo e disponibilidade de recursos

Todos os parâmetros do pipeline eram fixados antes dos testes de recuperação. Nenhum parâmetro foi otimizado no benchmark de recuperação mantido para fora. Arquivos de configuração, vocabulários controlados, tabelas de léxicos, modelos de consulta, mapeamentos de campos, diretrizes de anotação, scripts estatísticos e scripts de geração de figuras foram mantidos no sistema de controle de versões listado na Tabela de Materiais com semente aleatória 2025.

Para suportar validação independente, o livro de dados de origem inclui uma tabela desidentificada com 1.600 registros e 17 variáveis usadas para reconhecimento óptico de caracteres, metadados e análises de classificação visual. Tabelas 1, Tabela 2, Tabela 3, Tabela 4 e Tabela 5, resumos de figuras e fontes, definições de benchmark-consulta, resumos de relevância-julgamento, substitutos de log-retrieval, diagnósticos de treinamento, categorias de léxico, regras de mapeamento de vocabulário e campos de diretrizes de anotação são fornecidos como tabelas ou arquivos de materiais carregáveis separados quando aplicável. Materiais que não podem ser compartilhados publicamente devido a restrições de repositório são representados por campos de metadados desidentificados e campos de amostragem reprodutíveis.

Este protocolo avalia descobertas orientadas à recuperação, em vez da veracidade das alegações históricas. Ela não substitui a avaliação do arquivista, avaliação de proveniência, revisão de privacidade ou regras específicas de acesso do repositório.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A correção OCR melhorou a transcrição, especialmente em registros manuscritos e tabulares

A correção por reconhecimento óptico de caracteres melhorou a qualidade da transcrição em todas as oito classes de documentos arquivísticos (n = 1.600 registros). A média do WER diminuiu de 0,529 ± 0,172 para 0,384 ± 0,123, com uma variação média pareada de −0,144 (IC 95%, −0,149 a −0,139; Wilcoxon assinado - posto P < 0,001). A média da CER diminuiu de 0,377 ± 0,126 para 0,258 ± 0,086, com uma variação média pareada de −0,119 (IC 95%, −0,123 a −0,116; Wilcoxon assinado - posto P < 0,001). A Tabela 2 mostra que o WER de referência foi o mais alto para cartas manuscritas, livros-razão e livros de registro, indicando que os registros visualmente mais complexos também apresentavam a maior carga inicial de reconhecimento.

Após a correção, o WER diminuiu em todas as classes de documentos. As maiores reduções médias de WER pareados ocorreram em cartas manuscritas (n = 262; −0,200; IC 95%, −0,213 a −0,188), livros-razão (n = 263; −0,195; IC 95%, −0,206 a −0,183) e livros de registro (n = 194; −0,173; IC 95%, −0,187 a −0,160). A CER seguiu o mesmo padrão, apoiando a interpretação de que o módulo pós-correção beneficiava principalmente registros difíceis manuscritos, tabulares e de layout misto.

A recuperação de entidades nomeadas também melhorou em todos os tipos de documentos, conforme mostrado na tabela resumida. Os maiores aumentos ocorreram em cartas manuscritas (0,302–0,440), livros-razão (0,336–0,471) e livros de registro (0,369–0,504). A correspondência digitada atingiu o maior retorno de identificação de entidades nomeadas após a correção (0,646), mas seu ganho absoluto foi menor porque o reconhecimento de linha de base já era mais forte para essa classe. A Figura 2 resume a relação CER-WER em nível de registro de base, a associação entre intensidade de escrita manual e benefício na correção, e a mudança pós-correção na descoberta em nível de registro.

A classificação visual de documentos melhorou no geral, mas os ganhos de desempenho foram desiguais entre as classes

A classificação visual de documentos melhorou no geral em todo o conjunto de 1.600 registros. A precisão do top-1 aumentou de 0,717 para 0,796 (variação absoluta, 0,079; McNemar chi-quadrado = 27,33; P < 0,001), e a confiança média na predição aumentou de 0,736 ± 0,131 para 0,800 ± 0,108 (variação média pareada, 0,064; IC 95%, 0,057–0,071; teste t pareado P < 0,001). Como mostrado na Tabela 3, sete das oito aulas melhoraram após ajustes específicos do arquivo, com os maiores ganhos para mapas, cartazes, jornais e livros de registro.

A correspondência digitada não melhorou significativamente após o ajuste fino (0,796–0,791), sugerindo que suas características visuais básicas já eram estáveis e que o procedimento de treinamento adicionou pouca separação adicional de classes para essa categoria.

A Figura 3 resume o desempenho visual da classificação de documentos antes e depois do ajuste fino específico do arquivo; o livro de dados de origem lista 20 épocas de perda e precisão de trem/validação, juntamente com resumos diagnósticos macro-F1, ponderado-F1, ROC-AUC e PR-AUC.

O enriquecimento de metadados melhorou a completude descritiva em todos os períodos históricos (n = 1.600 registros). A completude média aumentou de 0,657 ± 0,125 para 0,907 ± 0,070, com uma variação média pareada de 0,250 (IC 95%, 0,243–0,257; Wilcoxon assinado - posto P < 0,001). Como mostrado na Tabela 4, a completude de base foi a menor para 1850–1879 e aumentou em períodos posteriores antes do enriquecimento. A Figura 4 resume a melhoria na completude dos metadados, os campos de metadados recém-realizados por tipo de documento e os ganhos de correspondência de títulos de assunto ao longo de períodos históricos.

Após o enriquecimento, a completude aumentou em todos os períodos históricos: 1850–1879 (n = 281; variação média, 0,207; IC 95%, 0,191–0,223), 1880–1909 (n = 474; variação média, 0,236; IC 95%, 0,223–0,248), 1910–1939 (n = 549; variação média, 0,277; IC 95%, 0,265–0,288) e 1940–1969 (n = 296; variação média, 0,263; IC 95%, 0,247–0,279). A média dos campos povoados também aumentou consistentemente ao longo dos períodos.

A correspondência de títulos de assunto melhorou em paralelo. As taxas de correspondência de base variaram de 64,3% a 69,4%, enquanto as taxas de correspondência pós-enriquecimento variaram de 82,1% a 85,4%. O maior ganho absoluto ocorreu no período mais antigo (Delta = 0,178), apoiando o valor do enriquecimento conservador para registros com descrição inicial escassa.

O desempenho de recuperação melhorou em todos os sistemas aprimorados, com os maiores ganhos sob integração multimodal completa

A eficácia da coleta melhorou sob cada condição de aprimoramento em relação à linha de base, mas a magnitude da melhoria variou conforme o braço do sistema (n = 420 consultas de benchmark pareadas). Os resultados gerais da recuperação estão listados na Tabela 5. O desempenho inicial foi baixo: P@10 = 0,394, R@10 = 0,238, nDCG@10 = 0,392, tempo médio até o primeiro resultado relevante = 156,079 s, e taxa de busca bem-sucedida = 5,0% (21/420; IC 95%, 3,3%–7,5%). A Figura 5 resume o desempenho de recuperação nos cinco braços do sistema experimental, incluindo métricas gerais de recuperação, taxas de sucesso em nível tópico e estratos de dificuldade de consulta.

Todos os três sistemas de componente único superaram a linha de base no total. A correção por reconhecimento óptico de caracteres aumentou P@10 para 0,484, R@10 para 0,346 e nDCG@10 para 0,475, enquanto reduzia o tempo até o primeiro resultado relevante para 124,261 s e aumentava a taxa de busca bem-sucedida para 30,2% (127/420; IC 95%, 26,0%–34,8%). A classificação visual produziu P@10 = 0,490, R@10 = 0,302, nDCG@10 = 0,478, tempo médio até o primeiro resultado relevante = 131,985 s e taxa de busca bem-sucedida = 22,9% (96/420; IC 95%, 19,1%–27,1%). O enriquecimento de metadados alcançou o melhor desempenho de recuperação em componente único, com P@10 = 0,507, R@10 = 0,347, nDCG@10 = 0,513, tempo médio até o primeiro resultado relevante = 117,474 s, e uma taxa de busca bem-sucedida de 38,3% (161/420; IC 95%, 33,8%–43,1%).

O sistema multimodal completo teve melhor desempenho em todos os endpoints de recuperação. P@10 aumentou de 0,394 no início para 0,624, R@10 de 0,238 para 0,492 e nDCG@10 de 0,392 para 0,634. O tempo médio até o primeiro resultado relevante diminuiu de 156,079 s para 58,485 s, e a taxa de busca bem-sucedida aumentou de 5,0% para 95,5% (401/420; IC 95%, 93,0%–97,1%). Esses valores correspondem a ganhos absolutos de 0,230 para P@10, 0,254 para R@10 e 0,242 para nDCG@10.

A recuperação específica por tópico também melhorou com integração multimodal completa. As taxas de busca bem-sucedida aumentaram entre pessoas, instituições, lugares, ocupações, eventos e temas temáticos, com a categoria ocupacional apresentando o maior ganho prático, já que sua taxa de sucesso base foi de 0,0% e subiu para 90,0% sob a condição multimodal completa. Consultas por nomes de lugar tinham o desempenho de base mais forte, mas ainda assim se beneficiavam da integração multimodal.

Os ganhos multimodais variaram entre os estratos de documentos, períodos e línguas

Análises de subgrupos mostraram que os ganhos multimodais estavam amplamente distribuídos entre tipos de documentos, períodos históricos e contextos linguísticos, embora a magnitude da melhoria variasse. Essa heterogeneidade indica que o fluxo de trabalho deve ser avaliado dentro de cada coleção-alvo, em vez de assumir que produz ganhos uniformes. A Figura 6 mostra a heterogeneidade dos ganhos de recuperação multimodal entre o tipo de documento alvo, período histórico e contexto linguístico.

No nível do tipo documento, nDCG@10 melhorado em todas as classes alvo. Fotografias com legendas, cartas manuscritas, mapas, livros de contas e cadernos de registro apresentaram fortes ganhos, enquanto jornais e correspondência datilografada melhoraram de forma mais modesta. Esses padrões sugerem que registros com metadados iniciais fracos ou estrutura visual complexa se beneficiam mais de sinais combinados de texto, imagem e metadados.

No nível do período histórico, R@10 aumentou de 0,175 para 0,429 em 1850–1879 e atingiu 0,506 em 1880–1909, 0,501 em 1910–1939 e 0,519 em 1940–1969 sob integração multimodal completa. Os ganhos foram semelhantes em escala absoluta entre períodos, sugerindo que o enriquecimento e o reconhecimento corrigido ajudaram tanto registros esparsos iniciais quanto registros posteriores com metadados de base mais ricos.

Os resultados do contexto linguístico mostraram um padrão semelhante. P@10 sob a condição multimodal completa atingiu 0,607 para discos mistos em alfabeto latino, 0,628 para inglês, 0,618 para francês, 0,661 para alemão e 0,639 para português e espanhol. O maior ganho de precisão ocorreu para registros mistos em alfabeto latino, que apresentaram a menor precisão de base.

Padrões em nível de componente: contribuições complementares em vez de redundantes

Juntos, os resultados mostram que os componentes do protocolo são complementares, e não redundantes. A correção de OCR melhorou a reconhecibilidade do texto, a classificação visual adicionou sinais de tipo documento conscientes da estrutura, e o enriquecimento de metadados expandiu a camada descritiva pesquisável. A condição multimodal completa produziu os ganhos de recuperação mais fortes e consistentes, apoiando o objetivo do estudo de testar um fluxo de trabalho auditável e orientado à recuperação para arquivos digitais heterogêneos.

Essas descobertas apoiam um modelo de protocolo no qual a inteligência artificial multimodal complementa a busca arquivística, preservando a necessidade de governança de repositórios, proveniência de dados e validação de especialistas.

DISPONIBILIDADE DE DADOS:

O conjunto de dados de 1.600 registros desidentificados usados para as principais análises está disponível no Zenodo como data.xlsx (https://doi.org/10.5281/zenodo.20774456).

figure-results-1
Figura 1: Fluxo de trabalho reproduzível para descoberta arquivística multimodal. (A) Construção de corpus a partir de registros arquivísticos em nível de repositório com triagem de inclusão/exclusão. (B) Rotulagem de referência e controle de qualidade, incluindo tipo de documento, regiões de referência OCR, contexto do idioma, período histórico e completude dos metadados. (C) Pré-processamento de imagens, geração e pós-correção de OCR, classificação visual de documentos e enriquecimento conservador de metadados. (D) Construção de índice, avaliação de recuperação de cinco braços, análise estatística e empacotamento de recursos. Abreviações: OCR, reconhecimento óptico de caracteres; CER, taxa de erro de personagem; WER, taxa de erro de palavras. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-2
Figura 2: Estrutura de erro e descoberta de erro em reconhecimento óptico de caracteres em nível de registro após correção pós-correção. (A) CER de referência versus WER de referência em 1.600 registros de arquivo, colorido por tipo de documento para classes representativas. (B) Associação entre intensidade escalonada da escrita manual e mudança no WER após correção; valores negativos indicam WER menor após correção. A linha ajustada e a faixa cinza mostram a tendência linear e o intervalo de confiança de 95%. (C) Pontuação de descoberta em nível de registro antes e depois da correção por tipo de documento, ilustrando mudanças pós-correção nas evidências pesquisáveis. Abreviações: CER, taxa de erro de caracteres; WER, taxa de erro de palavras. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-3
Figura 3: Classificação visual de documentos antes e depois do ajuste fino específico do arquivo. (A) Precisão Top 1 por tipo de documento na linha de base e após o ajuste fino. (B) Distribuições de confiança para previsões corretas e incorretas sob condições de base e pós-ajuste. (C) Matriz de desempenho em nível de classe que resume a precisão top-1 e a confiança posterior média antes e depois da afinação. Os dados diagnósticos do modelo incluem 20 épocas de curvas de perda/precisão, macro-F1, ponderado-F1, ROC-AUC e PR-AUC. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-4
Figura 4: Completude dos metadados e correspondência de títulos de assunto após enriquecimento conservador. (A) Completude dos metadados em nível de registro antes e após o enriquecimento. (B) Campos de metadados recém-realizados por tipo de documento. (C) Ganho na disputa de cabeça de assunto ao longo dos períodos históricos. A completude foi calculada como o número de campos centrais aplicáveis povoados dividido pelo número total de campos centrais aplicáveis. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-5
Figura 5: Desempenho de recuperação nos cinco braços do sistema experimental. (A) P@10, R@10, nDCG@10, tempo até o primeiro resultado relevante e taxa de busca bem-sucedida para linha de base, correção de reconhecimento óptico de caracteres, classificação visual, enriquecimento de metadados e integração multimodal completa. (B) Gráfico de bolhas da taxa de busca bem-sucedida por tópico de consulta e braço do sistema; a cor indica o braço do sistema, e o tamanho da bolha indica o percentual de sucesso. (C) P@10, R@10 e nDCG@10 em camadas de dificuldade fácil, moderada e difícil de consulta. (D) Visão alternativa de taxa de sucesso em nível de tópico mostrando a distribuição de buscas bem-sucedidas entre tópicos de consulta e braços do sistema. Abreviações: P@10, precisão em 10; R@10, recall às 10; nDCG@10, ganho acumulado descontado normalizado em 10. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-6
Figura 6: Heterogeneidade dos ganhos de recuperação multimodal entre subgrupos arquivísticos. (A) nDCG@10 por tipo de documento alvo e condição de recuperação. (B) R@10 por período histórico e condição de recuperação. (C) P@10 por contexto do idioma alvo e condição de recuperação. As condições são: Linha de Base, correção OCR, classificação visual, enriquecimento de metadados, Integração multimodal completa, OCR+Texto, Texto+Visual+Metadados e Visual+Metadados. A figura destaca que os ganhos multimodais são generalizados, mas não uniformes entre os estratos de documentos, períodos e línguas. Por favor, clique aqui para ver uma versão ampliada desta figura.

Tipo de documentoN recordesPáginas medianasRegistros manuscritosLinha média de base
WER
Linha média de base
Metadados
Completude
Linha média de base
Descoberta
(%)
Carta manuscrita2622950.7290.64868.2
Livro de contas263763.50.6790.67472.2
Mapa10212.90.4570.55274.1
Jornal26180.80.4950.6675.5
Fotografia com legenda17911.10.3740.60173.6
Cartaz87100.4130.57174.8
Livro de registro19410180.6160.70371.3
Correspondência datilografada252340.3150.68976.4

Tabela 1: Características da coleção arquivística por tipo de documento. A tabela informa o número de registros, a contagem mediana de páginas, a porcentagem de registros contendo escrita manual, a média do WER da linha de base, a completude média dos metadados da linha de base e a pontuação média de descoberta da linha de base para cada uma das oito classes de documentos.

Tipo de DocumentoTamanho da AmostraCERCERWERWEREntidade nomeada
Recall
Entidade nomeada
Recall
ΔWER
(n)(Linha de base)(Pós-texto)(Linha de base)(Pós-texto)(Linha de base)(Pós-texto)
Carta manuscrita2620.5310.3630.7290.5310.3020.44−0,198
Livro de contas2630.490.3260.6790.4850.3360.471−0,194
Mapa1020.3220.2280.4570.3470.380.503−0.11
Jornal2610.3540.2560.4950.3810.4360.558−0,114
Fotografia com legenda1790.2570.1810.3740.2860.4940.616−0,088
Cartaz870.2870.1990.4130.3160.4480.57−0,097
Livro de registro1940.4420.2930.6160.4390.3690.504−0,177
Correspondência datilografada2520.2190.1550.3150.2320.5240.646−.083

Tabela 2: Desempenho do OCR antes e depois da correção por tipo de documento. CER e WER foram calculados com base em transcrições de referência; A recall de entidades nomeadas foi calculada contra entidades de pessoa, local, instituição e data rotuladas manualmente. O WER Delta é o WER pós-correção menos o WER do estado basal.

Tipo de documentonPrecisão,
Linha de base
Precisão,
Postar
Confiança,
Linha de base
Confiança,
Postar
ΔAccuracy
Carta manuscrita2620.6150.6450.6160.6550.03
Livro de contas2630.7070.7490.7250.7670.042
Mapa1020.7650.9020.8010.8990.137
Jornal2610.7160.8430.7280.830.127
Fotografia com legenda1790.8150.8690.8240.890.054
Cartaz870.7710.9030.7920.8890.132
Livro de registro1940.6870.7930.7010.7870.106
Correspondência datilografada2520.7960.7910.8040.82-0.005

Tabela 3: Desempenho visual da classificação de documentos antes e depois do ajuste fino específico do arquivo. A tabela relata o tamanho da amostra, a precisão top-1, a confiança posterior média e a mudança na precisão conforme o tipo de documento. Os dados diagnósticos incluem 20 linhas em nível de época com macro-F1, ponderado-F1, ROC-AUC, PR-AUC, perda de treinamento, perda de validação, precisão do treinamento e precisão de validação.

CompletudeCompletudeCampos PovoadosCampos PovoadosTítulo do assunto
Partida
Título do assunto
Partida
Δ CompletudeΔ Título de assunto
Partida
(Linha de base)(Pós-texto)(Linha de base)(Pós-texto)(Linha de base)(Pós-texto)
0.5340.8684.2748.5840.6430.8210.3340.178
0.6070.8984.8388.7090.6720.8410.2910.169
0.680.9275.4269.0950.6860.8490.2470.163
0.6860.9225.488.9530.6940.8540.2360.16

Tabela 4: Enriquecimento de metadados por período histórico. Completude é a proporção de campos descritivos centrais aplicáveis preenchidos para um registro; os campos povoados são reportados como contagens médias; A correspondência por título de assunto indica se evidências em nível de registro apoiaram pelo menos um rótulo de vocabulário controlado.

Braço do sisteman consultasP@10R@10nDCG@10Hora de começar a ser relevante
resultado(s)
Taxa de busca bem-sucedida
(%)
Linha de base4200.3940.2380.392156.0795
Correção de OCR4200.4840.3460.475124.26130.2
Classificação visual4200.490.3020.478131.98522.9
Enriquecimento de metadados4200.5070.3470.513117.47438.3
Multimodal completo4200.6240.4920.63458.48595.5

Tabela 5: Desempenho de recuperação para os cinco braços do sistema experimental. P@10, R@10, nDCG@10, tempo até o primeiro resultado relevante e taxa de busca bem-sucedida foram calculados em todo o benchmark de 420 consultas sob condições de consulta pareada.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esse protocolo demonstra que a descoberta em arquivos digitais históricos melhorou mais quando a correção de OCR, a compreensão visual de documentos e o enriquecimento conservador de metadados foram avaliados como componentes de recuperação conectados, em vez de atualizações técnicas isoladas. Os maiores ganhos em OCR ocorreram em materiais manuscritos, tabulares e de registro, apoiando o valor da correção pós-correção para classes de documentos onde o reconhecimento de linha de base é mais fraco. Ao mesmo tempo, o erro residual após correção mostra que a limpeza do OCR não pode ser tratada como transcrição definitiva e deve permanecer auditável.

Os resultados da classificação visual também exigem interpretação cuidadosa. O ajuste fino melhorou classes visualmente distintas, como mapas, cartazes, jornais e livros de registro, mas os ganhos foram menores para cartas manuscritas e livros-caixas, onde layouts se sobrepõem e os limites das classes são menos separáveis visualmente. O tamanho relativamente pequeno do corpus significa que o desempenho na classificação deve ser interpretado como evidência de protocolo, e não como prova de que um modelo multimodal de produção pode ser treinado apenas a partir de 1.600 registros. A validação futura deve comparar o EfficientNet-B3 com transformadores de documentos, transformadores de visão, transformadores Swin, ConvNeXt e modelos multimodais de fundaçãodocumental 8,11,12,13,14,15,16,17,18.

O enriquecimento de metadados contribuiu significativamente para a recuperação ao expandir registros descritivos esparsos para campos pesquisáveis, mantendo as informações de fonte e confiança. Essa descoberta é consistente com a necessidade arquivística de pontos de acesso mais ricos, mas também eleva riscos de governança. O enriquecimento automatizado pode amplificar erros de ROC, normalizar nomes historicamente ambíguos de forma muito agressiva ou introduzir viés se vocabulários controlados forem incompletos. Por essa razão, o fluxo de trabalho utiliza limiares de confiança, registro de origem e flags de revisão, em vez de substituir totalmente os registros de catálogo.

A avaliação de recuperação fornece evidências de efeitos complementares no módulo, mas possui limitações. A comparação atual utilizou condições de ablação de base e de módulo interno; não foi comparado com resgatagem densa, rankings de interação tardia como ColBERT, recuperação híbrida esparsa-densa, reclassificação neural ou sistemas de geração aumentadapor recuperação 22,23,24. Essas abordagens devem ser adicionadas em trabalhos futuros para determinar se os ganhos multimodais observados permanecem competitivos em relação às arquiteturas de recuperação atuais.

A implementação também exige atenção ao vazamento de dados, restrições computacionais e escalabilidade. O enriquecimento utilizava saídas de reconhecimento óptico de caracteres, previsões visuais e metadados existentes, então a divisão de train/validação/teste e avaliação de consultas devem ser mantidas separadas das decisões de enriquecimento. Implantações futuras devem reportar hardware, tempo de execução, uso de memória, tamanho do índice e custo por 1.000 registros. Abordagens de restauração de imagens a partir de trabalhos adjacentes de visão computacional, incluindo modelos de remoção de oclusão multiescala e baseados em atenção, podem inspirar futuros experimentos de pré-processamento, mas devem ser testadas cuidadosamente porque os fluxos de trabalho arquivísticos não devem alucinar ou alterar o conteúdo dasevidências 26,27.

No geral, o fluxo de trabalho é melhor compreendido como um protocolo de acesso reproduzível, e não como um substituto da descrição arquivística. A inteligência artificial multimodal pode melhorar a descoberta quando seus resultados são limitados, registrados e revisados, mas os arquivistas continuam sendo essenciais para avaliação de procedência, decisões de acesso e governança e interpretação de registros historicamentecomplexos 21,25.

CONCLUSÕES:
Este estudo testou se a correção por reconhecimento óptico de caracteres, a classificação visual de documentos e o enriquecimento conservador de metadados podem servir como componentes complementares de recuperação em arquivos digitais históricos. O protocolo melhorou a transcrição, classificação, completude dos metadados e desempenho agregado na recuperação, mantendo limiares explícitos, registro de fontes e salvaguardas de revisão humana. Portanto, o fluxo de trabalho deve ser usado como um protocolo auditável de suporte ao acesso, não como substituto do julgamento do arquivista ou da governança do repositório.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm nada a revelar.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores agradecem sinceramente aos dois membros experientes da equipe de arquivos e ao pesquisador profissional de humanidades digitais pela valiosa assistência na anotação de texto e controle de qualidade. Essa pesquisa foi financiada pelo Plano de Projeto de Ciência e Tecnologia dos Arquivos Provinciais de Jiangsu (Grant No. 2024-9) para a construção de um sistema inteligente de arquivos orais baseados em fala, e pelo Plano Provincial de Desenvolvimento de Ciência e Tecnologia de Jiangsu para Medicina Tradicional Chinesa (Grant No. MS2025025) para estudar a herança e o desenvolvimento das escolas da MTC sob uma perspectiva arquivística.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
PythonPython Software Foundationv3.11.8; https://www.python.org/Scripting de fluxo de trabalho, processamento de dados, correção pós-ocorrência óptica de caracteres e suporte estatístico
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/Análise estatística e geração de figuras finais
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseractGeração de reconhecimento óptico de caracteres base
Pacotes de idiomas TesseractTesseract OCR ProjectPacotes de idiomas específicos do estudo; https://github.com/tesseract-ocr/tessdataDecodificação primária e mista de reconhecimento óptico de caracteres
OpenCVOpenCV Teamv4.9.0; https://opencv.org/Desviação, estimativa de ruído e pré-processamento de imagem
PillowPython Imaging Library contributorsv10.3.0; https://python-pillow.org/Entrada/saída de imagem e normalização de formato
NumPyNumPy developersv1.26.4; https://numpy.org/Computação de matriz para processamento de imagens e métricas
pandaspandas development teamv2.2.2; https://pandas.pydata.org/Manuseio de dados tabulares e exportações de resumo
SciPySciPy developersv1.13.1; https://scipy.org/Testes estatísticos e utilitários numéricos
statsmodelsstatsmodels developersv0.14.2; https://www.statsmodels.org/Modelagem estatística e suporte de comparação emparelhada
scikit-learnscikit-learn developersv1.4.2; https://scikit-learn.org/Métricas de classificação, diagnósticos ROC/PR e utilitários de validação
rapidfuzzMax Bachmann and contributorsv3.9.0; https://github.com/rapidfuzz/RapidFuzzClassificação de candidatos por distância de edição para correção de reconhecimento óptico de caracteres
spaCyExplosion AIv3.7.4; https://spacy.io/Processamento de entidades nomeadas com tabelas de léxico personalizadas
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/Treinamento de classificador de documentos visuais
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/Implementação EfficientNet-B3 e transformações de imagem
Backbone EfficientNet-B3torchvision / Imagens predefinidas do ImageNetEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.htmlBackbone para classificação de documentos visuais
sentence-transformersUKP Lab / Hugging Face ecosystemv2.7.0; https://www.sbert.net/Expansão semântica para candidatos de vocabulário controlado
Software de mecanismo de buscaElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchIndexação, recuperação e classificação BM25
Motor de contêinerDocker Inc.Docker v26.1.1; https://www.docker.com/Ambiente de recuperação em contêiner
Sistema operacional LinuxCanonicalUbuntu 22.04 LTS; https://ubuntu.com/Ambiente operacional fixo para execuções de recuperação
Sistema de controle de versãoGit projectGit v2.44.0; https://git-scm.com/Controle de versão para configuração, vocabulários, scripts e código de figuras
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/Renderização de figuras baseada em R
MatplotlibMatplotlib developersv3.8.4; https://matplotlib.org/Visualizações suplementares e gráficos de garantia de qualidade
Diretriz de anotaçãoAutores5 seções de anotação; 8 rótulos de classe de documento; regiões de OCR; rótulos de entidade; julgamentos de relevância; regras de adjudicaçãoDefinições para classes de documento, regiões de OCR, entidades, julgamentos de relevância e adjudicação
Lexicon OCR específico do arquivoAutores6 categorias de léxico: variantes de pessoa, nomes de lugares, nomes de instituições, padrões de data, termos administrativos, abreviaçõesNomes, lugares, instituições, termos administrativos e variantes ortográficas
Mapeamento de vocabulário controladoAutores / repositórios de arquivo5 regras de mapeamento ligando entidades OCR, classe visual, palavras-chave do título, cobertura de data e tópico da consulta a campos de metadadosCorrespondência de cabeçalhos de assunto e expansão semântica
Conjunto de consulta de referênciaAutores420 consultas de referência; 6 tópicos de consulta; 3 níveis de dificuldade; 8 classes de documentos-alvo; 4 períodos históricos; 6 contextos linguísticosBenchmark de recuperação correspondido em cinco braços do sistema
Julgamentos de relevânciaAutores / anotadores2.100 linhas de consulta-sistema; 420 consultas x 5 braços do sistema; totais relevantes, contagens de relevantes-no-top-10, relevância classificada e sinalizadores de sucessoSurrogato de verdade para P@10, R@10, nDCG@10 e taxa de busca bem-sucedida
Diagnósticos de treinamentoAutores20 épocas; perda de treinamento; perda de validação; precisão de treinamento; precisão de validação; macro-F1; F1 ponderado; ROC-AUC; PR-AUCResumos de diagnóstico do modelo em nível de época
Hardware computacionalAutores8 núcleos de CPU; 32 GB de RAM; ambiente de treinamento com GPU da classe NVIDIADetalhes de recursos de reprodutibilidade para submissão JoVE
Arquivo de conjunto de dadosAutoresdata.xlsx; 1.600 registros; 17 variáveis; DOI listado na disponibilidade de dados do manuscritoDados de origem em nível de registro para análises de reconhecimento óptico de caracteres, completude de metadados, descoberta e classificação visual

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

EngenhariaEdi o 234Edi o 234Valor VazioEdi oArquivos DigitaisIA Multimodalcorre o de OCREnriquecimento de MetadadosClassifica o Visual e consulta de registros hist ricos

Artigos relacionados