$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
A correção OCR melhorou a transcrição, especialmente em registros manuscritos e tabulares
A correção por reconhecimento óptico de caracteres melhorou a qualidade da transcrição em todas as oito classes de documentos arquivísticos (n = 1.600 registros). A média do WER diminuiu de 0,529 ± 0,172 para 0,384 ± 0,123, com uma variação média pareada de −0,144 (IC 95%, −0,149 a −0,139; Wilcoxon assinado - posto P < 0,001). A média da CER diminuiu de 0,377 ± 0,126 para 0,258 ± 0,086, com uma variação média pareada de −0,119 (IC 95%, −0,123 a −0,116; Wilcoxon assinado - posto P < 0,001). A Tabela 2 mostra que o WER de referência foi o mais alto para cartas manuscritas, livros-razão e livros de registro, indicando que os registros visualmente mais complexos também apresentavam a maior carga inicial de reconhecimento.
Após a correção, o WER diminuiu em todas as classes de documentos. As maiores reduções médias de WER pareados ocorreram em cartas manuscritas (n = 262; −0,200; IC 95%, −0,213 a −0,188), livros-razão (n = 263; −0,195; IC 95%, −0,206 a −0,183) e livros de registro (n = 194; −0,173; IC 95%, −0,187 a −0,160). A CER seguiu o mesmo padrão, apoiando a interpretação de que o módulo pós-correção beneficiava principalmente registros difíceis manuscritos, tabulares e de layout misto.
A recuperação de entidades nomeadas também melhorou em todos os tipos de documentos, conforme mostrado na tabela resumida. Os maiores aumentos ocorreram em cartas manuscritas (0,302–0,440), livros-razão (0,336–0,471) e livros de registro (0,369–0,504). A correspondência digitada atingiu o maior retorno de identificação de entidades nomeadas após a correção (0,646), mas seu ganho absoluto foi menor porque o reconhecimento de linha de base já era mais forte para essa classe. A Figura 2 resume a relação CER-WER em nível de registro de base, a associação entre intensidade de escrita manual e benefício na correção, e a mudança pós-correção na descoberta em nível de registro.
A classificação visual de documentos melhorou no geral, mas os ganhos de desempenho foram desiguais entre as classes
A classificação visual de documentos melhorou no geral em todo o conjunto de 1.600 registros. A precisão do top-1 aumentou de 0,717 para 0,796 (variação absoluta, 0,079; McNemar chi-quadrado = 27,33; P < 0,001), e a confiança média na predição aumentou de 0,736 ± 0,131 para 0,800 ± 0,108 (variação média pareada, 0,064; IC 95%, 0,057–0,071; teste t pareado P < 0,001). Como mostrado na Tabela 3, sete das oito aulas melhoraram após ajustes específicos do arquivo, com os maiores ganhos para mapas, cartazes, jornais e livros de registro.
A correspondência digitada não melhorou significativamente após o ajuste fino (0,796–0,791), sugerindo que suas características visuais básicas já eram estáveis e que o procedimento de treinamento adicionou pouca separação adicional de classes para essa categoria.
A Figura 3 resume o desempenho visual da classificação de documentos antes e depois do ajuste fino específico do arquivo; o livro de dados de origem lista 20 épocas de perda e precisão de trem/validação, juntamente com resumos diagnósticos macro-F1, ponderado-F1, ROC-AUC e PR-AUC.
O enriquecimento de metadados melhorou a completude descritiva em todos os períodos históricos (n = 1.600 registros). A completude média aumentou de 0,657 ± 0,125 para 0,907 ± 0,070, com uma variação média pareada de 0,250 (IC 95%, 0,243–0,257; Wilcoxon assinado - posto P < 0,001). Como mostrado na Tabela 4, a completude de base foi a menor para 1850–1879 e aumentou em períodos posteriores antes do enriquecimento. A Figura 4 resume a melhoria na completude dos metadados, os campos de metadados recém-realizados por tipo de documento e os ganhos de correspondência de títulos de assunto ao longo de períodos históricos.
Após o enriquecimento, a completude aumentou em todos os períodos históricos: 1850–1879 (n = 281; variação média, 0,207; IC 95%, 0,191–0,223), 1880–1909 (n = 474; variação média, 0,236; IC 95%, 0,223–0,248), 1910–1939 (n = 549; variação média, 0,277; IC 95%, 0,265–0,288) e 1940–1969 (n = 296; variação média, 0,263; IC 95%, 0,247–0,279). A média dos campos povoados também aumentou consistentemente ao longo dos períodos.
A correspondência de títulos de assunto melhorou em paralelo. As taxas de correspondência de base variaram de 64,3% a 69,4%, enquanto as taxas de correspondência pós-enriquecimento variaram de 82,1% a 85,4%. O maior ganho absoluto ocorreu no período mais antigo (Delta = 0,178), apoiando o valor do enriquecimento conservador para registros com descrição inicial escassa.
O desempenho de recuperação melhorou em todos os sistemas aprimorados, com os maiores ganhos sob integração multimodal completa
A eficácia da coleta melhorou sob cada condição de aprimoramento em relação à linha de base, mas a magnitude da melhoria variou conforme o braço do sistema (n = 420 consultas de benchmark pareadas). Os resultados gerais da recuperação estão listados na Tabela 5. O desempenho inicial foi baixo: P@10 = 0,394, R@10 = 0,238, nDCG@10 = 0,392, tempo médio até o primeiro resultado relevante = 156,079 s, e taxa de busca bem-sucedida = 5,0% (21/420; IC 95%, 3,3%–7,5%). A Figura 5 resume o desempenho de recuperação nos cinco braços do sistema experimental, incluindo métricas gerais de recuperação, taxas de sucesso em nível tópico e estratos de dificuldade de consulta.
Todos os três sistemas de componente único superaram a linha de base no total. A correção por reconhecimento óptico de caracteres aumentou P@10 para 0,484, R@10 para 0,346 e nDCG@10 para 0,475, enquanto reduzia o tempo até o primeiro resultado relevante para 124,261 s e aumentava a taxa de busca bem-sucedida para 30,2% (127/420; IC 95%, 26,0%–34,8%). A classificação visual produziu P@10 = 0,490, R@10 = 0,302, nDCG@10 = 0,478, tempo médio até o primeiro resultado relevante = 131,985 s e taxa de busca bem-sucedida = 22,9% (96/420; IC 95%, 19,1%–27,1%). O enriquecimento de metadados alcançou o melhor desempenho de recuperação em componente único, com P@10 = 0,507, R@10 = 0,347, nDCG@10 = 0,513, tempo médio até o primeiro resultado relevante = 117,474 s, e uma taxa de busca bem-sucedida de 38,3% (161/420; IC 95%, 33,8%–43,1%).
O sistema multimodal completo teve melhor desempenho em todos os endpoints de recuperação. P@10 aumentou de 0,394 no início para 0,624, R@10 de 0,238 para 0,492 e nDCG@10 de 0,392 para 0,634. O tempo médio até o primeiro resultado relevante diminuiu de 156,079 s para 58,485 s, e a taxa de busca bem-sucedida aumentou de 5,0% para 95,5% (401/420; IC 95%, 93,0%–97,1%). Esses valores correspondem a ganhos absolutos de 0,230 para P@10, 0,254 para R@10 e 0,242 para nDCG@10.
A recuperação específica por tópico também melhorou com integração multimodal completa. As taxas de busca bem-sucedida aumentaram entre pessoas, instituições, lugares, ocupações, eventos e temas temáticos, com a categoria ocupacional apresentando o maior ganho prático, já que sua taxa de sucesso base foi de 0,0% e subiu para 90,0% sob a condição multimodal completa. Consultas por nomes de lugar tinham o desempenho de base mais forte, mas ainda assim se beneficiavam da integração multimodal.
Os ganhos multimodais variaram entre os estratos de documentos, períodos e línguas
Análises de subgrupos mostraram que os ganhos multimodais estavam amplamente distribuídos entre tipos de documentos, períodos históricos e contextos linguísticos, embora a magnitude da melhoria variasse. Essa heterogeneidade indica que o fluxo de trabalho deve ser avaliado dentro de cada coleção-alvo, em vez de assumir que produz ganhos uniformes. A Figura 6 mostra a heterogeneidade dos ganhos de recuperação multimodal entre o tipo de documento alvo, período histórico e contexto linguístico.
No nível do tipo documento, nDCG@10 melhorado em todas as classes alvo. Fotografias com legendas, cartas manuscritas, mapas, livros de contas e cadernos de registro apresentaram fortes ganhos, enquanto jornais e correspondência datilografada melhoraram de forma mais modesta. Esses padrões sugerem que registros com metadados iniciais fracos ou estrutura visual complexa se beneficiam mais de sinais combinados de texto, imagem e metadados.
No nível do período histórico, R@10 aumentou de 0,175 para 0,429 em 1850–1879 e atingiu 0,506 em 1880–1909, 0,501 em 1910–1939 e 0,519 em 1940–1969 sob integração multimodal completa. Os ganhos foram semelhantes em escala absoluta entre períodos, sugerindo que o enriquecimento e o reconhecimento corrigido ajudaram tanto registros esparsos iniciais quanto registros posteriores com metadados de base mais ricos.
Os resultados do contexto linguístico mostraram um padrão semelhante. P@10 sob a condição multimodal completa atingiu 0,607 para discos mistos em alfabeto latino, 0,628 para inglês, 0,618 para francês, 0,661 para alemão e 0,639 para português e espanhol. O maior ganho de precisão ocorreu para registros mistos em alfabeto latino, que apresentaram a menor precisão de base.
Padrões em nível de componente: contribuições complementares em vez de redundantes
Juntos, os resultados mostram que os componentes do protocolo são complementares, e não redundantes. A correção de OCR melhorou a reconhecibilidade do texto, a classificação visual adicionou sinais de tipo documento conscientes da estrutura, e o enriquecimento de metadados expandiu a camada descritiva pesquisável. A condição multimodal completa produziu os ganhos de recuperação mais fortes e consistentes, apoiando o objetivo do estudo de testar um fluxo de trabalho auditável e orientado à recuperação para arquivos digitais heterogêneos.
Essas descobertas apoiam um modelo de protocolo no qual a inteligência artificial multimodal complementa a busca arquivística, preservando a necessidade de governança de repositórios, proveniência de dados e validação de especialistas.
DISPONIBILIDADE DE DADOS:
O conjunto de dados de 1.600 registros desidentificados usados para as principais análises está disponível no Zenodo como data.xlsx (https://doi.org/10.5281/zenodo.20774456).

Figura 1: Fluxo de trabalho reproduzível para descoberta arquivística multimodal. (A) Construção de corpus a partir de registros arquivísticos em nível de repositório com triagem de inclusão/exclusão. (B) Rotulagem de referência e controle de qualidade, incluindo tipo de documento, regiões de referência OCR, contexto do idioma, período histórico e completude dos metadados. (C) Pré-processamento de imagens, geração e pós-correção de OCR, classificação visual de documentos e enriquecimento conservador de metadados. (D) Construção de índice, avaliação de recuperação de cinco braços, análise estatística e empacotamento de recursos. Abreviações: OCR, reconhecimento óptico de caracteres; CER, taxa de erro de personagem; WER, taxa de erro de palavras. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 2: Estrutura de erro e descoberta de erro em reconhecimento óptico de caracteres em nível de registro após correção pós-correção. (A) CER de referência versus WER de referência em 1.600 registros de arquivo, colorido por tipo de documento para classes representativas. (B) Associação entre intensidade escalonada da escrita manual e mudança no WER após correção; valores negativos indicam WER menor após correção. A linha ajustada e a faixa cinza mostram a tendência linear e o intervalo de confiança de 95%. (C) Pontuação de descoberta em nível de registro antes e depois da correção por tipo de documento, ilustrando mudanças pós-correção nas evidências pesquisáveis. Abreviações: CER, taxa de erro de caracteres; WER, taxa de erro de palavras. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 3: Classificação visual de documentos antes e depois do ajuste fino específico do arquivo. (A) Precisão Top 1 por tipo de documento na linha de base e após o ajuste fino. (B) Distribuições de confiança para previsões corretas e incorretas sob condições de base e pós-ajuste. (C) Matriz de desempenho em nível de classe que resume a precisão top-1 e a confiança posterior média antes e depois da afinação. Os dados diagnósticos do modelo incluem 20 épocas de curvas de perda/precisão, macro-F1, ponderado-F1, ROC-AUC e PR-AUC. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 4: Completude dos metadados e correspondência de títulos de assunto após enriquecimento conservador. (A) Completude dos metadados em nível de registro antes e após o enriquecimento. (B) Campos de metadados recém-realizados por tipo de documento. (C) Ganho na disputa de cabeça de assunto ao longo dos períodos históricos. A completude foi calculada como o número de campos centrais aplicáveis povoados dividido pelo número total de campos centrais aplicáveis. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 5: Desempenho de recuperação nos cinco braços do sistema experimental. (A) P@10, R@10, nDCG@10, tempo até o primeiro resultado relevante e taxa de busca bem-sucedida para linha de base, correção de reconhecimento óptico de caracteres, classificação visual, enriquecimento de metadados e integração multimodal completa. (B) Gráfico de bolhas da taxa de busca bem-sucedida por tópico de consulta e braço do sistema; a cor indica o braço do sistema, e o tamanho da bolha indica o percentual de sucesso. (C) P@10, R@10 e nDCG@10 em camadas de dificuldade fácil, moderada e difícil de consulta. (D) Visão alternativa de taxa de sucesso em nível de tópico mostrando a distribuição de buscas bem-sucedidas entre tópicos de consulta e braços do sistema. Abreviações: P@10, precisão em 10; R@10, recall às 10; nDCG@10, ganho acumulado descontado normalizado em 10. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 6: Heterogeneidade dos ganhos de recuperação multimodal entre subgrupos arquivísticos. (A) nDCG@10 por tipo de documento alvo e condição de recuperação. (B) R@10 por período histórico e condição de recuperação. (C) P@10 por contexto do idioma alvo e condição de recuperação. As condições são: Linha de Base, correção OCR, classificação visual, enriquecimento de metadados, Integração multimodal completa, OCR+Texto, Texto+Visual+Metadados e Visual+Metadados. A figura destaca que os ganhos multimodais são generalizados, mas não uniformes entre os estratos de documentos, períodos e línguas. Por favor, clique aqui para ver uma versão ampliada desta figura.
| Tipo de documento | N recordes | Páginas medianas | Registros manuscritos | Linha média de base WER | Linha média de base Metadados Completude | Linha média de base Descoberta |
| | | (%) | | | |
| Carta manuscrita | 262 | 2 | 95 | 0.729 | 0.648 | 68.2 |
| Livro de contas | 263 | 7 | 63.5 | 0.679 | 0.674 | 72.2 |
| Mapa | 102 | 1 | 2.9 | 0.457 | 0.552 | 74.1 |
| Jornal | 261 | 8 | 0.8 | 0.495 | 0.66 | 75.5 |
| Fotografia com legenda | 179 | 1 | 1.1 | 0.374 | 0.601 | 73.6 |
| Cartaz | 87 | 1 | 0 | 0.413 | 0.571 | 74.8 |
| Livro de registro | 194 | 10 | 18 | 0.616 | 0.703 | 71.3 |
| Correspondência datilografada | 252 | 3 | 4 | 0.315 | 0.689 | 76.4 |
Tabela 1: Características da coleção arquivística por tipo de documento. A tabela informa o número de registros, a contagem mediana de páginas, a porcentagem de registros contendo escrita manual, a média do WER da linha de base, a completude média dos metadados da linha de base e a pontuação média de descoberta da linha de base para cada uma das oito classes de documentos.
| Tipo de Documento | Tamanho da Amostra | CER | CER | WER | WER | Entidade nomeada Recall | Entidade nomeada Recall | ΔWER |
| (n) | (Linha de base) | (Pós-texto) | (Linha de base) | (Pós-texto) | (Linha de base) | (Pós-texto) | |
| Carta manuscrita | 262 | 0.531 | 0.363 | 0.729 | 0.531 | 0.302 | 0.44 | −0,198 |
| Livro de contas | 263 | 0.49 | 0.326 | 0.679 | 0.485 | 0.336 | 0.471 | −0,194 |
| Mapa | 102 | 0.322 | 0.228 | 0.457 | 0.347 | 0.38 | 0.503 | −0.11 |
| Jornal | 261 | 0.354 | 0.256 | 0.495 | 0.381 | 0.436 | 0.558 | −0,114 |
| Fotografia com legenda | 179 | 0.257 | 0.181 | 0.374 | 0.286 | 0.494 | 0.616 | −0,088 |
| Cartaz | 87 | 0.287 | 0.199 | 0.413 | 0.316 | 0.448 | 0.57 | −0,097 |
| Livro de registro | 194 | 0.442 | 0.293 | 0.616 | 0.439 | 0.369 | 0.504 | −0,177 |
| Correspondência datilografada | 252 | 0.219 | 0.155 | 0.315 | 0.232 | 0.524 | 0.646 | −.083 |
Tabela 2: Desempenho do OCR antes e depois da correção por tipo de documento. CER e WER foram calculados com base em transcrições de referência; A recall de entidades nomeadas foi calculada contra entidades de pessoa, local, instituição e data rotuladas manualmente. O WER Delta é o WER pós-correção menos o WER do estado basal.
| Tipo de documento | n | Precisão, Linha de base | Precisão, Postar | Confiança, Linha de base | Confiança, Postar | ΔAccuracy |
| Carta manuscrita | 262 | 0.615 | 0.645 | 0.616 | 0.655 | 0.03 |
| Livro de contas | 263 | 0.707 | 0.749 | 0.725 | 0.767 | 0.042 |
| Mapa | 102 | 0.765 | 0.902 | 0.801 | 0.899 | 0.137 |
| Jornal | 261 | 0.716 | 0.843 | 0.728 | 0.83 | 0.127 |
| Fotografia com legenda | 179 | 0.815 | 0.869 | 0.824 | 0.89 | 0.054 |
| Cartaz | 87 | 0.771 | 0.903 | 0.792 | 0.889 | 0.132 |
| Livro de registro | 194 | 0.687 | 0.793 | 0.701 | 0.787 | 0.106 |
| Correspondência datilografada | 252 | 0.796 | 0.791 | 0.804 | 0.82 | -0.005 |
Tabela 3: Desempenho visual da classificação de documentos antes e depois do ajuste fino específico do arquivo. A tabela relata o tamanho da amostra, a precisão top-1, a confiança posterior média e a mudança na precisão conforme o tipo de documento. Os dados diagnósticos incluem 20 linhas em nível de época com macro-F1, ponderado-F1, ROC-AUC, PR-AUC, perda de treinamento, perda de validação, precisão do treinamento e precisão de validação.
| Completude | Completude | Campos Povoados | Campos Povoados | Título do assunto Partida | Título do assunto Partida | Δ Completude | Δ Título de assunto Partida |
| (Linha de base) | (Pós-texto) | (Linha de base) | (Pós-texto) | (Linha de base) | (Pós-texto) | | |
| 0.534 | 0.868 | 4.274 | 8.584 | 0.643 | 0.821 | 0.334 | 0.178 |
| 0.607 | 0.898 | 4.838 | 8.709 | 0.672 | 0.841 | 0.291 | 0.169 |
| 0.68 | 0.927 | 5.426 | 9.095 | 0.686 | 0.849 | 0.247 | 0.163 |
| 0.686 | 0.922 | 5.48 | 8.953 | 0.694 | 0.854 | 0.236 | 0.16 |
Tabela 4: Enriquecimento de metadados por período histórico. Completude é a proporção de campos descritivos centrais aplicáveis preenchidos para um registro; os campos povoados são reportados como contagens médias; A correspondência por título de assunto indica se evidências em nível de registro apoiaram pelo menos um rótulo de vocabulário controlado.
| Braço do sistema | n consultas | P@10 | R@10 | nDCG@10 | Hora de começar a ser relevante resultado(s) | Taxa de busca bem-sucedida |
| | | | | | (%) |
| Linha de base | 420 | 0.394 | 0.238 | 0.392 | 156.079 | 5 |
| Correção de OCR | 420 | 0.484 | 0.346 | 0.475 | 124.261 | 30.2 |
| Classificação visual | 420 | 0.49 | 0.302 | 0.478 | 131.985 | 22.9 |
| Enriquecimento de metadados | 420 | 0.507 | 0.347 | 0.513 | 117.474 | 38.3 |
| Multimodal completo | 420 | 0.624 | 0.492 | 0.634 | 58.485 | 95.5 |
Tabela 5: Desempenho de recuperação para os cinco braços do sistema experimental. P@10, R@10, nDCG@10, tempo até o primeiro resultado relevante e taxa de busca bem-sucedida foram calculados em todo o benchmark de 420 consultas sob condições de consulta pareada.