Este estudo utilizou registros arquivísticos digitalizados e consultas simuladas de recuperação como unidades de análise. Repositórios arquivísticos podem restringir o acesso a registros sensíveis ou culturalmente restritos. Siga as regras de acesso ao repositório, procedimentos institucionais de segurança de dados e requisitos de desidentificação antes de processar ou compartilhar qualquer registro. Nenhum lixo químico perigoso, biológicos, cortantes, radioativos ou outros resíduos laboratoriais regulados foi gerado por esse fluxo de trabalho digital.
Projeto do estudo e construção do corpus
A Figura 1 apresenta o fluxo de trabalho completo do estudo, incluindo construção de corpus, rotulagem de referência, pré-processamento de imagens, geração e pós-correção de OCR, classificação visual, enriquecimento de metadados, construção de índices, avaliação de recuperação, análise estatística e embalagem de reprodutibilidade.
A construção do corpus foi realizada de 15 de janeiro a 30 de abril de 2025, seguida pelo projeto e depuração do sistema de 1º de maio a 31 de outubro de 2025. O corpus continha 1.600 registros arquivísticos digitalizados, selecionados de oito depósitos que representam sistemas estaduais, municipais, religiosos, de museus, universitários e bibliotecarios. O quadro de amostragem foi estratificado por classe de repositório e documento para preservar a heterogeneidade arquivística entre cartas manuscritas, livros-caixa, mapas, jornais, fotografias com legendas, cartazes, livros de registro e correspondência datilografada.
Para cada registro candidato, o registro de seleção registrava o identificador do repositório ou coleção, identificador de catálogo, classe do documento, período histórico aproximado, contexto dominante do idioma, formato de imagem disponível, resolução da imagem, contagem de páginas e campos descritivos de referência. A inclusão exigia todos os seguintes fatores: um identificador estável de catálogo; pelo menos uma imagem de página em TIFF, JPEG ou PNG; resolução de imagem de origem de pelo menos 150 dpi; conteúdo textual, tabular ou estrutural documental legível; e atribuição a uma das oito classes de documentos predefinidas. Os critérios de exclusão eram duplicatas exatas, páginas reversas em branco, imagens cortadas a ponto de mais de 30% da área com texto estar faltando, e registros considerados ilegíveis após inspeção manual.
O benchmark de recuperação continha 420 consultas curtas em linguagem natural geradas entre 5 e 20 de agosto de 2025. A geração de consultas seguiu um modelo reproduzível: as necessidades de informação dos candidatos foram amostradas de pessoas, instituições, locais, períodos de datas, ocupações, eventos e temas atuais; cada consulta foi normalizada para 2–9 palavras; e registros relevantes ao alvo foram identificados antes da comparação do sistema. Cada consulta foi avaliada sob cinco condições de recuperação, produzindo 2.100 observações de condição de consulta correspondentes.
Rotulagem de referência e controle de qualidade
A rotulagem de referência foi realizada de 1º de maio a 15 de julho de 2025, por três anotadores: dois membros da equipe de arquivos com experiência em catalogação descritiva e um pesquisador de humanidades digitais com experiência em avaliação de documentos históricos. O guia de anotação definiu classes de documentos, categorias de contexto de idioma, bins de período histórico, campos de completude de metadados, categorias de entidades nomeadas e regras para selecionar regiões de avaliação de OCR.
Para avaliação de OCR, os anotadores selecionaram regiões representativas com texto que incluíam títulos, nomes, datas, termos institucionais, notas marginais, entradas tabulares e, quando presentes, áreas de layout ruidosas. Quando uma página continha múltiplas regiões de texto, a região selecionada precisava ser relevante para a recuperação e incluir caracteres suficientes para cálculos de CER e WER. As discordâncias eram inicialmente resolvidas por meio de discussões entre os dois principais anotadores; Casos não resolvidos foram julgados pelo pesquisador de humanidades digitais.
O controle de qualidade utilizou um subconjunto aleatório de 12% dos registros. O acordo entre anotadores para o tipo principal de documento era o kappa de Cohen = 0,86, apoiando um acordo substancial. O log de adjudicação manteve os rótulos original e final, a categoria de discordância e o motivo da resolução para que futuros usuários possam auditar definições de classes e casos extremos.
Pré-processamento de imagem
Todas as imagens foram processadas em nível de registro usando Python 3.11.8 com OpenCV 4.9.0, Pillow 10.3.0 e NumPy 1.26.4. Cada página de entrada era convertida para escala de cinza de 8 bits, a menos que a cor contenha informações semânticas, como mapas, cartazes, carimbos ou anotações codificadas por cores. O descompasso foi estimado usando perfis de projeção e detecção de linhas de Hough; Deskewing era aplicado apenas quando o ângulo absoluto de desvio ultrapassava 1,5 graus e era limitado a 8,0 graus para evitar distorção.
O aprimoramento de contraste utilizou equalização adaptativa de histogramas limitada por contraste com clipLimit = 2.0 e tileGridSize = 8 × 8. Um filtro mediano com um núcleo de 3 × 10−23 foi aplicado apenas quando a razão estimada de ruído de fundo excedeu 0,35. Imagens capturadas entre 150 e 299 dpi foram reamostradas para 300 dpi para reconhecimento óptico de caracteres; Imagens já a 300 dpi ou mais não foram ampliadas. Não foi usada super-resolução, restauração generativa ou alucinação de conteúdo.
O bleed-through, escurecimento das bordas, textura irregular do papel, carimbos marginais, caligrafia, linhas com regras e limites de tabela foram mantidos, a menos que impedissem a seleção de regiões OCR. Essa regra preservava evidências arquivísticas enquanto padronizava suficientemente as entradas de imagem para OCR reproduzível e classificação.
Geração de base OCR e pós-correção
O OCR de base foi gerado com o OCR Tesseract 5.3.0. O pacote de idiomas primários foi selecionado a partir do idioma do catálogo e do script visível; a decodificação multilíngue era ativada quando o idioma do catálogo e o script da página não coincidiam. As saídas do OCR eram agrupadas no nível do registro e armazenadas com identificadores de página, confiança do OCR, coordenadas da caixa delimitadora quando disponíveis e texto bruto antes da correção.
A correção pós-OCR utilizou um procedimento conservador em três estágios. Primeiro, a normalização em nível de caractere corrigiu confusões frequentes de reconhecimento histórico, incluindo ligaduras, substituições long-s/short-s, pontuação fragmentada e substituições dígito-letra. Segundo, a correção em nível de token utilizou candidatos de distância de edição e classificação de frequência a partir de um léxico específico do arquivo de nomes pessoais, nomes de lugares, instituições, termos administrativos e variantes históricas de ortografia. Terceiro, verificações de sequência baseadas em regras validaram entidades e datas nomeadas com base em evidências de contexto e metadados.
Substitutos candidatos foram aceitos apenas quando a confiança na correção posterior excedeu 0,80; Substituições de entidades nomeadas exigiam confiança de pelo menos 0,85. Candidatos abaixo do limite foram mantidos como texto do OCR, mas sinalizados para revisão. A CER foi calculada como a distância de edição de Levenshtein dividida pelo número de caracteres na transcrição de referência. A WER usava a mesma fórmula no nível do token. A recordação de entidades nomeadas foi calculada como entidades de referência corretamente reconhecidas divididas por todas as entidades de referência na região de avaliação selecionada.
Classificação visual de documentos
O módulo de classificação visual atribuía cada registro a uma das oito classes de documentos arquivísticos: carta manuscrita, livro-caixa, mapa, jornal, fotografia com legenda, pôster, livro de registro e correspondência datilografada. O tipo de documento previsto era usado como sinal de recuperação e filtragem, não como substituto autoritativo para a catalogação arquivística.
O modelo foi implementado no PyTorch 2.2.2 e no torchvision 0.17.2 usando uma espinha dorsal EfficientNet-B3 pré-treinada pelo ImageNet. As miniaturas em nível de registro foram redimensionadas para 384 x 384 pixels. Para reduzir vazamentos, os registros foram divididos por classe de repositório e documento em conjuntos de treinamento, validação e teste em uma proporção de 70:15:15, correspondendo a aproximadamente 1.120, 240 e 240 registros.
O treinamento usou AdamW com taxa inicial de aprendizado = 1 × 10-4, decaimento do peso = 1 × 10−2, tamanho do lote = 16, suavização de rótulos = 0,05 e parada precoce quando a perda de validação não melhorou por cinco épocas consecutivas. A inversão horizontal foi desativada porque layouts de arquivo espelhado não são realistas. O aumento foi limitado à rotação de -3 graus para +3 graus e variação de brilho dentro de ±10%.
Os diagnósticos de modelos em nível de época são resumidos em 20 linhas de treinamento, cada uma contendo perda de treinamento, perda de validação, precisão do treinamento, precisão de validação, macro-F1, F1 ponderado, ROC-AUC e PR-AUC.
Fluxo de trabalho de enriquecimento de metadados
O enriquecimento de metadados foi projetado para melhorar a descoberta enquanto preserva o conservadorismo arquivístico. Valores existentes do catálogo eram mantidos, a menos que contivessem uma contradição explícita, como uma data impossível ou um conflito do tipo documento confirmado tanto pelo OCR quanto por evidências visuais. Os campos de enriquecimento de candidatos incluíam título normalizado, tipo de documento, data aproximada, menções a instituições, menções geográficas, menções a nomes pessoais, títulos de assuntos e palavras-chave.
A prioridade das evidências seguia uma ordem fixa: (1) metadados existentes do catálogo, (2) saída corrigida do OCR e (3) previsão visual do tipo de documento. A correspondência controlada de vocabulário foi usada para títulos de assuntos, e a expansão semântica do vizinho mais próximo com transformadores de frase 2.7.0 foi usada apenas quando a similaridade do cosseno era pelo menos 0,72. A normalização de data exigiu confiança de pelo menos 0,85 ou concordância entre OCR e metadados. Cada campo adicionado automaticamente manteve sua fonte, confiança e identificador de regra.
Completude dos metadados foi definida como o número de campos descritivos centrais preenchidos dividido pelo número de campos centrais aplicáveis para aquele registro. A correspondência de título de assunto foi definida como a presença de pelo menos um rótulo de assunto de vocabulário controlado, apoiado por evidências de conteúdo em nível de registro e considerado relevante para a categoria de consulta.
Construção do sistema de recuperação
Cinco índices de recuperação foram construídos para isolar contribuições de módulos: indexação de linha de base; apenas correção de reconhecimento óptico de caracteres; apenas classificação visual; apenas enriquecimento de metadados; e integração multimodal completa. Todos os índices foram construídos no software de mecanismo de busca listado na Tabela de Materiais (versão 8.11.1) no nível de registro. Os parâmetros de BM25 foram fixados em k1 = 1,2 e b = 0,75 antes da avaliação.
O índice de referência usava metadados originais e texto OCR de referência. A condição de TOC substituiu o OCR de base por um TOC corrigido. A condição visual adicionou priors do tipo documento e aumentos de ranking conscientes da classe. A condição de metadados adicionou campos descritivos enriquecidos. A condição multimodal completa combinava OCR corrigido, priors visuais e metadados enriquecidos. Os pesos dos campos foram fixados antes do teste: título normalizado = 3,0, títulos de assunto = 2,5, menções a pessoas e instituições = 2,2, menções ao local = 2,0, tipo de documento = 1,8, texto do corpo do OCR corrigido = 1,0 e texto do corpo do OCR de base = 0,8, quando aplicável.
A correspondência exata de frases foi habilitada para consultas citadas. A expansão de consultas era permitida apenas nas condições de enriquecimento de metadados e multimodal completo, e era limitada a sinônimos aceitos de vocabulário controlado e variantes de cabeçalhos de assunto. Os registros de busca foram gerados de 25 a 28 de agosto de 2025, no ambiente Linux conteinerizado listado na Tabela de Materiais, com sementes fixas e configurações de índice congeladas.
Projeto de consulta e medidas de resultado
As 420 consultas representavam comportamentos comuns de busca arquivística, em vez de prompts de benchmark apenas com palavras-chave. Os temas incluíam nomes pessoais, instituições, lugares, datas e intervalos de datas, ocupações, eventos e temas temáticos. Cada consulta era armazenada com sua redação normalizada, conjunto de registros alvo, categoria de tópico de consulta e pontuação de dificuldade.
A dificuldade foi avaliada antes da coleta usando ambiguidade do alvo, especificidade lexical e frequência esperada de expressão. Pontuações compostas abaixo de 0,40 foram classificadas como de baixa dificuldade, de 0,40 a 0,69 como de dificuldade moderada, e de 0,70 ou superior como de alta dificuldade. Os julgamentos de relevância eram concluídos antes da comparação do sistema e depois verificados em relação à coleção finalizada.
Os desfechos da coleta incluíram P@10, R@10, nDCG@10, tempo até o primeiro resultado relevante e taxa de busca bem-sucedida. P@10 foi a proporção dos 10 melhores discos considerados relevantes. R@10 foi a proporção de todos os registros relevantes conhecidos recuperados entre os 10 primeiros. nDCG@10 usava relevância graduada quando disponível e relevância binária caso contrário. O tempo até o primeiro resultado relevante foi medido desde o envio da consulta até o primeiro registro relevante aparecer na saída ranqueada. Uma busca bem-sucedida foi definida como pelo menos um resultado relevante entre os 10 melhores registros.
Coleta de estatísticas
Todas as análises foram realizadas usando as versões de software listadas na Tabela de Materiais. Os resultados contínuos foram resumidos como média ± DS quando aproximadamente simétricos e como mediana com intervalo interquartil caso contrário. Os resultados categóricos foram resumidos como contagens e percentagens.
A normalidade das diferenças pareadas foi avaliada pelo teste de Shapiro-Wilk e pelos gráficos de distribuição. Os resultados pré/pós de TOC e metadados foram comparados com testes T pareados quando as diferenças pareadas eram aproximadamente normais e os testes de Wilcoxon assinados por rank fora do caso. O desempenho da classificação antes e após o ajuste fino foi comparado usando o teste de McNemar em rótulos pareados corretos/incorretos. Os resultados de coleta multi-braço pareados foram comparados com o teste de Friedman, seguido pelos testes de Wilcoxon por sinal ajustados por Holm.
Todos os testes estatísticos foram bilaterais, e P < 0,05 foi considerado estatisticamente significativo. Intervalos de confiança foram estimados usando 2.000 reamostras bootstrap, com a semente aleatória fixada em 2025. Os efeitos foram relatados como diferenças médias, razões de chances pareadas ou tamanhos de efeito baseados em classificação, de acordo com o tipo de desfecho.
Reprodutibilidade, escopo e disponibilidade de recursos
Todos os parâmetros do pipeline eram fixados antes dos testes de recuperação. Nenhum parâmetro foi otimizado no benchmark de recuperação mantido para fora. Arquivos de configuração, vocabulários controlados, tabelas de léxicos, modelos de consulta, mapeamentos de campos, diretrizes de anotação, scripts estatísticos e scripts de geração de figuras foram mantidos no sistema de controle de versões listado na Tabela de Materiais com semente aleatória 2025.
Para suportar validação independente, o livro de dados de origem inclui uma tabela desidentificada com 1.600 registros e 17 variáveis usadas para reconhecimento óptico de caracteres, metadados e análises de classificação visual. Tabelas 1, Tabela 2, Tabela 3, Tabela 4 e Tabela 5, resumos de figuras e fontes, definições de benchmark-consulta, resumos de relevância-julgamento, substitutos de log-retrieval, diagnósticos de treinamento, categorias de léxico, regras de mapeamento de vocabulário e campos de diretrizes de anotação são fornecidos como tabelas ou arquivos de materiais carregáveis separados quando aplicável. Materiais que não podem ser compartilhados publicamente devido a restrições de repositório são representados por campos de metadados desidentificados e campos de amostragem reprodutíveis.
Este protocolo avalia descobertas orientadas à recuperação, em vez da veracidade das alegações históricas. Ela não substitui a avaliação do arquivista, avaliação de proveniência, revisão de privacidade ou regras específicas de acesso do repositório.