여기서는 수정 후 광학 문자 인식, 시각적 문서 분류, 메타데이터 풍부화 및 검색 평가를 감사 가능한 워크플로우에 통합하여 역사적 디지털 아카이브의 발견을 향상시키는 프로토콜을 제시합니다.
연구 논문
여기서는 수정 후 광학 문자 인식, 시각적 문서 분류, 메타데이터 풍부화 및 검색 평가를 감사 가능한 워크플로우에 통합하여 역사적 디지털 아카이브의 발견을 향상시키는 프로토콜을 제시합니다.
역사적 디지털 아카이브는 점점 검색 가능해지고 있지만, 광학 문자 인식 오류, 시각적으로 이기종적인 문서 유형, 희박한 메타데이터를 별도로 처리하면 발견은 제한적입니다. 이 연구는 보수적인 다중 모달 인공지능 워크플로우가 기록 보관 전문가 검토를 대체하지 않고 기록 검색을 개선할 수 있는지 평가하기 위한 재현 가능한 프로토콜을 개발하는 것을 목표로 했습니다. 8개 문서 분류에서 1,600건의 디지털화된 기록 기록을 수집하고, 420쿼리 벤치마크를 사용하여 기준선 색인, 광학 문자 인식 보정 단독, 시각적 분류 단독, 메타데이터 풍부화 단독, 완전 다중 모달 통합의 다섯 가지 검색 조건을 비교했습니다. 기록 수준 결과에는 문자 오류율(CER), 단어 오류율(WER), 명명된 엔터티 회상, 문서 유형 분류 정확성, 예측 신뢰도, 메타데이터 완전성, 주제 제목 일치 등이 포함되었습니다. 쿼리 수준의 결과에는 P@10, R@10, nDCG@10, 첫 번째 관련 결과까지 시간, 성공률이 포함되었습니다. 광학 문자 인식 보정은 손글씨 편지, 장부, 등록부에서 WER(광문자 인식 보정)를 가장 크게 감소시켰으며; 시각적 미세 조정은 주로 지도, 포스터, 신문, 등록부의 분류 정확도를 높였으며; 메타데이터 풍부화는 모든 역사적 시기에서 완전성을 높였습니다. 완전한 다중 모드 조건은 최고 검색 성능(P@10 = 0.624, R@10 = 0.492, nDCG@10 = 0.634)을 달성했으며, 첫 관련 결과까지의 평균 시간을 156.079초에서 58.485초로 단축시켰습니다. 이 결과들은 텍스트, 이미지, 기술적 신호가 명시적 임계값과 인간 검토 하에 결합되는 모듈형의 감사 가능한 워크플로우를 지원합니다.
디지털 아카이브는 빠르게 확장되어 현재는 역사, 문화유산, 공공 행정, 디지털 인문학 분야의 연구를 지원하고 있습니다. 그러나 기록 기록은 종종 열악한 광학 문자 인식 출력, 시각적으로 다양한 페이지 레이아웃, 일관되지 않은 분류 관행, 역사적으로 변하는 이름, 장소, 기관이 결합되어 접근이 불균등합니다. 이러한 한계는 전사 품질뿐만 아니라 디지털화된 컬렉션 1,2,3,4,5,6,7의 검색, 필터링 및 후속 재사용에도 영향을 미칩니다.
기존의 문서 인공지능과 아카이브-검색 연구들은 수정 후 광학 문자 인식, 문서-이미지 분류, 메타데이터 정규화, 주제 모델링, 단어 임베딩, 신경 검색, 데이터 거버넌스 실천 등 개별 구성 요소를 개선했습니다. 8,9,10,11,12,13,14,15,16, 17, 18, 19, 20, 21, 22, 23, 24, 25. 하지만 많은 기록 보관 시스템은 여전히 이 구성 요소들을 별도로 평가하기 때문에, 결합된 워크플로우가 현실적인 검색 조건에서 발견을 개선하는지 판단하기 어렵습니다. 여기서 다루는 방법론적 공백은 텍스트, 이미지, 메타데이터 모듈을 단일 기록 워크플로우에서 결과 검색에 연결하는 재현 가능하고 감사 가능한 프로토콜의 부재입니다.
중심 목표는 광학 문자 인식 보정, 시각적 문서 분류, 규칙 제약 메타데이터 풍부화가 동일한 검색 벤치마크와 비교했을 때 상호 보완적인 개선을 이루는지 검증하는 것이었습니다.
우리는 전체 다중 모달 조건이 각 단일 구성 요소 조건보다 더 우수할 것이라고 가설을 세웠는데, 이는 아카이브 발견이 읽기 가능한 텍스트, 시각적으로 해석 가능한 문서 구조, 검색 가능한 설명 메타데이터의 상호작용에 의존하기 때문입니다. 워크플로우는 보수적으로 설계되었으며, 자동화된 출력은 검색 인덱스를 풍부하게 할 수 있었지만, 신뢰도가 낮은 예측은 권위 있는 기록 설명으로 사용되기보다는 검토를 위해 표시되었습니다.
이 연구는 디지털화된 기록 보관 기록과 시뮬레이션된 검색 쿼리를 분석 단위로 사용하였습니다. 아카이브 저장소는 민감하거나 문화적으로 제한된 기록에 대한 접근을 제한할 수 있습니다. 기록을 처리하거나 공유하기 전에 저장소 접근 규칙, 기관 데이터 보안 절차, 식별 해제 요건을 준수하세요. 이 디지털 워크플로우로 인해 유해한 화학물질, 생물학적, 날카로운 도구, 방사성 또는 기타 규제된 실험실 폐기물이 발생하지 않았습니다.
연구 설계 및 코퍼스 구성
그림 1 은 코퍼스 생성, 참조 라벨링, 이미지 전처리, OCR 생성 및 수정 후, 시각적 분류, 메타데이터 풍부화, 인덱스 생성, 검색 평가, 통계 분석, 재현성 패키징 등 전체 연구 워크플로우를 보여줍니다.
코퍼스 구축은 2025년 1월 15일부터 4월 30일까지 진행되었고, 이어서 5월 1일부터 10월 31일까지 시스템 설계 및 디버깅이 진행되었습니다. 이 말뭉치에는 주, 도시, 종교, 박물관, 대학, 도서관 시스템을 대표하는 8개 저장소에서 선별된 1,600개의 디지털화된 기록 기록이 포함되어 있었습니다. 샘플링 프레임은 보관소와 문서 분류별로 계층화되어 손글씨 편지, 장부, 지도, 신문, 캡션이 있는 사진, 포스터, 등록부, 타이핑된 서신 등에서 기록 보관의 이질성을 유지했습니다.
각 후보 레코드에 대해 선택 로그는 저장소 또는 컬렉션 식별자, 카탈로그 식별자, 문서 클래스, 대략적인 역사적 기간, 주요 언어 맥락, 사용 가능한 이미지 형식, 이미지 해상도, 페이지 수, 그리고 기준선 설명 필드를 기록했습니다. 포함을 위해서는 다음 모든 조건이 필요했습니다: 안정적인 카탈로그 식별자; 최소 한 장의 TIFF, JPEG, 또는 PNG 페이지 이미지; 최소 150 dpi의 소스 이미지 해상도; 읽기 쉬운 텍스트, 표 형식 또는 문서 구조 내용; 그리고 8개의 사전 정의된 문서 클래스 중 하나에 할당됩니다. 제외 기준은 정확히 동일한 중복, 빈 뒷면 페이지, 텍스트 포함 면적의 30% 이상이 빠진 이미지가 잘려 나간 것, 그리고 수작업 검사 후 읽을 수 없다고 판단된 기록이었습니다.
검색 벤치마크에는 2025년 8월 5일부터 8월 20일까지 생성된 420개의 짧은 자연어 쿼리가 포함되어 있습니다. 쿼리 생성은 재현 가능한 템플릿을 따랐습니다: 후보자 정보 필요는 인물, 기관, 장소, 날짜 범위, 직업, 사건, 주제 등에서 샘플링되었습니다; 각 쿼리는 2단어에서 9단어로 정규화되었으며; 그리고 시스템 비교 전에 목표 관련 기록이 확인되었습니다. 각 쿼리는 다섯 가지 검색 조건에서 평가되어 2,100개의 일치 쿼리-조건 관찰값을 생성했습니다.
참고 표시 및 품질 관리
참고 표기표 작성은 2025년 5월 1일부터 7월 15일까지 세 명의 주석가가 수행했습니다: 기술적 분류에 경험이 있는 기록 보관 직원 2명과 역사 문서 평가에 경험이 있는 디지털 인문학 연구자 1명입니다. 주석 가이드는 문서 클래스, 언어-맥락 범주, 역사적 시기 빈, 메타데이터 완전성 필드, 명명된 엔터티 카테고리, OCR 평가 영역 선택 규칙을 정의했습니다.
OCR 평가를 위해 주석 작성자들은 제목, 이름, 날짜, 기관 용어, 여백 주석, 표 항목, 그리고 존재할 경우 잡음이 많은 레이아웃 영역을 포함하는 대표적인 텍스트 영역을 선택했습니다. 페이지에 여러 텍스트 영역이 있을 경우, 선택한 영역은 검색에 적합해야 하며, CER과 WER 계산에 충분한 문자를 포함해야 했습니다. 의견 차이는 두 주요 주석가의 논의를 통해 먼저 해결되었다; 미해결 사건들은 디지털 인문학 연구자가 심리했습니다.
품질 관리는 기록의 무작위 12% 하위 집합을 사용했습니다. 주요 문서 유형에 대한 주석자 간 합의는 Cohen의 kappa = 0.86으로, 상당한 일치를 지지했습니다. 판결 로그는 원래와 최종 라벨, 불합의 범주, 해결 사유를 유지하여 향후 사용자가 클래스 정의와 예외 사례를 검토할 수 있도록 했습니다.
이미지 전처리
모든 이미지는 OpenCV 4.9.0, Pillow 10.3.0, NumPy 1.26.4와 함께 Python 3.11.8을 사용하여 레코드 수준으로 처리되었습니다. 각 입력 페이지는 지도, 포스터, 우표, 색상 구분 주석과 같은 의미 정보를 담고 있지 않은 한 8비트 그레이스케일로 변환되었습니다. 기울기는 투영 프로파일과 하우 선 검출을 이용해 추정되었으며; 데스크윙은 절대 비스듬각 각도가 1.5도를 초과할 때만 적용되었으며, 왜곡을 방지하기 위해 8.0도로 제한되었습니다.
대비 향상은 clipLimit = 2.0과 tileGridSize = 8× 8을 적용한 대비 제한 적응형 히스토그램 이퀄라이제이션을 사용했습니다. 3 × 10⁻²³ 핵을 가진 중앙값 필터는 추정된 배경 잡음비가 0.35를 초과할 때만 적용되었습니다. 150–299 dpi에서 촬영된 이미지는 광학 문자 인식을 위해 300 dpi로 재샘플링되었으며; 이미 300 dpi 이상인 이미지는 업스케일되지 않았습니다. 초해상도, 생성 복원, 콘텐츠 환각은 사용되지 않았습니다.
번짐, 가장자리 어두움, 고르지 않은 종이 질감, 여백 도장, 필체, 줄이 있는 선, 테이블 경계는 OCR 지역 선택을 방해하지 않는 한 유지되었습니다. 이 규칙은 기록 보관 증거를 보존하면서도 이미지 입력을 충분히 표준화하여 재현 가능한 OCR 및 분류를 가능하게 했습니다.
OCR 기본 생성 및 보정 후
기본 OCR은 Tesseract OCR 5.3.0으로 생성되었습니다. 기본 언어 팩은 카탈로그 언어와 가시 문자 중에서 선택되었으며; 카탈로그 언어와 페이지 스크립트가 일치하지 않을 때 다국어 디코딩이 가능했습니다. OCR 출력은 레코드 수준에서 그룹화되어 페이지 식별자, OCR 신뢰도, 가능한 경우 경계 상자 좌표, 수정 전 원시 텍스트와 함께 저장되었습니다.
OCR 교정 후 교정은 3단계 보존적 절차를 사용했습니다. 첫째, 문자 수준 정규화는 합자, 긴 s/s-short s 치환, 조각난 구두점, 숫자-문자 치환 등 자주 발생하는 과거 인식 혼동을 수정했습니다. 둘째, 토큰 수준 수정은 개인 이름, 지명, 기관, 행정 용어, 역사적 철자 변형 등 아카이브 전용 어휘집에서 편집 거리 및 빈도 순위 후보 후보를 사용하여 사용했습니다. 셋째, 규칙 기반 시퀀스 검사는 명명된 개체와 날짜를 맥락과 메타데이터의 증거와 대조하여 검증합니다.
후보 대체 후보자는 후방 교정 신뢰도가 0.80을 초과할 때만 승인되었습니다; 명명된 법인 대체는 최소 0.85의 신뢰도를 요구했습니다. 기준 이하의 지원자는 OCR 텍스트로 유지되었으나 검토를 위해 표시되었습니다. CER은 레벤슈타인 편집 거리를 참조 전사 문자 수로 나눈 값으로 계산되었습니다. WER는 토큰 수준에서 같은 공식을 사용했습니다. 명명된 개체 회상은 선택된 평가 영역 내 모든 참조 개체로 올바르게 인식된 참조 개체를 나누어 계산했습니다.
시각적 문서 분류
시각적 분류 모듈은 각 기록을 8가지 기록 문서 분류 중 하나로 할당했습니다: 손글씨 편지, 장부, 지도, 신문, 캡션이 포함된 사진, 포스터, 등록부, 타이핑된 서신. 예측된 문서 유형은 아카이브 분류를 권위 있게 대체하는 것이 아니라 검색 및 필터링 신호로 사용되었습니다.
이 모델은 PyTorch 2.2.2와 torchvision 0.17.2에서 ImageNet 사전 학습된 EfficientNet-B3 백본을 사용하여 구현되었습니다. 기록 수준 썸네일은 384 x 384 픽셀로 크기 조정되었습니다. 누수를 줄이기 위해 레코드는 저장소와 문서 클래스별로 훈련, 검증, 테스트 세트로 70:15:15 비율로 나뉘었으며, 약 1,120, 240, 240개의 레코드에 해당합니다.
학습은 초기 학습률 = 1 × 10-4, 가중치 감소 = 1 × 10⁻², 배치 크기 = 16, 라벨 스무딩 = 0.05, 그리고 5년 연속 에포크에서 검증 손실이 개선되지 않을 경우 조기 중단을 적용한 AdamW를 사용했습니다. 가로 뒤집기는 미러 아카이브 레이아웃이 현실적이지 않아 비활성화되었습니다. 증강은 -3도에서 +3도까지 회전하고 밝기 변화는 ±10% 이내로 제한되었습니다.
시대 수준 모델 진단은 20개의 훈련 행으로 요약되며, 각 행에는 훈련 손실, 검증 손실, 훈련 정확도, 검증 정확도, 매크로-F1, 가중-F1, ROC-AUC, PR-AUC가 포함됩니다.
메타데이터 풍부화 워크플로우
메타데이터 풍부화는 아카이브의 보존성을 유지하면서 발견 가능성을 높이기 위해 설계되었습니다. 기존 카탈로그 값은 불가능한 날짜나 OCR과 시각적 증거로 확인된 문서 유형의 충돌과 같은 명확한 모순이 있을 경우를 제외하고는 유지되었습니다. 후보 심화 필드에는 정규화된 제목, 문서 유형, 대략적인 날짜, 기관 언급, 지리적 언급, 개인 이름 언급, 주제 제목, 키워드 등이 포함되었습니다.
증거 우선순위는 고정된 순서를 따랐습니다: (1) 기존 카탈로그 메타데이터, (2) 수정된 OCR 출력, (3) 시각적 문서 유형 예측. 주제 제목에는 통제된 어휘 매칭이 사용되었고, 문장 변환기 2.7.0을 사용한 근접 이웃 의미 확장은 코사인 유사성이 최소 0.72일 때만 사용되었습니다. 날짜 정규화는 최소 0.85의 신뢰도나 OCR과 메타데이터 간의 일치가 필요했습니다. 자동으로 추가된 모든 필드는 출처, 신뢰도, 규칙 식별자를 유지했습니다.
메타데이터 완전성은 해당 기록에 대해 채워진 코어 기술 필드 수와 적용 가능한 코어 필드 수로 나눈 것으로 정의되었습니다. 주제 표내 일치는 기록 수준의 내용 증거로 뒷받침되고 쿼리 범주와 관련성이 있다고 판단된 최소 하나의 통제 어휘 주제 라벨의 존재로 정의되었습니다.
검색 시스템 구성
모듈 기여도를 분리하기 위해 다섯 가지 검색 인덱스가 구축되었습니다: 기준선 색인; 광학 문자 인식 보정만; 시각적 분류만 가능하며; 메타데이터 풍부화만; 그리고 완전한 다중 모드 통합을 포함합니다. 모든 지수는 재료 표(버전 8.11.1)에 나열된 검색 엔진 소프트웨어에서 기록 수준으로 작성되었습니다. 평가 전 BM25 매개변수는 k1 = 1.2, b = 0.75로 고정되었습니다.
기준선 인덱스는 원본 메타데이터와 기준선 OCR 텍스트를 사용했습니다. OCR 조건은 기본 OCR 대신 교정된 OCR로 대체되었습니다. 시각적 조건은 문서 유형의 선행과 클래스 인식 순위 향상을 추가했습니다. 메타데이터 조건은 풍부한 기술적 필드를 추가했습니다. 완전한 다중 모드 조건은 보정된 OCR, 시각적 사전 측정, 풍부한 메타데이터를 결합했습니다. 필드 가중치는 테스트 전에 고정되었습니다: 정규화된 제목 = 3.0, 주제 제목 = 2.5, 인물 및 기관 언급 = 2.2, 장소 언급 = 2.0, 문서 유형 = 1.8, 수정된 OCR 본문 = 1.0, 기준 OCR 본문 = 0.8(해당되는 경우).
인용 쿼리에 대해 정확한 구문 매칭이 활성화되었습니다. 쿼리 확장은 메타데이터 풍부화 및 완전 다중 모드 조건에서만 허용되었으며, 허용된 통제 어휘 동의어와 주목 변형에 한정되었다. 검색 로그는 2025년 8월 25일부터 8월 28일까지 Table of Materials에 나열된 컨테이너화된 리눅스 환경에서 생성되었으며, 고정 시드와 동결된 인덱스 구성으로 이루어졌습니다.
쿼리 설계 및 결과 측정
420개의 쿼리는 키워드 전용 벤치마크 프롬프트가 아니라 일반적인 아카이브 검색 행동을 나타냈습니다. 주제에는 개인 이름, 기관, 장소, 날짜와 날짜 범위, 직업, 사건, 주제별 주제가 포함되었습니다. 각 쿼리는 정규화된 문구, 목표 레코드 집합, 쿼리-주제 카테고리, 난이도 점수와 함께 저장되었습니다.
난이도는 검색 전에 표적 모호성, 어휘 특이성, 예상 표현 빈도를 사용하여 점수를 매겼다. 0.40 미만의 종합 점수는 저난이도, 0.40–0.69 점수는 중간, 0.70 이상은 고난이도로 분류되었습니다. 관련성 판단은 시스템 비교 전에 완료되었고, 최종 수집본과 대조되었습니다.
검색 결과에는 P@10, R@10, nDCG@10, 첫 번째 관련 결과까지 도달하는 시간, 성공률이 포함되었습니다. P@10 상위 10개 음반 중 관련성 있다고 판단된 비율이었습니다. R@10는 상위 10위 안에 포함된 모든 알려진 관련 기록 중 차지하는 비율입니다. nDCG@10 가능한 경우 등급별 관련성을 사용했고, 그렇지 않으면 이진 관련성을 사용했습니다. 쿼리 제출부터 순위 매김 결과에 첫 관련 레코드가 나타날 때까지 첫 번째 관련 결과까지의 시간을 측정했습니다. 성공적인 검색은 상위 10개 기록 중 최소 하나의 관련 결과로 정의되었습니다.
통계 수집
모든 분석은 재료표에 나열된 소프트웨어 버전을 사용하여 수행되었습니다. 연속 결과는 대칭일 때는 평균 ± SD로, 그렇지 않으면 중간값으로 요약되었습니다. 범주별 결과는 카운트 수와 백분율로 요약되었습니다.
쌍 차이의 정규성은 Shapiro-Wilk 검정과 분포 플롯을 통해 평가하였다. OCR 및 전후 결과 전후 데이터를 쌍 t-검정과 비교하였으며, 쌍 간 차이가 거의 정상일 때, Wilcoxon 부호 순위 검정은 그렇지 않은 경우에 적용되었습니다. 미세 조정 전후의 분류 성과는 정확/부정 쌍을 가진 쌍을 대상으로 맥네마르 검정을 사용해 비교하였다. 일치하는 다팔 추출 결과는 프리드먼 검정과 홀름 조정 쌍별 윌콕슨 서명 순위 검정과 비교하였다.
모든 통계 검정은 양측 검정이었으며, P < 0.05는 통계적으로 유의미한 것으로 간주되었습니다. 신뢰구간은 2,000개의 부트스트랩 재샘플을 사용해 추정했으며, 무작위 시드는 2025년으로 고정되었습니다. 효과는 결과 유형에 따른 평균 차이, 일치 오즈비 또는 순위 기반 효과 크기 형태로 보고되었습니다.
재현성, 범위, 자원 가용성
모든 파이프라인 매개변수는 추출 테스트 전에 고정되었습니다. 보유된 검색 벤치마크에서는 어떤 매개변수도 최적화되지 않았습니다. 구성 파일, 통제된 어휘, 어휘 표, 쿼리 템플릿, 필드 매핑, 주석 지침, 통계 스크립트, 도표 생성 스크립트 등이 2025년 무작위 시드가 포함된 Table of Materials 에 나열된 버전 관리 시스템에서 유지되었습니다.
독립적인 검증을 지원하기 위해 소스-데이터 워크북에는 광학 문자 인식, 메타데이터, 시각적 분류 분석에 사용되는 17개의 변수가 포함된 1,600개 레코드 표가 식별되지 않습니다. 파생 표 1, 표 2, 표 3, 표 4, 표 5, 도표-출처 요약, 벤치마크-쿼리 정의, 관련성 판단 요약, 검색 로그 대리모, 학습 진단, 어휘 범주, 어휘 매핑 규칙, 주석-지침 필드는 해당 시 별도의 업로드 가능한 표 또는 자료 파일로 제공됩니다. 저장소 제한으로 인해 공개 공유가 불가능한 자료는 식별 해제된 메타데이터 필드와 재현 가능한 샘플링 필드로 표현됩니다.
이 프로토콜은 역사적 주장의 진실성보다는 검색 중심의 발견을 평가합니다. 이는 기록 관리자 평가, 출처 평가, 개인정보 보호 검토, 저장소별 접근 규칙을 대체하지 않습니다.
OCR 보정은 특히 손글씨와 표 형식 기록에서 전사 품질을 향상시켰습니다
광학 문자 인식 보정은 8개 아카이브 문서 분류(n = 1,600 레코드) 모두에서 전사 품질을 향상시켰습니다. 평균 WER ± 0.529에서 0.384 ± 0.123로 감소했으며, 평균 쌍 변화는 −0.144(95% 신뢰구간, −0.149에서 −0.139로; 윌콕슨 서명 순위 P < 0.001). 평균 CER은 0.377± 0.126에서 0.258± 0.086으로 감소했으며, 평균 쌍 변화는 −0.119(95% 신뢰구간, −0.123에서 −0.116까지; 윌콕슨 서명 순위 P < 0.001). 표 2는 기본 WER(기초 WER)가 손글씨 편지, 장부, 등기부에서 가장 높았음을 보여주며, 시각적으로 가장 복잡한 기록이 초기 인식 부담도 가장 크다는 것을 나타냅니다.
수정 후 모든 문서 클래스에서 WER가 감소했습니다. 가장 큰 평균 쌍 WER 감소는 손글씨 편지(n = 262; −0.200; 95% CI, −0.213에서 −0.188), 원장(n = 263; −0.195; 95% CI, −0.206에서 −0.183), 등록부(n = 194; −0.173; 95% CI, −0.187에서 −0.160)에서 나타났습니다. CER도 같은 패턴을 따르며, 수정 후 모듈이 주로 어려운 손글씨, 표 및 혼합 레이아웃 기록에 유리하다는 해석을 지지했습니다.
명명된 엔터티 회상도 모든 문서 유형에서 개선되었으며, 요약 표에서 확인할 수 있습니다. 가장 큰 증가는 손글씨 편지(0.302–0.440), 장부(0.336–0.471), 등기부(0.369–0.504)에서 나타났다. 타이핑된 서신은 수정 후 명명된 엔터티 회상률이 가장 높았으나(0.646), 이 클래스의 기준선 인식이 이미 더 강했기 때문에 절대 이득은 더 작았습니다. 그림 2 는 기록 수준의 기준선 CER-WER 관계, 필기 강도와 수정 이점 간의 연관성, 그리고 수정 후 기록 수준의 발견 가능성 변화를 요약합니다.
시각적 문서 분류는 전반적으로 개선되었지만, 성능 향상은 클래스별로 고르지 못했습니다
1,600개 기록 테스트 세트 전반적으로 시각적 문서 분류가 개선되었습니다. 톱 1 정확도는 0.717에서 0.796으로 증가했습니다(절대 변동률은 0.079; 맥네마 카이제곱 = 27.33; P < 0.001), 평균 예측 신뢰도는 0.736 ± 0.131에서 0.800± 0.108로 증가했습니다(평균 쌍 변화 0.064; 95% 신뢰구간, 0.057–0.071; 쌍립 t 검정 P < 0.001). 표 3에서 보듯, 8개 클래스 중 7개 클래스는 아카이브별 미세 조정 후 개선되었으며, 지도, 포스터, 신문, 등록부에서 가장 큰 향상을 보였습니다.
타이핑된 서신은 미세 조정 후에도 크게 개선되지 않았다(0.796–0.791). 이는 기본 시각 특징이 이미 안정적이었고 훈련 절차가 이 범주에 대한 추가 클래스 분리를 거의 추가하지 않았음을 시사한다.
그림 3은 아카이브별 미세 조정 전후의 시각적 문서 분류 성능을 요약합니다; 원본 데이터 워크북에는 20개의 train/검증 손실 및 정확도 시기와 함께 매크로-F1, 가중 F1, ROC-AUC, PR-AUC 진단 요약이 나열되어 있습니다.
메타데이터 풍부화는 모든 역사적 기간(n = 1,600 기록)에서 기술적 완전성을 향상시켰습니다. 평균 완전성은 0.657 ± 0.125에서 0.907± 0.070으로 증가했으며, 평균 쌍 변화는 0.250(95% 신뢰구간, 0.243–0.257; 윌콕슨 서명 순위 P < 0.001). 표 4에 나타난 바와 같이, 1850년부터 1879년까지 기준선 완전성은 가장 낮았으며, 이후 풍부화 이전 기간에 걸쳐 점차 증가했습니다. 그림 4 는 메타데이터 완전성 향상, 문서 유형별 새롭게 구현된 메타데이터 필드, 그리고 역사적 기간 전반에 걸친 주제 제목 일치 증가를 요약합니다.
풍부화 이후 모든 역사 기간에서 완전성이 증가했습니다: 1850–1879년(n = 281; 평균 변화량 0.207; 95% 신뢰구간, 0.191–0.223), 1880–1909년(n = 474; 평균 변화량 0.236; 95% 신뢰구간, 0.223–0.248), 1910–1939년(n = 549; 평균 변화량 0.277; 95% 신뢰구간, 0.265–0.288), 그리고 1940–1969년(n=296; 평균 변화량 0.263; 95% 신뢰구간, 0.247–0.279). 인구 농지의 평균 수도 기간에 따라 꾸준히 증가했습니다.
주제 표내 일치도 병행하여 향상되었습니다. 기본 매칭률은 64.3%에서 69.4% 사이였으며, 농축 후 매칭률은 82.1%에서 85.4% 사이였습니다. 가장 큰 절대 증가는 가장 초기 기간(Delta = 0.178)에서 발생했으며, 이는 초기 기술이 희소한 기록에 대해 보존적 풍부도의 가치를 뒷받침합니다.
모든 향상된 시스템에서 검색 성능이 향상되었으며, 완전한 다중 모드 통합 하에서 가장 큰 향상을 보였습니다
각 향상 조건에서 검색 효과는 기준선에 비해 향상되었으나, 개선 정도는 시스템 군에 따라 달랐습니다(n = 420개의 벤치마크 매칭 쿼리). 전체 검색 결과는 표 5에 나열되어 있습니다. 기초 검사 성과는 낮았습니다: P@10 = 0.394, R@10 = 0.238, nDCG@10 = 0.392, 첫 관련 결과까지 평균 시간 = 156.079초, 성공 검색률 = 5.0% (21/420; 95% 신뢰구간, 3.3%–7.5%). 그림 5 는 전체 검색 지표, 주제별 성공률, 쿼리 난이도 층을 포함한 다섯 실험 시스템 군 간의 검색 성능을 요약합니다.
세 가지 단일 구성 시스템 모두 총합적으로 기준선을 능가했습니다. 광학 문자 인식 보정은 P@10 0.484, R@10 0.346, nDCG@10 0.475로 증가했으며, 첫 관련 결과까지 124.261초로 단축하고 성공 검색률을 30.2%(127/420; 95% 신뢰구간, 26.0%–34.8%)로 증가시켰습니다. 시각적 분류 결과는 P@10 = 0.490, R@10 = 0.302, nDCG@10 = 0.478, 평균 최초 관련 결과 발생 시간 = 131.985초, 성공 검색율 = 22.9% (96/420; 95% 신뢰구간, 19.1%–27.1%). 메타데이터 풍부화는 단일 구성 요소 검색 성능이 가장 우수했으며, P@10 = 0.507, R@10 = 0.347, nDCG@10 = 0.513, 평균 첫 관련 결과까지 시간 = 117.474초, 성공률은 38.3%(161/420; 95% 신뢰구간, 33.8%–43.1%)였습니다.
전체 멀티모달 시스템은 모든 회수 엔드포인트에서 가장 우수한 성능을 보였습니다. P@10 기준선 0.394에서 0.624로, R@10가 0.238에서 0.492로, nDCG@10가 0.392에서 0.634로 상승했습니다. 평균 첫 관련 결과까지의 시간은 156.079초에서 58.485초로 감소했으며, 성공 검색율은 5.0%에서 95.5%로 증가했습니다(401/420; 95% 신뢰구간, 93.0%–97.1%). 이 값들은 P@10의 절대 상승률 0.230, R@10의 0.254, nDCG@10의 0.242에 해당합니다.
주제별 검색도 완전한 다중 모드 통합 하에서 개선되었습니다. 성공률은 사람, 기관, 장소, 직업, 사건, 주제별로 증가했으며, 직업 범주가 가장 큰 실질적 상승을 보였는데, 기본 성공률은 0.0%였고 전체 다중 모드 조건에서는 90.0%로 상승했습니다. 지명 쿼리가 가장 강력한 기준선 성능을 보였으나 여전히 다중 모달 통합의 혜택을 누렸습니다.
다중양상 성과는 문서, 시대, 언어 계층에 따라 달랐다
하위 그룹 분석 결과, 다중 양식 향상은 문서 유형, 역사적 시기, 언어 맥락에 걸쳐 넓게 분포되어 있었으나, 개선 정도는 다양했습니다. 이러한 이질성은 워크플로우가 균일한 향상을 내기 위해 가정하기보다는 각 대상 컬렉션 내에서 평가되어야 함을 의미합니다. 그림 6 은 대상 문서 유형, 역사적 시기, 언어 맥락 전반에 걸친 다중 모드 검색의 이질성을 보여줍니다.
문서 유형 수준에서는 모든 대상 클래스에서 nDCG@10 개선되었습니다. 캡션이 포함된 사진, 손글씨 편지, 지도, 장부, 등기부는 강한 증가를 보였고, 신문과 타이핑된 서신은 다소 개선되었다. 이러한 패턴은 초기 메타데이터가 약하거나 시각적 구조가 복잡한 기록이 텍스트, 이미지, 메타데이터 신호의 결합으로부터 가장 큰 혜택을 받는다는 것을 시사합니다.
역사적 시기 R@10수준에서는 1850년부터 1879년까지 0.175에서 0.429로 증가했고, 완전 다중 모드 적분 하에서는 1880년부터 1909년까지 0.506, 1910년부터 1939년까지 0.501, 1940년부터 1969년까지 0.519에 도달했습니다. 절대 규모의 증가는 기간별로 유사하여, 풍부화와 교정 인식이 초기 희소 기록과 더 풍부한 기준선 메타데이터를 가진 후기 기록 모두에 도움이 되었음을 시사합니다.
언어-맥락 결과도 유사한 패턴을 보여주었다. 완전한 다중 모드 조건 하에서 P@10은 혼합 라틴-문자 기록에서 0.607, 영어 0.628, 프랑스어 0.618, 독일어 0.661, 포르투갈어와 스페인어 0.639에 달했습니다. 가장 큰 정밀도 향상은 혼합 라틴 문자 기록에서 발생했으며, 이 기록은 기준선 정밀도가 가장 약했습니다.
구성 요소 수준 패턴: 중복이 아닌 보완적 기여
종합된 결과는 프로토콜 구성 요소들이 중복이 아니라 상호 보완적임을 보여줍니다. OCR 보정은 텍스트 인식성을 향상시키고, 시각적 분류는 구조 인식 문서 유형 신호를 추가했으며, 메타데이터 풍부화는 검색 가능한 설명 계층을 확장시켰습니다. 완전한 다중 모드 조건은 가장 강력하고 일관된 검색 향상을 만들어내며, 이기종 디지털 아카이브에 대한 감사 가능하고 검색 지향적인 워크플로우를 테스트하는 연구 목표를 뒷받침했습니다.
이 발견들은 다중 모달 인공지능이 저장소 거버넌스, 데이터 출처 확인, 전문가 검증의 필요성을 유지하면서 아카이브 검색을 보완하는 프로토콜 모델을 뒷받침합니다.
데이터 가용성:
주요 분석에 사용되는 비식별화된 1,600개 레코드 데이터셋은 Zenodo as data.xlsx(https://doi.org/10.5281/zenodo.20774456)에서 확인할 수 있습니다.

그림 1: 다중 모달 기록 발견을 위한 재현 가능한 워크플로우. (A) 포함/제외 스크리닝을 포함한 저장소 수준 기록에서의 코퍼스 구성. (B) 문서 유형, OCR 참조 영역, 언어 맥락, 역사적 시기, 메타데이터 완전성을 포함한 참조 라벨링 및 품질 관리. (C) 이미지 전처리, OCR 생성 및 사후 수정, 시각적 문서 분류, 그리고 보수적 메타데이터 풍부화. (D) 지수 구축, 5군 검색 평가, 통계 분석 및 자원 패키징. 약어: OCR, 광학 문자 인식; CER, 문자 오류율; WER, 단어 오류율. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 2: 레코드 수준의 광학 문자 인식 오류 구조 및 보정 후 발견 가능성. (A) 1,600개의 아카이브 레코드에 대한 기준 CER과 기준 WER, 대표 클래스별 문서 유형별 색상. (B) 스케일화된 필기 강도와 교정 후 WER 변화 간의 연관성; 음수는 보정 후 낮은 WER를 나타냅니다. 적합선과 회색 띠는 선형 추세와 95% 신뢰구간을 나타냅니다. (C) 문서 유형별 기록 수준의 발견 가능성 점수, 수정 전후 검색 가능한 증거의 변화를 보여줍니다. 약어: CER, 문자 오류율; WER, 단어 오류율. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 3: 아카이브별 미세 조정 전후의 시각적 문서 분류. (A) 기본 및 미세 조정 후 문서 유형별 상위 1 정확도. (B) 기준선 및 조정 후 조건에서 정답 및 부정확 예측에 대한 신뢰 분포. (C) 튜닝 전후의 상위 1 정확도와 평균 사후 신뢰도를 요약한 클래스 수준 성능 행렬. 모델 진단 데이터에는 20개의 손실/정확도 곡선, 매크로 F1, 가중 F1, ROC-AUC, PR-AUC가 포함됩니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 4: 보존적 풍부화 후 메타데이터 완전성과 주제 제목 일치. (A) 풍부화 전후 기록 수준의 메타데이터 완전성. (B) 문서 유형별로 새로 구현된 메타데이터 필드. (C) 역사적 시기를 넘어 주제 표출 일치 증가. 완전성은 인구가 거주하는 적용 가능한 핵심 필드 수와 적용 가능한 핵심 필드 총수로 나눈 값으로 계산되었습니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 5: 다섯 실험 시스템 군 간 검색 성능. (A) 전체 P@10, R@10, nDCG@10, 첫 관련 결과까지 시간, 그리고 기본 검색, 광학 문자 인식 보정, 시각적 분류, 메타데이터 풍부화, 완전한 멀티모달 통합에 대한 성공률. (B) 쿼리 주제와 시스템 암에 따른 성공 검색율의 버블 플롯; 색상은 시스템 암을 나타내고, 버블 크기는 성공률을 나타냅니다. (C) P@10, R@10, nDCG@10 쉬이고, 중간, 어려운 쿼리 난이도 계층에 걸쳐 있습니다. (D) 쿼리 주제와 시스템 암 간 성공적인 검색 분포를 보여주는 대안 주제 수준 성공률 뷰. 약어: P@10, 정밀도 10; R@10, 10번을 기억하라; nDCG@10, 정규화된 할인 누적 이득은 10입니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 6: 아카이브 하위 그룹 간 다중 모달 검색 이질성 . (A) 대상 문서 유형 및 검색 조건에 따른 nDCG@10. (B) 역사적 시기와 회수 상태에 따라 R@10. (C) 대상 언어 문맥과 검색 조건에 따른 P@10. 조건은 기준선, OCR 보정, 시각적 분류, 메타데이터 풍부화, 완전한 다중 모달 통합, OCR+Text, 텍스트+시각+메타데이터, 그리고 시각+메타데이터입니다. 이 도표는 다중양식 증가가 문서, 시대, 언어 계층에 걸쳐 널리 퍼져 있지만 균일하지는 않음을 강조합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
| 문서 유형 | N 레코드 | 중앙값 페이지 | 손으로 쓴 기록 | 평균 기준선 WER | 평균 기준선 메타데이터 완전성 | 평균 기준선 검색 가능성 |
| (%) | ||||||
| 손으로 쓴 편지 | 262 | 2 | 95 | 0.729 | 0.648 | 68.2 |
| 원장 | 263 | 7 | 63.5 | 0.679 | 0.674 | 72.2 |
| 지도 | 102 | 1 | 2.9 | 0.457 | 0.552 | 74.1 |
| 신문 | 261 | 8 | 0.8 | 0.495 | 0.66 | 75.5 |
| 사진과 캡션 | 179 | 1 | 1.1 | 0.374 | 0.601 | 73.6 |
| 포스터 | 87 | 1 | 0 | 0.413 | 0.571 | 74.8 |
| 등록부 | 194 | 10 | 18 | 0.616 | 0.703 | 71.3 |
| 타이핑된 서신 | 252 | 3 | 4 | 0.315 | 0.689 | 76.4 |
표 1: 문서 유형별 기록 보관소 컬렉션의 특성. 이 표는 8개 문서 클래스 각각에 대해 기록 수, 중간 페이지 수, 필기 기록 비율, 평균 기준 WER, 평균 기준 메타데이터 완전성, 평균 기준선 발견 가능성 점수를 보고합니다.
| 문서 유형 | 표본 크기 | CER | CER | WER | WER | 명명된 엔터티 리콜 | 명명된 엔터티 리콜 | ΔWER |
| (n) | (기준선) | (포스트) | (기준선) | (포스트) | (기준선) | (포스트) | ||
| 손으로 쓴 편지 | 262 | 0.531 | 0.363 | 0.729 | 0.531 | 0.302 | 0.44 | −0.198 |
| 원장 | 263 | 0.49 | 0.326 | 0.679 | 0.485 | 0.336 | 0.471 | −0.194 |
| 지도 | 102 | 0.322 | 0.228 | 0.457 | 0.347 | 0.38 | 0.503 | −0.11 |
| 신문 | 261 | 0.354 | 0.256 | 0.495 | 0.381 | 0.436 | 0.558 | −0.114 |
| 사진과 캡션 | 179 | 0.257 | 0.181 | 0.374 | 0.286 | 0.494 | 0.616 | −0.088 |
| 포스터 | 87 | 0.287 | 0.199 | 0.413 | 0.316 | 0.448 | 0.57 | −0.097 |
| 등록부 | 194 | 0.442 | 0.293 | 0.616 | 0.439 | 0.369 | 0.504 | −0.177 |
| 타이핑된 서신 | 252 | 0.219 | 0.155 | 0.315 | 0.232 | 0.524 | 0.646 | −.083 |
표 2: 문서 유형별 수정 전후 OCR 성능. CER과 WER는 기준 전사와 비교하여 계산되었으며; 명명된 엔티티 리콜은 수동으로 표시된 인물, 장소, 기관, 날짜 엔티셔널을 기준으로 계산되었습니다. 델타 WER는 보정 후 WER에서 기준 WER 뺀 값입니다.
| 문서 유형 | n | 정확성, 기준선 | 정확성, 포스트 | 자신감, 기준선 | 자신감, 포스트 | Δ수집 |
| 손으로 쓴 편지 | 262 | 0.615 | 0.645 | 0.616 | 0.655 | 0.03 |
| 원장 | 263 | 0.707 | 0.749 | 0.725 | 0.767 | 0.042 |
| 지도 | 102 | 0.765 | 0.902 | 0.801 | 0.899 | 0.137 |
| 신문 | 261 | 0.716 | 0.843 | 0.728 | 0.83 | 0.127 |
| 사진과 캡션 | 179 | 0.815 | 0.869 | 0.824 | 0.89 | 0.054 |
| 포스터 | 87 | 0.771 | 0.903 | 0.792 | 0.889 | 0.132 |
| 등록부 | 194 | 0.687 | 0.793 | 0.701 | 0.787 | 0.106 |
| 타이핑된 서신 | 252 | 0.796 | 0.791 | 0.804 | 0.82 | -0.005 |
표 3: 아카이브별 미세 조정 전후의 시각적 문서 분류 성능. 표는 표본 크기, 상위 1 정확도, 평균 사후 신뢰도, 문서 유형별 정확도 변화를 보고합니다. 진단 데이터에는 매크로 F1, 가중 F1, ROC-AUC, PR-AUC, 훈련 손실, 검증 손실, 훈련 정확도, 검증 정확도 등 20개의 에포흐 수준 행이 포함됩니다.
| 완전성 | 완전성 | 인구 농장 | 인구 농장 | 주제 제목 경기 | 주제 제목 경기 | Δ 완전성 | Δ 주제 제목 경기 |
| (기준선) | (포스트) | (기준선) | (포스트) | (기준선) | (포스트) | ||
| 0.534 | 0.868 | 4.274 | 8.584 | 0.643 | 0.821 | 0.334 | 0.178 |
| 0.607 | 0.898 | 4.838 | 8.709 | 0.672 | 0.841 | 0.291 | 0.169 |
| 0.68 | 0.927 | 5.426 | 9.095 | 0.686 | 0.849 | 0.247 | 0.163 |
| 0.686 | 0.922 | 5.48 | 8.953 | 0.694 | 0.854 | 0.236 | 0.16 |
표 4: 역사적 시기별 메타데이터 풍부화. 완전성은 기록에 대해 채워진 적용 가능한 핵심 기술 필드의 비율을 의미합니다; 인구 농지는 평균 수로 보고되며; 주제 표내 일치는 기록 수준의 증거가 적어도 하나의 통제 어휘 주제 라벨을 지지하는지 여부를 나타냅니다.
| 시스템 암 | n 쿼리 | P@10 | R@10 | nDCG@10 | 이제 첫 번째 관련 이야기를 할 시간입니다 결과(s) | 검색 성공률 |
| (%) | ||||||
| 기본 기준 | 420 | 0.394 | 0.238 | 0.392 | 156.079 | 5 |
| OCR 수정 | 420 | 0.484 | 0.346 | 0.475 | 124.261 | 30.2 |
| 시각적 분류 | 420 | 0.49 | 0.302 | 0.478 | 131.985 | 22.9 |
| 메타데이터 풍부화 | 420 | 0.507 | 0.347 | 0.513 | 117.474 | 38.3 |
| 완전 다중 모드 | 420 | 0.624 | 0.492 | 0.634 | 58.485 | 95.5 |
표 5: 다섯 개 실험 시스템 병의 검색 성능. P@10, R@10, nDCG@10, 첫 관련 결과까지 시간, 성공 검색률이 420쿼리 벤치마크에서 매칭 쿼리 조건 하에서 계산되었습니다.
이 프로토콜은 OCR 보정, 시각적 문서 이해, 보수적 메타데이터 풍부화가 고립된 기술 업그레이드가 아닌 연결된 검색 구성 요소로 평가되었을 때 역사적 디지털 아카이브에서의 발견이 가장 크게 향상되었음을 보여줍니다. 가장 큰 OCR 향상은 손글씨, 표표, 레지스트리 자료에서 나타났으며, 이는 기준선 인식이 가장 약한 문서 클래스에서 사후 수정의 가치를 뒷받침합니다. 동시에 수정 후 잔여 오류는 OCR 정리가 결정적인 전사로 간주될 수 없으며 감사 가능함을 보여줍니다.
시각적 분류 결과도 신중한 해석이 필요합니다. 미세 조정은 지도, 포스터, 신문, 등록부 등 시각적으로 구별되는 클래스를 개선했지만, 손글씨 편지와 장부는 레이아웃이 겹치고 클래스 경계가 시각적으로 구분하기 어려운 경우 이점은 작았습니다. 상대적으로 작은 말뭉치 크기로 분류 성능을 프로토콜 증거로 해석해야 하며, 생산 멀티모달 모델이 1,600개의 레코드만으로도 학습할 수 있다는 증거가 아닙니다. 향후 검증에서는 EfficientNet-B3를 문서 변환기, Vision 변환기, Swin 변환기, ConvNeXt 및 다중 모달 문서 기반 모델 8,11,12,13,14,15,16,17,18과 비교해야 합니다.
메타데이터 풍부화는 드문 기술 기록을 검색 가능한 필드로 확장하면서 출처와 신뢰도 정보를 유지함으로써 검색에 크게 기여했습니다. 이 발견은 더 풍부한 접근 지점에 대한 기록 보관 필요성과 일치하지만, 동시에 거버넌스 위험을 높입니다. 자동 강화는 OCR 오류를 증폭시키거나, 역사적으로 모호한 이름을 지나치게 정규화하거나, 통제된 어휘가 불완전할 경우 편향을 초래할 수 있습니다. 이러한 이유로 워크플로우는 카탈로그 레코드의 완전 자동 대체보다는 신뢰 임계값, 소스 로깅, 검토 플래그를 사용합니다.
검색 평가는 상보적 모듈 효과의 증거를 제공하지만, 한계가 있습니다. 본 비교는 기준선 및 내부 모듈 소작 조건을 사용했으며; ColBERT, 하이브리드 희소-밀집 검색, 신경 재순위, 검색 증강 생성 시스템과 같은 밀집 검색, 후기 상호작용 랭커와 벤치마크하지 않았습니다 22,23,24. 이러한 접근법들은 관찰된 다중 모달 향상이 현재의 회수 아키텍처와 경쟁력이 있는지 여부를 판단하기 위해 향후 연구에서 추가되어야 합니다.
구현에는 데이터 유출, 계산 제약, 확장성에 대한 주의도 필요합니다. 풍부화는 광학 문자 인식 출력, 시각적 예측, 기존 메타데이터를 사용하므로, 훈련/검증/테스트 분할과 쿼리 평가는 강화 결정과 분리되어야 합니다. 향후 배포에서는 하드웨어, 런타임, 메모리 사용량, 인덱스 크기, 1,000 레코드당 비용을 보고해야 합니다. 인접한 컴퓨터 비전 작업에서의 영상-복원 접근법, 예를 들어 다중 규모 및 주의 기반 폐색-제거 모델은 향후 전처리 실험에 영감을 줄 수 있으나, 기록 보관 워크플로우가 환각을 일으키거나 증거 내용을 변경해서는 안 되므로 신중하게 테스트해야 합니다26,27.
전반적으로 이 워크플로우는 아카이브 설명을 대체하기보다는 재현 가능한 접근 프로토콜로 이해하는 것이 가장 좋습니다. 멀티모달 인공지능은 출력물을 제한, 기록, 검토할 때 발견을 개선할 수 있지만, 기록 보관자는 출처 평가, 접근 거버넌스 결정, 역사적으로 복잡한 기록 해석에 여전히 필수적입니다21,25.
결론:
이 연구는 광학 문자 인식 보정, 시각적 문서 분류, 보수적 메타데이터 풍부화가 역사적 디지털 아카이브에서 상호 보완적인 검색 구성 요소로 작용할 수 있는지 검증했습니다. 프로토콜은 명시적 임계값, 소스 기록, 인간 검토 안전장치를 유지하면서 전사, 분류, 메타데이터 완전성, 집계 검색 성능을 향상시켰습니다. 따라서 워크플로우는 아카이브 관리자의 판단이나 저장소 거버넌스를 대체하는 것이 아니라 감사 가능한 접근 지원 프로토콜로 사용되어야 합니다.
저자들은 공개할 것이 없습니다.
저자들은 텍스트 주석 작성과 품질 관리를 위해 귀중한 도움을 준 두 경험 많은 기록 보관 직원과 전문 디지털 인문학 연구자에 진심으로 감사드립니다. 이 연구는 지능형 음성 기반 구술 기록 시스템 구축을 위한 장쑤성 기록 과학기술 프로젝트 계획(보조금 번호 2024-9)과 장쑤성 전통 중의학 과학기술발전 계획(보조금 번호)의 재정 지원을 받았습니다. MS2025025) 기록 보관 관점에서 TCM 학교의 계승과 발전을 연구하기 위한 것입니다.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| Python | Python Software Foundation | v3.11.8; https://www.python.org/ | Workflow scripting, data processing, optical character recognition post-correction, and statistical support |
| R | R Foundation for Statistical Computing | v4.3.3; https://www.r-project.org/ | 통계 분석 및 최종 그림 생성 |
| Tesseract OCR | Tesseract OCR Project | v5.3.0; https://github.com/tesseract-ocr/tesseract | 베이스라인 광학 문자 인식 생성 |
| Tesseract language packs | Tesseract OCR Project | 연구 특정 언어 팩; https://github.com/tesseract-ocr/tessdata | 기본 및 혼합 언어 광학 문자 인식 디코딩 |
| OpenCV | OpenCV Team | v4.9.0; https://opencv.org/ | 데스키잉, 노이즈 추정 및 이미지 사전 처리 |
| Pillow | Python Imaging Library contributors | v10.3.0; https://python-pillow.org/ | 이미지 입력/출력 및 형식 정규화 |
| NumPy | NumPy developers | v1.26.4; https://numpy.org/ | 이미지 및 메트릭 처리를 위한 배열 계산 |
| pandas | pandas development team | v2.2.2; https://pandas.pydata.org/ | 표 형식 데이터 처리 및 요약 내보내기 |
| SciPy | SciPy developers | v1.13.1; https://scipy.org/ | 통계 테스트 및 수치 유틸리티 |
| statsmodels | statsmodels developers | v0.14.2; https://www.statsmodels.org/ | 통계 모델링 및 쌍 비교 지원 |
| scikit-learn | scikit-learn developers | v1.4.2; https://scikit-learn.org/ | 분류 지표, ROC/PR 진단 및 검증 유틸리티 |
| rapidfuzz | Max Bachmann and contributors | v3.9.0; https://github.com/rapidfuzz/RapidFuzz | 광학 문자 인식 수정을 위한 편집 거리 후보 순위 지정 |
| spaCy | Explosion AI | v3.7.4; https://spacy.io/ | 사용자 정의 사전표와 함께하는 명명된 엔티티 처리 |
| PyTorch | PyTorch Foundation | v2.2.2; https://pytorch.org/ | 시각 문서 분류기 학습 |
| torchvision | PyTorch Foundation | v0.17.2; https://pytorch.org/vision/ | EfficientNet-B3 구현 및 이미지 변환 |
| EfficientNet-B3 backbone | torchvision / ImageNet pretrained weights | EfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.html | 시각 문서 분류 백본 |
| sentence-transformers | UKP Lab / Hugging Face ecosystem | v2.7.0; https://www.sbert.net/ | 제어 어휘 후보에 대한 의미 확장 |
| 검색 엔진 소프트웨어 | Elastic | Elasticsearch v8.11.1; https://www.elastic.co/elasticsearch | BM25 인덱싱, 검색 및 순위 지정 |
| 컨테이너 엔진 | Docker Inc. | Docker v26.1.1; https://www.docker.com/ | 컨테이너화된 검색 환경 |
| 리눅스 운영체제 | Canonical | Ubuntu 22.04 LTS; https://ubuntu.com/ | 검색 실행을 위한 고정 운영 환경 |
| 버전 관리 시스템 | Git 프로젝트 | Git v2.44.0; https://git-scm.com/ | 구성, 어휘, 스크립트 및 그림 코드에 대한 버전 관리 |
| ggplot2 | tidyverse | v3.5.1; https://ggplot2.tidyverse.org/ | R 기반 그림 렌더링 |
| Matplotlib | Matplotlib developers | v3.8.4; https://matplotlib.org/ | 보조 시각화 및 품질 보증 플롯 |
| 주석 지침 | 작성자 | 5개의 주석 섹션; 8개의 문서 클래스 레이블; OCR 영역; 엔티티 레이블; 관련성 판단; 조정 규칙 | 문서 클래스, OCR 영역, 엔티티, 관련성 판단 및 조정에 대한 정의 |
| 아카이브 특정 OCR 어휘 | 작성자 | 6개의 어휘 카테고리: 인물 변형, 장소 이름, 기관 이름, 날짜 패턴, 관리 용어, 약어 | 이름, 장소, 기관, 관리 용어 및 철자 변형 |
| 제어 어휘 매핑 | 작성자 / 기록 보관소 | OCR 엔티티, 시각적 클래스, 제목 키워드, 날짜 범위 및 쿼리 주제를 메타데이터 필드에 연결하는 5개의 매핑 규칙 | 주제 목차 일치 및 의미 확장 |
| 벤치마크 쿼리 세트 | 작성자 | 420개의 벤치마크 쿼리; 6개의 쿼리 주제; 3개의 난이도 레벨; 8개의 대상 문서 클래스; 4개의 역사적 시기; 6개의 언어 맥락 | 5개의 시스템 암을 통한 일치하는 검색 벤치마크 |
| 관련성 판단 | 작성자 / 주석자 | 2,100개의 쿼리-시스 |
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청