이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.

연구 논문

역사적 디지털 아카이브 발견을 위한 재현 가능한 다중 모달 인공지능 워크플로우

71 조회수

DOI:

10.3791/71698

2026년 8월 7일

이 논문에서

요약

여기서는 수정 후 광학 문자 인식, 시각적 문서 분류, 메타데이터 풍부화 및 검색 평가를 감사 가능한 워크플로우에 통합하여 역사적 디지털 아카이브의 발견을 향상시키는 프로토콜을 제시합니다.

초록

역사적 디지털 아카이브는 점점 검색 가능해지고 있지만, 광학 문자 인식 오류, 시각적으로 이기종적인 문서 유형, 희박한 메타데이터를 별도로 처리하면 발견은 제한적입니다. 이 연구는 보수적인 다중 모달 인공지능 워크플로우가 기록 보관 전문가 검토를 대체하지 않고 기록 검색을 개선할 수 있는지 평가하기 위한 재현 가능한 프로토콜을 개발하는 것을 목표로 했습니다. 8개 문서 분류에서 1,600건의 디지털화된 기록 기록을 수집하고, 420쿼리 벤치마크를 사용하여 기준선 색인, 광학 문자 인식 보정 단독, 시각적 분류 단독, 메타데이터 풍부화 단독, 완전 다중 모달 통합의 다섯 가지 검색 조건을 비교했습니다. 기록 수준 결과에는 문자 오류율(CER), 단어 오류율(WER), 명명된 엔터티 회상, 문서 유형 분류 정확성, 예측 신뢰도, 메타데이터 완전성, 주제 제목 일치 등이 포함되었습니다. 쿼리 수준의 결과에는 P@10, R@10, nDCG@10, 첫 번째 관련 결과까지 시간, 성공률이 포함되었습니다. 광학 문자 인식 보정은 손글씨 편지, 장부, 등록부에서 WER(광문자 인식 보정)를 가장 크게 감소시켰으며; 시각적 미세 조정은 주로 지도, 포스터, 신문, 등록부의 분류 정확도를 높였으며; 메타데이터 풍부화는 모든 역사적 시기에서 완전성을 높였습니다. 완전한 다중 모드 조건은 최고 검색 성능(P@10 = 0.624, R@10 = 0.492, nDCG@10 = 0.634)을 달성했으며, 첫 관련 결과까지의 평균 시간을 156.079초에서 58.485초로 단축시켰습니다. 이 결과들은 텍스트, 이미지, 기술적 신호가 명시적 임계값과 인간 검토 하에 결합되는 모듈형의 감사 가능한 워크플로우를 지원합니다.

서론

디지털 아카이브는 빠르게 확장되어 현재는 역사, 문화유산, 공공 행정, 디지털 인문학 분야의 연구를 지원하고 있습니다. 그러나 기록 기록은 종종 열악한 광학 문자 인식 출력, 시각적으로 다양한 페이지 레이아웃, 일관되지 않은 분류 관행, 역사적으로 변하는 이름, 장소, 기관이 결합되어 접근이 불균등합니다. 이러한 한계는 전사 품질뿐만 아니라 디지털화된 컬렉션 1,2,3,4,5,6,7의 검색, 필터링 및 후속 재사용에도 영향을 미칩니다.

기존의 문서 인공지능과 아카이브-검색 연구들은 수정 후 광학 문자 인식, 문서-이미지 분류, 메타데이터 정규화, 주제 모델링, 단어 임베딩, 신경 검색, 데이터 거버넌스 실천 등 개별 구성 요소를 개선했습니다. 8,9,10,11,12,13,14,15,16, 17, 18, 19, 20, 21, 22, 23, 24, 25. 하지만 많은 기록 보관 시스템은 여전히 이 구성 요소들을 별도로 평가하기 때문에, 결합된 워크플로우가 현실적인 검색 조건에서 발견을 개선하는지 판단하기 어렵습니다. 여기서 다루는 방법론적 공백은 텍스트, 이미지, 메타데이터 모듈을 단일 기록 워크플로우에서 결과 검색에 연결하는 재현 가능하고 감사 가능한 프로토콜의 부재입니다.

중심 목표는 광학 문자 인식 보정, 시각적 문서 분류, 규칙 제약 메타데이터 풍부화가 동일한 검색 벤치마크와 비교했을 때 상호 보완적인 개선을 이루는지 검증하는 것이었습니다.

우리는 전체 다중 모달 조건이 각 단일 구성 요소 조건보다 더 우수할 것이라고 가설을 세웠는데, 이는 아카이브 발견이 읽기 가능한 텍스트, 시각적으로 해석 가능한 문서 구조, 검색 가능한 설명 메타데이터의 상호작용에 의존하기 때문입니다. 워크플로우는 보수적으로 설계되었으며, 자동화된 출력은 검색 인덱스를 풍부하게 할 수 있었지만, 신뢰도가 낮은 예측은 권위 있는 기록 설명으로 사용되기보다는 검토를 위해 표시되었습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

이 연구는 디지털화된 기록 보관 기록과 시뮬레이션된 검색 쿼리를 분석 단위로 사용하였습니다. 아카이브 저장소는 민감하거나 문화적으로 제한된 기록에 대한 접근을 제한할 수 있습니다. 기록을 처리하거나 공유하기 전에 저장소 접근 규칙, 기관 데이터 보안 절차, 식별 해제 요건을 준수하세요. 이 디지털 워크플로우로 인해 유해한 화학물질, 생물학적, 날카로운 도구, 방사성 또는 기타 규제된 실험실 폐기물이 발생하지 않았습니다.

연구 설계 및 코퍼스 구성

그림 1 은 코퍼스 생성, 참조 라벨링, 이미지 전처리, OCR 생성 및 수정 후, 시각적 분류, 메타데이터 풍부화, 인덱스 생성, 검색 평가, 통계 분석, 재현성 패키징 등 전체 연구 워크플로우를 보여줍니다.

코퍼스 구축은 2025년 1월 15일부터 4월 30일까지 진행되었고, 이어서 5월 1일부터 10월 31일까지 시스템 설계 및 디버깅이 진행되었습니다. 이 말뭉치에는 주, 도시, 종교, 박물관, 대학, 도서관 시스템을 대표하는 8개 저장소에서 선별된 1,600개의 디지털화된 기록 기록이 포함되어 있었습니다. 샘플링 프레임은 보관소와 문서 분류별로 계층화되어 손글씨 편지, 장부, 지도, 신문, 캡션이 있는 사진, 포스터, 등록부, 타이핑된 서신 등에서 기록 보관의 이질성을 유지했습니다.

각 후보 레코드에 대해 선택 로그는 저장소 또는 컬렉션 식별자, 카탈로그 식별자, 문서 클래스, 대략적인 역사적 기간, 주요 언어 맥락, 사용 가능한 이미지 형식, 이미지 해상도, 페이지 수, 그리고 기준선 설명 필드를 기록했습니다. 포함을 위해서는 다음 모든 조건이 필요했습니다: 안정적인 카탈로그 식별자; 최소 한 장의 TIFF, JPEG, 또는 PNG 페이지 이미지; 최소 150 dpi의 소스 이미지 해상도; 읽기 쉬운 텍스트, 표 형식 또는 문서 구조 내용; 그리고 8개의 사전 정의된 문서 클래스 중 하나에 할당됩니다. 제외 기준은 정확히 동일한 중복, 빈 뒷면 페이지, 텍스트 포함 면적의 30% 이상이 빠진 이미지가 잘려 나간 것, 그리고 수작업 검사 후 읽을 수 없다고 판단된 기록이었습니다.

검색 벤치마크에는 2025년 8월 5일부터 8월 20일까지 생성된 420개의 짧은 자연어 쿼리가 포함되어 있습니다. 쿼리 생성은 재현 가능한 템플릿을 따랐습니다: 후보자 정보 필요는 인물, 기관, 장소, 날짜 범위, 직업, 사건, 주제 등에서 샘플링되었습니다; 각 쿼리는 2단어에서 9단어로 정규화되었으며; 그리고 시스템 비교 전에 목표 관련 기록이 확인되었습니다. 각 쿼리는 다섯 가지 검색 조건에서 평가되어 2,100개의 일치 쿼리-조건 관찰값을 생성했습니다.

참고 표시 및 품질 관리

참고 표기표 작성은 2025년 5월 1일부터 7월 15일까지 세 명의 주석가가 수행했습니다: 기술적 분류에 경험이 있는 기록 보관 직원 2명과 역사 문서 평가에 경험이 있는 디지털 인문학 연구자 1명입니다. 주석 가이드는 문서 클래스, 언어-맥락 범주, 역사적 시기 빈, 메타데이터 완전성 필드, 명명된 엔터티 카테고리, OCR 평가 영역 선택 규칙을 정의했습니다.

OCR 평가를 위해 주석 작성자들은 제목, 이름, 날짜, 기관 용어, 여백 주석, 표 항목, 그리고 존재할 경우 잡음이 많은 레이아웃 영역을 포함하는 대표적인 텍스트 영역을 선택했습니다. 페이지에 여러 텍스트 영역이 있을 경우, 선택한 영역은 검색에 적합해야 하며, CER과 WER 계산에 충분한 문자를 포함해야 했습니다. 의견 차이는 두 주요 주석가의 논의를 통해 먼저 해결되었다; 미해결 사건들은 디지털 인문학 연구자가 심리했습니다.

품질 관리는 기록의 무작위 12% 하위 집합을 사용했습니다. 주요 문서 유형에 대한 주석자 간 합의는 Cohen의 kappa = 0.86으로, 상당한 일치를 지지했습니다. 판결 로그는 원래와 최종 라벨, 불합의 범주, 해결 사유를 유지하여 향후 사용자가 클래스 정의와 예외 사례를 검토할 수 있도록 했습니다.

이미지 전처리

모든 이미지는 OpenCV 4.9.0, Pillow 10.3.0, NumPy 1.26.4와 함께 Python 3.11.8을 사용하여 레코드 수준으로 처리되었습니다. 각 입력 페이지는 지도, 포스터, 우표, 색상 구분 주석과 같은 의미 정보를 담고 있지 않은 한 8비트 그레이스케일로 변환되었습니다. 기울기는 투영 프로파일과 하우 선 검출을 이용해 추정되었으며; 데스크윙은 절대 비스듬각 각도가 1.5도를 초과할 때만 적용되었으며, 왜곡을 방지하기 위해 8.0도로 제한되었습니다.

대비 향상은 clipLimit = 2.0과 tileGridSize = 8× 8을 적용한 대비 제한 적응형 히스토그램 이퀄라이제이션을 사용했습니다. 3 × 10⁻²³ 핵을 가진 중앙값 필터는 추정된 배경 잡음비가 0.35를 초과할 때만 적용되었습니다. 150–299 dpi에서 촬영된 이미지는 광학 문자 인식을 위해 300 dpi로 재샘플링되었으며; 이미 300 dpi 이상인 이미지는 업스케일되지 않았습니다. 초해상도, 생성 복원, 콘텐츠 환각은 사용되지 않았습니다.

번짐, 가장자리 어두움, 고르지 않은 종이 질감, 여백 도장, 필체, 줄이 있는 선, 테이블 경계는 OCR 지역 선택을 방해하지 않는 한 유지되었습니다. 이 규칙은 기록 보관 증거를 보존하면서도 이미지 입력을 충분히 표준화하여 재현 가능한 OCR 및 분류를 가능하게 했습니다.

OCR 기본 생성 및 보정 후

기본 OCR은 Tesseract OCR 5.3.0으로 생성되었습니다. 기본 언어 팩은 카탈로그 언어와 가시 문자 중에서 선택되었으며; 카탈로그 언어와 페이지 스크립트가 일치하지 않을 때 다국어 디코딩이 가능했습니다. OCR 출력은 레코드 수준에서 그룹화되어 페이지 식별자, OCR 신뢰도, 가능한 경우 경계 상자 좌표, 수정 전 원시 텍스트와 함께 저장되었습니다.

OCR 교정 후 교정은 3단계 보존적 절차를 사용했습니다. 첫째, 문자 수준 정규화는 합자, 긴 s/s-short s 치환, 조각난 구두점, 숫자-문자 치환 등 자주 발생하는 과거 인식 혼동을 수정했습니다. 둘째, 토큰 수준 수정은 개인 이름, 지명, 기관, 행정 용어, 역사적 철자 변형 등 아카이브 전용 어휘집에서 편집 거리 및 빈도 순위 후보 후보를 사용하여 사용했습니다. 셋째, 규칙 기반 시퀀스 검사는 명명된 개체와 날짜를 맥락과 메타데이터의 증거와 대조하여 검증합니다.

후보 대체 후보자는 후방 교정 신뢰도가 0.80을 초과할 때만 승인되었습니다; 명명된 법인 대체는 최소 0.85의 신뢰도를 요구했습니다. 기준 이하의 지원자는 OCR 텍스트로 유지되었으나 검토를 위해 표시되었습니다. CER은 레벤슈타인 편집 거리를 참조 전사 문자 수로 나눈 값으로 계산되었습니다. WER는 토큰 수준에서 같은 공식을 사용했습니다. 명명된 개체 회상은 선택된 평가 영역 내 모든 참조 개체로 올바르게 인식된 참조 개체를 나누어 계산했습니다.

시각적 문서 분류

시각적 분류 모듈은 각 기록을 8가지 기록 문서 분류 중 하나로 할당했습니다: 손글씨 편지, 장부, 지도, 신문, 캡션이 포함된 사진, 포스터, 등록부, 타이핑된 서신. 예측된 문서 유형은 아카이브 분류를 권위 있게 대체하는 것이 아니라 검색 및 필터링 신호로 사용되었습니다.

이 모델은 PyTorch 2.2.2와 torchvision 0.17.2에서 ImageNet 사전 학습된 EfficientNet-B3 백본을 사용하여 구현되었습니다. 기록 수준 썸네일은 384 x 384 픽셀로 크기 조정되었습니다. 누수를 줄이기 위해 레코드는 저장소와 문서 클래스별로 훈련, 검증, 테스트 세트로 70:15:15 비율로 나뉘었으며, 약 1,120, 240, 240개의 레코드에 해당합니다.

학습은 초기 학습률 = 1 × 10-4, 가중치 감소 = 1 × 10⁻², 배치 크기 = 16, 라벨 스무딩 = 0.05, 그리고 5년 연속 에포크에서 검증 손실이 개선되지 않을 경우 조기 중단을 적용한 AdamW를 사용했습니다. 가로 뒤집기는 미러 아카이브 레이아웃이 현실적이지 않아 비활성화되었습니다. 증강은 -3도에서 +3도까지 회전하고 밝기 변화는 ±10% 이내로 제한되었습니다.

시대 수준 모델 진단은 20개의 훈련 행으로 요약되며, 각 행에는 훈련 손실, 검증 손실, 훈련 정확도, 검증 정확도, 매크로-F1, 가중-F1, ROC-AUC, PR-AUC가 포함됩니다.

메타데이터 풍부화 워크플로우

메타데이터 풍부화는 아카이브의 보존성을 유지하면서 발견 가능성을 높이기 위해 설계되었습니다. 기존 카탈로그 값은 불가능한 날짜나 OCR과 시각적 증거로 확인된 문서 유형의 충돌과 같은 명확한 모순이 있을 경우를 제외하고는 유지되었습니다. 후보 심화 필드에는 정규화된 제목, 문서 유형, 대략적인 날짜, 기관 언급, 지리적 언급, 개인 이름 언급, 주제 제목, 키워드 등이 포함되었습니다.

증거 우선순위는 고정된 순서를 따랐습니다: (1) 기존 카탈로그 메타데이터, (2) 수정된 OCR 출력, (3) 시각적 문서 유형 예측. 주제 제목에는 통제된 어휘 매칭이 사용되었고, 문장 변환기 2.7.0을 사용한 근접 이웃 의미 확장은 코사인 유사성이 최소 0.72일 때만 사용되었습니다. 날짜 정규화는 최소 0.85의 신뢰도나 OCR과 메타데이터 간의 일치가 필요했습니다. 자동으로 추가된 모든 필드는 출처, 신뢰도, 규칙 식별자를 유지했습니다.

메타데이터 완전성은 해당 기록에 대해 채워진 코어 기술 필드 수와 적용 가능한 코어 필드 수로 나눈 것으로 정의되었습니다. 주제 표내 일치는 기록 수준의 내용 증거로 뒷받침되고 쿼리 범주와 관련성이 있다고 판단된 최소 하나의 통제 어휘 주제 라벨의 존재로 정의되었습니다.

검색 시스템 구성

모듈 기여도를 분리하기 위해 다섯 가지 검색 인덱스가 구축되었습니다: 기준선 색인; 광학 문자 인식 보정만; 시각적 분류만 가능하며; 메타데이터 풍부화만; 그리고 완전한 다중 모드 통합을 포함합니다. 모든 지수는 재료 표(버전 8.11.1)에 나열된 검색 엔진 소프트웨어에서 기록 수준으로 작성되었습니다. 평가 전 BM25 매개변수는 k1 = 1.2, b = 0.75로 고정되었습니다.

기준선 인덱스는 원본 메타데이터와 기준선 OCR 텍스트를 사용했습니다. OCR 조건은 기본 OCR 대신 교정된 OCR로 대체되었습니다. 시각적 조건은 문서 유형의 선행과 클래스 인식 순위 향상을 추가했습니다. 메타데이터 조건은 풍부한 기술적 필드를 추가했습니다. 완전한 다중 모드 조건은 보정된 OCR, 시각적 사전 측정, 풍부한 메타데이터를 결합했습니다. 필드 가중치는 테스트 전에 고정되었습니다: 정규화된 제목 = 3.0, 주제 제목 = 2.5, 인물 및 기관 언급 = 2.2, 장소 언급 = 2.0, 문서 유형 = 1.8, 수정된 OCR 본문 = 1.0, 기준 OCR 본문 = 0.8(해당되는 경우).

인용 쿼리에 대해 정확한 구문 매칭이 활성화되었습니다. 쿼리 확장은 메타데이터 풍부화 및 완전 다중 모드 조건에서만 허용되었으며, 허용된 통제 어휘 동의어와 주목 변형에 한정되었다. 검색 로그는 2025년 8월 25일부터 8월 28일까지 Table of Materials에 나열된 컨테이너화된 리눅스 환경에서 생성되었으며, 고정 시드와 동결된 인덱스 구성으로 이루어졌습니다.

쿼리 설계 및 결과 측정

420개의 쿼리는 키워드 전용 벤치마크 프롬프트가 아니라 일반적인 아카이브 검색 행동을 나타냈습니다. 주제에는 개인 이름, 기관, 장소, 날짜와 날짜 범위, 직업, 사건, 주제별 주제가 포함되었습니다. 각 쿼리는 정규화된 문구, 목표 레코드 집합, 쿼리-주제 카테고리, 난이도 점수와 함께 저장되었습니다.

난이도는 검색 전에 표적 모호성, 어휘 특이성, 예상 표현 빈도를 사용하여 점수를 매겼다. 0.40 미만의 종합 점수는 저난이도, 0.40–0.69 점수는 중간, 0.70 이상은 고난이도로 분류되었습니다. 관련성 판단은 시스템 비교 전에 완료되었고, 최종 수집본과 대조되었습니다.

검색 결과에는 P@10, R@10, nDCG@10, 첫 번째 관련 결과까지 도달하는 시간, 성공률이 포함되었습니다. P@10 상위 10개 음반 중 관련성 있다고 판단된 비율이었습니다. R@10는 상위 10위 안에 포함된 모든 알려진 관련 기록 중 차지하는 비율입니다. nDCG@10 가능한 경우 등급별 관련성을 사용했고, 그렇지 않으면 이진 관련성을 사용했습니다. 쿼리 제출부터 순위 매김 결과에 첫 관련 레코드가 나타날 때까지 첫 번째 관련 결과까지의 시간을 측정했습니다. 성공적인 검색은 상위 10개 기록 중 최소 하나의 관련 결과로 정의되었습니다.

통계 수집

모든 분석은 재료표에 나열된 소프트웨어 버전을 사용하여 수행되었습니다. 연속 결과는 대칭일 때는 평균 ± SD로, 그렇지 않으면 중간값으로 요약되었습니다. 범주별 결과는 카운트 수와 백분율로 요약되었습니다.

쌍 차이의 정규성은 Shapiro-Wilk 검정과 분포 플롯을 통해 평가하였다. OCR 및 전후 결과 전후 데이터를 쌍 t-검정과 비교하였으며, 쌍 간 차이가 거의 정상일 때, Wilcoxon 부호 순위 검정은 그렇지 않은 경우에 적용되었습니다. 미세 조정 전후의 분류 성과는 정확/부정 쌍을 가진 쌍을 대상으로 맥네마르 검정을 사용해 비교하였다. 일치하는 다팔 추출 결과는 프리드먼 검정과 홀름 조정 쌍별 윌콕슨 서명 순위 검정과 비교하였다.

모든 통계 검정은 양측 검정이었으며, P < 0.05는 통계적으로 유의미한 것으로 간주되었습니다. 신뢰구간은 2,000개의 부트스트랩 재샘플을 사용해 추정했으며, 무작위 시드는 2025년으로 고정되었습니다. 효과는 결과 유형에 따른 평균 차이, 일치 오즈비 또는 순위 기반 효과 크기 형태로 보고되었습니다.

재현성, 범위, 자원 가용성

모든 파이프라인 매개변수는 추출 테스트 전에 고정되었습니다. 보유된 검색 벤치마크에서는 어떤 매개변수도 최적화되지 않았습니다. 구성 파일, 통제된 어휘, 어휘 표, 쿼리 템플릿, 필드 매핑, 주석 지침, 통계 스크립트, 도표 생성 스크립트 등이 2025년 무작위 시드가 포함된 Table of Materials 에 나열된 버전 관리 시스템에서 유지되었습니다.

독립적인 검증을 지원하기 위해 소스-데이터 워크북에는 광학 문자 인식, 메타데이터, 시각적 분류 분석에 사용되는 17개의 변수가 포함된 1,600개 레코드 표가 식별되지 않습니다. 파생 표 1, 표 2, 표 3, 표 4, 표 5, 도표-출처 요약, 벤치마크-쿼리 정의, 관련성 판단 요약, 검색 로그 대리모, 학습 진단, 어휘 범주, 어휘 매핑 규칙, 주석-지침 필드는 해당 시 별도의 업로드 가능한 표 또는 자료 파일로 제공됩니다. 저장소 제한으로 인해 공개 공유가 불가능한 자료는 식별 해제된 메타데이터 필드와 재현 가능한 샘플링 필드로 표현됩니다.

이 프로토콜은 역사적 주장의 진실성보다는 검색 중심의 발견을 평가합니다. 이는 기록 관리자 평가, 출처 평가, 개인정보 보호 검토, 저장소별 접근 규칙을 대체하지 않습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

OCR 보정은 특히 손글씨와 표 형식 기록에서 전사 품질을 향상시켰습니다

광학 문자 인식 보정은 8개 아카이브 문서 분류(n = 1,600 레코드) 모두에서 전사 품질을 향상시켰습니다. 평균 WER ± 0.529에서 0.384 ± 0.123로 감소했으며, 평균 쌍 변화는 −0.144(95% 신뢰구간, −0.149에서 −0.139로; 윌콕슨 서명 순위 P < 0.001). 평균 CER은 0.377± 0.126에서 0.258± 0.086으로 감소했으며, 평균 쌍 변화는 −0.119(95% 신뢰구간, −0.123에서 −0.116까지; 윌콕슨 서명 순위 P < 0.001). 표 2는 기본 WER(기초 WER)가 손글씨 편지, 장부, 등기부에서 가장 높았음을 보여주며, 시각적으로 가장 복잡한 기록이 초기 인식 부담도 가장 크다는 것을 나...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

이 프로토콜은 OCR 보정, 시각적 문서 이해, 보수적 메타데이터 풍부화가 고립된 기술 업그레이드가 아닌 연결된 검색 구성 요소로 평가되었을 때 역사적 디지털 아카이브에서의 발견이 가장 크게 향상되었음을 보여줍니다. 가장 큰 OCR 향상은 손글씨, 표표, 레지스트리 자료에서 나타났으며, 이는 기준선 인식이 가장 약한 문서 클래스에서 사후 수정의 가치를 뒷받침합니다. 동시에 수정 후 잔여 오류는 OCR 정리가 결정적인 전사로 간주될 수 없으며 감사 가능함을 보여줍니다.

시각적 분류 결과도 신중한 해석이 필요합니다. 미세 조정은 지도, 포스터, 신문, 등록부 등 시각적으로 구별되는 클래스를 개선했지만, 손글씨 편지와 장부는 레이아웃이 겹치고 클래스 경계가 시각적으로 구분하기 어려운 경우 이점은 작았습니다. 상대적으로 작은 말뭉치 크기로 분류 성능을 프로토콜 증거로 해석해야 하며, 생산 멀티모달 모델이 1,600개의 레코드만...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

저자들은 공개할 것이 없습니다.

감사의 글

저자들은 텍스트 주석 작성과 품질 관리를 위해 귀중한 도움을 준 두 경험 많은 기록 보관 직원과 전문 디지털 인문학 연구자에 진심으로 감사드립니다. 이 연구는 지능형 음성 기반 구술 기록 시스템 구축을 위한 장쑤성 기록 과학기술 프로젝트 계획(보조금 번호 2024-9)과 장쑤성 전통 중의학 과학기술발전 계획(보조금 번호)의 재정 지원을 받았습니다. MS2025025) 기록 보관 관점에서 TCM 학교의 계승과 발전을 연구하기 위한 것입니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
PythonPython Software Foundationv3.11.8; https://www.python.org/Workflow scripting, data processing, optical character recognition post-correction, and statistical support
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/통계 분석 및 최종 그림 생성
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseract베이스라인 광학 문자 인식 생성
Tesseract language packsTesseract OCR Project연구 특정 언어 팩; https://github.com/tesseract-ocr/tessdata기본 및 혼합 언어 광학 문자 인식 디코딩
OpenCVOpenCV Teamv4.9.0; https://opencv.org/데스키잉, 노이즈 추정 및 이미지 사전 처리
PillowPython Imaging Library contributorsv10.3.0; https://python-pillow.org/이미지 입력/출력 및 형식 정규화
NumPyNumPy developersv1.26.4; https://numpy.org/이미지 및 메트릭 처리를 위한 배열 계산
pandaspandas development teamv2.2.2; https://pandas.pydata.org/표 형식 데이터 처리 및 요약 내보내기
SciPySciPy developersv1.13.1; https://scipy.org/통계 테스트 및 수치 유틸리티
statsmodelsstatsmodels developersv0.14.2; https://www.statsmodels.org/통계 모델링 및 쌍 비교 지원
scikit-learnscikit-learn developersv1.4.2; https://scikit-learn.org/분류 지표, ROC/PR 진단 및 검증 유틸리티
rapidfuzzMax Bachmann and contributorsv3.9.0; https://github.com/rapidfuzz/RapidFuzz광학 문자 인식 수정을 위한 편집 거리 후보 순위 지정
spaCyExplosion AIv3.7.4; https://spacy.io/사용자 정의 사전표와 함께하는 명명된 엔티티 처리
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/시각 문서 분류기 학습
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/EfficientNet-B3 구현 및 이미지 변환
EfficientNet-B3 backbonetorchvision / ImageNet pretrained weightsEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.html시각 문서 분류 백본
sentence-transformersUKP Lab / Hugging Face ecosystemv2.7.0; https://www.sbert.net/제어 어휘 후보에 대한 의미 확장
검색 엔진 소프트웨어ElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchBM25 인덱싱, 검색 및 순위 지정
컨테이너 엔진Docker Inc.Docker v26.1.1; https://www.docker.com/컨테이너화된 검색 환경
리눅스 운영체제CanonicalUbuntu 22.04 LTS; https://ubuntu.com/검색 실행을 위한 고정 운영 환경
버전 관리 시스템Git 프로젝트Git v2.44.0; https://git-scm.com/구성, 어휘, 스크립트 및 그림 코드에 대한 버전 관리
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/R 기반 그림 렌더링
MatplotlibMatplotlib developersv3.8.4; https://matplotlib.org/보조 시각화 및 품질 보증 플롯
주석 지침작성자5개의 주석 섹션; 8개의 문서 클래스 레이블; OCR 영역; 엔티티 레이블; 관련성 판단; 조정 규칙문서 클래스, OCR 영역, 엔티티, 관련성 판단 및 조정에 대한 정의
아카이브 특정 OCR 어휘작성자6개의 어휘 카테고리: 인물 변형, 장소 이름, 기관 이름, 날짜 패턴, 관리 용어, 약어이름, 장소, 기관, 관리 용어 및 철자 변형
제어 어휘 매핑작성자 / 기록 보관소OCR 엔티티, 시각적 클래스, 제목 키워드, 날짜 범위 및 쿼리 주제를 메타데이터 필드에 연결하는 5개의 매핑 규칙주제 목차 일치 및 의미 확장
벤치마크 쿼리 세트작성자420개의 벤치마크 쿼리; 6개의 쿼리 주제; 3개의 난이도 레벨; 8개의 대상 문서 클래스; 4개의 역사적 시기; 6개의 언어 맥락5개의 시스템 암을 통한 일치하는 검색 벤치마크
관련성 판단작성자 / 주석자2,100개의 쿼리-시스

참고문헌

  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

태그

234234AIOCR