このコンテンツを表示するには、JoVEへの購読が必要です。 または、無料トライアルをお申し込みください。

研究記事

歴史的デジタルアーカイブの発見のための再現可能なマルチモーダル人工知能ワークフロー

71 回視聴

DOI:

10.3791/71698

2026年8月7日

この記事について

サマリー

ここでは、修正後の光学文字認識、視覚的文書分類、メタデータの強化、検索評価を監査可能なワークフローに統合することで、歴史的デジタルアーカイブの発見を向上させるプロトコルを提示します。

要約

歴史的なデジタルアーカイブはますます検索可能になっていますが、光学的な文字認識エラー、視覚的に異種な文書タイプ、稀なメタデータを別々に扱うと、発見は限られています。本研究は、保守的なマルチモーダル人工知能ワークフローがアーカイブ検索を改善できるかどうかを評価する再現可能なプロトコルを開発することを目的としました。8つの文書クラスから1,600件のデジタル化されたアーカイブ記録のコーパスをまとめ、420クエリのベンチマークを用いて、ベースラインインデックス、光学文字認識補正単独、視覚分類単独、メタデータ強化単独、完全なマルチモーダル統合の5つの検索条件を比較しました。記録レベルの成果には、文字誤り率(CER)、語誤り率(WER)、名前エンティティのリコール、文書型分類の正確性、予測信頼度、メタデータの完全性、主題見出しの一致が含まれていました。クエリレベルの成果には、P@10、R@10、nDCG@10、最初の関連結果が得られるまでの時間、成功率が含まれます。光学文字認識補正は手書きの手紙、台帳、レジストリブックにおいてWER(世界情報の誤差)を最も大幅に削減しました。視覚的な微調整により、地図、ポスター、新聞、登録簿の分類精度が主に向上し、メタデータの充実は、すべての歴史的期間における完全性を高めました。完全なマルチモーダル条件は最高の復元性能(P@10 = 0.624、R@10 = 0.492、nDCG@10 = 0.634)を達成し、最初の関連結果までの平均時間も156.079秒から58.485秒に短縮しました。これらの結果は、テキスト、画像、記述信号を明示的な閾値と人間のレビューのもとで組み合わせるモジュール型で監査可能なワークフローをサポートします。

概要

デジタルアーカイブは急速に拡大し、現在では歴史、文化遺産、公共行政、デジタル人文学の研究を支援しています。しかし、アーカイブ記録はしばしば劣化した光学文字認識出力、視覚的に多様なページレイアウト、一貫性のない目録作成の慣行、歴史的に異なる名前、場所、機関が混在するため、アクセスの均一性は依然として不一致です。これらの制限は転写の品質だけでなく、デジタル化されたコレクション1234567の検索、フィルタリング、下流再利用にも影響を及ぼします。

既存の文書人工知能およびアーカイブ検索研究は、修正後の光学文字認識、文書画像分類、メタデータ正規化、トピックモデリング、ワード埋め込み、ニューラル検索、データガバナンスの実践など、個別の要素を改善してきました8,9,10,11,12,13,14,1516171819202122232425。しかし、多くのアーカイブシステムはこれらのコンポーネントを個別に評価するため、現実的な検索条件下で複数のワークフローが発見を向上させるかどうか判断が難しいです。ここで対処される方法論的なギャップは、テキスト、画像、メタデータモジュールを単一のアーカイブワークフローで結果を取得するために再現可能で監査可能なプロトコルが存在しないことです。

中心的な目的は、光学文字認識補正、視覚的文書分類、ルール制約されたメタデータ強化が、同じ検索ベンチマークと比較して相補的な改善をもたらすかどうかを検証することでした。

私たちは、アーカイブの発見が可読テキスト、視覚的に解釈可能な文書構造、検索可能な記述メタデータの相互作用に依存しているため、完全なマルチモーダル条件が各単一成分条件を上回ると仮説を立てました。ワークフローは保守的に設計されており、自動出力で検索インデックスを豊かにすることは可能でしたが、信頼度の低い予測は権威あるアーカイブ記述としてではなくレビュー用にフラグ付けされました。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

本研究では、デジタル化されたアーカイブ記録とシミュレーション検索クエリを分析単位として用いました。アーカイブリポジトリは、機密または文化的に制限された記録へのアクセスを制限する場合があります。記録を処理または共有する前に、リポジトリアクセスルール、機関のデータセキュリティ手順、非識別化要件を遵守してください。このデジタルワークフローでは、有害な化学物質、生物学的、鋭利器、放射性物質、その他の規制対象の実験室廃棄物は一切発生しませんでした。

研究デザインとコーパス構成

図1 は、コーパス構築、参照ラベリング、画像前処理、OCR生成および補正後補正、視覚分類、メタデータ強化、インデックス構築、検索評価、統計解析、再現性パッケージングを含む研究全体のワークフローを示しています。

コーパス構築は2025年1月15日から4月30日まで行われ、その後5月1日から10月31日までシステム設計とデバッグが行われました。コーパスには、州、市、宗教、博物館、大学、図書館の8つの保管庫から選ばれた1,600件のデジタル化されたアーカイブ記録が含まれていました。サンプリング枠は、手書きの手紙、台帳、地図、新聞、キャプション付き写真、ポスター、登録簿、タイプされた書簡など、アーカイブの異質性を保持するために、リポジトリや文書クラスごとに階層化されました。

各候補レコードについては、選択ログにはリポジトリまたはコレクション識別子、カタログ識別子、文書クラス、おおよその歴史的期間、主要な言語の文脈、利用可能な画像フォーマット、画像解像度、ページ数、基準記述フィールドが記録されました。収録には以下すべての条件が必要でした:安定したカタログ識別子;少なくとも1枚のTIFF、JPEG、またはPNGのページ画像;少なくとも150 dpiのソース画像解像度;読みやすいテキスト、表形式、または文書構造的な内容;そして、8つのあらかじめ定義された文書クラスのいずれかへの割り当て。除外基準は、完全な重複、空白の裏返しページ、テキストを含む部分の30%以上が欠落するほど画像を切り取ったもの、手動検査後に判読不能と判断された記録でした。

検索ベンチマークには、2025年8月5日から8月20日の間に生成された420件の短い自然言語クエリが含まれていました。クエリ生成は再現可能なテンプレートに従い、候補者の情報ニーズは人物、機関、場所、日付、職業、出来事、トピックからサンプリングされました。各クエリは2〜9語に正規化され、およびシステム比較前に対象となる関連レコードが特定されました。各クエリは5つの検索条件で評価され、2,100件の一致クエリ条件観測結果が生成されました。

リファレンスラベルと品質管理

参考文献ラベリングは2025年5月1日から7月15日まで、記述的目録作成に熟練したアーカイブスタッフ2名と歴史的文書評価に熟練したデジタル人文学研究者1名の3名によって実施されました。注釈ガイドでは、文書クラス、言語文脈カテゴリ、歴史的期間ビン、メタデータ完全性フィールド、名前エンティティカテゴリ、OCR評価領域の選択ルールが定義されました。

OCR評価のために、注釈者は見出し、名前、日付、機関用語、余白注釈、表形式の項目、そして存在する場合はノイズの多いレイアウト領域を含む代表的なテキスト領域を選びました。複数のテキスト領域を含むページの場合、選択された領域は検索可能な関連性があり、CERおよびWER(世界空間)の計算に十分な文字を含める必要がありました。意見の相違はまず二人の主要な注釈者間の議論を通じて和解されました。未解決の案件はデジタル人文学研究者によって裁定されました。

品質管理では、記録の12%をランダムに選んだサブセットが使用されました。主要な文書タイプの注釈者間合意はコーエンのκ=0.86であり、実質的な一致を支持していました。裁定ログには、元のラベルと最終ラベル、意見の相違のカテゴリ、解決理由が保持され、将来のユーザーがクラス定義やエッジケースを監査できるようになっています。

画像前処理

すべての画像は、Python 3.11.8、OpenCV 4.9.0、Pillow 10.3.0、NumPy 1.26.4を用いてレコードレベルで処理されました。各入力ページは、地図、ポスター、切手、色分けされた注釈などの意味情報を含む色を除き、8ビットグレースケールに変換されました。スキューは投影プロファイルとハフライン検出を用いて推定されました。デスクウィングは絶対的なスキュー角が1.5度を超える場合のみ適用され、歪みを避けるために8.0度に制限されていました。

コントラスト強化には、clipLimit = 2.0、tileGridSize = 8 × 8 を用いたコントラスト制限適応ヒストグラム均等化が用いられました。推定背景雑音比が0.35を超える場合にのみ、核が3× 10−23 の中央値フィルターが適用されました。150〜299 dpiで撮影された画像は、光学文字認識のために300 dpiにリサンプリングされました。すでに300 dpi以上の画像はアップスケールされませんでした。超解像度、生成復元、内容幻覚は使用されませんでした。

にじみ、エッジの暗化、紙の質感の不均一さ、余白のスタンプ、手書き、線付き線、表の境界線は、OCR地域選択を妨げない限り保持されました。このルールはアーカイブ証拠を保存しつつ、画像入力を十分に標準化し、再現可能なOCRや分類を実現しました。

OCRベース生成と補正後

ベースラインOCRはTesseract OCR 5.3.0で生成されました。主要な言語パックはカタログの言語と可視文字から選択されました。カタログ言語とページスクリプトが一致しない場合、多言語デコードが可能になりました。OCR出力はレコードレベルでグループ化され、ページ識別子、OCR信頼度、利用可能なバウンディングボックス座標、修正前の生テキストとともに保存されていました。

OCR後の矯正は3段階の保存的手法を用いました。まず、文字レベルの正規化により、合字、長S/短Sの置換、断片的な句読点、数字と文字の置換など、頻繁に起こる歴史的認識の混乱を修正しました。次に、トークンレベルの修正は、個人名、地名、機関、行政用語、歴史的綴りの変種などアーカイブ固有の語彙から、編集距離と頻度順位の候補を用いています。第三に、ルールベースのシーケンスチェックにより、名前のある実体や日付が文脈やメタデータの証拠と照らされて検証されます。

候補者置換は後方矯正信頼度が0.80を超えた場合にのみ受け入れられました。名前エンティティの置換は信頼度が少なくとも0.85を必要としました。基準を下回る候補者はOCRテキストとして保持されましたが、審査のためにフラグが立てられました。CERはレヴェンシュタインの編集距離を参照文字数で割ったものとして計算されました。WERはトークンレベルで同じ式を用いていました。名前エンティティのリコールは、選択された評価領域内のすべての参照エンティティで正しく認識された参照エンティティで計算されました。

視覚文書分類

視覚的分類モジュールは、各記録を手書きの手紙、台帳、地図、新聞、キャプション付き写真、ポスター、登録簿、タイプされた書簡の8つのアーカイブ文書クラスのいずれかに割り当てました。予測された文書タイプは、アーカイブのカタログ作成の権威ある代替ではなく、検索およびフィルタリングの信号として使用されました。

このモデルはPyTorch 2.2.2およびtorchvision 0.17.2で、ImageNetで事前学習済みのEfficientNet-B3バックボーンを用いて実装されました。記録レベルのサムネイルは384×384ピクセルにリサイズされました。漏洩を減らすため、レコードはリポジトリとドキュメントクラスごとにトレーニング、検証、テストセットに70:15:15の比率で分割され、約1,120、240、240のレコードに相当します。

トレーニングでは、初期学習率=1 × 10-4、ウェイト減衰=1 × 10−2、バッチサイズ=16、ラベル平滑化=0.05、検証損失が5回連続で改善しなかった場合は早期停止を用い、AdamWを用いました。水平反転はミラーアーカイブレイアウトがリアルでないため無効化されました。増強は回転度が-3度から+3度、明るさの変動は±10%以内に限定されました。

エポックレベルのモデル診断は20の訓練行にまとめられ、それぞれに訓練損失、検証損失、訓練精度、検証精度、マクロF1、重み付きF1、ROC-AUC、PR-AUCが含まれています。

メタデータエンリッチメントワークフロー

メタデータの強化は、アーカイブの保守性を保ちつつ発見可能性を向上させるために設計されました。既存のカタログ値は、OCRや視覚的証拠で確認された不可能な日付や文書型の矛盾など、明確な矛盾を含まない限り保持されました。候補者増強フィールドには、正規化されたタイトル、文書タイプ、おおよその日付、機関名の言及、地理的言及、個人名の言及、主題見出し、キーワードが含まれていました。

エビデンスの優先順位は固定された順序で、(1)既存のカタログメタデータ、(2)修正されたOCR出力、(3)視覚文書タイプの予測。主語見出しには制御語彙マッチングが用いられ、文変換器2.7.0を用いた近傍意味展開は、余弦類似度が少なくとも0.72の場合にのみ用いられました。日付正規化には、少なくとも0.85の信頼度、またはOCRとメタデータの整合性が必要でした。自動追加されたすべてのフィールドは、そのソース、信頼度、ルール識別子を保持しました。

メタデータの完全性は、そのレコードに適用可能なコアフィールドの数で埋め込まれた記述フィールドの数を割ることで定義されました。主題見出し一致は、少なくとも1つの制御語彙主語ラベルの存在と、記録レベルの内容証拠によって裏付けられ、クエリカテゴリに関連して判断されることと定義されました。

検索システムの構築

モジュール寄与を分離するために5つの検索インデックスが構築されました:ベースラインインデックス;光学文字認識補正のみ;視覚的分類のみ;メタデータ強化のみ;完全なマルチモーダル積分。すべての指数は、 Table of Materials (バージョン8.11.1)に記載された検索エンジンソフトウェアで記録レベルで作成されました。評価前にBM25パラメータはk1=1.2、b=0.75に固定されていました。

ベースラインインデックスは元のメタデータとベースラインOCRテキストを使用していました。OCR条件はベースラインOCRを補正OCRに置き換えました。視覚的な条件により、文書タイプの事前評価やクラス認識のランク強化が加わりました。メタデータ条件により、強化された記述フィールドが追加されました。完全なマルチモーダル状態は、修正済みOCR、視覚的事前分析、強化メタデータを組み合わせたものでした。フィールド重みはテスト前に固定されていました:正規化されたタイトル=3.0、主題見出し=2.5、人物および機関の言及数=2.2、場所の言及数=2.0、文書タイプ=1.8、修正済みOCR本文=1.0、基準OCR本文=0.8(該当する場合)。

引用クエリには正確なフレーズマッチングが可能になりました。クエリ展開はメタデータ強化およびフルマルチモーダル条件でのみ許可され、受け入れられた制御語彙同義語および主題見出しの変種に限定されました。検索ログは2025年8月25日から8月28日まで、 Table of Materialsに記載されたコンテナ化されたLinux環境で生成され、固定シードと凍結されたインデックス構成で行われました。

クエリ設計とアウトカム指標

420件のクエリは、キーワードのみのベンチマークプロンプトではなく、一般的なアーカイブ検索行動を表していました。トピックには、個人名、機関、場所、日付や日付範囲、職業、出来事、テーマ別などが含まれていました。各クエリは正規化された文言、ターゲットレコードセット、クエリトピックカテゴリ、難易度スコアとともに保存されました。

難易度は、標的の曖昧さ、語彙特異性、期待される発現頻度を用いて検索前にスコアリングされました。0.40未満の総合スコアは低難易度、0.40〜0.69のスコアは中程度の難易度、0.70以上のスコアは高難易度と分類されました。関連性判断はシステム比較前に完了し、最終的なコレクションと照合されました。

検索結果には、P@10、R@10、nDCG@10、最初に関連した結果に至るまでの時間、成功率が含まれていました。P@10は、トップ10レコードの中で関連性があると判断された割合でした。R@10は、トップ10で取得された既知の関連レコード全体の割合でした。nDCG@10利用可能な場合は段階的関連性を使い、それ以外はバイナリ関連性を使いました。クエリ提出からランキングされた出力に最初の関連レコードが現れるまでの時間が測定されました。検索に成功したとは、上位10件のレコードのうち少なくとも1件の関連結果が出ることと定義されました。

統計収集

すべての分析は 材料表に記載されているソフトウェアバージョンを使用して実施されました。連続アウトカムは、ほぼ対称±平均SDとして、それ以外の場合は四分位数範囲を持つ中央値として要約されました。カテゴリ別アウトカムはカウントとパーセンテージでまとめられました。

ペア差の正規性はシャピロ・ウィルク検定および分布プロットで評価されました。OCRおよびメタデータの事前・事後評価は、ペアの差がほぼ正常であった場合と、Wilcoxon署名ランク検定がそれ以外の場合にペアt検定と比較されました。ファインチューニング前後の分類性能は、正しく/誤ったラベルのペアを対象にマクネマー検定を用いて比較されました。一致した多腕抽出アウトカムをフリードマン検定と比較し、その後ホルム調整済みペアワイズウィルコクソン符号付き順位検定を比較しました。

すべての統計検定は両側で、 P < 0.05は統計的に有意とされました。信頼区間は2,000件のブートストラップ再サンプルを用いて推定され、ランダムシードは2025年に固定されました。効果は平均差、マッチングオッズ比、または結果タイプに応じたランクベースの効果サイズとして報告されました。

再現性、範囲、資源の利用可能性

すべてのパイプラインパラメータは抽出試験前に固定されていました。ホールドアウトされた検索ベンチマークでは、どのパラメータも最適化されていませんでした。構成ファイル、制御語彙、辞書表、クエリテンプレート、フィールドマッピング、注釈ガイドライン、統計スクリプト、図生成スクリプトは、2025年のランダムシード付き Table of Materials に記載されたバージョン管理システムで管理されました。

独立した検証を支援するため、ソースデータワークブックには17変数の非号化された1,600レコードテーブルが含まれており、光学文字認識、メタデータ、視覚的分類解析に使用されています。派生表1、表2、表3、表4、 表5、図の出典要約、ベンチマーククエリ定義、関連性判断要約、検索ログ代替、訓練診断、語彙カテゴリ、語彙マッピングルール、注釈ガイドラインフィールドは、該当する場合は別々のアップロード可能な表または資料ファイルとして提供されます。リポジトリの制限により公開できない資料は、非特定メタデータフィールドや再現可能なサンプリングフィールドで表されます。

このプロトコルは、歴史的主張の真偽ではなく、検索志向の発見を評価します。アーカイブ評価、出所評価、プライバシーレビュー、リポジトリ固有のアクセスルールに代わるものではありません。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

OCR補正により、特に手書きおよび表形式の記録における転記が向上しました

光学文字認識補正により、8つのアーカイブ文書クラスすべて(n = 1,600レコード)で転写品質が向上しました。平均WERは0.529±0.172から0.384±0.123に減少し、平均ペア変化は−0.144(95%信頼区間、−0.149から−0.139;ウィルコクソン署名順位 P < 0.001)。平均CERは0.377±0.126から0.258±0.086に減少し、平均ペア変化は−0.119(95%信頼区間、−0.123から−0.116へ)でした。ウィルコクソン署名順位 P < 0.001)。 表2は 、手書きの手紙、台帳、登録簿で基準的なWER(基準のWAR)が最も高く、視覚的に最も複雑な記録が初期認識負荷も最も大きいことを示しています。

修正後、すべての文書クラスでWERが減少...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

このプロトコルは、歴史的デジタルアーカイブでの発見が最も向上したことを示しています。OCR補正、視覚的文書理解、保守的なメタデータ強化を、単なる技術的アップグレードではなく、接続された検索要素として評価したことが示されています。最大のOCR向上は手書き、表形式、レジストリ資料で見られ、基準認識が最も弱い文書クラスにおいて修正後の価値を支持しています。同時に、修正後の残留誤差はOCRのクリーンアップを決定的な転写として扱えず、監査可能なままにしておく必要があります。

視覚分類の結果も慎重な解釈が必要です。微調整により地図、ポスター、新聞、登録簿などの視覚的に特徴的なクラスは改善されましたが、手書きの手紙や台帳ではレイアウトが重なり、クラス境界が視覚的に分離しにくいため、その効果は小さくなりました。比較的小さなコーパスサイズのため、分類性能は1,600件のレコードだけで生産マルチモーダルモデルを訓練できるという証明ではなく、プロトコルの証拠として解釈すべきです。今後の検証では、EfficientNet-B3を文書変換器...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

著者たちは何も明かすことはありません。

謝辞

著者たちは、テキスト注釈と品質管理において貴重な支援をいただいた経験豊富なアーカイブスタッフ2名と専門のデジタル人文学研究者に心から感謝申し上げます。この研究は、江蘇省省公文書館科学技術プロジェクト計画(助成金番号2024-9)によるインテリジェント音声口頭アーカイブシステム構築および江蘇省伝統中医科学技術開発計画(助成金番号)から財政的支援を受けました。MS2025025)アーカイブの観点からTCM学校の継承と発展を研究するためのもの。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
PythonPython Software Foundationv3.11.8; https://www.python.org/ワークフロースクリプティング、データ処理、光学文字認識の事後修正、統計サポート
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/統計分析と最終図の生成
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseractベースライン光学文字認識生成
Tesseract language packsTesseract OCR Project研究固有の言語パック; https://github.com/tesseract-ocr/tessdata主要および混合言語光学文字認識デコード
OpenCVOpenCV Teamv4.9.0; https://opencv.org/デスケーリング、ノイズ推定、画像前処理
PillowPython Imaging Library contributorsv10.3.0; https://python-pillow.org/画像入出力と形式正規化
NumPyNumPy developersv1.26.4; https://numpy.org/画像とメトリック処理のための配列計算
pandaspandas development teamv2.2.2; https://pandas.pydata.org/表形式データ処理とサマリーエクスポート
SciPySciPy developersv1.13.1; https://scipy.org/統計検定と数値ユーティリティ
statsmodelsstatsmodels developersv0.14.2; https://www.statsmodels.org/統計モデリングとペア比較サポート
scikit-learnscikit-learn developersv1.4.2; https://scikit-learn.org/分類指標、ROC/PR診断、検証ユーティリティ
rapidfuzzMax Bachmann and contributorsv3.9.0; https://github.com/rapidfuzz/RapidFuzz光学文字認識修正のための編集距離候補ランキング
spaCyExplosion AIv3.7.4; https://spacy.io/カスタム語彙表を用いた命名エンティティ処理
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/視覚的ドキュメント分類器トレーニング
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/EfficientNet-B3実装と画像変換
EfficientNet-B3 backbonetorchvision / ImageNet pretrained weightsEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.html視覚的ドキュメント分類のバックボーン
sentence-transformersUKP Lab / Hugging Face ecosystemv2.7.0; https://www.sbert.net/制御語彙候補の意味拡張
検索エンジンソフトウェアElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchBM25インデックス作成、検索、ランキング
コンテナエンジンDocker Inc.Docker v26.1.1; https://www.docker.com/コンテナ化された検索環境
LinuxオペレーティングシステムCanonicalUbuntu 22.04 LTS; https://ubuntu.com/検索実行の固定環境
バージョン管理システムGitプロジェクトGit v2.44.0; https://git-scm.com/設定、語彙、スクリプト、図コードのバージョン管理
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/Rベースの図描画
MatplotlibMatplotlib開発者v3.8.4; https://matplotlib.org/補助的な可視化と品質保証プロット
アノテーションガイドライン著者5つのアノテーションセクション; 8つのドキュメントクラスラベル; OCR領域; エンティティラベル; 関連性判断; 裁定ルールドキュメントクラス、OCR領域、エンティティ、関連性判断、裁定の定義
アーカイブ固有のOCR語彙著者6つの語彙カテゴリ:人物バリアント、場所名、機関名、日付パターン、管理用語、省略形名前、場所、機関、管理用語、スペリングバリアント
制御語彙マッピング著者/アーカイブリポジトリOCRエンティティ、視覚的クラス、タイトルキーワード、日付範囲、クエリトピック、メタデータフィールドをリンクする5つのマッピングルール件名見出しの一致と意味拡張
ベンチマーククエリセット著者420のベンチマーククエリ; 6つのクエリトピック; 3つの難易度レベル; 8つのターゲットドキュメントクラス; 4つの歴史的期間; 6つの言語コンテキスト5つのシステムアームにわたる一致検索ベンチマーク
関連性判断著者/アノテーター2,100のクエリシステム行; 420のクエリ×5システムアーム; 関連性の合計、トップ10内関連性カウント、採点関連性、成功フラグP@10、R@10、nDCG@10、成功検索率の基準真値代理
トレーニング診断著者20エポック; トレーニング損失; 検証損失; トレーニング精度; 検証精度; マクロF1; 加重F1; ROC-AUC; PR-AUCエポックレベルのモデル診断サマリー
計算ハードウェア著者8CPUコア; 32GB RAM; NVIDIA GPUクラスのトレーニング環境JoVE提出のための再現性リソース詳細
データセットファイル著者data.xlsx; 1,600レコード; 17変数; 原稿のデータ利用可能性に記載されたDOI光学文字認識、メタデータの完全性、発見可能性、視覚的分類分析のためのレコードレベルのソースデータ

参考文献

  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

タグ

234 234 AI OCR