本記事では、人間の読書実験における高精度なアイトラッキングデータ収集のための段階的なプロトコルを提示します。高精度かつ高正確度のデータと再現性のある結果を得るために、ハードウェアとディスプレイの選択、ラボのセットアップ、被験者の管理、キャリブレーションとバリデーション、オンラインでの品質管理、および前処理(イベント検出とドリフト補正)について解説します。
本記事では、人間の読書実験における高精度なアイトラッキングデータ収集のための段階的なプロトコルを提示します。高精度かつ高正確度のデータと再現性のある結果を得るために、ハードウェアとディスプレイの選択、ラボのセットアップ、被験者の管理、キャリブレーションとバリデーション、オンラインでの品質管理、および前処理(イベント検出とドリフト補正)について解説します。
アイトラッキングは、読解中の注意と言語処理を研究するための中心的な手法的なアプローチです。結果の妥当性と再現性は、データの質、明確な方法論、および一貫した前処理に依存します。本記事では、読解研究において高品質なアイトラッキングデータを収集するための、包括的で段階的なプロトコルを提示します。本プロトコルは、まず研究室の環境整備と装置のセットアップから始まり、次にアイトラッキングのハードウェアとソフトウェアの選定および設定、そして刺激の作成と実験設計へと進みます。被験者の管理、インフォームド・コンセント、ならびに言語的および心理計測学的特性の記録が行われます。その後、キャリブレーションとバリデーションの手順が実施され、データ収集中は被験者の快適性とデータの質がオンラインで綿密に監視されます。前処理のパイプラインには、標準形式での生データの書き出し、データのクリーニング、固定(fixation)およびサッカード(saccade)の検出(速度ベースおよび分散ベースのアルゴリズムを採用し、明確に定義されたパラメータを使用)が含まれ、信号消失の視覚的確認とノイズ制御、複数行テキストに対する垂直ドリフト補正、および標準的な読解指標(固定時間、サッカード指標、単語スキップ、回帰率)の抽出が行われます。プロトコル全体を通じて、研究目的とハードウェア仕様の整合性、定期的なチェックによるドリフトの管理、およびすべての重要なパラメータと決定事項の詳細な報告が特に強調されています。データ収集が成功すると、通常、設定範囲内で安定したバリデーション精度が得られ、データ損失率が低くなり、単語の長さ、頻度、予測可能性に関連する既知の効果を再現する固定時間およびサッカード挙動の解釈可能な分布が得られます。本プロトコルは、デスクトップ型アイトラッカー、一般的なソフトウェア環境、および頭部固定式・頭部自由式の両方の配置に対応しており、照明条件、眼鏡による反射、被験者の姿勢の変化などの実務的な課題に対処しています。本研究は、方法論的なガイダンスを統合したワークフローとして、明確で実用的なプロトコルを提示するものです。これにより、読解研究における信頼性の高いアイトラッキングデータの収集を支援し、再現性とメタ分析を促進し、研究室やグループ間の整合性を向上させ、最終的に読解研究の科学的な信頼性を高めることを目的としています。
アイトラッキングは、読書中の注意と言語処理を研究するための中心的な手法です。なぜなら、注視とサッカードは、刺激に対する視覚的および認知的リソースの瞬間ごとの配分を示すためです。古典的および現代的なレビューでは、眼球運動と、知覚スパン、プレビュー効果、眼球運動制御モデルなどの理論的構成概念との間の強固な関連性が記録されています1,2。これらの関連性を調べる信頼性の高い研究を行うには、装置の選択、実験デザイン、キャリブレーションとバリデーション、および前処理における方法論的な厳密さが不可欠です。そうでなければ、データ品質の低下が推定値にバイアスを与え、再現性を損なうことになります3。
過去10年間で、いくつかの入門書やベストプラクティスに関する論文によって、この分野の手法的な知見が集約されてきました。最近の基礎シリーズでは、理論と測定指標を関連付け、操作化とアルゴリズムの変動性について論じ、特定の研究課題に応じたアイトラッカーの選択に関するガイダンスを提供しています4,5,6,7,8。また、補完的なガイドラインでは、ハードウェアの選定、正確性と精度の確保、測定指標の定義、および報告に関するベストプラクティスが提示されており、妥当性への脅威を軽減するための推奨事項がまとめられています9。読書研究の導入リソースにおいても、実験デザイン、一般的な測定指標、および解析パイプラインについて、分かりやすい概要が提供されています10,1。応用言語学および読書研究における領域固有のレビューでは、測定指標とトラッカーの選定についてまとめられており、タスク依存的な制約が強調されています12,13,14,15,16,17。
本記事では、読書研究における高精度なアイトラッキングデータ収集のためのガイダンスを、段階的なプロトコルへと落とし込んで解説します。広範で理論的なベストプラクティスのガイドラインを提示するものや、特定の解析手法のみに焦点を当てた既存のリソースとは異なり、本プロトコルではこれらの概念をエンドツーエンドで実行可能なワークフローとして具体化しています。その目的は、具体的かつ連続的な手順を提供することで、日常的な研究室での実践を容易にすることにあります。適用範囲に関して、本プロトコルは、頭部固定装置(顎または額のレスト)を備えた高周波デスクトップ型アイトラッカー(例:50-20 Hz)を使用する、高度に制御された研究室での読書実験に特化して最適化されています。したがって、単語レベルの正確な固視や詳細なサッカード指標の分析など、厳格なデータ品質の制約、高い空間精度、および精密さが求められる研究に最適です。
読書研究においても、ヘッドフリーまたは自然な設定の使用が普及しつつありますが、本記事では範囲を研究室での研究に限定します。ここでは、ハードウェアとソフトウェアの選定、研究室のセットアップ、刺激の作成、被験者の管理、キャリブレーションと検証、オンラインでの品質管理、および前処理(イベント検出とドリフト補正を含む)について解説します。本プロトコルに従うことで、研究者は現在の標準に準拠したデータ品質を記録し達成することができ、それによって読書関連の知見における透明性、信頼性、および再現性を向上させることができます。
COST CA2131のデータ収集に関する倫理承認は、ポーランドのヤギェロ大学哲学部の研究倫理委員会より、プロトコル番号21.042.18_2024として得られた。また、すべての参加者からインフォームドコンセントを得た。
1. 実験環境の準備および装置のセットアップ
2. 実験の設計とパイロット試験
3. 被験者の募集とインフォームドコンセント
4. 校正およびバリデーションの実施
5. データ収集
6. データの前処理と品質チェック
データの品質とバリデーション
成功したセッションでは通常、ターゲット全体で平均誤差 ≤0.5–1.0°、および最大/点あたりの誤差 <1.0–1.5° のバリデーション精度が得られます。平均値と点あたりの値の両方を報告してください。点あたりの誤差のヒストグラムと、セッションごとの平均 ± SD および最大誤差をまとめた表を提示してください。これらの基準は一般的な慣行およびベンダーの推奨事項に準拠しています。これらの閾値を超えるセッションは、研究ルールに従って部分的または完全に除外する必要があります。図 2 は、3回のキャリブレーション試行を含む9点キャリブレーションのキャリブレーション精度に関する点あたりの誤差ヒストグラムの例を示しています。
精度とデータ損失
精密度(例:注視中のサンプル間分散のRMS:二乗平均平方根)およびデータ損失(試行/セッションごとの欠損サンプルの割合%)を報告してください。良好な試行では、通常、注視時の分散が小さく、データ損失が少なくなります(例: <(アイトラッキング装置およびセットアップにより異なりますが、5~10%程度です)。データ損失率の分布、および外れ値を明らかにするための試行ごとの精度対損失の散布図を提示してください。定義および最小報告項目について、最新の文献を確認してください。3,4,5,6,7,8,9,10,11.
ドリフト挙動(補正前/後)
良好な試行ランでは、垂直方向のオフセットが小さくほぼ一定であり、自動ドリフト補正アルゴリズム21または手動による行ごとの補正によって大幅に低減されます。対して、問題のあるランでは、非単調なドリフトや大きな残留ドリフトが見られます。補正前後の垂直方向の平均絶対誤差を記載してください。自動ドリフト補正法の適用可能性を確認してください。
一般的な読字指標の分布
初回注視時間(FFD)、単回注視時間(SFD)、初回通過時間(FP)、合計/注視時間(GD)、go-past time、スキッピング確率、および回帰確率の要約分布を提示してください。アルファベット文字を読み書きできる熟練した成人の場合、注視時間は通常 ~200–250 ms 前後に集中し(大幅な歪みを伴う)、サッカードの平均スパンは ~7–9 文字となります。これらの範囲から大きく外れた値や、高度に二峰性を示すサッカード分布が見られた場合は、それがタイミングの誤差ではなく、タスクの制約や処理の困難さによる想定内の前進サッカードおよび回帰サッカードを示しているかどうかを確認する必要があります。指標の選択および範囲は、対象集団、特定の言語、および正書法によって適宜異なる場合があります。図 3に、代表的なセッションから得られた注視時間分布プロトコルのサンプルを示します。
サニティチェック
一般的に、単語の長さが増すと(長い単語になると)、スキップ率が低下し、それらの単語への注視時間が長くなります。一方で、機能語(冠詞や前置詞など)は通常スキップされます。また、高頻度語や、言語的文脈(テキスト内または文内)に基づいて予測可能性が高い単語は、通常、初回固視時間と注視時間が短くなり、スキップ率が高くなります(低頻度語および予測可能性が低い単語では、その逆が予想されます)。データがこれらのパターンのいくつかを、少なくとも一方の方向において再現しているかを確認してください。大幅な逆転傾向が見られる場合は、ドリフト誤差、単語と固視位置の不整合、またはデータ処理エラーの可能性があります。

図 1. アイトラッキング実験のセットアップ設計およびデータ解析パイプラインに含まれる手順の図解。こちらのリンクをクリックして、この図の拡大版を表示してください。

図 2. 3回の校正試行を含む9点校正における、校正精度の各点誤差ヒストグラム。こちらをクリックして、この図の拡大版を表示してください。

図 3. 代表的なセッションにおける注視時間の分布プロトコル。1名の被験者が小説『星の王子さま』の抜粋を読んでいる。円の位置と大きさは、それぞれ注視位置と注視時間を表している。円の横の数字は注視時間を ms で示している。ここをクリックして、この図の拡大版を表示してください。
本プロトコルでは、読解研究において信頼性の高いアイトラッキングデータを取得するために必要な主要な手順をまとめています。これらの手順の多くは熟練した研究者には周知のことかもしれませんが、個別の手法論文やベンダーのドキュメント、研究室内の慣習などに分散していることが少なくありません。ラボの準備から前処理までの単一のワークフローとして整理することで、読解のアイトラッキング研究を初めて行う研究者にとって実用的なガイドを提供することを目的としています。一般的なアイトラッキングのガイドラインや、主に眼球運動検出アルゴリズムに焦点を当てたリソースとは異なり、本プロトコルは、高い空間分解能とサンプリング周波数を伴うデータ記録が求められる読解研究に応えるためのエンドツーエンドのフレームワークを提供します。
ワークフローの全段階における中心的なテーマは、環境制御と装置のセットアップから始まる、積極的なデータ品質管理の重要性です。モニター上の反射、椅子の不安定さ、あるいは視距離の不一致といった些細な問題が、注視位置や精度に系統的なバイアスを生じさせる可能性があります。これらの要因に早期に対処することで、事後的な大幅な補正の必要性を最小限に抑え、より一貫した検証精度(平均誤差 ≤ 0.5–1°)を維持することが可能になります。
本プロトコルでは、研究目的とハードウェア特性との整合性の重要性についても強調しています。読書に関する多くの研究は、注視点、サッケードの着地位置、および回帰の精密な空間的・時間的測定に依存しています1,2。したがって、特に着地位置やパラフォービア・プレビューのように小さな空間的誤差に敏感な指標を測定する場合、適切なサンプリングレート、精度、および正確性を備えたアイトラッカーを選択することが不可欠です。具体的な研究上の制約に応じて、これらの手法を変更することが可能です。例えば、顎台(チンレスト)に耐えられない神経多様性を持つ集団を対象とする場合、研究者はリモート型のヘッドフリー・トラッカーへの切り替えを検討し、フォントサイズの拡大、行間の拡大、および関心領域(Interest Areas)の拡大を行うことで、空間的精度の低下を補うことができます。ヘッドフリー・システムを使用する場合、研究者は動きの増加と潜在的なデータ損失を考慮しなければなりません。リモート・トラッカーはより自然な設定を可能にしますが、現在のところ、ほとんどの読書タスクにおいては依然として頭部の固定が好ましいとされています。
実験デザインは、データの品質と解釈可能性の両方に影響を与えるもう一つの重要な要因です。標準化された画面上の指示、試行のランダム化、および適切なブロック構造によって、セッションを通じて参加者の行動を安定させることができます。読書実験においては、わずかな緩やかなオフセットであってもテキストの行をまたいで蓄積される可能性があるため、定期的なドリフトチェックを組み込むことが特に重要です。また、本プロトコルは、言語依存的な語彙ノルムの使用および独立変数と従属変数の透明性のある報告を支持しており、これにより研究間での再現や比較が容易になります。
データ収集中は、精度、姿勢、および参加者の快適性を継続的にモニタリングすることで、大規模なデータ損失を防ぐことができます。よくある問題に対しては、積極的なトラブルシューティングが必要になることが多々あります。例えば、画面の隅でキャリブレーションが失敗する場合、モニターや椅子の高さを調整することで周辺部のトラッキング損失を解決できることがあります。反射性の眼鏡やコンタクトレンズによる問題は、周囲の照明を調整したりモニターの角度を変えたりすることで解決できる場合があります。詳細なセッションログを維持することは、後日のトラブルシューティングを容易にし、中断、再キャリブレーション、および予期せぬ事象を記録することで透明性を高めることにつながります。多くの既報の研究において、精度やデータ損失率などの品質指標の明示的な報告が求められるようになっているため、この点はます重要になっています。
前処理のセクションでは、イベント検出、ドリフト補正、およびクリーニングルーチンにおける一貫性があり、十分に文書化された選択を重視しています。注視点の分類アルゴリズムや閾値は、結果として得られる指標に強い影響を与える可能性があるため、研究者はすべてのパラメータ設定を明記し、一般的なデフォルト設定と異なる場合はその根拠を提示する必要があります。自動化ツールを適用する場合であっても、視覚的な確認は依然として重要なステップです。また、本プロトコルでは、研究間の信頼性の高い比較を可能にするため、検証精度、適合率、データ損失、およびドリフト挙動などの標準的な品質指標を報告することを推奨しています。
さらに、本プロトコルでは、単語の長さ、頻度、または予測可能性の影響など、読解行動に関する簡便なサニティチェックを行うことを推奨しています。これらの標準的なパターンを再現することで、気づかないうちに生じたアライメントの問題や問題のあるドリフト、あるいは前処理のエラーに対する追加的な保護策となります。これらのチェックは完全な統計分析に代わるものではありませんが、データが熟達した読解において期待通りに挙動しているかについて、迅速なフィードバックを提供します。
既に述べた実験プロトコルの詳細に加えて、参加者の言語的および心理測定学的特性を記述することが重要です。その主な理由は、実験研究者が直面する異なる研究間での比較可能性という課題にあります。これはオープンサイエンスの時代において特に重要であり、公開されたデータセットを、元々データを収集していない研究者が利用する場合、参加者の(社会)言語学的背景の相違から生じる潜在的な特異性に気づかない可能性があるためです。
言語的背景に関しては、参加者の母国語を記録し、結果に影響を与える可能性のある方言の違いを考慮するため、使用している方言に関する情報を収集する必要があります。現代社会において一般的であるように、参加者が複数の言語を話す場合は、第二言語の習熟度を記録すべきです。バイリンガリズムや第二言語処理の研究では、妥当性が確認された第二言語判定テストを用いて、第二言語の習熟度を評価する必要があります。さらに、社会経済的状況に関する関連事項(例:参加者の読書習慣など)を記録する場合もあります。
参加者のワーキングメモリ容量や認知柔軟性(特にバイリンガル研究において)などのサイコメトリック特性を評価するためのテストを実施する必要があります。方法論的な観点からは、どのテストを選択するか、それらに要する認知負荷と時間、および実験プロトコル内のどのタイミングでこれらの測定を行うか(アイトラッキングセッションの前か後か、あるいは別のセッションか)を検討する必要があります。
読書研究において、言語行動は刺激の言語的特性と読者のサイコメトリックな特性(または参加者の言語行動に関連するその他の特徴)の両方を用いて測定および説明されることを念頭に置くことが不可欠です11,12,17,20。研究間での比較を可能にするためには、データ解釈に関連し得るすべての要因を含める必要があります。どの特性を含めるかの選択は、研究の目的に依存します。データは比較可能でなければなりません。要約すると、潜在的な利用者が最大限の柔軟性を持ってデータを利用できるよう、十分な詳細さをもってデータを収集し、記述すべきです。これらの検討事項はプロトコル自体に含まれていないかもしれませんが、個々のあらゆる研究に関連します。今日のグローバルな科学環境において、このような詳細は収集されたデータの将来的な活用可能性を高めることになります。
本プロトコルには限界があり、特にデータ品質と生態学的妥当性のトレードオフが顕著です。頭部を固定して静止したモニターで読書を行うことは、自然な読書行動を完全には捉えておらず、また厳格な視覚的組み入れ基準はサンプルの代表性を制限する可能性があります。さらに、アイトラッカーは座標のスケーリング、タイムスタンプの精度、およびイベント分類において大幅に異なります。現在のプロトコルの限界は、このような変動性が研究室間やハードウェアブランド間の再現性にどのように影響するかを明確にしていない点にあります。デバイス間バリデーションのためのガイドラインを作成することや、研究室のパラダイムを没入型のバーチャルリアリティ(VR)や拡張現実(AR)の読書環境に適応させること、また認知障害や注意障害のデジタルバイオマーカーを開発することなど、現実的な将来の応用に向けた指針を策定することは、重要な空白を埋めることになるでしょう。
全体として、本プロトコルは既存の手法的なガイダンスを、読解における高品質なアイトラッキングデータを収集するための明確かつ透明性の高いワークフローへと統合したものです。これらの手順に従い、関連する品質指標を報告することで、研究者は読解研究の再現性と信頼性を向上させ、分野全体における手法的な一貫性をより強固に確立することに寄与できます。
資金提供:本プロジェクトは、COST–European Cooperation in Science and Technology (CA2131–Enabling multilingual eye-tracking data collection for human and machine language processing research (MultiplEYE), https://www.cost.eu/actions/CA21131)24、ポルトガル科学技術財団(助成金:UID/214/2025, UI/BD/15450/202)、およびヤギェロ大学戦略的プログラム・エクセレンス・イニシアチブ優先研究領域 DigiWorld (ID.UJ) プロジェクト「Cognitive Aspects of Interaction and Communication in Natural and Artificial Agents」の支援を受けています。また、技術的なサポートを提供してくださった Anna Maria Wilkosz 氏に感謝いたします。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| アルコール綿 (70% isopropyl) | 洗浄材 | 地域の研究用品供应商 | |
| 高さ調節可能なチンレスト | 頭部固定装置 | 各種研究用品供应商 | |
| 同意書およびデブリーフィング資料 | 文書 | 機関承認済みテンプレート | |
| アイトラッカー (例: SR Research EyeLink 100 Plus, Tobii Pro Fusion) | 視線計測ハードウェア | SR Research Ltd., Tobii AB | |
| 視線計測データ解析ソフトウェア (Data Viewer, Tobii Pro Lab) | 眼球運動データ解析ソフトウェア | SR Research Ltd., Tobii AB | |
| 視線計測ソフトウェア (例: Experiment Builder, Tobii Pro Lab, PsychoPy) およびそのSDK | 刺激提示ソフトウェアおよびソフトウェア開発キット | SR Research Ltd., Tobii AB, Open source | |
| 汎用データ解析ソフトウェア (lme4, ggplot2 を含む R, JASP, Pandas, NumPy, Matplotlib を含む Python) | データの前処理および解析 | Open source, https://www.python.org, https://www.r-project.org, https://www.jasp.org | |
| 汎用実験設計ソフトウェア (PsychoPy) | 刺激提示ソフトウェア | Open source, https://www.psychopy.org | |
| その他のサードパーティ製ソフトウェア (例: E-Prime) | 刺激提示ソフトウェア | Psychology Software Tools, Inc. | |
| 防音室 | 環境制御 | 機関施設 | |
| 標準的な 24 インチ LCD モニター (またはそれ以下) | 表示装置 | ISO準拠の任意のメーカー |