この計算科学的研究では、公開されている呼吸器ウイルス転写トムをベンチマークするためのコンパートメント意識型ワークフローを提示し、鼻腔および血液における宿主応答は遺伝子レベルでの一致性は限定的であるものの、独立したデータセット、臨床比較、縦断的な回復、および堅牢性解析を通じて、再現可能で生物学的に解釈可能なコンパートメント特異的なモジュールが得られることを実証しています。
研究記事
この計算科学的研究では、公開されている呼吸器ウイルス転写トムをベンチマークするためのコンパートメント意識型ワークフローを提示し、鼻腔および血液における宿主応答は遺伝子レベルでの一致性は限定的であるものの、独立したデータセット、臨床比較、縦断的な回復、および堅牢性解析を通じて、再現可能で生物学的に解釈可能なコンパートメント特異的なモジュールが得られることを実証しています。
公開されている呼吸器ウイルスのトランスクリプトームは宿主応答の研究において有用ですが、組織ソース、コントロールの定義、および研究デザインの違いがプール解析において交絡要因となる可能性があります。私たちは、鼻腔および血液の生物学的コンテキストを維持しつつ、再現性のある宿主応答活性を特定できるかどうかを判断するための、コンパートメントを考慮した計算ワークフローを開発しました。ペアリングされたGSE117827小児コホートをアンカーデータセットとして使用し、これには有症状のピコルナウイルス感染、有症状の呼吸器合胞体ウイルス感染、無症状のピコルナウイルス検出、およびウイルス陰性コントロールからの鼻腔スワブおよび全血トランスクリプトームが含まれています。HUGO遺伝子命名委員会(HGNC)によるフィルタリング後、27,685個の遺伝子が解析されました。上位の正の応答から、それぞれ50遺伝子からなるタンパク質符号化鼻腔モジュールと血液モジュールを定義し、外部評価の前に固定しました。遺伝子レベルでの鼻腔と血液の効果はほぼ独立しており(ピアソン相関係数 r = 0.015)、モジュール間で共有されていた探索的なランク重複遺伝子は6つでした(ジャカード係数 = 0.064)。それにもかかわらず、鼻腔モジュールは独立した上気道コホートにおいて感染群をコントロール群から分離し、受信者動作特性曲線下面積(AUROC)は0.749、0.693、0.609でした。一方、血液モジュールは外部血液コホートにおいて0.832、0.924、0.870のAUROCを達成しました。縦断的な自然感染データでは、一致したスコアが急性疾患から退院にかけて低下し、ペアリングされたデルタ値は鼻腔サンプルで0.436、血液で0.330でした。666個の外部サンプルを含むさらに3つのベンチマークデータセットに加え、ランダム遺伝子によるヌル解析、モジュールサイズのスイープ、ブートストラップ安定性、マーカープログラムの相関、および分散分解により、本ワークフローの堅牢性と限界を定義しました。Pandyaの33個のメッセンジャーリボ核酸(mRNA)セットは、ウイルス対細菌の識別においてより強力なままであり、また血液モジュールは細菌性肺炎においても上昇しました。これらの結果は、コンパートメント特異的なモジュールが、汎用的な全組織バイオマーカーや単独の病原体分類器としてではなく、コホート間比較や回復追跡のための再利用可能な宿主応答活性スコアとして有用であることを支持しています。
宿主のトランスクリプトーム署名は、感染症候群の分類や、病原体間における免疫応答の比較に広く利用されています1,2,3,4,5。呼吸器ウイルスは、重複するインターフェロン刺激遺伝子(ISGs)、炎症性メディエーター、および抗原提示経路を活性化することが一般的です6,7,8,9,10。近年のペアド研究および縦断的研究では、局所的な気道応答と全身的な応答において、タイミング、細胞組成、および規模が異なることが示されています11。この課題は、インフルエンザ、呼吸器合胞体ウイルス(RSV)、ライノウイルス、およびSARS-CoV-2にとどまりません。ヒトメタニューモウイルスは依然として呼吸器疾患の重要な原因となっていますが、その宿主応答および介入に関する文献はまだ発展段階にあります12,13。呼吸器ウイルス感染症全般におけるこれらの観察結果は、局所的な気道応答と全身的な宿主応答の差をさらに浮き彫りにしています14。したがって、宿主とウイルスの計算科学的研究における実務的な問題は、単に応答が存在するかどうかだけではありません。組織的なコンテキストを保持し、再現可能な宿主応答スコアを得ることができる透明なワークフローを通じて、公開データを再利用できるかどうかが重要です。
ほとんどの公開されている呼吸器ウイルス転写産物データセットは、ウイルス間または組織間でのクリーンな推論を目的として設計されていません。組織のソース、タイミング、重症度、年齢、対照群の定義、およびプラットフォームが、しばしば相互に変動しています。また、ハイスループットの発現データセットは、不要な技術的変動や研究レベルの変動の影響を受けやすい傾向があります15,16。そのため、プール解析を行うと、強力なインターフェロンまたは炎症シグネチャーを回収できる一方で、その起源が不明確になる可能性があります。鼻腔サンプルは上皮および粘膜免疫生物学を捉えるのに対し、全血は全身性の白血球反応を反映します。これらのコンパートメントを互換性があるものとして扱うと、スコアの算出は容易になりますが、その解釈は困難になります。
我々は、利用可能な最大の発見コホート17ではなく、同一研究内の鼻腔-血液ペアコホートであるGSE117827に基づいて解析を構築した。このコホートは規模こそ小さいが、鼻腔と血液の効果量を比較する際の研究間における交絡を低減できる。これには、有症状のピコルナウイルス感染、有症状のRSV感染、無症状のピコルナウイルス検出、およびウイルス陰性のコントロールが含まれている。そのため、我々はこれを個別のコンパートメント特異的モジュールのアンカーとしてのみ使用した。モジュールのメンバーシップは、外部検証の前に固定した。この小規模コホートによる選択の安定性は、層化ブートストラップ再サンプリング、ランダム遺伝子ヌル、およびモジュールサイズの感度分析によって検証した。
細菌性および非感染性の比較対照群を用いたベンチマーキング層を追加しました。GSE63990には、ウイルス性、細菌性、または非感染性とラベル付けされた全血急性呼吸器疾患サンプルが含まれています18。GSE40012には、重症市中肺炎、全身性炎症反応症候群(SIRS)、および健康なコントロールが含まれています19。これらのコホートにより、モジュールが一般的な宿主応答活性を反映しているのか、あるいは病原体クラス特異性を反映しているのかを検証します。GSE53543は、ex vivoの末梢血単核細胞(PBMC)ライノウイルス摂動ベンチマークとして個別に解析されました。これは制御された刺激下での白血球の応答性を測定したものですが、自然感染と同等ではありません。
我々の前提は、あえて保守的なものとしています。不均一な公開データから普遍的な抗ウイルスシグネチャーを証明しようとするのではなく、コンパートメントを考慮したワークフローによって、外部検証後も有用なモジュールスコアを算出できるかという点に焦点を当てています。想定される用途は、Pandya 33-mRNAのような診断用クラスファイアを補完することです。これらのモジュールは、コホート、回復過程、および症状の勾配にわたる鼻腔および血液中の宿主応答活性をスコア化するものであり、病原体のクラスを割り当てるための設計ではありません。
本研究では、匿名化され一般に公開されているデータを再解析しており、新たな被験者の募集、介入、または検体収集は行っていません。したがって、今回の二次解析において機関の倫理承認および新たなインフォームドコンセントは不要でした。元の研究に関する倫理承認およびインフォームドコンセントについては、それぞれのデータ作成者が報告しています。
研究デザインおよびワークフローの論理
我々は、Gene Expression Omnibus20,21に登録されたデータセットを用いた、遡及的な公開データバイオインフォマティクス研究を実施した。新しい患者サンプル、細胞培養実験、動物モデル、またはウェットラボでの検証は行われていない。ワークフローにはアンカー優先設計を用いた。GSE117827を効果量の推定、モジュールの構築、コンパートメント間の整合性、および症状勾配分析に使用した。独立したデータセットは、モジュールへの所属が確定した後にのみ導入された。ワークフローは、ペアコンパートメントアンカーリング、HGNCマッピングおよびタンパク質コーディングフィルタリング、鼻腔および血液の個別のモジュール構築、組織一致および縦断的検証、臨床ベンチマーク、および堅牢性分析で構成された。確認分析には、固定された組織一致および縦断的テストが含まれた。重複遺伝子、症状勾配、マーカープログラム、および分散分析は、探索的または記述的なものである。
アンカーコホートおよび主要対照
GSE117827には、26名の小児から採取した鼻腔スワブおよび全血の発現プロファイルが含まれている:有症状のピコルナウイルス感染例が9名、無症状のピコルナウイルス検出例が5名、有症状のRSV感染例が6名、および無症状のウイルス陰性対照群が6名である17。RSV感染例のうち2例は血液検体が欠損していた。したがって、完全なアンカー設計には50サンプルが含まれ、モジュール構築から無症状のピコルナウイルス検出例を除外した後、主要な「感染群対対照群」の対比には40サンプルが含まれた。主要対比において、有症状のピコルナウイルスおよび有症状のRSVサンプルを「感染群」と定義し、無症状のウイルス陰性サンプルを「対照群」と定義した。症状のないウイルス検出は、生物学的にウイルス陰性の健康状態とは異なるため、無症状のピコルナウイルス検出例は対照群として扱わなかった。これらのサンプルはモジュール構築からは除外され、後に症状勾配解析に使用された。
プローブのマッピングおよび前処理
GSE117827はGPL23126を用いてプロファイリングされた。転写産物クラスター識別子は、GEOプラットフォームGPL24539を通じて配布されているClariom D Human na36, hg38アノテーションファイルを使用して遺伝子シンボルにマッピングされた。HGNC承認済みのシンボルのみを保持した22。コントロールプローブ、ERCCプローブ、マッピングされなかった転写産物クラスター、および非承認シンボルは除外した。同一の承認済みシンボルにマッピングされる複数の転写産物クラスターは、発現の中央値を用いて統合した。フィルタリングおよび統合後、アンカー解析に使用可能な遺伝子は27,685個であった。発現マトリックスの95パーセンタイルが50を超え、対数変換されていない強度スケールであることが示された場合にのみ、log₂(x + 1)変換を適用した。欠損値が20%を超える遺伝子は除外され、残りの欠損値は遺伝子内の中央値で補完した。その後、各遺伝子を当該データセットの全サンプルにわたって、z = (x − 平均)/サンプルの標準偏差 (ddof = 1) として標準化した。分散がゼロの遺伝子には、標準化値として0を割り当てた。モジュールの構築は、HGNC完全セットにおいてタンパク質コード遺伝子として分類されたエントリに限定した。
効果量解析とモジュールの構築
鼻腔および血液のコンパートメントを個別に解析した。有症状のウイルス陽性サンプルを、Hedgesを用いてウイルス陰性コントロールと比較した。 g 標準化平均差および両側ウェルチ検定23ヘッジズ g は、感染群と対照群の平均値の差をプールした標準偏差で除し、小サンプル補正係数 1 − 3/(4df − 1)、ここで df = n感染した + n対照 − 2. 等分散性を仮定しないWelchの検定を実施した。各コンパートメント内で検定したすべての遺伝子について、Benjamini–Hochberg法を用いて偽発見率を算出した。24あらかじめ規定されたFDR(偽発見率)の厳格な組み合わせを満たすタンパク質コード遺伝子が認められなかったため、 < 0.05およびHedges g > 小規模アンカーコホートにおいて、正の効果を持つ遺伝子を、両側Welchのt検定による昇順で第1位にランク付けした。 P 値、次いでHedges gの降順で g、最終的な決定的なタイブレークには遺伝子シンボルを用いた。上位50個の遺伝子で各プライマリモジュールを構成した。50個という遺伝子数は、プラットフォーム間での遺伝子の欠損による損失を抑えつつ、生物学的な幅を維持できる適度なモジュールサイズとして、事前的に選択された。このモジュールサイズは、外部AUROCに合わせて調整されたものではない。10、25、50、100、および200個の遺伝子を用いた感度分析の結果、アンカー分離に関して定性的に同様の結果が得られた。目的は単一遺伝子の発見ではなく、モジュールレベルでの再現性であった。
コンパートメント間の整合性
鼻腔および血液のHedges g 推定値を遺伝子ごとに揃え、Pearson相関およびSpearman相関を用いて比較した。鼻腔の上位50モジュールと血液の上位50モジュールの重複を、重複数およびJaccard指数によって要約した。重複した遺伝子は、検証済みの保存されたバイオマーカーではなく、探索的なコンパートメント間ランク重複候補として解釈した。
外部組織整合バリデーション
モジュールスコアのバリデーションには、解釈可能なソースグループを持つ独立した公開データセットを用いた。上気道でのバリデーションには、GSE41374のRSV鼻腔洗浄検体、およびSARS-CoV-2データセットであるGSE152075とGSE156063を含めた。血液でのバリデーションには、GSE171110および、個別に正規化された2つのGSE38900ユニットであるGPL10558(36検体;RSV 28例、コントロール 8例)とGPL6884(138検体;RSV 107例、コントロール 31例)を含めた。すべての外部データセットにおいて、プローブをHGNCシンボルにマッピングし、重複するシンボルは発現量の中央値によって統合した。アンカーデータセットに使用したのと同様の変換、欠損値フィルタリング、中央値補完、および遺伝子ごとのz-標準化ルールを各データセットに適用した。モジュールスコアは、該当するモジュール遺伝子の標準化発現値の非加重平均として算出した。AUROC、平均精度、およびWelch検定のFDRを、臨床的な診断性能の推定値ではなく、ポータビリティ指標として報告した。
大規模な臨床ベンチマークおよびex vivo摂動データセット
2つの全血データセットを、探索コホートではなく臨床ベンチマークとして使用した。GSE63990では、登録された感染状態のメタデータに基づき、サンプルをウイルス性呼吸器感染症(n = 117)、細菌性呼吸器感染症(n = 73)、または非感染性疾患(n = 90)に割り当て、これらの明確なラベルのいずれも持たないサンプルは除外した18。GSE40012では、登録された診断フィールドを、A型インフルエンザ肺炎(n = 39)、インフルエンザを伴わない細菌性肺炎(n = 61)、肺炎を伴わないSIRS(n = 40)、健康対照群(n = 36)、または細菌・インフルエンザ混合肺炎(n = 14)にマッピングした19。細菌・インフルエンザ混合サンプルについては記述したが、バイナリ形式のベンチマーク対比からは除外した。
GSE53543には、98名から得られた196件のex vivo PBMCプロファイルが含まれています。各個体から、培地のみのサンプル1件と、ライノウイルス16に24 h曝露させたサンプル1件が提供され、被験者識別子により98組の完全なペアであることが確認されました。AUROCは順位分離指標であるため、主要なベンチマークでは、刺激ありのサンプル98件および刺激なしのサンプル98件にわたるAUROCが報告されました。被験者のペアリング情報はメタデータに保持され、スコア差のペア感度分析に使用されました。この実験は、自然な臨床感染とは別に分析されており、臨床診断の根拠として使用されたものではありません。
GSE63990、GSE40012、およびGSE53543のRaw GEOシリーズマトリックスをダウンロードした。GSE63990にはGPL571、GSE40012にはGPL6947、GSE53543にはGPL10558を使用した。プローブをHGNC承認のシンボルにマッピングし、重複するマッピングは発現量の中央値によって統合した。登録済みの正規化マトリックスを使用した。一般的な95パーセンタイルルールに基づき、対数変換されていないスケールのマトリックスに対してのみlog₂(x + 1)変換を行った。GSE53543は、元の研究者によってすでにlog₂変換、ランク不変正規化、および処理日の調整が行われていたため、追加の対数変換は適用しなかった。欠損値が20%を超える遺伝子を除去し、残りの欠損値を中央値で補完した後、各遺伝子をデータセット内の全サンプルにわたってz標準化した。ベンチマーク層には、470検体の臨床全血サンプルと196検体のex vivo PBMCサンプルが含まれていた。
リファレンスシグネチャーのベンチマーク
アンカーとなる鼻腔および血液モジュールのベンチマークを、3つの非重み付けリファレンスセットを用いて行った。公式のPandya 33-mRNAセットは、元の分類器レポートの補足表1から転記した5。Andres-Terre比較セットは、報告されているマルチウイルスシグネチャーから精選したインターフェロン関連の33遺伝子で構成した3。Hallmark比較セットは、MSigDBのHALLMARK_INTERFERON_ALPHA_RESPONSEセットに関連するインターフェロンαコアの33遺伝子サブセットで構成した25,26。3つのリファレンスセットすべての完全な遺伝子リストを補足データ1に提供している。これらのリファレンススコアは、元の重み付け分類器を再現したものではない。各データセットについて、スコアは利用可能な遺伝子ごとのzスコアの非重み付け平均として算出した。少なくとも3つの代表遺伝子が必要であり、代表遺伝子の数を報告した。ベンチマークの対比は、必要な群が利用可能な場合に、ウイルス対細菌、ウイルス対非感染性、ウイルス対細菌または非感染性、ウイルス対健康/コントロール、および細菌対健康/コントロールとした。ベンチマーク指標としてAUROCおよび平均精度(average precision)を解釈した。Welch検定のP値は、ベンチマーク表内のすべての有効なデータセット・対比・モジュールの組み合わせにおいて、Benjamini–Hochberg法を用いて補正した。
独立した縦断的検証
ペアを成す急性期対退院時のデータセットGSE97741およびGSE97742は、縦断的検証のみに使用した27。寄託されたメタデータにおいてRSV単独感染(RSVsi)またはライノウイルス(hRV)とラベル付けされたサンプルを主要解析の対象とし、RSV共感染(RSVco)は補足出力にのみ保持した。急性期および退院時のラベルはサンプル名から抽出した。サンプルはデータセット、コンパートメント、ウイルスグループ、および被験者識別子によって照合し、両方のタイムポイントが存在する被験者のみを保持した。主要な統合グループは、RSVsi 38ペアおよびhRV 30ペア(コンパートメントあたり68ペア)で構成された。
遺伝子の選択、モジュールの精査、および閾値の調整には、GSE97741およびGSE97742は使用せず、これらのデータセットは外部検証用に確保した。プローブ識別子を承認済みのHGNCシンボルにマッピングし、重複するシンボルは発現量の中央値を用いて統合した。固定されたGSE117827のモジュールスコアを算出する前に、同一の95パーセンタイル対数変換ルール、欠損値フィルタリング、中央値補完、およびデータセット内での遺伝子ごとのz標準化手順を適用した。
各組織およびモジュールについて、急性期と退院時のスコアを、被験者およびウイルス群ごとにペアリングした。各ペアについて、急性期から退院時の値を差し引いた差分を算出した。Cohen dzは、対応のある平均差をその標本標準偏差で除して算出した。両側対応のある t 急性期と退院時のスコアの分離能に関するAUROCとともに、検定および両側ウィルコクソン符号付き順位検定の結果を報告した。有効な20組のペアすべてについて、Benjamini–Hochberg法によるFDR値を算出した。 t 完全な縦断的出力(2つのデータセット、2つのモジュールソース、および5つの事前指定されたウイルスグループサマリー)におけるテスト。
症状勾配および事後解析
モジュールメンバーシップを確定させた後、GSE117827における除外済みの無症状ピコルナウイルス検出例を症状勾配解析のみに使用した。順序臨床スコアは、ウイルス陰性コントロールを0、無症状のピコルナウイルス検出例を1、有症状の感染例を2とした。順序的な傾向を評価するためにSpearman相関を用い、3群間の全体的な差を評価するためにKruskal–Wallis検定を用いた。3つの群のペア比較には、両側Mann–Whitney U事後検定を用いた。Benjamini–Hochberg補正を、各コンパートメント内の3つのペア比較セットに対して個別に適用した。
機能濃縮分析
鼻腔および血液のモジュール遺伝子は、gseapyを介してEnrichrを用い、MSigDB Hallmark 2020、Reactome 2022、およびGO Biological Process 2023ライブラリを使用して解析された。25,26,28,29,30,31Enrichrは、フィッシャーの正確確率検定に基づく標準的な過剰表現解析フレームワークを使用した。ライブラリで報告されたベンジャミニ・ホッホバーグ法による補正後の P 値 < 0.05を有意と見なした。照会した3つのライブラリ全体で、モジュールごとに最も有意であった8つの項を、補正後のp値によって順位付けした。 P 値。濃縮結果は、解釈のみに使用した。
堅牢性、マーカープログラム、および分散解析
堅牢性解析により、結果がモジュールのサイズや偶然の選択に依存するかどうかを検証した。10、25、50、100、および200個の遺伝子からなるモジュールサイズを評価した。ランダム遺伝子によるヌル解析において、適格なユニバースは、処理済みのGSE117827マトリックスに表示されているHGNCタンパク質コード遺伝子で構成した。NumPyのランダムシード20260622を用いて、非復元抽出により50個の遺伝子セットを500回サンプリングした。ブートストラップ再選択は、各コンパートメントの元のアンカー解析において、正の効果を持つタンパク質コード遺伝子のうち、ランキング上位1,000個に制限した。各再サンプルにおいて、正のタンパク質コード遺伝子を、両側Welch P 値の昇順、次いで平均差の降順でランキングし、上位50個の遺伝子を選択した。遺伝子の安定性は、選択回数を100で除して算出した。各コンパートメントで選択頻度が最も高かった20個の遺伝子を表示した。
マーカープログラムスコアは、細胞分画の推定値としてではなく、記述的な補助として使用した。キュレーションされた6つのプログラムを評価した:上皮細胞(EPCAM, KRT8, KRT18, KRT19, MUC1, KRT5, KRT14, SCGB1A1, FOXJ1)、単球/マクロファージ(LYZ, LST1, S100A8, S100A9, FCGR3A, FCGR1A, CD14, MS4A7, CTSS)、好中球(S100A8, S100A9, MPO, ELANE, CEACAM8, FCGR3B, OLFM4, MMP8)、T/NK細胞(CD3D, CD3E, TRAC, NKG7, GNLY, PRF1, GZMB, KLRD1, IL7R)、B/プラズマ細胞(MS4A1, CD79A, CD79B, MZB1, JCHAIN, IGHG1, SDC1)、および骨髄性インターフェロン(SIGLEC1, IFI27, IFI44L, ISG15, MX1, OAS1, RSAD2, IFIT3)である。各プログラムスコアは、利用可能な遺伝子ごとのzスコアの平均として算出し、少なくとも3つの代表遺伝子が必要とした。Spearman P値は、データセット-モジュール-プログラム相関の全ファミリーにわたってBenjamini–Hochberg法を用いて補正した。一元配置エータ二乗(eta-squared)は、各モジュール-因子ペアについて、群間平方和を全平方和で除して算出した。該当する因子が欠落している行は、その計算から除外した。本解析は記述的なものであり、相互に相関する因子についての補正は行っていない。
再現性
すべての解析は Python 3.12.13 のスクリプトワークフローを用いて実施され、使用したソフトウェアパッケージとそのバージョンは材料表に記載しています。ランダム化の手順には、固定シード値 20260622 を使用しました。公開されている GEO 発現マトリックスは、生入力データ、処理済みデータ、統計出力、表、および図を分離した一貫性のあるプロジェクト構造を用いて処理しました。独立した検証を可能にするため、モジュールの定義、サンプルキュレーション記録、効果量の推定値、検証統計量、濃縮解析結果、ロバストネス解析、および図のソースデータを保持しました。解析コード、依存関係の仕様、および根拠となる派生データは、「データの可用性」の記述に従って入手可能です。
アンカーステップ・ベンチマーキングにより、組織特異的な遺伝子効果と汎組織的な遺伝子効果を分離した
キュレーション済みのGSE117827アンカーマトリックスには、HGNC承認済みの27,685個の遺伝子が含まれていた。主要な鼻腔コントラストには、有症状の感染サンプル15検体とウイルス陰性のコントロールサンプル6検体が含まれ、血液コントラストには有症状の感染サンプル13検体とコントロール6検体が含まれていた(表1)。この小規模なコホートでは安定した単一遺伝子の発見をサポートできないため、ペアコンパートメントアンカーとして使用した。安定性は、ブートストラップ再サンプリング、ランダム遺伝子ヌル検定、外部バリデーション、およびモジュールサイズの感度分析によって、モジュールレベルで評価した。
| 検体 | グループ | 条件 | 主要対照 | n |
| 血液 | RSV | 感染 | あり | 4 |
| 血液 | 無症状ピコルナウイルス | 二次的 | なし | 5 |
| 血液 | 有症状ピコルナウイルス | 感染 | あり | 9 |
| 血液 | ウイルス陰性コントロール | コントロール | あり | 6 |
| 鼻腔 | RSV | 感染 | あり | 6 |
| 鼻腔 | 無症状ピコルナウイルス | 二次的 | なし | 5 |
| 鼻腔 | 有症状ピコルナウイルス | 感染 | あり | 9 |
| 鼻腔 | ウイルス陰性コントロール | コントロール | あり | 6 |
表1:一次対比キュレーション後のGSE117827アンカー設計。一次対比キュレーション後のペアアンカーデータセットにおける、血液および鼻腔コンパートメント間のサンプル分布。有症状のRSV(呼吸器合胞体ウイルス)および有症状のピコルナウイルスサンプルを「感染」として分類し、一次対比に含めた。一方、ウイルス陰性コントロールは「コントロール」として分類し、一次対比に含めた。無症状のピコルナウイルスサンプルは「二次的」と定義し、モジュール構築からは除外した。これらは探索的な症状勾配分析にのみ使用された。RSV症例のうち2例は血液検体がなかったため、血液サンプル4件、鼻腔サンプル6件のRSVサンプルとなった。
共有された27,685個の遺伝子全体において、鼻腔および血液のHedges g 推定値はほとんど相関していませんでした(Pearson r = 0.015; 図1)。この結果は単一の研究内で得られたものであり、プールされたコホート間比較よりも研究間の差異による影響を受けにくくなっています。中央の密集したクラウドは、ほとんどの遺伝子が両方のコンパートメントで同様に変動しなかったことを示しています。ハイライトされたオーバーラップ遺伝子は、両方のランクリストの上位にある例外的なものでした。このパターンは、鼻腔および血液のモジュールを個別に構築することを支持しています。

図1ペア GSE117827 アンカーコホートにおける鼻腔および血液の遺伝子レベルの効果量。 ヘッジ(限定表現) g 数値は、27,685個の遺伝子について、有症状の感染例とウイルス陰性のコントロールを比較したものである。x軸に鼻腔の推定値(感染例15、コントロール6)、y軸に血液の推定値(感染例13、コントロール6)を示す。六角形ビンのシェーディングは、ビンごとの遺伝子数を示す。赤色の点は、鼻腔および血液の上位50個のモジュールに共通して含まれる6つの遺伝子を示す。ピアソン r = 0.015. この図の拡大版を表示するには、ここをクリックしてください。
モジュールの構築により、インターフェロンを中心とした小さなオーバーラップが生じた
上位50個の鼻腔および血液モジュールは、ISG15、ACRBP、IFIT1、RSAD2、CCRL2、XAF1の6つの遺伝子を共有していた(ジャカード指数 = 0.064; 表2; 図2)。ISG15、IFIT1、RSAD2、およびXAF1は、インターフェロンに関連した抗ウイルス生物学的機序と整合している32,33,34CCRL2は、炎症性白血球遊走の文脈で解釈するのがより適切である。35ACRBPに確立された抗ウイルス作用はない。透明性を確保するため6つの遺伝子すべてを報告しているが、組織横断的なバイオマーカーとして検証済みであると主張するものは一つもない。小規模なアンカーコホートにおけるこれらの単一遺伝子のFDR値は有意ではなかった。したがって、主要な推論はオーバーラップリストではなく、固定されたモジュールレベルの検証に基づいている。
| 遺伝子 | 鼻腔ヘッジ g | 鼻腔内薬物配送 (Nasal FDR) | 血液ヘッジ g | 血液FDR(偽発見率) | 結果の解釈 |
| ISG15 | 2.215 | 0.213 | 1.369 | 0.442 | インターフェロン刺激抗ウイルス遺伝子;探索的オーバーラップ |
| ACRBP | 1.69 | 0.205 | 1.748 | 0.429 | 確立された抗ウイルス作用はありません。透明性確保のため記載しています。 |
| IFIT1 | 1.875 | 0.213 | 1.35 | 0.442 | インターフェロン刺激性抗ウイルス遺伝子;探索的重複 |
| RSAD2 | 1.663 | 0.213 | 1.532 | 0.442 | インターフェロン刺激抗ウイルス遺伝子;探索的重複 |
| CCRL2 | 1.396 | 0.217 | 1.782 | 0.442 | 炎症性白血球遊走のコンテキスト;ウイルス特異的ではない |
| XAF1 | 1.603 | 0.226 | 1.47 | 0.442 | インターフェロン結合アポトーシス因子;探索的な重複 |
表2:上位にランクされた鼻腔および血液モジュールの完全な探索的重複。共有された6つのすべての遺伝子について、鼻腔および血液のHedges gおよび遺伝子ごとのFDR値を報告する。小規模なアンカーコホートにおいて遺伝子ごとのFDR値が有意ではなかったため、これら6つの遺伝子はすべて探索的なランク重複候補として扱われる。ACRBPは、確立された抗ウイルス的役割を欠いているが、透明性のために保持されている。これら6つの遺伝子のいずれも、検証済みの汎用バイオマーカーとして提示されているわけではなく、主要な証拠はモジュールレベルの外部検証に基づいている。

図26つの探索的な鼻腔血重複遺伝子の効果量。 鼻腔および血液中のヘッジス g GSE117827におけるACRBP、CCRL2、IFIT1、ISG15、RSAD2、およびXAF1の推定値を示す。正の値は、ウイルス陰性対照群よりも有症状の感染群で発現が高いことを示す。透明性を確保するため、完全なオーバーラップを示している。単一遺伝子のFDR値は有意ではなく、これらの遺伝子は検証済みの汎用バイオマーカーとして提示するものではない。 この図の拡大版を表示するには、ここをクリックしてください。
機能濃縮解析により、モジュールの内容に関する生物学的な検証が行われた
両方のモジュールにおいてインターフェロンおよび抗ウイルス経路の濃縮が認められたが、遺伝子組成および濃縮の強さは異なっていた(図3)。モジュールあたり上位8つの最も有意な用語が表示されています。鼻腔モジュールでは、Hallmark インターフェロンガンマ応答(補正済み P = 2.23 × 10⁻24)、ホールマーク インターフェロンアルファ反応(調整済み P = 1.40 × 10⁻22), Reactome インターフェロンα/βシグナル伝達(補正済み P = 3.64 × 10⁻19)、およびウイルスに対するGO防御応答(調整済み P = 5.47 × 10⁻15上位の用語にランク付けされた。血液モジュールでは、より低い濃縮強度において同様の広範な生物学的特性が示された:インターフェロンアルファ応答(調整済み P = 3.87 × 10⁻6)、Reactome インターフェロンα/βシグナル伝達(補正済み P = 5.70 × 10⁻6)、インターフェロンガンマ応答(調整済み P = 8.89 × 10⁻6)、およびウイルスに対する防御応答(調整済み P = 1.07 × 10⁻4)。これらの結果は、コンパートメントごとの遺伝子ランキングが同一であることを意味せずとも、生物学的な一貫性を支持している。

図 3鼻腔および血液モジュールの選択された濃縮解析項目の用語。 Over-representation解析は、Enrichrを用い、Hallmark 2020、Reactome 2022、およびGO Biological Process 2023を使用して行われた。Benjamini–Hochberg補正後のp値が最も小さい8つの項目の P 各モジュールの値が示されている。バーの長さは−logを表す。10(調整済み) P 値)。左右のパネルは、それぞれ鼻腔モジュールと血液モジュールを示している。用語はセンテンスケースで表示されている。濃縮分析によってモジュールの構成が変更されることはなかった。 この図の拡大版を表示するには、ここをクリックしてください。
固定済みモジュールを組織適合外部検証でテストした
固定済みの鼻腔モジュールは、GSE41374で0.749、GSE152075で0.693、GSE156063で0.609のAUROCに達した(表3; 図4)。固定済みの血液モジュールは、GSE171110で0.832、GSE38900のGPL10558ユニットで0.924、GPL6884ユニットで0.870のAUROCに達した。内部アンカーの性能は、構築上楽観的なバイアスがかかるため省略している。外部AUROCはポータビリティの要約として扱う。これらは臨床的な感度、特異度、または診断への適用可能性を立証するものではない。
| コホート | サンプル/ウイルス | モジュール | 陽性n | n陰性 | 解析対象の遺伝子 | AUROC | 平均適合率 | Welch検定 FDR |
| GSE152075 | SARS-CoV-2 上気道 | 鼻腔の | 430 | 54 | 50 | 0.693 | 0.935 | 2.20 × 10⁻⁴ |
| GSE156063 | SARS-CoV-2 上気道 | 鼻腔の | 93 | 100 | 49 | 0.609 | 0.551 | 1.38 × 10⁻² |
| GSE171110 | SARS-CoV-2 全血 | 血液 | 44 | 10 | 50 | 0.832 | 0.959 | 7.94 × 10⁻⁴ |
| GSE38900-GPL10558 | RSV全血 | 血液 | 28 | 8 | 50 | 0.924 | 0.979 | 7.94 × 10⁻⁴ |
| GSE38900-GPL6884 | RSV全血 | 血液 | 107 | 31 | 49 | 0.87 | 0.962 | 3.47 × 10⁻¹⁵ |
| GSE41374 | RSV鼻腔洗浄 | 鼻腔の | 76 | 10 | 50 | 0.749 | 0.951 | 2.63 × 10⁻² |
表3:外部の組織一致モジュールスコア検証。 固定された鼻腔モジュールをGSE41374、GSE152075、およびGSE156063で検証し、固定された血液モジュールをGSE171110ならびにGSE38900プラットフォームユニットのGPL10558およびGPL6884で検証した。本表には、陽性および陰性サンプルの数、表現型モジュール遺伝子、AUROC、平均精度、およびWelch検定のFDRを示す。内部アンカーの性能は省略している。AUROCおよび平均精度はポータビリティの要約として報告されており、臨床診断能の推定値ではない。

図4外部組織整合モジュールスコアの移植性。 GSE41374(RSV 76例、コントロール 10例)、GSE152075(SARS-CoV-2 430例、コントロール 54例)、およびGSE156063(SARS-CoV-2 93例、コントロール 100例)における鼻腔モジュール、ならびにGSE171110(SARS-CoV-2 44例、コントロール 10例)、GSE38900-GPL10558(RSV 28例、コントロール 8例)、およびGSE38900-GPL6884(RSV 107例、コントロール 31例)における血液モジュールのAUROCを示す。スコアは、各遺伝子のz値の非加重平均である。破線はAUROC = 0.5を示す。これらの値はポータビリティの要約であり、臨床的な診断推定値ではない。 この図の拡大版を表示するには、こちらをクリックしてください。
縦断的バリデーションにより、回復期にスコアが低下するかを検証した
GSE97741/GSE97742のコンパニオンデータセットは、入院児の急性期および退院時のサンプルを用いた、独立した自然感染バリデーション設定を提供した27。これらのサンプルは、健康対照群の探索データとしては使用されなかった。これらは、アンカー由来のモジュールスコアが急性疾患から退院までに低下するかを評価するために使用された。
あらかじめ指定されたRSV単独感染およびライノウイルス複合感染群において、各組織で68組のペア被験者が解析されました(表4; 図5)。血液モジュールは、血液中において急性期から退院までに減少しました(mean delta = 0.330; Cohen dz = 0.740; paired-test FDR = 1.98 × 10⁻7; AUROC = 0.765)。鼻腔モジュールも、鼻咽腔サンプルにおいて同様に減少しました(mean delta = 0.436; Cohen dz = 0.477; paired-test FDR = 3.06 × 10⁻4; AUROC = 0.679)。ペアの軌跡とその標準誤差から、群レベルの減少が少数のペア外の極端な値によって引き起こされたものではないことが示されています。
| データセット | サンプルソース | モジュール | 組織の一致 | ペア数(n) | 平均急性期-退院時デルタ | Cohen dz | AUROC | ペア検定FDR |
| GSE97741 | 血液 | 血液 | あり | 68 | 0.330 | 0.740 | 0.765 | 1.98 × 10⁻⁷ |
| GSE97741 | 血液 | 鼻腔 | なし | 68 | 0.479 | 0.721 | 0.755 | 3.19 × 10⁻⁷ |
| GSE97742 | 鼻咽頭 | 血液 | なし | 68 | 0.361 | 0.914 | 0.845 | 9.42 × 10⁻¹⁰ |
| GSE97742 | 鼻咽頭 | 鼻腔 | あり | 68 | 0.436 | 0.477 | 0.679 | 3.06 × 10⁻⁴ |
表4:独立した縦断的急性期対退院時のバリデーション。 この表は、GSE97741およびGSE97742における固定モジュールの完全なペア数、急性期から退院時を差し引いた平均スコア差、Cohen dz、AUROC、およびペア検定のFDRを示している。正のデルタ値は、急性疾患時にモジュールスコアが高いことを示す。ペア検定のFDR値は、全縦断的出力における20個の有効なペア t 検定全体で算出された、Benjamini–Hochberg補正済みの両側ペア t 検定 P 値である。

図5急性疾患時から退院時までのモジュールスコアのペアでの変化。 (A) 全血における血液モジュールスコア (GSE97741)。 (B) 鼻咽頭検体における鼻腔モジュールスコア(GSE97742)。各パネルには68組の完全な被験者ペア(RSV単独感染38例、ライノウイルス感染30例)が含まれている。細線は被験者間で一致した測定値を結んでいる。オレンジ色の点は群平均を、オレンジ色のエラーバーは平均標準誤差を示す。両側ペア... t t検定およびウィルコクソン符号付順位検定を実施し、20組の有効な縦断的ペア全体にベンジャミーニ・ホッホベルグ法によるFDR補正を適用した。 t 試験。 この図の拡大版を表示するには、ここをクリックしてください。
コンパートメント間テストにより、有用なニュアンスが明らかになりました。鼻咽頭検体に血液モジュールを適用したところ、アンカーにおける個々の鼻腔および血液の効果量はわずかに一致していたにもかかわらず、AUROC 0.845が得られました。ペアにした軌跡を確認したところ、ラベル分布の逆転ではなく、一貫したスコアの低下が見られました。したがって、この結果は、同一の個々の遺伝子が両方の組織で支配的であるという証拠ではありません。これは、協調的なインターフェロン/炎症プログラムが、異なるが部分的に冗長な遺伝子セットによって要約され得ることを示しています。コンパートメント特異性は遺伝子ランキングレベルで最も強く、パスウェイまたはスコアレベルでは絶対的なものではありません。
保留した無症状検出例を用いた症状勾配挙動の検証
GSE117827における無症状のピコルナウイルス検出例は、一次コントロール群への混入を避けるため、モジュールの構築からは除外されました。この保留グループは、その後、生物学的な検証に用いられました。いずれのコンパートメントにおいても、ウイルス陰性コントロール、無症状のピコルナウイルス検出、および有症状感染という順序で並べたグループ間で、モジュールスコアが上昇しました(図 6A,B)。

図 6. 除外した症状勾配におけるモジュールスコア。 (A) 鼻腔モジュール:ウイルス陰性コントロール 6 例、無症状のピコルナウイルス検出 5 例、および有症状の感染 15 例。 (B) 血液モジュール:ウイルス陰性コントロール 6 例、無症状のピコルナウイルス検出 5 例、および有症状の感染 13 例。点は個々のサンプルを表す。中心線は中央値を、ボックスは第 25 パーセンタイルから第 75 パーセンタイルまでを示し、ひげは四分位範囲の 1.5 倍以内の最大値および最小値まで延びている。ラベルは、コンパートメントごとの 3 つの比較において Benjamini–Hochberg 補正を行った両側 Mann–Whitney U 事後検定の結果を示す。 この図の拡大版を表示するには、ここをクリックしてください。
鼻腔モジュールは順序症状スコアと相関していました(Spearman rho = 0.818, P = 3.28 × 10⁻7; Kruskal-Wallis P = 1.57 × 10⁻4)。血液モジュールでも同様の勾配が認められました(rho = 0.861, P = 6.89 × 10⁻8; Kruskal-Wallis P = 1.92 × 10⁻4)。各3群比較ファミリー内で補正を行った結果、両コンパートメントにおいて、有症状感染群は対照群および無症状検出群と異なっていました。無症状検出群はウイルス陰性対照群と有意な差はありませんでした(nasal FDR = 0.792; blood FDR = 0.082)。したがって、これらのモジュールは、ウイルスの検出のみよりも、有症状ホストの応答活性をより明確に追跡していました。
臨床的ベンチマークにより、宿主応答と病原体特異性の境界が定義された
臨床的ベンチマークにより、宿主応答活性と病原体分類の区別が定義された(表 5; 図 7)。GSE63990において、鼻腔モジュールは、ウイルス性疾患対細菌性疾患で 0.782、ウイルス性疾患対非感染性疾患で 0.791 の AUROC を示した。血液モジュールは、それぞれ 0.678 および 0.753 の AUROC を示した。Pandya 33-mRNA 比較群はより高い性能を示し、AUROC はそれぞれ 0.867 および 0.852 であった。この結果は、ウイルス性と非ウイルス性の識別用に設計されたセットとしては想定内であり、アンカーモジュールを診断用分類器の代替として提示すべきではないことを示している。
| データセット | 対照 | 鼻腔アンカー | 血液アンカー | Pandya 33 mRNA | Andres-Terre ISG | Hallmark interferon-alpha |
| GSE63990 | ウイルス性 vs 細菌性 | 0.782 | 0.678 | 0.867 | 0.833 | 0.831 |
| GSE63990 | ウイルス性 vs 非感染性 | 0.791 | 0.753 | 0.852 | 0.851 | 0.848 |
| GSE40012 | ウイルス性肺炎 vs 細菌性肺炎 | 0.755 | 0.789 | 0.893 | 0.867 | 0.872 |
| GSE40012 | ウイルス性肺炎 vs SIRS | 0.897 | 0.907 | 0.985 | 0.965 | 0.956 |
| GSE40012 | ウイルス性肺炎 vs 健康 | 0.804 | 0.986 | 0.923 | 0.906 | 0.891 |
| GSE40012 | 細菌性肺炎 vs 健康 | 0.476 | 0.917 | 0.465 | 0.391 | 0.378 |
| GSE53543 | Ex vivo ライノウイルス刺激 PBMC vs 非刺激 PBMC | 1 | 0.957 | 1 | 1 | 1 |
表5:アンカーモジュールと参照ホスト応答セットのAUROCベンチマーク。GSE63990およびGSE40012は臨床全血コホートである。GSE53543は98組のペア被験者を対象としたex vivo PBMC摂動実験であり、自然臨床コホートとは別に報告されている。参照セットは、元の重み付き分類器ではなく、重み付けなしの遺伝子平均としてスコア化された。AUROC値はベンチマーク指標として報告されており、臨床診断能の推定値ではない。

Figure 7. アンカーモジュールおよび参照ホスト応答セットのAUROCベンチマーク。 行はGSE63990、GSE40012、およびGSE53543における事前定義された対比を示し、列は2つのアンカーモジュールと3つの非重み付け参照セットを示す。GSE53543は、ex vivoライノウイルス刺激PBMC対非刺激PBMCとしてラベル付けされており、自然臨床コホートとは別に提示されている。Hallmarkの比較対象はHallmark interferon-alphaとしてラベル付けされている。セルの値は手法のベンチマークに使用されたAUROCを示しており、臨床診断能の推定値として解釈されるべきではない。こちらのリンクをクリックして、この図の拡大版を表示してください。
GSE40012はこの境界を明確にしました。Pandya比較解析では、ウイルス性肺炎対細菌性肺炎で0.893、ウイルス性肺炎対SIRSで0.985のAUROCに達しました。血液モジュールは、インフルエンザA型肺炎を健康対照群(AUROC = 0.986)およびSIRS(AUROC = 0.907)から区別しましたが、細菌性肺炎を健康対照群から区別することもできました(AUROC = 0.917)。したがって、血液モジュールは広範な全身性炎症およびインターフェロン関連活性を測定していることになります。これはウイルス特異的なものではなく、高スコアによって病原体のクラスを特定することはできません。
別のGSE53543 ex vivo PBMCベンチマークでは、ライノウイルス刺激PBMCと培地のみのPBMCの比較において、鼻腔モジュールおよびインターフェロン比較群が1.000のAUROCに達し、血液モジュールは0.957のAUROCに達しました。全98名の被験者がペア条件に寄与しました。この制御された結果は、スコア化されたプログラムがライノウイルス刺激に反応することを支持しています。なお、これは臨床診断能を推定するものではありません。
モジュールサイズ、ランダムな代替案、および選択の安定性に関するロバストネスチェックを実施した
アンカーの分離度は、上位ランクの遺伝子数を10、25、50、100、200とした場合でも不変であった(図 8A)。これらの内部AUROCは外部検証ではないが、定性的な結果がちょうど50個の遺伝子を選択したことに依存しなかったことを示している。50個の遺伝子からなる500組のランダムなセットにおいて、ヌルAUROCの中央値は、鼻腔検体で0.489、血液検体で0.705であり、対応する99パーセンタイルは0.722および0.872であった(図 8B)。観測されたモジュールは、これらのヌル分布を上回っていた。ブートストラップ選択頻度は、単一の不変なリストに集中せず分散していた(図 8C)。この結果は、アンカーサンプルサイズが小さいことを直接的に反映している。これは、集約されたシグナルが安定していることを裏付ける一方で、選択されたすべての遺伝子を固定的なものとして扱うことへの注意を促している。

図8モジュールサイズ、ランダム遺伝子、およびブートストラップの頑健性解析。 (A) 10、25、50、100、および200遺伝子のモジュールサイズにおけるアンカーAUROC。これらの値は内部感度チェックを表している。 (B) GSE117827に含まれる遺伝子から、非復元抽出でサンプリングされた500個のランダムなタンパク質コーディング遺伝子50セットにおけるAUROC分布(シード値 = 20260622)。オレンジ色の点は、観測されたモジュールのAUROCを示す。各バイオリン図内の水平線は、第25パーセンタイル、中央値、および第75パーセンタイルを示す。(Cブートストラップ再選択は、各コンパートメントについて、元のアンカー解析で最も高くランク付けされた正の効果を持つ上位1,000個のタンパク質コード遺伝子に限定した。棒グラフは、コンパートメントあたり選択頻度が最も高い20個の遺伝子を示している。選択頻度は、選択回数を100で除して算出した。 この図の拡大版を表示するには、ここをクリックしてください。
マーカープログラムおよび分散分析により、スコアが何を測定しているかが明確になった
GSE40012、GSE53543、およびGSE63990のすべてにおいて、両モジュールは骨髄系インターフェロンプログラムと最も一貫して相関していた(Figure 9A)。鼻腔モジュールの相関は0.812、0.878、および0.882であり、血液モジュールの相関は0.517、0.843、および0.774であった。分散分画は記述的であった(Table 6; Figure 9B)。血液モジュールでは、データセット(0.066)、サンプルタイプ(0.026)、またはソースグループ(0.025)よりも、コンディションおよび詳細グループの方がより多くの分散を説明した(eta-squaredはそれぞれ0.282および0.250)。鼻腔モジュールにおいても同様に、詳細グループおよびコンディションが、データセット、サンプルタイプ、またはソースグループよりも多くの分散を説明した。したがって、生物学的コンディションおよび詳細グループは、データセットやサンプルタイプよりもモジュールスコアの分散に寄与する割合が大きかったが、ゼロではないデータセットおよび組成の影響は、バルク公開データの再利用における限界として残っている。

図9マーカー・プログラム相関および記述的分散分画。 (A) GSE40012、GSE53543、およびGSE63990における、モジュールスコアと6つのマーカープログラムスコアとの間のスピアマン相関。プログラムには、少なくとも3つの代表的な遺伝子が必要である。 P すべてのデータセット・モジュール・プログラム間の相関において、値の調整を行いました。空白のセルは、遺伝子およびサンプルの要件を満たさなかったため、利用不可または推定不能な組み合わせであることを示しています。B) 一元配置分散分析のイータ二乗(η²)2(群間平方和/全平方和)を、条件、詳細グループ、データセット、サンプルタイプ、およびソースグループについて算出しました。解析には934件の血液モジュールスコアおよび1,469件の鼻腔モジュールスコアが含まれており、本解析は記述的なものであり、因果関係を示すものではありません。 この図の拡大版を表示するには、ここをクリックしてください。
| モジュール | 因子 | イータ二乗 | n個の試料 |
| アンカー血液 | 条件 | 0.282 | 934 |
| 血液の固定 | 詳細グループ | 0.25 | 934 |
| アンカー血液 | データセット | 0.066 | 934 |
| 血液の固定 | サンプルタイプ | 0.026 | 934 |
| 血液の固定 | ソース群 | 0.025 | 934 |
| 鼻腔アンカー | 詳細グループ | 0.17 | 1469 |
| 鼻腔アンカー | 条件 | 0.13 | 1469 |
| 鼻腔内アンカー | データセット | 0.021 | 1469 |
| 鼻腔アンカー | サンプルタイプ | 0.006 | 1469 |
| 鼻腔アンカー | ソースグループ | 0.002 | 1469 |
表 6:モジュールスコアの記述的分散分割。 各モジュールと因子のペアについて、対応するeta-squared(イータ二乗)およびサンプルサイズを1行ずつ示した。eta-squaredは、関連するモジュールスコアまたは因子が欠損している行を除外した後、群間平方和を全平方和で除して算出した。因子は個別に評価されたため、本解析は記述的なものであり、相互に相関する因子について調整は行っておらず、因果関係として解釈されるべきではない。
データの可用性:
本研究で解析したすべてのトランスクリプトームデータセットは、Gene Expression Omnibusにてアクセッション番号GSE117827、GSE41374、GSE152075、GSE156063、GSE171110、GSE38900、GSE97741、GSE97742、GSE63990、GSE40012、およびGSE53543で公開されています。主要な図表の根拠となる解析データおよび解析コードは、妥当な要求があれば責任著者から入手可能です。本研究では、制限付きデータまたは新たに生成された参加者レベルのデータは使用していません。
主要な教訓は運用上のものです。すなわち、最大規模のプールされたマトリックスからではなく、サンプリングされたコンパートメントから開始することです。GSE117827は小規模ですが、ペアードデザインであるため、1つの研究内で鼻腔と血液を直接比較することが可能です。遺伝子レベルでの効果相関がほぼゼロであることは、全組織をプールしたランクリストでは、実質的なコンパートメント構造が隠されてしまうことを示しています。したがって、個別のモジュールを採用する方がより妥当な設計でした。これらのモジュールの外部および縦断的なパフォーマンスは、普遍的な遺伝子リストではなく、モジュールレベルで再現可能な宿主応答活性があることを裏付けています。
遺伝子レベルのポータビリティとモジュールレベルのポータビリティは異なります。個々の鼻腔および血液におけるエフェクトサイズ間の整合性は低かったものの、血液モジュールは鼻咽頭の縦断的サンプルにおいて良好な性能を示しました(AUROC 0.845)。ペアとなるトラジェクタリーにラベルの反転は見られませんでした。より可能性の高い説明は、パスウェイの冗長性です。協調的なインターフェロン活性および炎症活性は、異なるコンパートメントにおいて異なる遺伝子のサブセットによって要約され得ます6,7,8,9,10,11,32,33,34。これが、我々がモジュールを「コンパートメント排他的」ではなく「コンパートメント認識的」であると記述する理由です。正確なランキングは異なりますが、共通のパスウェイレベルの構成要素は検出可能なままです。バルクプロファイルでは、発現の変化と細胞組成の変化が混在します。マーカープログラムの相関によってこの問題を特定することは可能ですが、細胞レベルで解像されたメカニズムを提供することはできません36,37。
臨床的ベンチマークによって、もう一つの境界が定義されます。Pandya 33-mRNAおよびインターフェロンの比較因子は、ウイルス感染と細菌感染の識別においてより強力でした。一方、アンカーモジュールは異なる問い、すなわち、サンプルが急性宿主応答プログラムをどの程度強く発現しているかという問いに答えるものです。血液モジュールは細菌性肺炎においても上昇しました。したがって、これはウイルス特異的な分類器ではなく、広範な全身性炎症/インターフェロン活性スコアとして解釈されるべきです。高スコアは、コホート比較、反応追跡、または炎症状態の記述を裏付ける可能性がありますが、病原体を特定することはできません。ヒトメタニューモウイルスなどのウイルスの臨床的重要性の高まりは、限定的なウイルスセットからの外挿ではなく、病原体が多様で組織が一致したバリデーションが必要であることをさらに裏付けています12,13。
6つの重複遺伝子は探索的なものです。ISG15、IFIT1、RSAD2、およびXAF1は、インターフェロンに関連する妥当な役割を有しています32,33,34。CCRL2は炎症性白血球の遊走に関連しており35、ACRBPについては確立された抗ウイルス的な解釈はありません。コホート規模が小さく、遺伝子ごとのFDR値が有意ではなかったため、より強い主張を行うことはできません。本研究の手法的な革新性は別の点にあります。それは、同一研究内でのペアードアンカー、固定されたコンパートメント特異的モジュール、組織を一致させた外部検証、ペアードリカバリー解析、臨床的比較対照によるベンチマーキング、および明示的なランダムチェック、サイズチェック、ブートストラップチェック、マーカーチェック、分散チェックの実施です。このエビデンスの階層構造により、結果を解釈するための保守的な枠組みが提供されます。
いくつかの限界が残っています。アンカーコホートには、感染した鼻腔サンプル15検体と対照群の鼻腔サンプル6検体、および感染した血液サンプル13検体と対照群の血液サンプル6検体しか含まれていません。ブートストラップの結果から、個々の遺伝子のメンバーシップが完全に安定していないことが確認されました。症候性RSVとピコルナウイルスが統合されているため、アンカー効果はウイルス特異的ではありません。外部コホートは、年齢、プラットフォーム、重症度、タイミング、および対照群の定義が異なります。GSE53543はex vivoのペア摂動研究です。GSE63990およびGSE40012は有用な臨床的比較対象を提供していますが、ペアとなった鼻腔・血液サンプリングは行われていません。ウイルス量、症状の持続期間、酸素投与の必要性、および重症度は一貫して得られていませんでした。より強力な前向き設計では、同一の参加者から一致した時点での鼻腔スワブと血液を回収し、ウイルス量と症状の測定、細菌および症候性ウイルス陰性の比較対象、および細胞分解能での検証を行う必要があります11,14,36,37。
結論として、現在の公開トランスクリプトームは、組織のコンテキストが保持されていれば、再現可能な鼻腔および血液の宿主応答活性モジュールを支持しています。一方で、組織間で互換性のある汎組織的な遺伝子シグネチャーは支持されませんでした。ペアアンカーは遺伝子レベルでの一致をほとんど示しませんでしたが、ロックされたモジュールスコアは一致する組織間で転移し、回復期に低下しました。細菌性肺炎における血液モジュールの応答、および確立された分類器によるウイルス対細菌の優れた性能は、本手法の意図された用途を定義しています。すなわち、これらのモジュールは宿主応答活性を記述し、透明性の高いコホートベンチマークをサポートするものであり、単独の病原体分類器ではありません。独立した検証およびワークフローの再利用を支援するため、解析コードおよび派生データは「データ可用性」ステートメントに記載されている方法で利用可能です。
著者らは、本研究に関連して、金銭的または非金銭的な利益相反がないことを宣言します。
著者らは、本研究で再解析した公開GEO研究の調査者および参加者に感謝いたします。著者の基準を満たす追加の個人はいませんでした。本研究は、公的、商業的、または非営利セクターのいかなる資金提供機関からも、特定の助成金を受けていません。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| Andres-Terreマルチウイルスインターフェロン刺激遺伝子セット | Andres-Terre et al. | 33遺伝子コンパレーター; Supplementary Data 1 | 報告されたマルチウイルスシグネチャーからキュレートされた非重み付けインターフェロン指向コンパレーター。完全な遺伝子リストはSupplementary Data 1に記載されている。 |
| Enrichr | Ma'ayan Laboratory | 2026年8月18日にアクセス; RRID:SCR_001575 | gseapyを通じてアクセスした遺伝子セット過剰表現リソース。 |
| Gene Expression Omnibus | National Center for Biotechnology Information | GEO; RRID:SCR_005012 | 解析データセットへのアクセスに使用した公共トランスクリプトームリポジトリ。 |
| Gene Ontology | Gene Ontology Consortium | GO Biological Process 2023; RRID:SCR_002811 | Enrichrを通じて使用した機能アノテーションライブラリ。 |
| GPL10558 | NCBI GEO | GPL10558 | GSE53543および36サンプルのGSE38900バリデーションユニット用プラットフォーム。 |
| GPL23126 | NCBI GEO | GPL23126 | GSE117827用発現プラットフォーム。 |
| GPL24539 | NCBI GEO | Clariom_D_Human.na36.hg38. probeset.csv | GSE117827のトランスクリプトクラスターマッピングに使用したClariom D Human na36, hg38アノテーション。 |
| GPL571 | NCBI GEO | GPL571 | GSE63990に適用したプラットフォームアノテーション。 |
| GPL6884 | NCBI GEO | GPL6884 | 138サンプルのGSE38900 RSV全血バリデーションユニット用プラットフォーム。 |
| GPL6947 | NCBI GEO | GPL6947 | GSE40012に適用したプラットフォームアノテーション。 |
| GSE117827 | NCBI GEO | GSE117827 | 主要なペア鼻腔スワブおよび全血アンカーデータセット。 |
| GSE152075 | NCBI GEO | GSE152075 | 外部SARS-CoV-2上気道バリデーションデータセット。 |
| GSE156063 | NCBI GEO | GSE156063 | 外部SARS-CoV-2上気道バリデーションデータセット。 |
| GSE171110 | NCBI GEO | GSE171110 | 外部SARS-CoV-2全血バリデーションデータセット。 |
| GSE38900 | NCBI GEO | GSE38900; GPL10558 and GPL6884 | 個別に標準化された36サンプルおよび138サンプルのプラットフォームユニットとして解析された外部RSV全血バリデーション。 |
| GSE40012 | NCBI GEO | GSE40012 | 臨床的なインフルエンザA型肺炎、細菌性肺炎、SIRS、および健康対照ベンチマーク。 |
| GSE41374 | NCBI GEO | GSE41374 | 外部RSV鼻腔洗浄バリデーションデータセット。 |
| GSE53543 | NCBI GEO | GSE53543 | 98名の被験者と196サンプルを含むペアex vivo PBMCライノウイルス摂動ベンチマーク。 |
| GSE63990 | NCBI GEO | GSE63990 | 臨床的なウイルス性、細菌性、および非感染性全血ベンチマーク。 |
| GSE97741 | NCBI GEO | GSE97741 | 縦断的な全血急性期対退院時バリデーションデータセット。 |
| GSE97742 | NCBI GEO | GSE97742 | 縦断的な鼻咽頭急性期対退院時バリデーションデータセット。 |
| gseapy | gseapy developers | Version 1.3.1 | Enrichrにクエリを送信するために使用したPythonインターフェース。 |
| HGNC遺伝子シンボルリソース | HUGO Gene Nomenclature Committee | 2026年8月18日にアクセス; RRID:SCR_002827 | 承認済みの遺伝子シンボル標準化およびタンパク質コード分類リソース。 |
| Matplotlib | Matplotlib development team | Version 3.11.1 | 図の生成。 |
| MSigDB Hallmark遺伝子セット | Broad Institute | Hallmark 2020; RRID:SCR_016863 | Enrichrを通じてアクセスしたHallmark濃縮ライブラリ。 |
| MSigDB Hallmarkインターフェロンアルファ応答遺伝子セット | Broad Institute | HALLMARK_INTERFERON_ALPHA_ RESPONSE; Supplementary Data 1内の33遺伝子コアサブセット | 非重み付けインターフェロンアルファコンパレーター。正確なサブセットはSupplementary Data 1に記載されている。 |
| NumPy | NumPy developers | Version 2.5.2 | 数値計算およびシード付きランダムサンプリング。 |
| pandas | pandas development team | Version 3.0.5 | 表形式データの処理。 |
| Pandya 33-mRNA宿主応答遺伝子セット | Pandya et al. | Supplementary Table 1; Supplementary Data 1 | 非重み付けコンパレーターとしてスコア化された公式の33遺伝子セット。 |
| Python | Python Software Foundation | Version 3.12.13 | 計算解析環境。 |
| Reactome | Reactome | Reactome 2022; RRID:SCR_003485 | Enrichrを通じてアクセスしたパスウェイ濃縮ライブラリ。 |
| scikit-learn | scikit-learn developers | Version 1.9.0 | AUROCおよび平均精度の計算。 |
| SciPy | SciPy developers | Version 1.18.0 | Welch、対応のあるt検定、Wilcoxon、Mann–Whitney、および相関検定。 |
| Seaborn | Seaborn development team | Version 0.13.2 | 統計グラフィックス。 |
| statsmodels | statsmodels developers | Version 0.14.6 | 統計ユーティリティ。 |