$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
После успешного выполнения рабочего процесса создается несколько таблиц и рисунков, как показано на рисунке 2. Рисунки помещаются в папку /figures (Рисунок 6, Рисунок 7, Рисунок 8, Дополнительный рисунок 1, Дополнительный рисунок 2, Дополнительный рисунок 3, Дополнительный рисунок 4), а таблицы будут помещены в указанную папку /results .
Если расчетная схема не выполнена успешно, это может быть вызвано в основном техническими ошибками, вызванными, например, недостаточным объемом памяти (особенно на первом этапе, когда загружается большой набор данных с одной ячейкой), неправильно отформатированными данными (например, несоответствие столбцов sample_id между наборами данных) или неправильными спецификациями в файлах конфигурации (например, исключение многих функций). В этом случае, как правило, во время выполнения появляется сообщение об ошибке в скрипте Jupyter-notebook, и графики и данные не генерируются. Рекомендуется использовать конфигурационные файлы по умолчанию, созданные во время выполнения скрипта, и изменять только определенные параметры, как описано в протоколе.
Об успешном выполнении свидетельствует генерация полученных графиков и таблиц, и каждый шаг будет раскрывать дополнительную информацию о данных и основных закономерностях дисперсии, присущих им. Тем не менее, не обязательно каждое выполнение приведет к биологически полезным и интерпретируемым результатам. Часто данные характеризуются большими техническими эффектами и различными распределениями, которые необходимо учитывать на этапе «Предварительная обработка и гармонизация данных» или в «Модели MOFA9 » (которая также позволяет задавать различные распределения для типов входных данных), чтобы иметь возможность извлечь вариацию данных, отражающую лежащие в основе биологические процессы.
В рамках представленного рабочего процесса в качестве входных данных могут использоваться различные мультиомические наборы данных. В настоящее время рабочий процесс принимает популярный формат файла .h5ad для данных с одной ячейкой и очень общий формат файла .csv для всех остальных наборов данных в качестве входных данных (рисунок 3). Обычно разные омические наборы данных имеют очень разные форматы файлов. Чтобы не ограничивать выполнение рабочего процесса определенными форматами файлов, .csv используется в качестве очень общего формата. Таким образом, все виды различных наборов омиксных наборов данных могут быть использованы в качестве входных данных для рабочего процесса, но перед использованием в этом рабочем процессе их необходимо преобразовать в соответствующий формат .csv , как показано на рисунке 3 . Это может быть подготовлено с помощью электронной таблицы или специализированного программного обеспечения. Для предварительной обработки различных наборов омиксных данных в рабочем процессе доступно несколько опций для применения различных этапов предварительной обработки и нормализации (например, корректировка размера библиотеки, преобразование журнала, нормализация выборки квантиля) к различным входным наборам данных путем настройки файла 02_Pre_Processing_Configs.csv и 02_Pre_Processing_Configs_SC.csv (рис. 2)). Тем не менее, доступные здесь варианты в основном основаны на конкретных исходных данных, доступных в представленном здесь наборе данных (scRNA-seq, цитокиновый анализ, протеомика, prime-seq). В случае использования других омиксов/типов данных может потребоваться применение дополнительных шагов нормализации, специфичных для омиков, в соответствии с существующими передовыми практиками. В этом случае данные могут быть переданы в рабочий процесс в уже предварительно обработанной форме и будут интегрированы вместе с другими наборами данных без применения дополнительных этапов предварительной обработки. Во многих случаях применение шага Feature Wise Quantile Normalization полезно для выравнивания распределения всех типов данных в соответствии с нормальным распределением и для того, чтобы сделать последующий анализ между различными входными признаками более сопоставимым и совместимым со спецификацией модели гауссова шума.
Во время выполнения рабочего процесса генерируется несколько графиков и выходных данных, которые поддерживают процесс интеграции данных и последующей биологической интерпретации. Для данных scRNA-seq график в FIG01_Amount_of_Cells_Overview (рис. 6) показывает, какие типы клеток могут включать слишком мало клеток на образец и тип клеток для надежного измерения сигнала экспрессии гена, поскольку для последующих анализов среднее значение по всем клеткам типа клеток на образец используется в качестве оценки экспрессии (psedobulk-подход). В этом случае мы исключаем типы клеток, которые имеют менее трех ячеек в большинстве образцов.
График дисперсионной декомпозиции FIG03_Overview_Variance_Decomposition (рис. 7, дополнительный рис. 1) может показать, насколько хорошо интегрируются различные источники данных и какая дисперсия в различных источниках данных является общей и уникальной для каждого источника данных. Например, тестирование различных стратегий предварительной обработки на используемом здесь наборе данных показывает, например, что удаление шага нормализации Feature Wise Quantile из предварительной обработки приводит к появлению скрытых факторов, которые больше сосредоточены на конкретных представлениях данных, и снижает интеграцию протеомных данных с другими источниками данных. Это можно увидеть в уменьшенной величине объясняемой дисперсии (дополнительный рисунок 1B). Запуск модели MOFA без какой-либо фильтрации признаков или без нормализации приводит к меньшей общей дисперсии между различными представлениями, захваченными латентными факторами (дополнительный рисунок 1C). Это указывает на то, что латентные факторы преимущественно отражают технические эффекты, специфичные для типа данных. Кроме того, сама модель MOFA9 также может возвращать предупреждения в случае плохо обработанных данных. Пример такого предупреждения показан на дополнительном рисунке 1 для альтернативных конфигураций предварительной обработки MI_v2 и MI_v3 (конкретные примеры конфигурационных файлов хранятся в клонированном репозитории GitHub в папке config_examples ).
Кроме того, после запуска модели MOFA результаты могут быть оценены в нескольких последующих анализах путем связывания фактора с известной биологической метаинформацией о образцах, а также с техническими и другими искажающими ковариатами (04_Downstream_Factor_Analysis) для определения вероятной причины вариации, захваченной факторами. Например, если один из факторов моделей MOFA тесно связан с одной из технических ковариат (например, информация о партии), это может указывать на то, что этот фактор скорее отражает технические вариации в данных, а не биологические вариации.
Чтобы сузить биологическую интерпретацию в части анализа, ниже приведена пара выводов, основанных на входном наборе данных (более точную интерпретацию можно найти в оригинальной публикации11). На первом этапе мы можем наблюдать, что с помощью применяемой стратегии предварительной обработки мы находим несколько факторов, которые фиксируют дисперсию между несколькими типами клеток, а также другими типами омиксных данных (рис. 7A). Например, фактор 2 фиксирует дисперсию в клинических входных признаках и в нескольких типах клеток набора данных scRNA-seq. Связывая первые три фактора с соответствующими клиническими ковариатами, такими как «СРБ» и «КФК» (рисунок 7B), и исследуя различия в значениях факторов для различных подгрупп пациентов: «Контроль (включая CCS и без CCS) и «ACS», измеренный в разные моменты времени (TP1-TP4) (рисунок 7C), мы также обнаружили, что фактор 2 в значительной степени связан со значением «CK», а фактор 3 — со значением «CRP». В то же время образцы ACS в TP1 и TP2 (которые отражают острую фазу иммунного ответа на инфаркт миокарда (ИМ)) показывают увеличение значений факторов по сравнению с контрольными и более поздними образцами временных точек (TP3/TP4). КФК является известным маркером повреждения миокарда и обычно характеризуется повышенными значениями на уровне TP1/TP2, аналогично паттерну, регистрируемому Factor2.
Чтобы получить представление о биологических процессах, формирующих фактор 2, мы оцениваем наиболее ранжированные характеристики фактора, глядя на таблицу весов признаков, созданную моделью (03_Weight_Data.csv). Анализируя 1% лучших признаков с наибольшими абсолютными весами фактора, мы находим в основном CD4. ТКМ и CD14. Монопроизводные признаки преувеличены по сравнению с их общим числом входных признаков (рис. 8A), что указывает на то, что эти типы клеток имеют высокую значимость в воспалительном процессе после ИМ (ПРИМЕЧАНИЕ: в случае, если при предварительной обработке не применялась нормализация по признакам, различные распределения признаков также могут повлиять на этот результат, и оценка должна быть выполнена отдельно по типу данных). Анализируем топовые характеристики CD4. На этом факторе мы находим несколько интересных генов, таких как EIF3E18 , необходимых для устойчивой активации Т-клеток, и HMGB119, который способствует экспансии и активации Т-клеток (рис. 8B). Затем мы проводим анализ обогащения путей с использованием иммунных путей из базы данных REACTOME20 в виде набора путей (Prepared_Pathway_Data.csv). Мы обнаружили обогащение нескольких путей «Интерлейкина», включая передачу сигналов «Интерлейкин-6». Этому способствовали уровни экспрессии нескольких генов в различных типах клеток данных scRNA-seq и значения цитокинов IL6, измеренные с помощью анализа цитокинов (рис. 8C). Выявление этих общих закономерностей в разных типах данных подчеркивает дополнительные преимущества интегрированного анализа. В целом, этот подход может также выявить несколько других факторов, которые отражают состояние заболевания или связывают с ним исход лечения и лежащие в основе многоклеточные иммунные программы, как более подробно описано в соответствующей публикации11.
Чтобы еще больше подчеркнуть преимущество интегрированного анализа по нескольким омиксам, тот же рабочий процесс также был запущен только с использованием входных данных протеомики (дополнительный рисунок 4). Анализируя результирующие факторы, мы находим, как и в интегральном анализе, коэффициент (Factor1), который сильно коррелирует со значением CRP. Этот шаблон описывает основной источник вариаций в данных протеомики, а также согласуется с некоторыми вариациями в других наборах данных, зафиксированными «Фактором3» в интегрированном анализе (рисунок 7C). Тем не менее, аналогичная картина, на которую указывает Factor2, которая фиксирует временной ход воспаления в интегрированном анализе, не может быть идентифицирована исключительно на основе данных протеомики.
Представленный рабочий процесс и сама модель MOFA9 обладают широкими возможностями настройки и множеством настраиваемых параметров. Поэтому важно визуализировать и систематически сравнивать результаты, полученные при использовании различных конфигураций. Чтобы облегчить выполнение этой задачи, конечным результатом, который может быть сгенерирован рабочим процессом, является сравнение различных именованных запусков конвейера с различными параметрами в предварительной обработке и оценке модели. Например, модель MOFA может быть оценена с различным числом латентных факторов (дополнительный рисунок 2A) или представления с меньшим числом признаков могут быть взвешены (дополнительный рисунок 3A). При настройке и запуске последнего скрипта рабочего процесса «07_Compare_Models» создается несколько графиков для оценки сходства между различными прогонами конвейера. FIG07_Variance_Model_Comparison (Дополнительный рисунок 2B, Дополнительный рисунок 3B) показывает сравнение общей объясненной дисперсии для каждого вида для разных прогонов. Корреляция значений факторов и весов коэффициентов признаков между различными прогонами может показать, насколько изменяются результаты при изменении определенного параметра (дополнительный рисунок 2C, дополнительный рисунок 3C). В данном случае изменение числа факторов приводит лишь к незначительным изменениям в оценочных значениях факторов и весах признаков (дополнительный рисунок 2C). Изменение веса представления данных приводит к гораздо более высокой объяснимой дисперсии в представлениях с меньшим числом признаков, например, в «клиническом» представлении (дополнительный рисунок 3B). Тем не менее, соответствующие особенности в рамках первых трех факторов по-прежнему сильно коррелируют с теми, которые выводятся из невзвешенной версии (дополнительный рисунок 3C).
С помощью созданных выходных данных модели .csv файлов в папке результатов (например, оценочных коэффициентов и весов признаков) можно проводить дальнейший анализ отдельных компонентов. Весь код и необходимые конфигурационные файлы (включая документацию) доступны на GitHub по адресу https://github.com/heiniglab/mofa_workflow. Изображение сингулярности, созданное для простой установки необходимых пакетов conda для анализа, можно скачать с сайта https://doi.org/10.5281/zenodo.10815146. Небольшой пример набора данных, который можно использовать для выполнения первоначального тестирования конвейера, также можно скачать из той же записи zenodo.

Рисунок 7: Анализ выходных данных MOFA. После запуска модели MOFA (03_Run_MOFA.ipynb) и последующего анализа значений факторов (04_Downstream_Factor_Analysis.ipynb) генерируется несколько графиков: (A) FIG03_Overview_Variance_Decomposition: возвращает визуализацию объясненной дисперсии оцененных факторов MOFA в различных представлениях. Тепловая карта (слева): показывает процент общей дисперсии вида, захваченного коэффициентом для каждого вида. Столбчатый столб (справа): показывает общий процент дисперсии, который захватывается всеми факторами для каждого представления. (B) FIG04_Factor_Association_Numerical_Features: показывает корреляцию Пирсона значений факторов с выбранными ковариатами числовой выборки, здесь: клинические переменные (СРБ, КФК). (C) FIG04_Factor_Association_Categorical_Features: показывает разницу в значениях факторов для категориальных выборочных ковариат в виде ящичковой диаграммы. Здесь сравниваются значения факторов 1-3 для каждой временной точки пациентов с ОКС и контрольной группы. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Рисунок 8: Анализ признаков MOFA. После выполнения последующих анализов (04_Downstream_Factor_Analysis.ipynb, 05_Downstream_Investigate_Features.ipynb) генерируется несколько графиков. Все графики здесь визуализируют фактор MOFA 2: (A) FIG04_Top_Feature_Overview_per_Factor: Тепловая карта (слева) показывает для каждого вида процент дисперсии, который захватывает выбранный фактор. Столбчатые диаграммы (справа) указывают на релевантность особенностей различных представлений для фактора. Слева указано общее количество признаков конкретного представления в пределах 1% наиболее ранжированных объектов по всем представлениям о факторе. Справа указан процент от деления общего числа среди 1% самых богатых на общее количество объектов этого представления. (B) FIG05_Heatmap_Feature_Overview: Тепловая карта (слева) показывает 1% функций CD4 с наивысшим рейтингом. Тип клеток ТКМ: нормализованные значения экспрессии в каждой выборке, сравнивающие пациентов контрольной группы (CCS и без CCS) с различными временными точками для пациентов с ACS. Столбчатая диаграмма (справа) показывает вес признаков. Направление знака веса указано слева перед названиями типов ячеек: «+» вес положительного фактора; '-' отрицательный фактор вес. (C) FIG06_Pathway_and_Genes: показывает вес 25% наиболее ранжированных генов для фактора, которые принадлежат к обогащенным интерлейкиновым путям. На тепловой карте вверху они усредняются по видам, а на тепловой карте внизу отображается по каждому виду. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Дополнительный рисунок 1: Эффекты гармонизации данных. На рисунке показаны FIG03_Overview_Variance_Decomposition для нескольких различных конфигураций предварительной обработки данных: визуализация объясненной дисперсии оцененных коэффициентов MOFA в различных представлениях. Тепловая карта (слева): показывает для каждого вида процент общей дисперсии вида, который учитывается коэффициентом. Столбчатый график (справа): показывает для каждого представления общий процент дисперсии, который учитывается всеми факторами. (A) Конфигурация («MI_v1»), на основе которой были проанализированы биологические результаты на предыдущих рисунках (параметры, установленные как в файлах конфигурации по умолчанию в клонированном репозитории). (B) Та же конфигурация предварительной обработки, что и в 'MI_v1' с той модификацией, что не применяется нормализация квантилей по функциям (параметры задаются как в примерах конфигурационных файлов в папке 'config_examples' репозитория). Скриншот предупреждения модели MOFA для этой конфигурации добавлен на график ниже. (C) Результирующая дисперсионная декомпозиция , когда не применяются шаги предварительной обработки, а все данные используются в качестве входных данных без какой-либо предварительной обработки или фильтрации признаков (параметры задаются как в примере конфигурационного файла в папке 'config_examples' репозитория). Скриншот предупреждения модели MOFA для этой конфигурации добавлен на график ниже. Пожалуйста, нажмите здесь, чтобы загрузить этот файл.
Дополнительный рисунок 2: Конфигурация MOFA - Факторный эффект величины. Полученные цифры сгенерированы скриптом '07_Compare_Models.ipynb' с использованием нескольких различных конфигураций для запуска модели MOFA. (A) '03_MOFA_configs.csv': Пример различных конфигураций, используемых для запуска скрипта '03_Run_MOFA.ipynb' с указанием нескольких различных факторов (10,15,20,25). '07_Comparison_configs.csv': Пример указания входного файла конфигурации для выполнения скрипта '07_Compare_Models.ipynb'. (B) «FIG07_Variance_Model_Comparison», показывающая общую объясненную дисперсию для каждого вида (ось y) для различных моделей по всем факторам, указанным в модели. (C) «FIG07_Factor_Correlations», показывающая корреляцию значений факторной выборки между различными конфигурациями. Пожалуйста, нажмите здесь, чтобы загрузить этот файл.
Дополнительный рисунок 3: Конфигурация MOFA - Эффект взвешивания представлений. Полученные цифры сгенерированы скриптом '07_Compare_Models.ipynb' с использованием нескольких различных конфигураций для запуска модели MOFA. (A) '03_MOFA_configs.csv': Пример различных конфигураций, используемых для запуска скрипта '03_Run_MOFA.ipynb', в котором параметр 'weighting_of_views' имеет значение 'TRUE' (MI_v1_MOFA_weighted) или 'FALSE' (MI_v1_MOFA). '07_Comparison_configs.csv': Пример указания входного файла конфигурации для выполнения скрипта '07_Compare_Models.ipynb'. (B) «FIG07_Variance_Model_Comparison», показывающая общую объясненную дисперсию для каждого вида (ось y) для различных моделей по всем факторам, указанным в модели. (C) «FIG07_Feature_Correlations», показывающий корреляцию весов коэффициентов признаков между различными конфигурациями. Пожалуйста, нажмите здесь, чтобы загрузить этот файл.
Дополнительный рисунок 4: Мультиомный эффект интегрирования - использование только протеомных данных. Результирующие закономерности фиксируются латентными факторами при использовании только протеомных данных в качестве входных данных. (A) FIG04_Factor_Association_Numerical_Features: корреляция Пирсона между значениями факторов и клиническими переменными (СРБ, КФК). (B) FIG04_Factor_Association_Categorical_Features: Блочная диаграмма сравнения значений факторов для каждой временной точки пациентов с ОКС и контрольной группы. Пожалуйста, нажмите здесь, чтобы загрузить этот файл.
Дополнительный файл 1: Supplementary_File_
Running_Pipeline_with_Exemplary_Data. Описание того, как запустить конвейер на данных примера и ожидаемых выходных данных, приведено в дополнительном файле. Пожалуйста, нажмите здесь, чтобы загрузить этот файл.
Дополнительный видеофайл 1: Видео захвата экрана протокола. Пожалуйста, нажмите здесь, чтобы загрузить этот файл.