$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В соответствии с этим протоколом были получены репрезентативные результаты для изучения ассоциаций между митохондриальными белками (Таблица 2) и восемью категориями сердечно-сосудистых заболеваний (Таблица 3). В этих категориях мы нашли 363 567 публикаций, опубликованных с 2012 года по октябрь 2022 года (362 878 категоризированных по метаданным MeSH, 6 923 классифицированных по вменению ярлыков). Все публикации имели названия, 276 524 – аннотации, 51 065 – полный текст. В целом, 584 из 1687 опрошенных митохондриальных белков были идентифицированы в публикациях, в то время как 3284 из 8026 функционально связанных белков были идентифицированы. В общей сложности было идентифицировано 14 уникальных белков со значимыми показателями по всем категориям заболеваний с пороговым значением z-оценки 3,0 (рис. 5). Анализ реактомного пути этих белков выявил 12 путей, значимых для всех заболеваний (рис. 6). Все белки, пути, заболевания и баллы были интегрированы в граф знаний (табл. 4). Этот граф знаний был использован для прогнозирования 12 688 новых ассоциаций белков и заболеваний и отфильтрован с оценкой вероятности 0,90, чтобы получить 1 583 прогноза с высокой степенью достоверности. На рисунке 7 показан пример двух ассоциаций белка и заболевания, проиллюстрированный в контексте других соответствующих биологических объектов, функционально связанных с белками. Показатели оценки модели представлены в таблице 5.

Рисунок 1: Динамический вид рабочего процесса. На этом рисунке показаны четыре основных этапа этого рабочего процесса. Во-первых, соответствующие белки отбираются на основе терминов GO, предоставленных пользователем (например, клеточные компоненты), а категории заболеваний подготавливаются на основе предоставленных пользователем идентификаторов MeSH. Во-вторых, ассоциации между белками и заболеваниями вычисляются на этапе интеллектуального анализа текста. Публикации в определенном диапазоне дат загружаются и индексируются. Публикации, посвященные изучению болезней, идентифицируются (с помощью меток MeSH и, возможно, с помощью вмененных меток), а их полные тексты загружаются и индексируются. Названия белков запрашиваются в публикациях и используются для расчета баллов связи между белком и заболеванием. Затем, после интеллектуального анализа текста, эти оценки помогают определить основные ассоциации белков и путей. Наконец, строится граф знаний, охватывающий эти белки, болезни и их взаимосвязи в базе биомедицинских знаний. Новые ассоциации между белками и заболеваниями предсказываются на основе построенного графа знаний. В этих шагах используются самые последние доступные данные из биомедицинских баз знаний и PubMed. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 2: Техническая архитектура рабочего процесса. Технические детали этого рабочего процесса проиллюстрированы на этом рисунке. Пользователь предоставляет номера MeSH-деревьев категорий заболеваний и термин(ы) GO. Текстовые документы загружаются из PubMed, документы, относящиеся к заболеванию, идентифицируются на основе предоставленных меток MeSH, а документы без меток MeSH, указывающих на тему, получают метки вмененных категорий. Белки, ассоциированные с предоставленным термином (членами) GO, приобретаются. Этот белковый набор расширяется за счет включения белков, которые функционально связаны через белок-белковые взаимодействия, общие биологические пути и зависимость от транскрипционных факторов. Эти белки запрашиваются в документах, относящихся к заболеванию, и оцениваются CaseOLAP. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 3: Пример обработанного документа. Пример разобранного, индексированного текстового документа представлен здесь. По порядку в соответствующих полях указывается название индекса (_index, _type), идентификатор PubMed (_id, pmid), подразделы документа (название, аннотация, full_text, введение, методы, результаты, обсуждение) и другие метаданные (год, MeSH, местоположение, журнал). Только в целях отображения подразделы документа усекаются с помощью многоточия. Поле MeSH содержит темы документа, которые иногда могут быть предоставлены нашим шагом импутации метки. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 4: Схема графа знаний и биомедицинские ресурсы. На этом рисунке показана схема графа знаний. Каждый узел и ребро представляют собой узел или тип ребра соответственно. Границы между сердечно-сосудистыми заболеваниями (ССЗ) и белками взвешиваются по шкале CaseOLAP. Границы белок-белкового взаимодействия (ИПП) взвешиваются по доверительным оценкам STRING. Ребра зависимости транскрипционного фактора (TFD), полученные от GRNdb/GTEx, ребра дерева заболеваний, производные от MeSH, и ребра путей, полученные от реактома, являются невзвешенными. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 5: Основные ассоциации белковых заболеваний. На этом рисунке представлены митохондриальные белки, значимые для каждой категории заболеваний. Преобразование Z-критерия было применено к баллам CaseOLAP в каждой категории для идентификации значимых белков с использованием порогового значения 3,0. (Наверх) Количество митохондриальных белков, значимых для каждого заболевания: Эти графики показывают распределение z-оценок для белков в каждой категории заболеваний. Общее количество белков, значимых для каждой категории заболеваний, показано над каждым графиком скрипки. В общей сложности 14 уникальных белков были идентифицированы как значимые для всех заболеваний, а некоторые белки были значимыми для нескольких заболеваний. (Внизу) Белки, набравшие наибольшее количество баллов: Тепловая карта отображает 10 белков, получивших самые высокие средние z-баллы по всем заболеваниям. Пустые значения не представляют собой полученную оценку между белком и болезнью. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 6: Основные ассоциации между путями и заболеваниями. На этом рисунке показаны основные биологические пути, связанные с изучаемыми категориями заболеваний, определенные с помощью анализа реактомного пути. Все анализы путей были отфильтрованы с p < 0,05. Значения тепловой карты представляют собой среднюю z-оценку всех белков в пути. (Наверх) Пути сохранения среди всех заболеваний: В целом, было идентифицировано 14 белков, имеющих отношение ко всем категориям заболеваний, и было выявлено 12 консервативных путей среди всех категорий заболеваний. На основе иерархической структуры путей была построена дендрограмма, связывающая эти пути со сходными биологическими функциями. Высота древовидной диаграммы представляет собой относительную глубину в иерархии путей; Широкие биологические функции имеют более длинные конечности, а более специфические пути имеют более короткие конечности. (Внизу) Пути, отличающиеся от категории заболевания: Анализ путей был проведен с использованием белков, достигших значимого z-показателя при каждом заболевании. Три основных пути с наименьшими p-значениями, связанными с каждым заболеванием, показаны и обозначены звездочками. Эти пути могут входить в тройку лидеров при нескольких заболеваниях. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 7: Применение глубокого обучения для завершения графа знаний. Пример применения глубокого обучения к графу знаний по конкретному заболеванию представлен на этом рисунке. Скрытые взаимосвязи между белками и болезнями предсказываются, и они обозначены синим цветом. Отображаются вычисленные вероятности для обоих прогнозов со значениями в диапазоне от 0,0 до 1,0 и 1,0, указывающими на сильный прогноз. Включены несколько белков с известными взаимодействиями, представляющими белок-белковые взаимодействия, зависимость от транскрипционных факторов и общие биологические пути. Для визуализации показан подграф из нескольких узлов, имеющих отношение к выделенному примеру. Ключевые признаки: ИБС = ишемическая болезнь сердца; R-HSA-1430728 = метаболизм; O14949 = субъединица 8 комплекса цитохрома b-c1; P17568 = НАДН-дегидрогеназа (убихинон) 1 бета-субъединица 7; Q9NYF8 Bcl-2-ассоциированный транскрипционный фактор 1, оценка: 7,24 x 10−7; P49821 = НАДН-дегидрогеназа (убихинон) флавопротеин 1, митохондриальный, оценка: 1,06 x 10−5; P31930 = субъединица комплекса цитохрома b-c1 1, митохондриальная, оценка: 4,98 x 10−5; P99999 = цитохром С, балл: 0,399. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.
Таблица 1: Этапы рабочего процесса и ограничения скорости. В этой таблице представлены приблизительные оценки времени вычислений для каждого этапа рабочего процесса. Параметры включения компонентов конвейера изменят общее время выполнения, необходимое для завершения анализа. Общая оценка времени зависит от доступных вычислительных ресурсов, включая технические характеристики оборудования и настройки программного обеспечения. По приблизительным подсчетам, протокол занял 36 часов активного времени работы на нашем вычислительном сервере с шестью ядрами, 32 Гб оперативной памяти и 2 Тб хранилища, но это может быть быстрее или медленнее на других устройствах. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Таблица 2: Автоматическая сборка белков клеточного компонента. В этой таблице показано количество белков, ассоциированных с данным клеточным компонентом (т.е. термином GO), белков, функционально связанных с ними через белок-белковые взаимодействия (PPI), общие пути (PW) и зависимость от транскрипционного фактора (TFD). Общее количество белков — это количество белков из всех предыдущих категорий вместе взятых. Все функционально связанные белки были получены с использованием параметров CaseOLAP LIFT по умолчанию. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Таблица 3: Статистика вменения меток MeSH. В этой таблице отображаются категории заболеваний, номера деревьев MeSH, используемые в качестве родительского термина для всех заболеваний, включенных в категорию, количество статей PubMed, найденных в каждой категории с 2012 по 2022 год, и количество дополнительных статей, включенных на этапе вменения меток. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Таблица 4: Статистика построения графа знаний. В этой таблице описаны статистические данные по размеру построенного графа знаний, включая различные узлы и типы ребер. Баллы CaseOLAP отражают взаимосвязь между белком и категорией сердечно-сосудистых заболеваний (ССЗ). Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Таблица 5: Статистика прогнозирования и валидация графа знаний. В этой таблице представлены оценочные метрики для прогнозирования связи графа знаний для новых и скрытых ассоциаций белков и заболеваний. Ребра графа знаний были разделены на обучающие и тестовые наборы данных в соотношении 70/30, а графовая связность ребер была сохранена в обоих наборах данных. Точность указывает долю правильно классифицированных прогнозов, а сбалансированная точность корректирует дисбаланс классов. Специфичность указывает на долю правильно классифицированных негативных прогнозов. Точность указывает на долю правильных положительных прогнозов из всех положительных прогнозов, в то время как отзыв указывает на долю правильных положительных прогнозов из всех положительных ребер (т. е. ассоциаций белка с заболеванием, выявленных с помощью интеллектуального анализа текста). Оценка F1 — это среднее гармоническое значение точности и запоминаемости. Область под кривой рабочих характеристик приемника (AUROC) показывает, насколько хорошо модель различает положительные и отрицательные прогнозы, при этом 1,0 указывает на идеальный классификатор. Область под кривой точности-полноты (AUPRC) измеряет компромисс между точностью и полнотой при различных пороговых значениях вероятности, при этом более высокие значения указывают на лучшую производительность. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.