$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Siguiendo este protocolo, se obtuvieron resultados representativos para estudiar las asociaciones entre las proteínas mitocondriales (Tabla 2) y ocho categorías de enfermedades cardiovasculares (Tabla 3). En estas categorías, encontramos 363.567 publicaciones publicadas desde 2012 hasta octubre de 2022 (362.878 categorizadas por metadatos MeSH, 6.923 categorizadas por imputación de etiqueta). Todas las publicaciones tenían títulos, 276.524 tenían resúmenes y 51.065 tenían el texto completo disponible. En total, se identificaron 584 de las 1.687 proteínas mitocondriales consultadas en las publicaciones, mientras que se identificaron 3.284 de las 8.026 proteínas funcionalmente relacionadas consultadas. En total, se identificaron 14 proteínas únicas con puntuaciones significativas en todas las categorías de enfermedades, con un umbral de puntuación z de 3,0 (Figura 5). El análisis de la vía del reactoma de estas proteínas reveló 12 vías significativas para todas las enfermedades (Figura 6). Todas las proteínas, vías, enfermedades y puntuaciones se integraron en un gráfico de conocimiento (Tabla 4). Este gráfico de conocimiento se aprovechó para predecir 12.688 nuevas asociaciones proteína-enfermedad y se filtró con una puntuación de probabilidad de 0,90 para producir 1.583 predicciones de alta confianza. En la Figura 7 se muestra un ejemplo destacado de dos asociaciones proteína-enfermedad, ilustrado en el contexto de otras entidades biológicas relevantes relacionadas funcionalmente con las proteínas. Las métricas de evaluación del modelo se presentan en la Tabla 5.

Figura 1: Vista dinámica del flujo de trabajo. Esta figura representa los cuatro pasos principales de este flujo de trabajo. En primer lugar, las proteínas relevantes se seleccionan en función de los términos GO proporcionados por el usuario (por ejemplo, componentes celulares), y las categorías de enfermedades se preparan en función de los identificadores MeSH de enfermedades proporcionados por el usuario. En segundo lugar, las asociaciones entre proteínas y enfermedades se calculan en la etapa de minería de textos. Las publicaciones dentro de un determinado rango de fechas se descargan e indexan. Las publicaciones que estudian la enfermedad se identifican (a través de etiquetas MeSH y, opcionalmente, a través de etiquetas imputadas), y sus textos completos se descargan e indexan. Los nombres de las proteínas se consultan en las publicaciones y se utilizan para calcular las puntuaciones de asociación proteína-enfermedad. A continuación, tras la minería de textos, estas puntuaciones ayudan a identificar las principales asociaciones de proteínas y vías. Finalmente, se construye un grafo de conocimiento que abarca estas proteínas, enfermedades y sus relaciones dentro de la base de conocimiento biomédico. Las nuevas asociaciones proteína-enfermedad se predicen en función del gráfico de conocimiento construido. Estos pasos utilizan los datos más recientes disponibles de las bases de conocimiento biomédico y PubMed. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Arquitectura técnica del flujo de trabajo. Los detalles técnicos de este flujo de trabajo se ilustran en esta figura. El usuario proporciona los números del árbol MeSH de las categorías de enfermedades y los términos GO. Los documentos de texto se descargan de PubMed, los documentos relevantes para la enfermedad se identifican en función de las etiquetas MeSH proporcionadas, y los documentos sin etiquetas MeSH que indican el tema reciben etiquetas de categoría imputadas. Se adquieren las proteínas asociadas con los términos GO proporcionados. Este conjunto de proteínas se amplía para incluir proteínas que están relacionadas funcionalmente a través de interacciones proteína-proteína, vías biológicas compartidas y dependencia de factores de transcripción. Estas proteínas se consultan en documentos relevantes para la enfermedad y se puntúan mediante CaseOLAP. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Ejemplo de un documento procesado. Aquí se presenta un ejemplo de un documento de texto analizado e indexado. En orden, los campos relevantes indican el nombre del índice (_index, _type), el ID de PubMed (_id, pmid), las subsecciones del documento (título, resumen, full_text, introducción, métodos, resultados, discusión) y otros metadatos (año, MeSH, ubicación, revista). Solo con fines de visualización, las subsecciones del documento se truncan con puntos suspensivos. El campo MeSH contiene los temas del documento, que a veces pueden ser proporcionados por nuestro paso de imputación de etiquetas. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Esquema del gráfico de conocimiento y recursos biomédicos. En esta figura se muestra el esquema del gráfico de conocimiento. Cada nodo y arista representa un tipo de nodo o arista, respectivamente. Los límites entre las enfermedades cardiovasculares (ECV) y las proteínas se ponderan mediante las puntuaciones de CaseOLAP. Los bordes de la interacción proteína-proteína (PPI) se ponderan mediante puntuaciones de confianza STRING. Los bordes de la dependencia del factor de transcripción (TFD) derivados de GRNdb/GTEx, los bordes del árbol de enfermedades derivados del MeSH y los bordes de la vía derivados del reactoma no están ponderados. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Principales asociaciones proteína-enfermedad. Esta figura presenta proteínas mitocondriales significativas para cada categoría de enfermedad. La transformación de la puntuación Z se aplicó a las puntuaciones de CaseOLAP dentro de cada categoría para identificar proteínas significativas utilizando un umbral de 3,0. (Arriba) Número de proteínas mitocondriales significativas para cada enfermedad: Estos gráficos de violín representan la distribución de las puntuaciones z para las proteínas en cada categoría de enfermedad. El número total de proteínas significativas para cada categoría de enfermedad se muestra encima de cada gráfico de violín. Se identificaron un total de 14 proteínas únicas como significativas en todas las enfermedades, y algunas proteínas fueron significativas para múltiples enfermedades. (Abajo) Proteínas con mayor puntuación: El mapa de calor muestra las 10 proteínas principales que obtuvieron las puntuaciones z promedio más altas en todas las enfermedades. Los valores en blanco representan la ausencia de puntuación obtenida entre la proteína y la enfermedad. Haga clic aquí para ver una versión más grande de esta figura.

Figura 6: Principales asociaciones vía-enfermedad. Esta figura ilustra las principales vías biológicas asociadas con las categorías de enfermedades estudiadas, según se determina mediante el análisis de la vía del actoma. Todos los análisis de vía se filtraron con p < 0,05. Los valores del mapa de calor representan la puntuación z promedio de todas las proteínas dentro de la vía. (Arriba) Vías conservadas entre todas las enfermedades: En general, se identificaron 14 proteínas relevantes para todas las categorías de enfermedades, y se revelaron 12 vías conservadas entre todas las categorías de enfermedades. Se construyó un dendrograma basado en la estructura jerárquica de la vía para vincular las vías con funciones biológicas similares. La altura del dendrograma representa la profundidad relativa dentro de la jerarquía de vías; Las funciones biológicas amplias tienen extremidades más largas, y las vías más específicas tienen extremidades más cortas. (Abajo) Vías distintas a una categoría de enfermedad: El análisis de vías se realizó utilizando proteínas que lograron una puntuación z significativa en cada enfermedad. Las tres vías principales con los valores p más bajos asociados con cada enfermedad se muestran e indican con asteriscos. Las vías podrían estar entre las tres primeras en múltiples enfermedades. Haga clic aquí para ver una versión más grande de esta figura.

Figura 7: Aplicación del aprendizaje profundo para completar gráficos de conocimiento. En esta figura se presenta un ejemplo de aplicación del aprendizaje profundo a un gráfico de conocimiento específico de una enfermedad. Se predicen relaciones ocultas entre las proteínas y la enfermedad, y estas se indican en azul. Se muestran las probabilidades calculadas para ambas predicciones, con valores que van de 0,0 a 1,0 y donde 1,0 indica una predicción fuerte. Se incluyen varias proteínas con interacciones conocidas, que representan las interacciones proteína-proteína, la dependencia de factores de transcripción y las vías biológicas compartidas. Para la visualización, se muestra un subgrafo de algunos nodos con relevancia para el ejemplo resaltado. Clave: CI = cardiopatía isquémica; R-HSA-1430728 = metabolismo; O14949 = citocromo b-c1 complejo subunidad 8; P17568 = NADH deshidrogenasa (ubiquinona) 1 subcomplejo beta subunidad 7; Q9NYF8 Factor de transcripción asociado a Bcl-2 1, puntuación: 7,24 x 10−7; P49821 = NADH deshidrogenasa (ubiquinona) flavoproteína 1, mitocondrial, puntuación: 1,06 x 10−5; P31930 = citocromo b-c1 complejo subunidad 1, mitocondrial, puntuación: 4,98 x 10−5; P99999 = citocromo c, puntuación: 0,399. Haga clic aquí para ver una versión más grande de esta figura.
Tabla 1: Flujo de trabajo y pasos de limitación de velocidad. En esta tabla se presentan estimaciones aproximadas del tiempo de cálculo para cada etapa del flujo de trabajo. Las opciones para incluir componentes de la canalización cambiarán el tiempo de ejecución total necesario para completar el análisis. La estimación del tiempo total varía en función de los recursos computacionales disponibles, incluidas las especificaciones de hardware y la configuración del software. Como estimación aproximada, el protocolo tardó 36 h de tiempo de ejecución activo en ejecutarse en nuestro servidor computacional, con seis núcleos, 32 Gb de RAM y 2 Tb de almacenamiento, pero esto puede ser más rápido o más lento en otros dispositivos. Haga clic aquí para descargar esta tabla.
Tabla 2: Ensamblaje automático de las proteínas componentes celulares. Esta tabla muestra el número de proteínas asociadas con un componente celular determinado (es decir, el término GO), las proteínas relacionadas funcionalmente con ellos a través de interacciones proteína-proteína (PPI), vías compartidas (PW) y dependencia del factor de transcripción (TFD). El número de proteínas totales es el número de proteínas de todas las categorías anteriores combinadas. Todas las proteínas funcionalmente relacionadas se obtuvieron utilizando los parámetros predeterminados de CaseOLAP LIFT. Haga clic aquí para descargar esta tabla.
Tabla 3: Estadísticas de imputación de etiquetas MeSH. Esta tabla muestra las categorías de enfermedades, los números del árbol MeSH utilizados como término principal de todas las enfermedades incluidas en la categoría, el número de artículos de PubMed encontrados en cada categoría entre 2012 y 2022 y el número de artículos adicionales incluidos en función del paso de imputación de la etiqueta. Haga clic aquí para descargar esta tabla.
Tabla 4: Estadística de construcción de grafos de conocimiento. En esta tabla se describen las estadísticas del tamaño del gráfico de conocimiento construido, incluidos los distintos nodos y tipos de borde. Las puntuaciones de CaseOLAP representan la relación entre una proteína y una categoría de enfermedad cardiovascular (ECV). Haga clic aquí para descargar esta tabla.
Tabla 5: Estadísticas y validaciones de predicción de gráficos de conocimiento. En esta tabla se presentan las métricas de evaluación para la predicción del vínculo del gráfico de conocimiento de las asociaciones proteína-enfermedad nuevas/ocultas. Los bordes del gráfico de conocimiento se dividieron en conjuntos de datos de entrenamiento y prueba 70/30, y la conectividad del gráfico de los bordes se conservó en ambos conjuntos de datos. La precisión indica la proporción de predicciones clasificadas correctamente, mientras que la precisión equilibrada corrige el desequilibrio de clase. La especificidad indica la proporción de predicciones negativas correctamente clasificadas. La precisión indica la proporción de predicciones positivas correctas de todas las predicciones positivas, mientras que la recuperación indica la proporción de predicciones positivas correctas de todas las aristas positivas (es decir, asociaciones proteína-enfermedad identificadas a través de la minería de texto). La puntuación F1 es la media armónica de la precisión y la recuperación. El área bajo la curva de características operativas del receptor (AUROC) describe qué tan bien el modelo distingue entre predicciones positivas y negativas, donde 1.0 indica un clasificador perfecto. El área bajo la curva de precisión-recuperación (AUPRC) mide el equilibrio entre la precisión y la recuperación en diferentes umbrales de probabilidad, con valores más altos que indican un mejor rendimiento. Haga clic aquí para descargar esta tabla.