$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Como todos sabemos, el cáncer de vejiga (BLCA) es uno de los tumores malignos más agresivos y metastásicos del mundo, y todavía existen problemas con los biomarcadores actuales del cáncer de vejiga, como la inexactitud, etc. Para identificar el pronóstico de los pacientes con BLCA y predecir los resultados de los pacientes con BLCA, la búsqueda de biomarcadores para el cáncer de vejiga y el establecimiento de modelos pronósticos son de gran importancia. Aunque se han desarrollado algunos métodos de investigación para biomarcadores, la mayoría de estos métodos actualmente se limitan a la transcriptómica, lo que inevitablemente conduce a la heterogeneidad en las muestras2. Además, estudiar solo los datos de transcriptómica a menudo no logra investigar los roles que desempeñan las diferentes subpoblaciones celulares, así como las funciones de los genes en distintas vías a nivel de célula única, lo que hace que investigaciones anteriores sean menos precisas yefectivas 3. Teniendo en cuenta que el análisis de célula única puede ser un reto para principiantes, se ha introducido una plataforma online para el análisis de célula única que les ayuda a aprender las habilidades rápidamente4. Por último, aunque no menos importante, incluso si se encuentra un solo gen como biomarcador adecuado mediante análisis transcriptómico y análisis de células individuales, no hay garantía de que el biomarcador sea aplicable a todas las cohortes, por lo que es necesario construir modelos pronósticos asociados al biomarcador para que las conclusiones sean más universalmenteaplicables 5. El algoritmo de aprendizaje automático 101 se refiere a la construcción de 101 modelos pronósticos utilizando una combinación de 10 algoritmos diferentes de aprendizaje automático, con el objetivo de identificar el modelo de pronóstico óptimo. La inclusión de algoritmos como el bosque aleatorio, XGBoost y SVM, que son más capaces de manejar datos complejos y muestran mayor estabilidad, ha dado lugar a que este algoritmo combinado demuestre una estabilidad notable. Para hacer este modelo pronóstico más preciso y relevante para el biomarcador, primero se realiza un análisis de correlación entre todos los genes y el biomarcador, luego se seleccionan unos 20-30 genes según los requisitos, y posteriormente se utiliza un algoritmo de aprendizaje automático 101 para construir el modelo pronóstico, seguido de una serie de análisis para finalizar los resultados.
En comparación con los biomarcadores predichos por el análisis transcriptómico simple de losúltimos 6, los biomarcadores del análisis unicelular y transcriptómico permiten una descomposición imparcial de tejidos o muestras en sus componentes celulares básicos. Permite la diferenciación clara de diferentes tipos celulares (como células T, células B y macrófagos) y el descubrimiento de nuevas subpoblaciones (como células T agotadas y células T reguladoras), así como la captura de procesos dinámicos continuos (como las trayectorias de diferenciación celular). Es como disponer frutas y leche por separado, permitiendo una visualización clara de cada componente y su cantidad. En comparación con los modelos deCox 7 de una sola cohorte, el modelo pronóstico construido usando aprendizaje automático 101 también es más preciso y científicamente sólido, ya que puede aprender automáticamente sobre las complejas interacciones no lineales entre variables a partir de los datos. Por ejemplo, el impacto de una mutación genética específica podría ser significativo solo en pacientes de ciertas edades y tamaños tumorales. Modelos de aprendizaje automático, como los bosques aleatorios y las redes neuronales, pueden capturar automáticamente estas interacciones de alto orden sin necesidad de especificaciónmanual 8. Las restricciones clave de aplicabilidad de señalización que indican que el conjunto de datos utilizado para el análisis debe incluir la gran mayoría de genes, sin que el número de genes sea demasiado bajo y que el número de genes usados para construir modelos pronósticos no sea demasiado alto, generalmente manteniéndose alrededor de 20-30, siendo lo óptimo. El estándar de control de calidad del conjunto de células individuales debe ser superior a 1000, el recuento de UMI por célula debe ser superior a 1000 y el número de genes por célula debe ser superior a 5009.
Aquí se ofrece un enfoque paso a paso para la identificación de nuevos biomarcadores a partir de conjuntos de datos transcriptómicos públicos y de conjuntos de datos unicelulares, tomando como ejemplo el papel de TRPM4 en BLCA. Se emplean múltiples métodos de investigación y conjuntos de datos diversos —incluyendo el Atlas del Genoma del Cáncer-Cáncer de Vejiga (TCGA-BLCA), el conjunto de datos de células unicelulares GSE145281 y los conjuntos de datos BLCA GSE32894 y GSE31684— para mejorar la precisión y aplicabilidad de los biomarcadores en oncología desde múltiples perspectivas y para avanzar en el estudio de TRPM4 en BLCA. El conjunto de datos TCGA-BLCA se obtuvo de la página web Xena de la Universidad de California, Santa Cruz (UCSC Xena). GSE32894 y GSE31684 se descargaron del Gene Expression Omnibus (GEO), y los datos de células únicas GSE145281 se obtuvieron del Tumor Immune Single-Cell Hub 2 (TISCH2). Además, se extrajeron datos sobre subtipos moleculares de BLCA y respuestas al tratamiento de archivos suplementarios de hojas de cálculo de un artículo relevante. A continuación, se realizan análisis bioinformáticos, análisis de células únicas y aprendizaje automático, estableciendo una metodología integrada de investigación de un solo gen.