Sobre la base de imágenes de campo claro y ML, el proceso de diferenciación general se puede monitorear y optimizar de manera inteligente. En la etapa de PSC, desarrollamos un modelo de ML que pudo predecir la eficiencia de diferenciación final de acuerdo con las características morfológicas de las colonias iniciales de PSC, para determinar el momento más adecuado o apropiado para iniciar la diferenciación (Figura 4A,B). La eficiencia de diferenciación predicha por el modelo de bosque aleatorio está altamente correlacionada con la verdadera eficiencia de diferenciación (r de Pearson = 0.76, P < 0.0001) (Figura 4B). El modelo entrenado también resalta las características que son más importantes para la diferenciación. Entre todas las características morfológicas de la colonia, la desviación estándar, la relación mínima y mínima/máxima de las distancias de contorno central (CCD), así como la circunferencia, el área, la relación área/circunferencia, la convexidad y la circularidad, son las 8 características con el peso más importante. La relación entre estas características y la eficiencia final sugiere que las colonias iniciales de PSC con área moderada y con periferias más largas e irregulares tendían a poseer una mayor eficiencia de diferenciación (Figura 4A), lo que nos inspira a mejorar la eficiencia de diferenciación al aumentar el tiempo de procesamiento de la solución de digestión para producir colonias más pequeñas con límites más largos e irregulares (ver paso 1.3.1 del Protocolo). La monitorización basada en ML de las colonias de PSC y las operaciones optimizadas de paso de células realizan la optimización del estado inicial de la célula.
En la etapa I de la diferenciación cardíaca, evaluamos y ajustamos la dosis de CHIR (un inductor de la diferenciación cardíaca temprana) mediante el uso de ML. Utilizando la regresión logística, la dosis de CHIR se puede evaluar temprano utilizando imágenes de campo claro de lapso de tiempo de 0 a 12 h. El clasificador de regresión logística logra una precisión del 93,1 %, una precisión del 88,7 %, un 94,5 % de recuperación, una puntuación F1 del 91,1 % y un AUC del 97,2 % cuando se selecciona la duración de CHIR como 24 h. Las puntuaciones de desviación (resultado predicho) están altamente correlacionadas con la "concentración de ΔCHIR" (resultado verdadero) para cada condición de dosis de CHIR en experimentos ( r de Pearson = 0,82, P < 0,0001) (Figura 4C, D), lo que sugiere que la predicción de ML puede reflejar la desviación de las dosis de CHIR de las óptimas. Con la evaluación temprana de las dosis de CHIR, podemos ajustar la duración o la concentración del tratamiento de CHIR hacia el óptimo antes de las 48 h, lo que nos permite rectificar rápidamente la trayectoria celular mal diferenciada y mantener la diferenciación de CM con alta eficiencia.
También construimos modelos de ML para reconocer CPC y CM de manera informativa a partir de imágenes de campo claro en la etapa II y la etapa III de diferenciación (Figura 5A-D). Al introducir imágenes de campo claro de células vivas, los modelos de ML entrenados pueden predecir la distribución regional de CPC y CM y evaluar la eficiencia de la diferenciación final de forma no invasiva. Para el reconocimiento de CPC, las máscaras de segmentación de CPC predichas por ResNeSt y Grad-CAM coinciden con las máscaras anotadas manualmente (Figura 5A), con un IoU medio del 59,0%. La proporción prevista de regiones CPC también puede servir como indicador de la eficiencia de diferenciación final (r de Pearson = 0,88, P < 0,0001) (Figura 5B). Para el reconocimiento de CM, el modelo pix2pix puede generar imágenes de fluorescencia de cTnT que son similares a las imágenes de fluorescencia de cTnT verdaderas (obtenidas experimentalmente) (Figura 5C), con una alta correlación entre el Índice de Eficiencia de Diferenciación de pozo completo predicho y verdadero (r de Pearson = 0.93, P < 0.0001) (Figura 5D). Este enfoque evita el daño irreversible a las células causado por la tinción de inmunofluorescencia o la clasificación por flujo. Sobre la base de una sonda fotoactivada (DACT-1), logramos con éxito una purificación eficiente de CPC selectiva por región sin biomarcadores (Figura 5E, F), lo que permite la purificación en tiempo real del tipo de célula deseado durante el proceso de diferenciación.
Por lo tanto, al aprovechar las imágenes de campo claro de células vivas y el aprendizaje automático, la metodología realiza la predicción del linaje celular en tiempo real y la evaluación de la eficiencia en todo el proceso de diferenciación, modulando y estabilizando la diferenciación de PSC.

Figura 1: Esquema del flujo de trabajo de diferenciación de CM asistido por ML. El experimentador realiza la diferenciación cardíaca y obtiene imágenes celulares de campo claro de lapso de tiempo de un microscopio; las imágenes en cada etapa de la diferenciación de CM se pasan a modelos de ML entrenados para la predicción; Utilizando la predicción como retroalimentación, los experimentadores modulan y optimizan el esquema de diferenciación en tiempo real para lograr una diferenciación estable y de alta eficiencia. Barra de escala = 1 mm. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Adquisición de imágenes celulares. (A) Ejemplo de una imagen de celda viva de campo claro de la etapa PSC con un 70% de confluencia celular. (B) Ejemplo de una imagen de células vivas de campo claro de la etapa PSC con una confluencia de células del 80-90%. (C) Ejemplo de una imagen de celda viva de campo claro de la etapa CPC. (D) Ejemplo de una imagen de célula viva de campo claro de la etapa CM. (E) Ejemplo de campo claro y fluorescencia después de la tinción de inmunofluorescencia desde el mismo campo de visión. (De la A a la E) Barra de escala = 250 μm. Abreviaturas: PSC = célula madre pluripotente; CPC = célula progenitora cardíaca; MC = cardiomiocitos; cTnT = troponina T cardíaca. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Capturas de pantalla para el uso de ML. (A-C) Capturas de pantalla representativas de ML en la etapa de PSC, incluyendo (A) la preparación del conjunto de datos, (B) el rendimiento del modelo de prueba y (C) la interpretación de la importancia de las características. (D-F) Capturas de pantalla representativas del ML en la etapa I, incluida la preparación del conjunto de datos (D) y la evaluación del modelo (E,F). (G-I) Capturas de pantalla representativas del aprendizaje automático en la etapa II, incluida la preparación del conjunto de datos (G), el entrenamiento del modelo (H) y la evaluación del modelo (I). (J-L) Capturas de pantalla representativas de ML en la etapa III, incluyendo (J) entrenamiento del modelo y (K,L) evaluación del modelo. Abreviaturas: ML = aprendizaje automático; PSC = célula madre pluripotente. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Resultados representativos en la etapa de PSC y la etapa I para la diferenciación de CM basada en ML. (A) Resultados de la visualización de características en la etapa de PSC. Se muestra la relación entre la eficiencia de diferenciación y las ocho características más importantes. La importancia de la característica viene determinada por el modelo de ML entrenado. El rango de cada función se divide en 20 contenedores. Los índices de eficiencia de diferenciación para los pozos dentro de cada contenedor se promedian y se muestran por color. La tendencia del cambio de color representa cómo cada rasgo morfológico influye en la eficiencia de la diferenciación final. Estos resultados en conjunto sugieren que el área moderada, las circunferencias más largas, las distancias de contorno central más variables, la circularidad más baja y la convexidad más alta son más propicias para la diferenciación. (B) Evaluación del desempeño de ML en la etapa de PSC mediante análisis de correlación entre el Índice de Eficiencia de Diferenciación verdadero y el pronosticado. La alta correlación indica que el potencial de diferenciación de las colonias de PSC puede predecirse a partir de sus características morfológicas. n = 584 pozos. (C) Evaluación del rendimiento de ML en la etapa I utilizando un análisis de correlación entre las puntuaciones de desviación predichas y las concentraciones verdaderas de ΔCHIR para cada condición de dosis CHIR en un lote. Las puntuaciones de desviación (que van de -1 a 1) se predicen de forma no invasiva mediante el aprendizaje automático utilizando flujos de imágenes de campo claro de 0 a 12 h. Las concentraciones de ΔCHIR (..., -4 μM, -2 μM, 0, 2 μM, 4 μM, ...) se determinan experimentalmente mediante los resultados finales de diferenciación para medir la desviación real de las condiciones óptimas para cada condición CHIR. Las puntuaciones de desviación predichas son muy indicativas de las concentraciones reales de ΔCHIR, lo que sugiere que la predicción de ML puede servir como señal para la evaluación y el ajuste de la dosis de CHIR. Los recuadros azul y rojo representan condiciones de subdosis y sobredosis, respectivamente. (D) Evaluación del rendimiento del ML en la etapa I mediante validación entre lotes. En cada ronda, un lote se usa para pruebas, mientras que otros son para entrenamiento, para probar la capacidad de generalización de los modelos de ML en nuevos lotes. Se realiza un análisis de correlación entre las puntuaciones de desviación predichas y las concentraciones reales de ΔCHIR (bajo una duración CHIR de 24 h). El color de los puntos representa diferentes lotes de prueba. n = 20 dosis de CHIR. Esta cifra fue tomada de Yang et al.35. Abreviaturas: ML = aprendizaje automático; PSC = célula madre pluripotente; CHIR = CHIR99021. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Resultados representativos en la etapa de CPC y la etapa de MC para la diferenciación de MC basada en ML. (A) Resultado típico de ML para el reconocimiento de CPC en la etapa II. Se muestran las imágenes de fluorescencia cTnT verdaderas en el día 12 (izquierda), las regiones CPC anotadas manualmente (centro) y las regiones CPC predichas por ML utilizando imágenes de campo claro en el día 6 (derecha). Los resultados pronosticados se parecen mucho a los resultados experimentales reales. Barra de escala = 1 mm. (B) Evaluación del rendimiento de ML en la etapa II mediante análisis de correlación entre el verdadero Índice de Eficiencia de Diferenciación (a partir del día 12 de las etiquetas de fluorescencia de cTnT) y el porcentaje previsto de regiones de CPC (a partir de las imágenes de campo claro del día 6). La alta correlación sugiere que la eficiencia de la diferenciación puede predecirse de forma no invasiva en la etapa II. Los verdaderos índices de eficiencia de diferenciación se normalizan entre 0% y 100%. n = 35 pozos. (C) Resultado típico de ML para el reconocimiento de MC en la etapa III. Se muestran los resultados de fluorescencia cTnT verdadera (izquierda), los resultados de fluorescencia cTnT pronosticados (centro) y el mapa de calor para comparar las intensidades de fluorescencia predichas y verdaderas en cada píxel (derecha). Las imágenes de fluorescencia se redimensionan a 512 x 512 píxeles, y los números de los contenedores del mapa de calor representan los recuentos de frecuencia de píxeles por 100. Una gran proporción de píxeles se encuentra a lo largo de la línea diagonal del mapa de calor, lo que indica que las intensidades de fluorescencia predichas y verdaderas están cerca. Barra de escala = 1 mm. (D) Evaluación del rendimiento del ML en la etapa III mediante análisis de correlación entre los índices de eficiencia de diferenciación verdaderos y predichas. Los índices de eficiencia de diferenciación verdaderos y previstos se normalizan entre el 0 % y el 100 %. n = 36 pozos. (E) Efecto de purificación de CPC identificado por imagen del día 6. Después de FACS y 6 días de cultivo, las CPC identificadas con imágenes no marcadas muestran una alta pureza de CM en comparación con las CPC no marcadas con DACT-1 y las células del grupo de control (CTL). Barra de escala = 100 μm. (F) Análisis cuantitativo del efecto de purificación comparando el porcentaje de células cTnT+ en (E). Los datos son medias ± SD. n = 5 imágenes. * P < 0,05; P < 0,0001 por ANOVA de un factor seguido de las pruebas de comparaciones múltiples de Dunnett. Esta cifra fue tomada de Yang et al.35. Abreviaturas: ML = aprendizaje automático; PSC = célula madre pluripotente; CPC = célula progenitora cardíaca; MC = cardiomiocitos; cTnT = troponina T cardíaca. Haga clic aquí para ver una versión más grande de esta figura.
| Problema observado | Posible razón | Solución |
| Los modelos de ML no funcionan bien en el conjunto de entrenamiento. | 1. El entrenamiento del modelo de ML no converge bien. 2. Para el ML tradicional, las características de la imagen extraída no son lo suficientemente informativas como para reflejar los estados y linajes de las células. 3. Para el aprendizaje profundo, el poder de representación de la red neuronal diseñada no es suficiente para realizar la tarea. 4. La tarea en sí es difícil de aprender. | 1. Ajustar los hiperparámetros, por ejemplo, aumentar el número de épocas y modificar la tasa de aprendizaje. 2. Observar las imágenes para encontrar pistas morfológicas sobre los estados de las células. Diseñar características biológicamente plausibles. 3. Modificar la arquitectura de red para aumentar su complejidad. 4. Examine el conjunto de datos y asegúrese de que las características de las celdas objetivo se puedan identificar fácilmente. Si el modelo no logra aprender la tarea, intente aplicar ML en una etapa en la que las pistas de imagen sean más claras o diseñar una tarea más simple. |
| Los modelos de ML no funcionan bien en el conjunto de entrenamiento, pero no en el conjunto de pruebas. | 1. El modelo sobreajusta el conjunto de entrenamiento. | 1. Enriquezca los conjuntos de datos de entrenamiento y vuelva a entrenar el modelo. Aumente la diversidad de los conjuntos de datos de entrenamiento incluyendo más líneas celulares, condiciones de diferenciación y condiciones de imagen. En el caso del aprendizaje automático tradicional, el uso de la selección de características para disminuir el número de características de entrada también puede aumentar la capacidad de generalización del modelo. |
| Los modelos de ML no funcionan bien en nuevos lotes o nuevas líneas celulares. | 1. Cambios en los parámetros del microscopio y de la imagen. 2. Las características morfológicas de las diferentes líneas celulares pueden ser diferentes. | 1. Asegúrese de que el dispositivo de imagen sea el mismo que el del entrenamiento del modelo. 2. Recopile datos etiquetados adquiridos de nuevas líneas celulares y/o nuevas condiciones de imagen, vuelva a entrenar o ajuste los modelos de ML. |
| La modulación guiada por ML del proceso de diferenciación no parece mejorar el resultado de la diferenciación. | 1. La salida de ML es inexacta. 2. Existen problemas en los reactivos o procedimientos experimentales. 3. La línea celular tiene problemas subyacentes, carece de la capacidad de diferenciarse. | 1. Intente los pasos de solución de problemas mencionados anteriormente. 2. Inspeccionar los reactivos de laboratorio y los procedimientos experimentales. 3. Cambiar las líneas celulares. |
| La contaminación del tipo de célula todavía existe después de la purificación. | 1. Resultados de predicción inexactos. 2. Se encapsularon algunas células no deseadas ubicadas en el borde del área purificada. | 1. Optimice los resultados pronosticados por ML. 2. Utilice los resultados pronosticados por ML de manera más conservadora, es decir, una reducción adecuada en el tamaño de la región CM. |
| Mal estado de la célula después de la purificación. | 1. Fototoxicidad del láser. 2. Proceso de operación lento. 3. Daño celular causado por la digestión. 4. Daño celular causado por el proceso de clasificación de flujo. | 1. Elimine las células no deseadas mediante irradiación láser en lugar de las células objetivo. 2. Operación más rápida. 3. Ajuste el método de paso, como reducir la concentración de enzimas digestivas. 4. Ajuste el método de clasificación, como reducir la velocidad de flujo de celda establecida durante el proceso de clasificación. |
Tabla 1: Tabla de solución de problemas.