$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Selección de estudios
La estrategia de búsqueda integral identificó inicialmente 540 registros de cuatro bases de datos. Tras la eliminación de 180 artículos duplicados, se revisaron 360 títulos y resúmenes. En esta etapa, se excluyeron 300 registros porque no involucraban a poblaciones de enfermería, carecían de intervenciones basadas en simulación o no se centraban en escenarios de emergencia o gastroenterología. Este proceso de selección resultó en la evaluación de 60 artículos en texto completo para determinar su elegibilidad. De estos, 28 artículos fueron excluidos debido a datos cuantitativos insuficientes para metaanálisis (por ejemplo, falta de medias post-prueba o desviaciones estándar), y 24 artículos fueron excluidos porque el texto completo no estaba disponible o no se publicaba en idiomas distintos al inglés. Finalmente, ocho estudios cumplieron todos los criterios de elegibilidad y se incluyeron en la síntesis cuantitativa final. El proceso de selección del estudio se ilustra en el diagrama de flujo PRISMA (Figura 1).
Características del estudio
Los ocho estudios involucraron a un total de 986 participantes. El principal resultado documentado en los estudios fue la adquisición de conocimientos, y los resultados secundarios fueron el rendimiento de habilidades, la capacidad de trabajo en equipo, la capacidad de pensar clínicamente, la responsabilidad profesional y la autoconfianza.
Los estudios incluidos variaron en diseño e incluyeron ensayos controlados aleatorizados, estudios cuasi-experimentales, estudios retrospectivos y estudios de validación prospectiva. La mayoría de los participantes eran estudiantes de enfermería de grado y internos en enfermería, aunque algunos estudios involucraban a enfermeros en formación que habían trabajado en el entorno clínico. Un estudio incluido evaluó específicamente el uso de pacientes estandarizados por estudiantes combinados con simulación situacional en la educación de enfermería gastrointestinal y reportó resultados educativosfavorables 15. Los tamaños de muestra variaron entre 20 y más de 200 encuestados, y los estudios fueron muy diversos en cuanto a tamaño muestral. Las intervenciones fueron todas simulaciones y consistieron en maniquíes de alta fidelidad o modelos estandarizados de pacientes, simulaciones grupales de escenarios o instrucción mixta. A los grupos mixtos normalmente se les asignaban métodos tradicionales de enseñanza, como conferencias, rondas de sala o formación superficial en la clínica. No todos los estudios midieron los seis dominios de resultado, lo que contribuyó a la heterogeneidad en la presentación de resultados. Esta variación en el diseño del estudio, las características de intervención y las medidas de resultado probablemente contribuyó a la alta heterogeneidad observada en los análisis agrupados. Los detalles de los estudios incluidos se describen en la Tabla 3.
Efectos agrupados por conocimiento del dominio de resultados
En los estudios incluidos, diez comparaciones de resultados evaluaron la adquisición de conocimientos. El análisis agrupado favoreció el aprendizaje basado en simulación, produciendo un tamaño de efecto de g = 0,31 (IC 95%: 0,12–0,50). Estos resultados sugieren que un conocimiento teórico mejorado se asoció con intervenciones de simulación en comparación con estrategias de enseñanza sin simulación. No obstante, la heterogeneidad fue alta (I2 = 98,79%), lo que indica una variabilidad considerable entre estudios. Las variaciones en la fidelidad de la simulación, las instrucciones y las medidas de evaluación, así como las diferencias entre los participantes, fueron causas probables de esta variabilidad. A pesar del amplio intervalo de confianza, la mayoría de los estudios reportaron mejores resultados de conocimiento en los grupos de simulación. Estos resultados se resumen en la Tabla 2 e ilustran en el gráfico del bosque (Figura 2A).
Rendimiento de habilidades
Diez comparaciones de resultados evaluaron el rendimiento de las habilidades. El tamaño global del efecto agrupado fue g = -0,39 (IC: -0,85–0,07), lo que indica que no hay diferencia estadísticamente significativa en las habilidades técnicas entre el aprendizaje basado en simulación y la enseñanza tradicional. El intervalo de confianza cruzó cero, lo que indica dudas sobre la estimación combinada. La heterogeneidad fue extremadamente alta (I2 = 98,66%), lo que indica que las definiciones de las habilidades, su enseñanza y las pruebas eran significativamente diferentes entre estudios. Los periodos de intervención inconsistentes, la ausencia de instrumentos estandarizados de medición del rendimiento y la variación en las situaciones clínicas son fuentes potenciales de variabilidad. Las estimaciones agrupadas se presentan en la Tabla 2, con los resultados individuales de los estudios en la Figura 2B.
Capacidad de trabajo en equipo
Tres estudios informaron de resultados relacionados con el trabajo en equipo. El análisis combinado demostró un efecto positivo del aprendizaje basado en simulación, con un tamaño de efecto de g = 0,66 (IC 95%: 0,18–1,14). El intervalo de confianza era bastante amplio, pero la dirección general de la preferencia por el efecto era hacia intervenciones basadas en simulación. Los participantes que se sometieron a la simulación demostraron una mejora en el trabajo en equipo y las habilidades de comunicación. La heterogeneidad seguía siendo elevada (I2 = 97,18%), lo que quizá indica diferencias en el énfasis en el trabajo en equipo como foco explícito de la simulación o como subconjunto de resultados de rendimiento. Estos hallazgos se resumen en la Tabla 2 y se ilustran en la Figura 2C.
Pensamiento clínico
Seis estudios aportaron datos sobre el pensamiento clínico y los resultados en la toma de decisiones. El tamaño combinado del efecto fue g = 0,17 (IC 95%: -0,21–0,55), que es un efecto pequeño y no significativo. El nivel de heterogeneidad era muy alto (I2 = 98,95%), lo que implica que existía una variación significativa entre estudios. Estos hallazgos probablemente se vieron influenciados por diferencias en el realismo de la simulación, los objetivos educativos, las herramientas de evaluación y la experiencia de los participantes. Algunos estudios encontraron mejoras significativas en el pensamiento clínico, pero algunos encontraron efecto mínimo o nulo. Estos hallazgos se resumen en la Tabla 2, y el correspondiente gráfico forestal se representa en la Figura 2D.
Responsabilidad profesional
Seis estudios exploraron los resultados de la responsabilidad profesional. El tamaño del efecto combinado fue g = 0,27 (IC 95%: -0,11–0,65), que es un efecto positivo pequeño e impreciso del aprendizaje basado en simulación. El nivel de heterogeneidad también fue significativo (I2 = 99,25%), que es el mayor entre todos los dominios de resultados. Esta inconsistencia probablemente indica variaciones en las definiciones conceptuales de responsabilidad profesional, que abarcan en el cumplimiento del protocolo y la rendición de cuentas a la práctica ética y profesional general. Estas inconsistencias resultaron en amplios intervalos de confianza. Los resultados agrupados se presentan en la Tabla 2 e ilustran en la Figura 2E.
Autoconfianza
Tres estudios informaron de resultados sobre la autoconfianza. El análisis agrupado mostró un efecto significativo y positivo del aprendizaje basado en simulación, donde el tamaño del efecto g = 1,05 (IC 95%: 0,62–1,49). Aunque el grado de heterogeneidad seguía siendo alto (I2 = 98,95%), todos los estudios reportaron una mayor autoconfianza en todos los individuos sometidos a entrenamiento basado en simulación. Estos resultados subrayan la alta eficacia del aprendizaje experiencial en la preparación psicológica de los estudiantes para entornos clínicos de alta presión. Las estimaciones agrupadas se muestran en la Tabla 4, con los efectos individuales de los estudios en la Figura 2F.
Efecto global integrado
Se encontró que el aprendizaje basado en simulación tiene beneficios específicos de dominio en comparación con los métodos de enseñanza tradicionales en diferentes dominios de resultado. Las mejoras más consistentes se produjeron en la adquisición de conocimiento, la capacidad de trabajo en equipo y la autoconfianza, siendo esta última la que mostró el mayor tamaño de efecto agrupado. Por el contrario, los hallazgos sobre el rendimiento de habilidades, el pensamiento clínico y la responsabilidad profesional fueron menos homogéneos e incluyeron un alto grado de heterogeneidad. Estas diferencias probablemente se deban a diferencias en el diseño de la intervención, la medición del resultado y la fidelidad de la implementación. La Tabla 4 ofrece un resumen de las tendencias generales, y el gráfico combinado del bosque en la Figura 3 las representa visualmente.
Sesgo de publicación
El sesgo de publicación se evaluó utilizando diagramas de embudo y la prueba de regresión de Egger. La inspección visual de los diagramas de embudo (Figura 4) sugirió una asimetría leve en algunos dominios de resultado, especialmente aquellos con un número limitado de estudios, donde los estudios más pequeños tendían a reportar tamaños de efecto mayores. Sin embargo, la regresión de Egger no identificó efectos estadísticamente significativos en estudios pequeños en ningún dominio. Dado que los diagramas de embudo y la prueba de Egger son menos fiables cuando hay menos de diez estudios disponibles, estos hallazgos deben interpretarse con cautela. En general, no hubo evidencia sólida de sesgo sistemático de publicación, aunque el número limitado de estudios merece precaución a la hora de interpretar las estimaciones agrupadas.
Análisis de sensibilidad
Los análisis de sensibilidad se realizaron utilizando modelos de efectos aleatorios con estimación REML y ajuste de Knapp–Hartung. Como ningún estudio se clasificó como de alto riesgo de sesgo, se excluyeron dos estudios con ceguera poco clara para fines ilustrativos. Los resultados agrupados permanecieron en gran medida sin cambios, con tamaños de efecto de g = 0,29 (IC 95%: 0,11–0,47) para el conocimiento, g = 0,65 (IC 95%: 0,17–1,13) para el trabajo en equipo, y g = -0,38 (IC 95%: -0,83–0,07) para el rendimiento de habilidades, indicando la robustez de los hallazgos principales.
Análisis de subgrupos
Se realizaron análisis de subgrupos para explorar posibles fuentes de heterogeneidad. Los estudios se estratificaron por diseño (aleatorizados vs cuasi-experimentales) y por fidelidad de simulación (alta vs baja). Las simulaciones de mayor fidelidad demostraron efectos agrupados mayores para el conocimiento (g = 0,42) y el trabajo en equipo (g = 0,79) en comparación con las simulaciones de menor fidelidad (g = 0,15 y g = 0,34, respectivamente). Las diferencias entre los estudiantes de enfermería de grado y los enfermeros en formación fueron mínimas en la mayoría de los dominios de resultado.
Intervalos de predicción
Para interpretar mejor la heterogeneidad, se calcularon intervalos de predicción del 95% para cada dominio de resultado: conocimiento (-0,42–1,04), rendimiento de habilidades (-1,28–0,50), capacidad de trabajo en equipo (-0,15–1,47), pensamiento clínico (-0,62–0,96), responsabilidad profesional (-0,54–1,08) y autoconfianza (0,12–1,98). Estos amplios intervalos indican una variabilidad esperada sustancial en los tamaños de efecto en estudios futuros.
Disponibilidad de datos
Este estudio no generó nuevos datos primarios. Los datos a nivel de estudio extraídos de las publicaciones incluidas y utilizados para la síntesis cuantitativa, junto con las estrategias completas de búsqueda en bases de datos y el marco de armonización de resultados, han sido depositados en el repositorio Zenodo y están disponibles públicamente en 10.5281/zenodo.20747753.
LEYENDAS DE MESA Y FIGURA:

Figura 1: Diagrama de flujo PRISMA de la selección de estudios para la síntesis cuantitativa.
Esta figura resume la identificación, cribado, evaluación de elegibilidad e inclusión final de los estudios en la revisión sistemática y la síntesis cuantitativa. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 2: Gráficos de bosque de tamaños de efectos agrupados entre dominios de resultado. (A) Adquisición de conocimiento. (B) Rendimiento de habilidad. (C) Habilidad para trabajar en equipo. (D) Pensamiento clínico. (E) Responsabilidad profesional. (F) Confianza en uno mismo. Se muestran tamaños de efecto individuales de los estudios y estimaciones grupadas de Hedges con intervalos de confianza del 95%. Abreviaturas: IC = intervalo de confianza; DL = DerSimonian–Laird; DME = diferencia media estandarizada. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 3: Gráfico forestal agrupado global que resume estimaciones de efectos integrados en todos los dominios de resultado. Esta figura ofrece una visión comparativa de la magnitud y dirección de los efectos del aprendizaje basado en simulaciones en los dominios de competencia evaluados. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 4: Gráfico de embudo que evalúa el posible sesgo de publicación entre los estudios incluidos. Esta figura ilustra la distribución de tamaños de efecto de los estudios y errores estándar para evaluar los posibles efectos de estudios pequeños y el sesgo de publicación. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
| Estudio | Sesgo de selección | Sesgo de rendimiento/detección | Datos de resultados incompletos | Informes selectivos | Riesgo global |
| Yang & Liu (2024)⁴ | Moderado | Moderado | Bajo | Bajo | Moderado |
| Rong & Ning (2024)² | Moderado | Moderado | Bajo | Bajo | Moderado |
| Wang et al. (2021)³ | Moderado | Moderado | Bajo | Bajo | Moderado |
| Nielsen et al. (2022)¹ | Bajo | Bajo | Bajo | Bajo | Bajo |
| Guo & Mao (2025)¹⁵ | Moderado | Moderado | Bajo | Bajo | Moderado |
| Jang & Park (2021)⁸ | Moderado | Moderado | Bajo | Bajo | Moderado |
| Liu et al. (2023)⁷ | Moderado | Moderado | Bajo | Bajo | Moderado |
| Maddahi et al. (2025)⁹ | Bajo | Moderado | Bajo | Bajo | Moderado |
Tabla 1: Resumen del riesgo de sesgo. Esta tabla resume la evaluación metodológica de la calidad de los estudios incluidos utilizando el marco modificado de ROBINS-I.
| Resultado | No. de Estudios | Efecto (g, IC 95%) | Certeza (GRADE) | Motivo de degradación |
| Conocimiento | 8 | 0.31 (0.12–0.50) | Moderado | Alta heterogeneidad |
| Rendimiento de habilidades | 10 | -0.39 (-0.85–0.07) | Bajo | Inconsistencia, imprecisión |
| Trabajo en equipo | 3 | 0.66 (0.18–1.14) | Moderado | Tamaño de muestra pequeño |
| Pensamiento clínico | 6 | 0.17 (-0.21–0.55) | Bajo | Inconsistencia |
| Responsabilidad profesional | 6 | 0.27 (-0.11–0.65) | Bajo | Variación conceptual |
| Autoconfianza | 3 | 1.05 (0.62–1.49) | Moderado | Alta heterogeneidad |
Tabla 2: Resumen de la evidencia de GRADE. Esta tabla presenta la certeza de las calificaciones de evidencia para cada dominio de resultado basándose en el enfoque GRADE.
| Autor (año) | País | Diseño del estudio | Condiciones | Población | N-Intervención | N-control | Resultados |
| Guo et al. (2025) | China | Estudio retrospectivo | Emergencias mixtas | Internos de enfermería | 100 | 100 | Conocimientos, rendimiento de habilidades, capacidad de trabajo en equipo, pensamiento clínico, responsabilidad profesional, |
| Jang y parque (2021) | Corea | Estudio de Métodos Mixtos | Sangrado gastrointestinal superior | Estudiantes de enfermería | 41 | 39 | Conocimiento, rendimiento de habilidades, confianza en uno mismo |
| Liu et al. (2023) | China | Ensayo controlado aleatorizado | Sangrado agudo del sistema digestivo superior | Estudiantes de enfermería | 20 | 20 | Conocimientos, capacidad de trabajo en equipo, pensamiento clínico, responsabilidad profesional |
| Maddahi et al. (2025) | Irán | Estudio cuasi-experimental | Sangrado | Estudiantes de enfermería | 23 | 22 | Conocimiento, rendimiento de habilidades |
| Nielsen et al. (2022) | Dinamarca | Estudio de validación prospectiva | Emergencias mixtas | Estudiantes de enfermería | 10 | 15 | Rendimiento de habilidades |
| Wang et al. (2021) | China | Estudio cuasi-experimental | Sangrado | Aprendices de enfermería | 108 | 108 | Conocimientos, rendimiento de habilidades, pensamiento clínico, responsabilidad profesional |
| Rong y Ning (2024) | China | Estudio retrospectivo | Emergencias mixtas | Internos de enfermería | 36 | 35 | Conocimientos, rendimiento de habilidades, pensamiento clínico, capacidad de trabajo en equipo, confianza en uno mismo |
| Yang y Liu (2024) | China | Estudio controlado aleatorizado | Emergencias mixtas | Estudiantes de enfermería | 30 | 30 | Conocimientos, rendimiento de habilidades, pensamiento clínico, responsabilidad profesional |
Tabla 3: Características de los estudios incluidos en el metaanálisis. Esta tabla describe el diseño del estudio, las características de los participantes, las intervenciones, los comparadores, el tamaño de la muestra y los resultados reportados.
| Resultado | k | G agrupado (DL) | SE (DL) | IC 95% bajo | IC alto al 95% | Q | df | p(Q) | I² % | τ² (DL) | Interceptación de Egger | Egger p |
| Pensamiento clínico | 6 | 0.166 | 0.89 | -1.579 | 1.91 | 477.796 | 5 | 0 | 98.954 | 4.689 | -13.632 | 0.375 |
| Conocimiento | 10 | 0.306 | 0.823 | -1.307 | 1.919 | 744.949 | 9 | 0 | 98.792 | 6.679 | -15.924 | 0.276 |
| Responsabilidad profesional | 6 | 0.27 | 1.434 | -2.541 | 3.08 | 668.813 | 5 | 0 | 99.252 | 12.198 | -2.884 | 0.835 |
| Autoconfianza | 3 | 1.054 | 1.982 | -2.83 | 4.939 | 190.421 | 2 | 0 | 98.95 | 11.621 | 9.595 | 0.727 |
| Rendimiento de habilidades | 10 | -0.389 | 0.756 | -1.87 | 1.093 | 670.517 | 9 | 0 | 98.658 | 5.584 | -13.461 | 0.054 |
| Capacidad de trabajo en equipo | 3 | 0.663 | 0.831 | -0.967 | 2.292 | 70.908 | 2 | 0 | 97.179 | 2.005 | -6.394 | 0.739 |
Tabla 4: Tamaños de efecto agrupados y estadísticas de heterogeneidad entre dominios de resultado. Esta tabla informa sobre los valores g de Hedges, los intervalos de confianza del 95%, las medidas de heterogeneidad y las evaluaciones de sesgo de publicación para todos los resultados analizados.
Tabla suplementaria 1: Estrategias completas de búsqueda en bases de datos. Esta tabla proporciona las cadenas de búsqueda completas utilizadas para PubMed, Scopus, Web of Science y Embase, incluyendo palabras clave, términos de vocabulario controlado, operadores booleanos y sintaxis específica de la base de datos. Estas estrategias de búsqueda se utilizaron para identificar estudios que evaluaban el aprendizaje basado en simulación en la educación de enfermería de urgencias con relevancia para escenarios clínicos relacionados con la gastroentería. Por favor, haga clic aquí para descargar este archivo.
Tabla suplementaria 2: Marco de reclasificación y armonización de resultados.
Esta tabla presenta los resultados que requirieron reclasificación desde sus etiquetas originales específicas del estudio a los dominios de resultados predefinidos usados para la síntesis cuantitativa. La justificación de cada decisión de clasificación se proporciona para mejorar la transparencia, la coherencia y la comparabilidad entre estudios. Por favor, haga clic aquí para descargar este archivo.