Flujo de participantes y poblaciones de análisis
Un total de 126 participantes fueron inscritos y asignados a 42 equipos de tres personas. A cada condición de entrenamiento se asignaron 14 equipos, resultando en 42 participantes en el grupo de simulación colaborativa en escritorio, 42 en el grupo de realidad virtual colaborativa distribuida a escala de habitación y 42 en el grupo de realidad virtual colaborativa co-localizada en espacio amplio. Todos los equipos completaron la sesión de entrenamiento asignada y se mantuvieron en el conjunto de datos de intención de tratar.
La ausencia de datos fue baja y no se concentró en ninguna condición. Las puntuaciones de presencia espacial estuvieron disponibles para 124 participantes, incluyendo 41 en el grupo de escritorio, 42 en el grupo de escala de habitación y 41 en el grupo de espacio amplio. Las puntuaciones autoevaluadas de coordinación del equipo estuvieron disponibles para 123 participantes, con 41 participantes en cada grupo. Las puntuaciones de compromiso con el aprendizaje estuvieron disponibles para 122 participantes, incluyendo 40 en el grupo de escritorio, 41 en el grupo de escala de habitación y 41 en el grupo de espacio amplio. Las puntuaciones de incomodidad por simulador estuvieron disponibles para 124 participantes, incluyendo 42 en el grupo de escritorio, 41 en el grupo de escala de habitación y 41 en el grupo de espacio amplio. Las puntuaciones válidas de conocimiento de retención a las 2 semanas estuvieron disponibles para 122 participantes, incluyendo 40 en el grupo de escritorio, 41 en el grupo de escala de habitación y 41 en el grupo de espacio amplio. La coordinación del equipo evaluada por observadores estuvo disponible para los 42 equipos completos. El flujo de participantes, asignación, evaluación inmediata y finalización del seguimiento se resumen en Figura 3.

Figura 3: Flujo de participantes y poblaciones para el análisis. El diagrama de flujo muestra la inscripción, la asignación de 126 participantes en 42 equipos de tres personas, la finalización de la capacitación, la evaluación inmediata, la calificación de la coordinación evaluada por observadores y los datos válidos de seguimiento a las dos semanas en las tres condiciones de entrenamiento. Haga clic aquí para ver una versión más grande de esta figura.
Características basales
Las características demográficas y relacionadas con la formación en la línea basal fueron ampliamente comparables entre las tres condiciones. La muestra final consistió en participantes adultos jóvenes, tanto de pregrado como de posgrado. Los tres grupos fueron similares en edad, exposición previa a la realidad virtual, familiaridad con juegos o simulaciones, experiencia previa en formación basada en equipos y formación previa en logística de emergencia, navegación o seguridad industrial.
Las puntuaciones de conocimientos previos también fueron comparables entre los grupos. Las puntuaciones medias de conocimientos previos fueron 16,17 ± 3,09 en el grupo de simulación colaborativa en escritorio, 16,10 ± 3,61 en el grupo de realidad virtual colaborativa distribuida a escala de habitación y 15,55 ± 3,23 en el grupo de realidad virtual colaborativa co-localizada en espacio amplio. La comparación entre grupos sin ajustar no fue estadísticamente significativa, F(2, 123) = 0,44, p = 0,647, η2 = 0,007.
Las características basales y las mediciones previas al entrenamiento se muestran en la Tabla 2. Antes de las pruebas inferenciales de hipótesis, las evaluaciones diagnósticas indicaron que las variables continuas principales cumplían con los supuestos de normalidad de los residuos y homogeneidad de la varianza. La consistencia interna fue alta en todos los instrumentos psicométricos, con coeficientes alfa de Cronbach de 0,86 para la presencia espacial, 0,88 para la coordinación del equipo autoevaluada y 0,91 para el compromiso con el aprendizaje. Todas las diferencias significativas entre grupos en los resultados principales siguieron siendo significativas tras el ajuste de la tasa de descubrimiento falso de Benjamini-Hochberg.
Tabla 2: Características basales y mediciones previas al entrenamiento. Esta tabla presenta los datos demográficos de los participantes, su experiencia previa con realidad virtual y entrenamiento, familiaridad con videojuegos o simulaciones, antecedentes de entrenamiento relacionado y puntajes de conocimiento previos al entrenamiento en las tres condiciones experimentales. Haga clic aquí para descargar esta tabla.
Presencia espacial
La presencia espacial se analizó mediante un modelo lineal de efectos mixtos con la condición de entrenamiento como efecto fijo y el código del equipo como intercepto aleatorio. Las pruebas del modelo de efectos mixtos utilizaron grados de libertad ajustados según Satterthwaite. El modelo mostró un efecto significativo de la condición de entrenamiento sobre la presencia espacial, F(2, 39) = 23,91, p < 0,001. Las medias marginales estimadas fueron 4,13 para el grupo de simulación colaborativa en escritorio, 5,00 para el grupo de realidad virtual colaborativa distribuida a escala de habitación y 5,42 para el grupo de realidad virtual colaborativa co-localizada en espacio amplio.
Las comparaciones por pares ajustadas con Tukey mostraron que la presencia espacial fue mayor en el grupo de espacio amplio que en el grupo de escritorio, diferencia media estimada = 1,29, IC del 95 %: 0,86 – 1,72, p < 0,001. La presencia espacial también fue mayor en el grupo de espacio amplio que en el grupo de escala de habitación, diferencia media estimada = 0,42, IC del 95 %: 0,04 – 0,80, p = 0,027. El grupo de escala de habitación obtuvo una puntuación mayor que el grupo de escritorio, diferencia media estimada = 0,87, IC del 95 %: 0,45 – 1,29, p < 0,001.
Para la comparación descriptiva, las puntuaciones medias sin ajustar ± desviación estándar (DE) fueron de 4,13 ± 0,91 en el grupo de escritorio, 5,00 ± 0,79 en el grupo de escala reducida y 5,42 ± 0,80 en el grupo de gran espacio. El análisis de varianza (ANOVA) sin ajustar mostró el mismo patrón, F(2, 121) = 25,68, p < 0,001, η2 = 0,298. Las distribuciones del resultado principal se muestran en Figura 4, y las estadísticas descriptivas y de efectos mixtos correspondientes se resumen en Tabla 3.

Figura 4: Resultados principales en las diferentes condiciones de entrenamiento. (A) Presencia espacial. (B) Coordinación del equipo autoevaluada. (C) Coordinación del equipo evaluada por observadores. (D) Compromiso con el aprendizaje. La presencia espacial, la coordinación del equipo autoevaluada y el compromiso con el aprendizaje fueron resultados a nivel de participante; la coordinación del equipo evaluada por observadores se analizó a nivel de equipo. Las barras de error indican la desviación estándar. Haga clic aquí para ver una versión más grande de esta figura.
Tabla 3: Resultados principales. Esta tabla resume la presencia espacial, la coordinación del equipo autoevaluada, la coordinación del equipo evaluada por observadores y el compromiso con el aprendizaje en las tres condiciones de entrenamiento. También se presentan los modelos estadísticos inferenciales correspondientes y las comprobaciones de sensibilidad de la tasa de falsos descubrimientos. Haga clic aquí para descargar esta tabla.
Coordinación del equipo
La coordinación del equipo autoevaluada se analizó a nivel de participante utilizando un modelo lineal de efectos mixtos con la condición de entrenamiento como un efecto fijo y el código del equipo como intercepto aleatorio. El modelo mostró un efecto significativo de la condición de entrenamiento, F(2, 39) = 9.96, p < 0.001. Las medias marginales estimadas fueron 4,54 en el grupo de escritorio, 4,49 en el grupo de escala reducida y 5,17 en el grupo de gran espacio.
Las comparaciones ajustadas con Tukey mostraron que la coordinación del equipo autoevaluada fue mayor en el grupo de espacio amplio que en el grupo de escritorio, diferencia media estimada = 0,63, IC del 95 %: 0,25 – 1,01, p = 0,002. El grupo de espacio amplio también obtuvo puntuaciones más altas que el grupo de escala de habitación, diferencia media estimada = 0,68, IC del 95 %: 0,29 – 1,07, p < 0,001. Los grupos de escritorio y de escala de habitación no difirieron significativamente, diferencia media estimada = 0,05, IC del 95 %: −0,33 – 0,43, p = 0,942. Para comparación descriptiva, las puntuaciones medias no ajustadas ± DE fueron 4,54 ± 0,63 en el grupo de escritorio, 4,49 ± 0,75 en el grupo de escala de habitación y 5,17 ± 0,81 en el grupo de espacio amplio. El ANOVA no ajustado produjo el mismo patrón direccional, F(2, 120) = 10,84, p < 0,001, η2 = 0,153.
La coordinación del equipo evaluada por observadores se analizó a nivel de equipo, como se especificó previamente. La fiabilidad entre evaluadores superó el umbral predefinido, con un coeficiente de correlación intraclase de efectos aleatorios bidireccionales de ICC = 0,84. Tres grabaciones de equipos presentaron diferencias totales en las puntuaciones de los observadores superiores a 12 puntos, las cuales se resolvieron mediante revisión por consenso. La coordinación evaluada por observadores difirió significativamente entre las condiciones, F(2, 39) = 10,92, p < 0,001, η2 = 0,359. Las puntuaciones medias a nivel de equipo fueron 56,84 ± 9,14 en el grupo de escritorio, 65,01 ± 9,56 en el grupo de escala de habitación y 71,81 ± 8,70 en el grupo de espacio amplio. Las comparaciones ajustadas con el método de Tukey mostraron una mayor coordinación evaluada por observadores en el grupo de espacio amplio en comparación con el grupo de escritorio, diferencia media = 14,97, IC del 95 %: 7,33 – 22,61, p < 0,001. El grupo de espacio amplio también obtuvo puntuaciones superiores al grupo de escala de habitación, diferencia media = 6,80, IC del 95 %: 0,42 – 13,18, p = 0,035. El grupo de escala de habitación obtuvo una puntuación más alta que el grupo de escritorio, diferencia media = 8,17, IC del 95 %: 1,31 – 15,03, p = 0,017. La coordinación autoevaluada y la evaluada por observadores mostraron el mismo orden entre los grupos, siendo el grupo de espacio amplio el que obtuvo las puntuaciones más altas en ambas medidas.
Compromiso con el aprendizaje
El compromiso con el aprendizaje se analizó mediante un modelo lineal de efectos mixtos con la condición de entrenamiento como un efecto fijo y el código del equipo como una intersección aleatoria. El modelo mostró un efecto significativo de la condición de entrenamiento, F(2, 39) = 37.46, p < 0.001. Las medias marginales estimadas fueron 4,22 en el grupo de escritorio, 4,74 en el grupo de escala reducida y 5,63 en el grupo de gran espacio. Las comparaciones por pares ajustadas por Tukey mostraron que el compromiso fue mayor en el grupo de gran espacio que en el grupo de escritorio, diferencia media estimada = 1,41, IC del 95 %: 1,03 – 1,79, p < 0,001. El compromiso también fue mayor en el grupo de gran espacio que en el grupo de escala reducida, diferencia media estimada = 0,89, IC del 95 %: 0,53 – 1,25, p < 0,001. El grupo de escala reducida obtuvo una puntuación más alta que el grupo de escritorio, diferencia media estimada = 0,52, IC del 95 %: 0,15 – 0,89, p = 0,006.
Para la comparación descriptiva, las puntuaciones medias sin ajustar ± DE fueron 4,22 ± 0,76 en el grupo de escritorio, 4,74 ± 0,67 en el grupo de escala reducida y 5,63 ± 0,73 en el grupo de gran espacio. El ANOVA sin ajustar mostró el mismo patrón, F(2, 119) = 40,00, p < 0,001, η2 = 0,402.
Controles de sensibilidad de la tasa de descubrimientos falsos para los resultados principales
Se aplicó el procedimiento de tasa de descubrimientos falsos de Benjamini-Hochberg a los cuatro resultados principales preespecificados: presencia espacial, coordinación del equipo autoevaluada, coordinación del equipo evaluada por observadores y participación en el aprendizaje. Los cuatro resultados principales siguieron siendo estadísticamente significativos tras el ajuste. El control de sensibilidad de la tasa de descubrimientos falsos produjo el mismo patrón de resultados principales que los análisis principales.
Resultados del conocimiento y retención
El conocimiento inmediato posterior a la capacitación se analizó mediante un modelo de efectos mixtos con la condición de capacitación como efecto fijo, el conocimiento previo a la capacitación como covariable y el código del equipo como intercepto aleatorio. El modelo ajustado mostró un efecto de grupo no significativo para el conocimiento posterior a la capacitación, F(2, 39) = 2.14, p = 0.131. Las medias marginales estimadas fueron 20,12 para el grupo de escritorio, 20,96 para el grupo de escala de habitación y 21,85 para el grupo de gran espacio. Para una comparación descriptiva, las puntuaciones medias de conocimiento posterior a la capacitación fueron 20,09 ± 4,04 en el grupo de escritorio, 21,00 ± 4,57 en el grupo de escala de habitación y 21,84 ± 3,95 en el grupo de gran espacio. La comparación entre grupos sin ajustar no fue estadísticamente significativa, F(2, 123) = 1,83, p = 0,165, η2 = 0,029.
La ganancia de conocimiento desde la evaluación basal hasta la evaluación inmediata posterior a la capacitación se evaluó como un resultado inferencial exploratorio secundario. Las ganancias medias fueron de 3,93 ± 2,88 puntos en el grupo de escritorio, 4,91 ± 2,12 puntos en el grupo de escala de habitación y 6,30 ± 2,75 puntos en el grupo de gran espacio. El efecto del grupo sin ajustar fue significativo, F(2, 123) = 8,77, p < 0,001, η2 = 0,125. Las comparaciones ajustadas por Tukey mostraron una mayor ganancia de conocimiento en el grupo de gran espacio que en el grupo de escritorio, diferencia media = 2,37, IC del 95 %: 0,96 – 3,78, p < 0,001. El grupo de gran espacio también mostró una mayor ganancia que el grupo de escala de habitación, diferencia media = 1,39, IC del 95 %: 0,14 – 2,64, p = 0,026. Los grupos de escala de habitación y de escritorio no difirieron significativamente, diferencia media = 0,98, IC del 95 %: −0,31 – 2,27, p = 0,171.
En el seguimiento a las 2 semanas, se analizó el conocimiento de retención entre los participantes con respuestas válidas de retención dentro de la ventana predefinida del día 13 al día 16. El modelo mixto ajustado, controlando el conocimiento previo a la capacitación e incluyendo el código del equipo como intercepto aleatorio, mostró un efecto de grupo no significativo, F(2, 39) = 1,68, p = 0,199. Las puntuaciones medias de retención fueron 18,70 ± 4,55 en el grupo de escritorio, 19,62 ± 4,37 en el grupo de escala reducida y 20,42 ± 4,38 en el grupo de gran espacio. La comparación entre grupos sin ajustar tampoco fue estadísticamente significativa, F(2, 119) = 1,53, p = 0,220, η2 = 0,025. Los resultados secundarios del aprendizaje se resumen en Tabla 4.
Tabla 4: Resultados secundarios del aprendizaje según las condiciones de entrenamiento. Esta tabla muestra el conocimiento previo al entrenamiento, el conocimiento inmediatamente posterior al entrenamiento, la ganancia de conocimiento y la retención del conocimiento a las 2 semanas en las tres condiciones de entrenamiento. Se presentan modelos mixtos ajustados para los resultados secundarios del aprendizaje. Haga clic aquí para descargar esta tabla.
Carga cognitiva y malestar en el simulador
La carga cognitiva se analizó como un resultado secundario. La carga cognitiva media fue de 4,22 ± 0,69 en el grupo de escritorio, 4,49 ± 0,62 en el grupo de escala reducida y 4,13 ± 0,82 en el grupo de gran espacio. El efecto del grupo sin ajustar fue F(2, 123) = 2,92, p = 0,058, η2 = 0,045. Este resultado no alcanzó el umbral de significación predefinido.
La molestia provocada por el simulador varió según las condiciones. El índice medio de molestia tras la tarea fue de 1,37 ± 0,71 en el grupo de escritorio, 2,18 ± 0,79 en el grupo de entorno completo y 2,42 ± 0,58 en el grupo de gran espacio. El efecto del grupo sin ajustar fue significativo, F(2, 121) = 25,72, p < 0,001, η2 = 0,298. Las puntuaciones de molestia fueron más altas en los dos grupos de realidad virtual que en el grupo de escritorio, aunque los valores promedio se mantuvieron en el rango leve. Ningún participante cumplió el criterio predefinido de interrupción de que cualquier ítem de molestia fuera ≥7. Siete participantes presentaron un índice de molestia tras la tarea ≥5 y recibieron contacto para verificar la resolución de síntomas a las 24 horas. Entre estos participantes, cuatro tuvieron un índice de molestia tras la tarea >6 y también fueron monitoreados en el laboratorio durante al menos 15 minutos antes de irse. Los siete participantes informaron resolución de síntomas sin necesidad de derivación médica. Ninguna sesión se interrumpió debido a molestias por el simulador, y no se registró ningún evento adverso que requiriera atención clínica. La carga cognitiva y la molestia provocada por el simulador se muestran en Figura 5.

Figura 5: Carga cognitiva e incomodidad en el simulador según las condiciones de entrenamiento. (A) Carga cognitiva, puntuada del 1 al 7, donde puntuaciones más altas indican una carga de trabajo percibida mayor. (B) Incomodidad en el simulador tras la tarea, puntuada del 0 al 10 y basada en náuseas, mareos, fatiga visual, dolor de cabeza e incomodidad del equilibrio. Las barras de error indican la desviación estándar. Haga clic aquí para ver una versión más grande de esta figura.
Indicadores del proceso de la tarea
Los indicadores del proceso de la tarea se utilizaron para describir el desempeño del equipo durante la tarea de entrenamiento colaborativo de 20 minutos. La finalización de la tarea fue del 71,4 % en el grupo de escritorio, del 78,6 % en el grupo de escala de habitación y del 85,7 % en el grupo de gran espacio. El tiempo medio de finalización fue de 1 041,6 ± 162,4 s en el grupo de escritorio, 984,3 ± 151,8 s en el grupo de escala de habitación y 931,7 ± 139,6 s en el grupo de gran espacio. Dado que a los equipos incompletos se les asignó un límite de tiempo de 1 200 s, el tiempo de finalización se interpretó de forma descriptiva.
El número medio de recursos seleccionados correctamente fue de 2,21 ± 0,70 en el grupo de escritorio, 2,43 ± 0,65 en el grupo de escala de habitación y 2,64 ± 0,50 en el grupo de gran espacio. El número medio de indicaciones de peligro manejadas correctamente fue de 1,93 ± 0,83, 2,21 ± 0,70 y 2,50 ± 0,65, respectivamente. El número medio de errores en la ruta fue de 2,07 ± 1,14 en el grupo de escritorio, 1,50 ± 0,94 en el grupo de escala de habitación y 1,00 ± 0,78 en el grupo de gran espacio. Las interrupciones por seguridad fueron infrecuentes en todas las condiciones, con medias de 0,21 ± 0,43, 0,29 ± 0,47 y 0,36 ± 0,50, respectivamente. El estado de finalización de la tarea, el tiempo de finalización, la selección correcta de recursos, las indicaciones de peligro manejadas correctamente, los errores en la ruta y las interrupciones por seguridad se resumen en la Tabla 5.
Tabla 5: Indicadores del proceso de la tarea y eventos de seguridad. Esta tabla resume las medidas objetivas de rendimiento en la tarea, incluidas las tasas de finalización, los errores en la navegación de la ruta y la gestión de peligros. También se informa sobre el monitoreo del malestar en el simulador y los eventos clínicos adversos registrados. Haga clic aquí para descargar esta tabla.
Asociaciones entre presencia, coordinación, implicación y aprendizaje
Las respuestas psicométricas a nivel individual se agruparon en medias por equipo antes de integrarlas con las medidas de coordinación evaluadas por observadores. El análisis de correlación a nivel de equipo mostró asociaciones positivas entre la presencia espacial y el compromiso en el aprendizaje (r = 0.57), la coordinación grupal autoevaluada (r = 0.26) y la coordinación evaluada por observadores (r = 0.32).
El patrón de correlación indicó una superposición moderada entre presencia, coordinación y compromiso, mientras que las correlaciones con la adquisición de conocimientos fueron menores. El patrón de correlación indicó superposición entre presencia, coordinación y compromiso, mientras que las asociaciones con la adquisición de conocimientos fueron menores. Estos análisis fueron exploratorios y no establecen trayectorias causales entre los resultados medidos. La matriz de correlación se muestra en Figura 6.

Figura 6: Matriz de correlación para presencia, coordinación, participación y resultados de aprendizaje. El mapa de calor muestra los coeficientes de correlación de Pearson entre la presencia espacial, la coordinación del equipo autoevaluada, la coordinación del equipo evaluada por observadores, la participación en el aprendizaje, el conocimiento tras la capacitación, el conocimiento retenido a las 2 semanas, la carga cognitiva y la ganancia de conocimiento. Haga clic aquí para ver una versión más grande de esta figura.
El grupo de realidad virtual colaborativa co-localizada en espacios amplios presentó una mayor presencia espacial, coordinación grupal autoevaluada, coordinación grupal evaluada por observadores y participación en el aprendizaje en comparación con los grupos de comparación. Estos hallazgos principales mantuvieron su significancia estadística tras tener en cuenta el agrupamiento por equipo y tras el ajuste por la tasa de descubrimientos falsos. En cuanto a los resultados secundarios, la adquisición de conocimientos favoreció al grupo de espacios amplios, mientras que el conocimiento ajustado tras la capacitación y el conocimiento de retención a las dos semanas no mostraron diferencias significativas entre las condiciones. La carga cognitiva no difirió significativamente entre los grupos, y la molestia provocada por el simulador permaneció leve en promedio, a pesar de puntuaciones más altas en las condiciones de realidad virtual.
DISPONIBILIDAD DE LOS DATOS:
El conjunto de datos analíticos desidentificados, el diccionario de datos, las rúbricas de calificación y la sintaxis estadística utilizados para respaldar la reproducibilidad están disponibles públicamente en el repositorio Zenodo: https://zenodo.org/records/21991446. Listas de verificación adicionales para informes, planos de los instrumentos, reglas de puntuación y documentación del conjunto de datos se proporcionan en Archivo Suplementario 1.
Archivo suplementario 1: Materiales de reproducibilidad para el estudio de entrenamiento en realidad virtual colaborativa en espacios amplios. Este archivo contiene el cuestionario para participantes, el esquema de la prueba de conocimientos, la rúbrica de coordinación evaluada por observadores, el diccionario de datos, las reglas de puntuación y limpieza, el esquema de sintaxis estadística, la estructura del conjunto de datos analíticos desidentificados y la lista de verificación para informes. Haga clic aquí para descargar este archivo.