Flusso dei partecipanti e popolazioni di analisi
Un totale di 126 partecipanti sono stati arruolati e assegnati a 42 squadre da tre persone. A ciascuna condizione di addestramento sono state assegnate 14 squadre, per un totale di 42 partecipanti nel gruppo di simulazione collaborativa su desktop, 42 nel gruppo di realtà virtuale collaborativa distribuita su scala ambientale e 42 nel gruppo di realtà virtuale collaborativa co-locata su grande spazio. Tutte le squadre hanno completato la sessione di addestramento assegnata e sono state mantenute nel dataset di analisi per intenzione-di-trattare.
La percentuale di dati mancanti era bassa e non era concentrata in alcuna condizione. I punteggi relativi alla presenza spaziale erano disponibili per 124 partecipanti, di cui 41 nel gruppo desktop, 42 nel gruppo room-scale e 41 nel gruppo large-space. I punteggi autovalutati di coordinamento di squadra erano disponibili per 123 partecipanti, con 41 partecipanti in ciascun gruppo. I punteggi di impegno nell'apprendimento erano disponibili per 122 partecipanti, di cui 40 nel gruppo desktop, 41 nel gruppo room-scale e 41 nel gruppo large-space. I punteggi relativi al disagio da simulatore erano disponibili per 124 partecipanti, di cui 42 nel gruppo desktop, 41 nel gruppo room-scale e 41 nel gruppo large-space. I punteggi validi di conoscenza alla ritenzione a 2 settimane erano disponibili per 122 partecipanti, di cui 40 nel gruppo desktop, 41 nel gruppo room-scale e 41 nel gruppo large-space. La valutazione del coordinamento di squadra effettuata dall'osservatore era disponibile per tutte e 42 le squadre. Il flusso dei partecipanti, l'assegnazione, la valutazione immediata e il completamento del follow-up sono riassunti nella Figura 3.

Figura 3: Flusso dei partecipanti e popolazioni analizzate. Il diagramma di flusso illustra l'arruolamento, l'assegnazione di 126 partecipanti in 42 squadre da tre persone, il completamento della formazione, la valutazione immediata, la valutazione dell'osservatore sulla coordinazione e i dati validi di follow-up a 2 settimane nei tre gruppi di formazione. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Caratteristiche alla baseline
Le caratteristiche demografiche e relative alla formazione alla baseline erano in generale comparabili tra le tre condizioni. Il campione finale era composto da partecipanti giovani adulti, sia universitari che post-laurea. I tre gruppi erano simili per età, esposizione precedente alla realtà virtuale, familiarità con giochi o simulazioni, esperienza pregressa in formazioni basate sul lavoro di squadra ed esperienza precedente in logistica di emergenza, navigazione o formazione sulla sicurezza industriale.
Anche i punteggi relativi alle conoscenze pre-addestramento erano comparabili tra i gruppi. I punteggi medi pre-addestramento erano 16,17 ± 3,09 nel gruppo della simulazione collaborativa su desktop, 16,10 ± 3,61 nel gruppo della realtà virtuale collaborativa distribuita su scala ambientale e 15,55 ± 3,23 nel gruppo della realtà virtuale collaborativa co-locata su grande spazio. Il confronto tra gruppi non aggiustato non era statisticamente significativo, F(2, 123) = 0,44, p = 0,647, η2 = 0,007.
Le caratteristiche alla baseline e le misurazioni pre-allenamento sono riportate nella Tabella 2. Prima dei test inferenziali delle ipotesi, le valutazioni diagnostiche hanno indicato che le variabili continue principali soddisfacevano le assunzioni di normalità dei residui e di omogeneità della varianza. La coerenza interna era elevata per tutti gli strumenti psicometrici, con coefficienti alfa di Cronbach pari a 0,86 per la presenza spaziale, 0,88 per la coordinazione del team autovalutata e 0,91 per l'impegno nell'apprendimento. Tutte le differenze significative tra i gruppi per gli esiti principali sono rimaste significative dopo la correzione del tasso di falsa scoperta di Benjamini-Hochberg.
Tabella 2: Caratteristiche alla baseline e misurazioni pre-allenamento. Questa tabella riporta le caratteristiche demografiche dei partecipanti, l'esperienza pregressa con la realtà virtuale e la formazione, la familiarità con videogiochi o simulazioni, la storia precedente di formazione correlata e i punteggi di conoscenza pre-allenamento nei tre gruppi sperimentali. Cliccare qui per scaricare questa tabella.
Presenza spaziale
La presenza spaziale è stata analizzata utilizzando un modello lineare a effetti misti con la condizione di addestramento come effetto fisso e il codice del team come intercetta casuale. I test del modello a effetti misti hanno utilizzato gradi di libertà aggiustati con il metodo di Satterthwaite. Il modello ha mostrato un effetto significativo della condizione di addestramento sulla presenza spaziale, F(2, 39) = 23,91, p < 0,001. Le medie marginali stimate sono state 4,13 per il gruppo di simulazione collaborativa su desktop, 5,00 per il gruppo di realtà virtuale collaborativa distribuita su scala ambientale e 5,42 per il gruppo di realtà virtuale collaborativa co-locata in spazi ampi.
I confronti a coppie con aggiustamento di Tukey hanno mostrato che la presenza spaziale era maggiore nel gruppo dello spazio ampio rispetto al gruppo desktop, differenza media stimata = 1,29, IC 95%: 0,86 – 1,72, p < 0,001. La presenza spaziale era inoltre maggiore nel gruppo dello spazio ampio rispetto al gruppo in scala reale, differenza media stimata = 0,42, IC 95%: 0,04 – 0,80, p = 0,027. Il gruppo in scala reale ha ottenuto punteggi più alti rispetto al gruppo desktop, differenza media stimata = 0,87, IC 95%: 0,45 – 1,29, p < 0,001.
Per un confronto descrittivo, i punteggi medi non aggiustati ± deviazione standard (DS) erano 4,13 ± 0,91 nel gruppo desktop, 5,00 ± 0,79 nel gruppo a scala ridotta e 5,42 ± 0,80 nel gruppo a grande spazio. L'analisi della varianza (ANOVA) non aggiustata ha mostrato lo stesso andamento, F(2, 121) = 25,68, p < 0,001, η2 = 0,298. Le distribuzioni degli esiti primari sono mostrate in Figura 4, mentre le corrispondenti statistiche descrittive e a effetti misti sono riassunte in Tabella 3.

Figura 4: Risultati primari in diverse condizioni di addestramento. (A) Presenza spaziale. (B) Coordinamento del team autovalutato. (C) Coordinamento del team valutato dall’osservatore. (D) Impegno nell’apprendimento. La presenza spaziale, il coordinamento del team autovalutato e l’impegno nell’apprendimento erano risultati a livello di partecipante; il coordinamento del team valutato dall’osservatore è stato analizzato a livello di gruppo. Le barre di errore indicano la deviazione standard. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Tabella 3: Risultati primari. Questa tabella riassume la presenza spaziale, la coordinazione del team autovalutata, la coordinazione del team valutata dall'osservatore e l'impegno nell'apprendimento nei tre condizioni di addestramento. Vengono inoltre presentati i corrispondenti modelli statistici inferenziali e i controlli di sensibilità relativi al tasso di scoperte false. Cliccare qui per scaricare questa tabella.
Coordinamento del team
Il coordinamento del team autovalutato è stato analizzato a livello dei partecipanti utilizzando un modello lineare a effetti misti con la condizione di addestramento come effetto fisso e il codice del team come intercetta casuale. Il modello ha mostrato un effetto significativo della condizione di addestramento, F(2, 39) = 9,96, p < 0,001. Le medie marginali stimate sono state 4,54 nel gruppo desktop, 4,49 nel gruppo room-scale e 5,17 nel gruppo large-space.
I confronti corretti con il metodo di Tukey hanno mostrato che l'autovalutazione della coordinazione di gruppo era più elevata nel gruppo dello spazio ampio rispetto al gruppo del desktop, differenza media stimata = 0,63, IC 95%: 0,25 – 1,01, p = 0,002. Il gruppo dello spazio ampio ha ottenuto anche punteggi più alti rispetto al gruppo della stanza su scala reale, differenza media stimata = 0,68, IC 95%: 0,29 – 1,07, p < 0,001. I gruppi del desktop e della stanza su scala reale non differivano in modo significativo, differenza media stimata = 0,05, IC 95%: −0,33 – 0,43, p = 0,942. Per un confronto descrittivo, i punteggi medi non aggiustati ± DS erano 4,54 ± 0,63 nel gruppo del desktop, 4,49 ± 0,75 nel gruppo della stanza su scala reale e 5,17 ± 0,81 nel gruppo dello spazio ampio. L'ANOVA non aggiustata ha prodotto lo stesso andamento direzionale, F(2, 120) = 10,84, p < 0,001, η2 = 0,153.
La coordinazione del team valutata dall'osservatore è stata analizzata a livello di gruppo, come specificato in anticipo. L'affidabilità tra valutatori ha superato la soglia predeterminata, con un coefficiente di correlazione intraclasse a effetti casuali bilaterali pari a ICC = 0,84. Tre registrazioni di team hanno mostrato differenze totali superiori a 12 punti tra i valutatori ed sono state risolte mediante revisione consensuale. La coordinazione valutata dall'osservatore differiva in modo significativo tra le condizioni, F(2, 39) = 10,92, p < 0,001, η2 = 0,359. I punteggi medi a livello di team sono stati 56,84 ± 9,14 nel gruppo desktop, 65,01 ± 9,56 nel gruppo a scala ambiente e 71,81 ± 8,70 nel gruppo a spazio ampio. I confronti aggiustati con il metodo di Tukey hanno mostrato una coordinazione valutata dall'osservatore maggiore nel gruppo a spazio ampio rispetto al gruppo desktop, differenza media = 14,97, IC 95%: 7,33 – 22,61, p < 0,001. Il gruppo a spazio ampio ha ottenuto anche punteggi superiori rispetto al gruppo a scala ambiente, differenza media = 6,80, IC 95%: 0,42 – 13,18, p = 0,035. Il gruppo a scala ambiente ha ottenuto punteggi più alti rispetto al gruppo desktop, differenza media = 8,17, IC 95%: 1,31 – 15,03, p = 0,017. La coordinazione autovalutata e quella valutata dall'osservatore hanno mostrato lo stesso ordine tra i gruppi, con il gruppo a spazio ampio che ha ottenuto i punteggi più elevati in entrambe le misurazioni.
Impegno nell'apprendimento
L'impegno nell'apprendimento è stato analizzato utilizzando un modello lineare a effetti misti con la condizione di addestramento come effetto fisso e il codice del team come intercetta casuale. Il modello ha mostrato un effetto significativo della condizione di addestramento, F(2, 39) = 37,46, p < 0,001. Le medie marginali stimate erano 4,22 nel gruppo desktop, 4,74 nel gruppo a scala ambiente e 5,63 nel gruppo a grande spazio. Confronti a coppie con aggiustamento di Tukey hanno mostrato che l'impegno era maggiore nel gruppo a grande spazio rispetto al gruppo desktop, differenza media stimata = 1,41, IC 95%: 1,03 – 1,79, p < 0,001. L'impegno era inoltre maggiore nel gruppo a grande spazio rispetto al gruppo a scala ambiente, differenza media stimata = 0,89, IC 95%: 0,53 – 1,25, p < 0,001. Il gruppo a scala ambiente ha ottenuto punteggi più elevati rispetto al gruppo desktop, differenza media stimata = 0,52, IC 95%: 0,15 – 0,89, p = 0,006.
Per un confronto descrittivo, i punteggi medi non aggiustati ± DS erano 4,22 ± 0,76 nel gruppo desktop, 4,74 ± 0,67 nel gruppo a scala ridotta e 5,63 ± 0,73 nel gruppo a grande spazio. L'ANOVA non aggiustata ha mostrato lo stesso andamento, F(2, 119) = 40,00, p < 0,001, η2 = 0,402.
Verifiche di sensibilità del tasso di scoperte false per i risultati primari
La procedura del tasso di scoperte false di Benjamini-Hochberg è stata applicata ai quattro risultati primari predeterminati: presenza spaziale, coordinamento del team autovalutato, coordinamento del team valutato dall’osservatore e impegno nell’apprendimento. Tutti e quattro i risultati primari sono rimasti statisticamente significativi dopo la correzione. La verifica di sensibilità del tasso di scoperte false ha prodotto lo stesso schema di risultati primari ottenuto nelle analisi principali.
Risultati e mantenimento delle conoscenze
La conoscenza immediatamente successiva alla formazione è stata analizzata utilizzando un modello a effetti misti con la condizione di formazione come effetto fisso, la conoscenza pre-formazione come covariata e il codice del gruppo come intercetta casuale. Il modello aggiustato ha mostrato un effetto di gruppo non significativo per la conoscenza post-formazione, F(2, 39) = 2.14, p = 0.131. Le medie marginali stimate sono state 20,12 per il gruppo desktop, 20,96 per il gruppo a scala ambiente e 21,85 per il gruppo a grande spazio. A scopo descrittivo, i punteggi medi di conoscenza post-formazione sono stati 20,09 ± 4,04 nel gruppo desktop, 21,00 ± 4,57 nel gruppo a scala ambiente e 21,84 ± 3,95 nel gruppo a grande spazio. Il confronto non aggiustato tra gruppi non è risultato statisticamente significativo, F(2, 123) = 1,83, p = 0,165, η2 = 0,029.
Il guadagno di conoscenza dal basale alla valutazione immediatamente successiva alla formazione è stato valutato come esito inferenziale secondario esplorativo. I guadagni medi sono stati di 3,93 ± 2,88 punti nel gruppo desktop, 4,91 ± 2,12 punti nel gruppo a scala ambiente e 6,30 ± 2,75 punti nel gruppo a grande spazio. L'effetto del gruppo non aggiustato è risultato significativo, F(2, 123) = 8,77, p < 0,001, η2 = 0,125. I confronti aggiustati con il metodo di Tukey hanno mostrato un maggiore guadagno di conoscenza nel gruppo a grande spazio rispetto al gruppo desktop, differenza media = 2,37, IC 95%: 0,96 – 3,78, p < 0,001. Il gruppo a grande spazio ha mostrato anche un guadagno maggiore rispetto al gruppo a scala ambiente, differenza media = 1,39, IC 95%: 0,14 – 2,64, p = 0,026. I gruppi a scala ambiente e desktop non differivano in modo significativo, differenza media = 0,98, IC 95%: −0,31 – 2,27, p = 0,171.
Al follow-up di 2 settimane, la conoscenza di mantenimento è stata analizzata tra i partecipanti con risposte valide di mantenimento all'interno della finestra predefinita dal giorno 13 al giorno 16. Il modello a effetti misti aggiustato, corretto per la conoscenza pre-addestramento e con il codice del gruppo incluso come intercetta casuale, ha mostrato un effetto di gruppo non significativo, F(2, 39) = 1,68, p = 0,199. I punteggi medi di mantenimento sono stati 18,70 ± 4,55 nel gruppo desktop, 19,62 ± 4,37 nel gruppo a scala ambiente e 20,42 ± 4,38 nel gruppo a grande spazio. Anche il confronto tra gruppi non aggiustato non è risultato statisticamente significativo, F(2, 119) = 1,53, p = 0,220, η2 = 0,025. Gli esiti secondari dell'apprendimento sono riassunti nella Tabella 4.
Tabella 4: Esiti secondari dell'apprendimento nei diversi condizioni di formazione. Questa tabella riporta le conoscenze pre-formazione, le conoscenze immediatamente successive alla formazione, il guadagno di conoscenze e il mantenimento delle conoscenze a 2 settimane nelle tre condizioni di formazione. Vengono presentati modelli ad effetti misti aggiustati per gli esiti secondari dell'apprendimento. Cliccare qui per scaricare questa tabella.
Carico cognitivo e disagio del simulatore
Il carico cognitivo è stato analizzato come esito secondario. Il carico cognitivo medio è stato di 4,22 ± 0,69 nel gruppo desktop, 4,49 ± 0,62 nel gruppo room-scale e 4,13 ± 0,82 nel gruppo large-space. L'effetto del gruppo non aggiustato è stato F(2, 123) = 2,92, p = 0,058, η2 = 0,045. Questo risultato non ha raggiunto la soglia di significatività predeterminata.
Il disagio provocato dal simulatore variava a seconda delle condizioni. L'indice medio di disagio dopo il compito era di 1,37 ± 0,71 nel gruppo desktop, 2,18 ± 0,79 nel gruppo room-scale e 2,42 ± 0,58 nel gruppo large-space. L'effetto del gruppo non aggiustato era significativo, F(2, 121) = 25,72, p < 0,001, η2 = 0,298. I punteggi di disagio erano più elevati nei due gruppi di realtà virtuale rispetto al gruppo desktop, anche se i valori medi rimanevano nell'intervallo lieve. Nessun partecipante ha soddisfatto il criterio predeterminato di interruzione per cui un qualsiasi elemento di disagio fosse ≥7. Sette partecipanti hanno riportato un indice di disagio dopo il compito ≥5 e hanno ricevuto un contatto per la risoluzione dei sintomi entro 24 ore. Tra questi partecipanti, quattro avevano un indice di disagio dopo il compito >6 e sono stati inoltre monitorati in laboratorio per almeno 15 minuti prima di andare via. Tutti e sette i partecipanti hanno riferito la risoluzione dei sintomi senza necessità di ricorso medico. Nessuna sessione è stata interrotta a causa del disagio provocato dal simulatore e non è stato registrato alcun evento avverso che richiedesse cure cliniche. Carico cognitivo e disagio del simulatore sono mostrati in Figura 5.

Figura 5: Carico cognitivo e disagio al simulatore nelle diverse condizioni di addestramento. (A) Carico cognitivo, valutato da 1 a 7, in cui punteggi più alti indicano un carico percepito maggiore. (B) Disagio al simulatore dopo il compito, valutato da 0 a 10 e basato su nausea, capogiri, affaticamento oculare, mal di testa e instabilità. Le barre di errore indicano la deviazione standard. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Indicatori del processo di esecuzione del compito
Gli indicatori del processo di esecuzione del compito sono stati utilizzati per descrivere le prestazioni del team durante il compito di formazione collaborativa della durata di 20 minuti. Il completamento del compito è stato del 71,4% nel gruppo desktop, del 78,6% nel gruppo room-scale e dell'85,7% nel gruppo large-space. Il tempo medio di completamento è stato di 1.041,6 ± 162,4 s nel gruppo desktop, 984,3 ± 151,8 s nel gruppo room-scale e 931,7 ± 139,6 s nel gruppo large-space. Poiché ai team incompleti è stato assegnato un limite di tempo di 1.200 s, il tempo di completamento è stato interpretato in modo descrittivo.
Il numero medio di risorse corrette selezionate è stato di 2,21 ± 0,70 nel gruppo desktop, 2,43 ± 0,65 nel gruppo room-scale e 2,64 ± 0,50 nel gruppo large-space. Il numero medio di solleciti sui rischi gestiti correttamente è stato rispettivamente di 1,93 ± 0,83, 2,21 ± 0,70 e 2,50 ± 0,65. Gli errori medi nel percorso sono stati di 2,07 ± 1,14 nel gruppo desktop, 1,50 ± 0,94 nel gruppo room-scale e 1,00 ± 0,78 nel gruppo large-space. Le interruzioni per motivi di sicurezza sono state infrequenti in tutte le condizioni, con valori medi di 0,21 ± 0,43, 0,29 ± 0,47 e 0,36 ± 0,50, rispettivamente. Lo stato di completamento del compito, il tempo di completamento, la selezione corretta delle risorse, i solleciti sui rischi gestiti correttamente, gli errori nel percorso e le interruzioni per sicurezza sono riassunti nella Tabella 5.
Tabella 5: Indicatori del processo di esecuzione del compito ed eventi di sicurezza. Questa tabella riassume misure oggettive di prestazione nel compito, inclusi tassi di completamento, errori di navigazione del percorso e gestione dei rischi. Vengono inoltre riportati il monitoraggio del disagio indotto dal simulatore e gli eventi clinici avversi registrati. Cliccare qui per scaricare questa tabella.
Associazioni tra presenza, coordinamento, coinvolgimento e apprendimento
Le risposte psicometriche a livello individuale sono state aggregate in medie di gruppo prima dell'integrazione con le misure di coordinamento valutate dall'osservatore. L'analisi delle correlazioni a livello di gruppo ha mostrato associazioni positive tra presenza spaziale e coinvolgimento nell'apprendimento (r = 0.57), coordinamento del gruppo autovalutato (r = 0.26) e coordinamento valutato dall'osservatore (r = 0.32).
Il modello di correlazione ha indicato un sovrapposizione moderata tra presenza, coordinamento e coinvolgimento, mentre le correlazioni con l'acquisizione di conoscenza erano più ridotte. Il modello di correlazione ha indicato un sovrapposizione tra presenza, coordinamento e coinvolgimento, mentre le associazioni con l'acquisizione di conoscenza erano più ridotte. Queste analisi erano esplorative e non stabiliscono percorsi causali tra gli esiti misurati. La matrice di correlazione è mostrata in Figura 6.

Figura 6: Matrice di correlazione per presenza, coordinamento, coinvolgimento e risultati dell'apprendimento. La mappa termica mostra i coefficienti di correlazione di Pearson tra presenza spaziale, coordinamento del team autovalutato, coordinamento del team valutato dall’osservatore, coinvolgimento nell'apprendimento, conoscenza post-formazione, conoscenza mantenuta dopo 2 settimane, carico cognitivo e incremento della conoscenza. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Il gruppo in realtà virtuale collaborativa collocato in uno spazio ampio ha mostrato una presenza spaziale maggiore, una coordinazione di squadra autovalutata e valutata dall'osservatore più elevata, e un maggiore coinvolgimento nell'apprendimento rispetto ai gruppi di confronto. Questi risultati principali sono rimasti significativi dopo aver tenuto conto del raggruppamento delle squadre e dopo la correzione per il tasso di falsa scoperta. Per quanto riguarda gli esiti secondari, l'aumento delle conoscenze ha favorito il gruppo in spazio ampio, mentre le conoscenze post-formazione aggiustate e quelle di mantenimento a 2 settimane non hanno mostrato differenze significative tra le condizioni. Il carico cognitivo non ha mostrato differenze significative tra i gruppi, e il disagio nel simulatore è rimasto lieve in media, nonostante punteggi più alti nelle condizioni di realtà virtuale.
DISPONIBILITÀ DEI DATI:
Il set di dati analitici anonimizzato, il dizionario dei dati, le griglie di valutazione e la sintassi statistica utilizzata per supportare la riproducibilità sono disponibili pubblicamente nel repository Zenodo - https://zenodo.org/records/21991446. Ulteriori checklist di report, schemi degli strumenti, regole di valutazione e documentazione del set di dati sono forniti in File Supplementare 1.
File Supplementare 1: Materiali per la Riproducibilità dello Studio sulla Formazione in Realtà Virtuale Collaborativa in Ambienti Ampi. Questo file contiene il questionario per i partecipanti, la struttura del test delle conoscenze, la griglia di valutazione della coordinazione effettuata dall'osservatore, il dizionario dei dati, le regole di punteggio e di pulizia dei dati, la struttura della sintassi statistica, la struttura del dataset analitico con dati anonimizzati e la checklist per la redazione della relazione. Cliccare qui per scaricare il file.