Fluxo de participantes e populações de análise
Um total de 126 participantes foram inscritos e distribuídos em 42 equipes de três pessoas. Cada condição de treinamento recebeu 14 equipes, resultando em 42 participantes no grupo de simulação colaborativa em desktop, 42 no grupo de realidade virtual colaborativa distribuída em escala de ambiente e 42 no grupo de realidade virtual colaborativa co-localizada em espaço amplo. Todas as equipes concluíram a sessão de treinamento designada e foram mantidas no conjunto de dados de intenção de tratar.
A ausência de dados foi baixa e não esteve concentrada em nenhuma condição. Os escores de presença espacial estavam disponíveis para 124 participantes, incluindo 41 no grupo desktop, 42 no grupo em escala de cômodo e 41 no grupo em grande espaço. Os escores de coordenação da equipe autoavaliados estavam disponíveis para 123 participantes, com 41 participantes em cada grupo. Os escores de engajamento na aprendizagem estavam disponíveis para 122 participantes, incluindo 40 no grupo desktop, 41 no grupo em escala de cômodo e 41 no grupo em grande espaço. Os escores de desconforto simulador estavam disponíveis para 124 participantes, incluindo 42 no grupo desktop, 41 no grupo em escala de cômodo e 41 no grupo em grande espaço. Escores válidos de retenção de conhecimento após 2 semanas estavam disponíveis para 122 participantes, incluindo 40 no grupo desktop, 41 no grupo em escala de cômodo e 41 no grupo em grande espaço. A coordenação da equipe avaliada por observadores estava disponível para as 42 equipes inteiras. O fluxo de participantes, alocação, avaliação imediata e conclusão do acompanhamento são resumidos na Figura 3.

Figura 3: Fluxo dos participantes e populações para análise. O diagrama de fluxo mostra a inscrição, alocação de 126 participantes em 42 equipes de três pessoas, conclusão do treinamento, avaliação imediata, pontuação da coordenação avaliada por observadores e dados válidos de acompanhamento após duas semanas nas três condições de treinamento. Clique aqui para visualizar uma versão maior desta figura.
Características basais
As características demográficas e relacionadas ao treinamento na linha de base foram amplamente comparáveis entre as três condições. A amostra final consistiu de participantes adultos jovens, graduandos e pós-graduandos. Os três grupos foram semelhantes quanto à idade, exposição prévia à realidade virtual, familiaridade com jogos ou simulações, experiência prévia em treinamentos em equipe e treinamentos prévios em logística de emergência, navegação ou segurança industrial.
Os escores de conhecimento pré-treinamento também foram comparáveis entre os grupos. Os escores médios de conhecimento pré-treinamento foram 16,17 ± 3,09 no grupo de simulação colaborativa em desktop, 16,10 ± 3,61 no grupo de realidade virtual colaborativa distribuída em escala de ambiente e 15,55 ± 3,23 no grupo de realidade virtual colaborativa co-localizada em grande espaço. A comparação entre grupos sem ajuste não foi estatisticamente significativa, F(2, 123) = 0,44, p = 0,647, η2 = 0,007.
As características basais e as medidas pré-treinamento são apresentadas na Tabela 2. Antes dos testes inferenciais de hipóteses, avaliações diagnósticas indicaram que as variáveis contínuas principais atenderam às premissas de normalidade dos resíduos e homogeneidade da variância. A consistência interna foi alta em todos os instrumentos psicométricos, com coeficientes alfa de Cronbach de 0,86 para presença espacial, 0,88 para coordenação da equipe autoavaliada e 0,91 para engajamento na aprendizagem. Todas as diferenças significativas entre grupos nas principais variáveis desfecho permaneceram significativas após ajuste da taxa de descobertas falsas de Benjamini-Hochberg.
Tabela 2: Características basais e medidas pré-treinamento. Esta tabela relata dados demográficos dos participantes, experiência prévia com realidade virtual e treinamentos, familiaridade com jogos ou simulações, histórico prévio de treinamentos relacionados e escores de conhecimento pré-treinamento nas três condições experimentais. Clique aqui para baixar esta tabela.
Presença espacial
A presença espacial foi analisada utilizando um modelo linear de efeitos mistos com a condição de treinamento como efeito fixo e o código da equipe como intercepto aleatório. Os testes do modelo de efeitos mistos utilizaram graus de liberdade ajustados pelo método de Satterthwaite. O modelo revelou um efeito significativo da condição de treinamento sobre a presença espacial, F(2, 39) = 23,91, p < 0,001. As médias marginais estimadas foram 4,13 para o grupo de simulação colaborativa em desktop, 5,00 para o grupo de realidade virtual colaborativa distribuída em escala de sala e 5,42 para o grupo de realidade virtual colaborativa co-localizada em espaço amplo.
As comparações pareadas ajustadas por Tukey mostraram que a presença espacial foi maior no grupo de ambiente amplo do que no grupo de desktop, diferença média estimada = 1,29, IC 95%: 0,86 – 1,72, p < 0,001. A presença espacial também foi maior no grupo de ambiente amplo do que no grupo de escala reduzida, diferença média estimada = 0,42, IC 95%: 0,04 – 0,80, p = 0,027. O grupo de escala reduzida obteve pontuação maior do que o grupo de desktop, diferença média estimada = 0,87, IC 95%: 0,45 – 1,29, p < 0,001.
Para comparação descritiva, as médias não ajustadas ± desvio padrão (DP) foram de 4,13 ± 0,91 no grupo de ambiente de mesa, 5,00 ± 0,79 no grupo de ambiente em escala real e 5,42 ± 0,80 no grupo de grande espaço. A análise de variância (ANOVA) não ajustada mostrou o mesmo padrão, F(2, 121) = 25,68, p < 0,001, η2 = 0,298. As distribuições dos resultados primários são apresentadas na Figura 4, e as estatísticas descritivas e de efeitos mistos correspondentes estão resumidas na Tabela 3.

Figura 4: Resultados primários nas diferentes condições de treinamento. (A) Presença espacial. (B) Coordenação da equipe autoavaliada. (C) Coordenação da equipe avaliada por observador. (D) Engajamento na aprendizagem. A presença espacial, a coordenação da equipe autoavaliada e o engajamento na aprendizagem foram resultados ao nível dos participantes; a coordenação da equipe avaliada por observador foi analisada ao nível da equipe. As barras de erro indicam o desvio padrão. Clique aqui para visualizar uma versão maior desta figura.
Tabela 3: Resultados primários. Esta tabela resume a presença espacial, coordenação da equipe autoavaliada, coordenação da equipe avaliada por observador e engajamento na aprendizagem nas três condições de treinamento. Também são apresentados os modelos estatísticos inferenciais correspondentes e verificações de sensibilidade à taxa de descobertas falsas. Clique aqui para baixar esta tabela.
Coordenação da equipe
A coordenação da equipe autoavaliada foi analisada no nível do participante utilizando um modelo linear de efeitos mistos com a condição de treinamento como efeito fixo e o código da equipe como intercepto aleatório. O modelo revelou um efeito significativo da condição de treinamento, F(2, 39) = 9,96, p < 0,001. As médias marginais estimadas foram 4,54 no grupo desktop, 4,49 no grupo em escala de sala e 5,17 no grupo de grande espaço.
As comparações ajustadas por Tukey mostraram que a coordenação da equipe autoavaliada foi maior no grupo de espaço amplo do que no grupo de desktop, diferença média estimada = 0,63, IC 95%: 0,25 – 1,01, p = 0,002. O grupo de espaço amplo também obteve pontuação maior do que o grupo em escala de sala, diferença média estimada = 0,68, IC 95%: 0,29 – 1,07, p < 0,001. Os grupos de desktop e em escala de sala não diferiram significativamente, diferença média estimada = 0,05, IC 95%: −0,33 – 0,43, p = 0,942. Para comparação descritiva, as médias não ajustadas ± DP foram 4,54 ± 0,63 no grupo de desktop, 4,49 ± 0,75 no grupo em escala de sala e 5,17 ± 0,81 no grupo de espaço amplo. A ANOVA não ajustada produziu o mesmo padrão direcional, F(2, 120) = 10,84, p < 0,001, η2 = 0,153.
A coordenação da equipe avaliada pelo observador foi analisada no nível da equipe, conforme pré-especificado. A confiabilidade entre avaliadores ultrapassou o limiar pré-definido, com um coeficiente de correlação intraclasse de efeitos aleatórios bidirecionais de ICC = 0,84. Três gravações de equipes apresentaram diferenças totais nas pontuações dos observadores superiores a 12 pontos e foram resolvidas mediante revisão por consenso. A coordenação avaliada pelo observador diferiu significativamente entre as condições, F(2, 39) = 10,92, p < 0,001, η2 = 0,359. As pontuações médias no nível da equipe foram 56,84 ± 9,14 no grupo desktop, 65,01 ± 9,56 no grupo de escala ambiente e 71,81 ± 8,70 no grupo de grande espaço. Comparações ajustadas por Tukey mostraram coordenação avaliada pelo observador maior no grupo de grande espaço do que no grupo desktop, diferença média = 14,97, IC 95%: 7,33 – 22,61, p < 0,001. O grupo de grande espaço também obteve pontuação superior à do grupo de escala ambiente, diferença média = 6,80, IC 95%: 0,42 – 13,18, p = 0,035. O grupo de escala ambiente obteve pontuação superior à do grupo desktop, diferença média = 8,17, IC 95%: 1,31 – 15,03, p = 0,017. A coordenação autoavaliada e a avaliada pelo observador apresentaram a mesma ordenação entre os grupos, sendo que o grupo de grande espaço obteve as pontuações mais altas em ambas as medidas.
Comprometimento com a aprendizagem
O comprometimento com a aprendizagem foi analisado utilizando um modelo linear de efeitos mistos com a condição de treinamento como efeito fixo e o código da equipe como intercepto aleatório. O modelo revelou um efeito significativo da condição de treinamento, F(2, 39) = 37,46, p < 0,001. As médias marginais estimadas foram 4,22 no grupo desktop, 4,74 no grupo em escala de sala e 5,63 no grupo em espaço amplo. Comparações pareadas ajustadas por Tukey mostraram que o comprometimento foi maior no grupo em espaço amplo do que no grupo desktop, diferença média estimada = 1,41, IC 95%: 1,03 – 1,79, p < 0,001. O comprometimento também foi maior no grupo em espaço amplo do que no grupo em escala de sala, diferença média estimada = 0,89, IC 95%: 0,53 – 1,25, p < 0,001. O grupo em escala de sala obteve pontuação superior à do grupo desktop, diferença média estimada = 0,52, IC 95%: 0,15 – 0,89, p = 0,006.
Para comparação descritiva, as médias não ajustadas ± DP foram 4,22 ± 0,76 no grupo de ambiente de mesa, 4,74 ± 0,67 no grupo de ambiente em escala reduzida e 5,63 ± 0,73 no grupo de grande espaço. A ANOVA não ajustada mostrou o mesmo padrão, F(2, 119) = 40,00, p < 0,001, η2 = 0,402.
Verificações de sensibilidade da taxa de falsas descobertas para os desfechos primários
O procedimento de taxa de falsas descobertas de Benjamini-Hochberg foi aplicado nos quatro desfechos primários pré-especificados: presença espacial, coordenação da equipe autoavaliada, coordenação da equipe avaliada por observador e engajamento na aprendizagem. Todos os quatro desfechos primários permaneceram estatisticamente significativos após o ajuste. A verificação de sensibilidade da taxa de falsas descobertas produziu o mesmo padrão de desfechos primários observado nas análises principais.
Resultados do conhecimento e retenção
O conhecimento imediatamente após o treinamento foi analisado utilizando um modelo de efeitos mistos com a condição de treinamento como efeito fixo, o conhecimento pré-treinamento como covariável e o código da equipe como intercepto aleatório. O modelo ajustado mostrou um efeito de grupo não significativo para o conhecimento pós-treinamento, F(2, 39) = 2,14, p = 0,131. As médias marginais estimadas foram 20,12 para o grupo desktop, 20,96 para o grupo em escala de sala e 21,85 para o grupo em espaço amplo. Para comparação descritiva, as pontuações médias de conhecimento após o treinamento foram 20,09 ± 4,04 no grupo desktop, 21,00 ± 4,57 no grupo em escala de sala e 21,84 ± 3,95 no grupo em espaço amplo. A comparação entre grupos sem ajuste não foi estatisticamente significativa, F(2, 123) = 1,83, p = 0,165, η2 = 0,029.
O ganho de conhecimento da linha de base até a avaliação imediatamente após o treinamento foi avaliado como um resultado inferencial exploratório secundário. Os ganhos médios foram de 3,93 ± 2,88 pontos no grupo de desktop, 4,91 ± 2,12 pontos no grupo de escala ambiente e 6,30 ± 2,75 pontos no grupo de grande espaço. O efeito do grupo não ajustado foi significativo, F(2, 123) = 8,77, p < 0,001, η2 = 0,125. Comparações ajustadas por Tukey mostraram maior ganho de conhecimento no grupo de grande espaço em comparação com o grupo de desktop, diferença média = 2,37, IC 95%: 0,96 – 3,78, p < 0,001. O grupo de grande espaço também apresentou maior ganho do que o grupo de escala ambiente, diferença média = 1,39, IC 95%: 0,14 – 2,64, p = 0,026. Os grupos de escala ambiente e de desktop não diferiram significativamente, diferença média = 0,98, IC 95%: −0,31 – 2,27, p = 0,171.
Na avaliação de acompanhamento de duas semanas, o conhecimento de retenção foi analisado entre participantes com respostas válidas de retenção dentro da janela predeterminada entre o dia 13 e o dia 16. O modelo misto ajustado, controlando para o conhecimento prévio ao treinamento e incluindo o código da equipe como intercepto aleatório, mostrou um efeito de grupo não significativo, F(2, 39) = 1,68, p = 0,199. As pontuações médias de retenção foram 18,70 ± 4,55 no grupo desktop, 19,62 ± 4,37 no grupo em escala de cômodo e 20,42 ± 4,38 no grupo em grande espaço. A comparação entre grupos sem ajuste também não foi estatisticamente significativa, F(2, 119) = 1,53, p = 0,220, η2 = 0,025. Os desfechos secundários de aprendizagem são resumidos na Tabela 4.
Tabela 4: Resultados secundários de aprendizagem nas diferentes condições de treinamento. Esta tabela apresenta o conhecimento pré-treinamento, o conhecimento imediatamente após o treinamento, o ganho de conhecimento e a retenção do conhecimento após 2 semanas nas três condições de treinamento. São apresentados modelos mistos ajustados para os resultados secundários de aprendizagem. Clique aqui para baixar esta tabela.
Carga cognitiva e desconforto no simulador
A carga cognitiva foi analisada como um desfecho secundário. A carga cognitiva média foi de 4,22 ± 0,69 no grupo desktop, 4,49 ± 0,62 no grupo em escala ambiente e 4,13 ± 0,82 no grupo de grande espaço. O efeito do grupo não ajustado foi F(2, 123) = 2,92, p = 0,058, η2 = 0,045. Esse resultado não atingiu o limiar de significância pré-definido.
O desconforto no simulador variou entre as condições. O índice médio de desconforto pós-tarefa foi de 1,37 ± 0,71 no grupo desktop, 2,18 ± 0,79 no grupo de ambiente virtual em escala de sala e 2,42 ± 0,58 no grupo de grande espaço. O efeito do grupo sem ajuste foi significativo, F(2, 121) = 25,72, p < 0,001, η2 = 0,298. Os escores de desconforto foram mais altos nos dois grupos de realidade virtual do que no grupo desktop, embora os valores médios tenham permanecido na faixa leve. Nenhum participante atendeu ao critério pré-definido de interrupção de qualquer item de desconforto ≥7. Sete participantes apresentaram índice de desconforto pós-tarefa ≥5 e receberam contato para verificação da resolução dos sintomas em 24 h. Dentre esses participantes, quatro tinham índice de desconforto pós-tarefa >6 e também foram monitorados no laboratório por pelo menos 15 minutos antes de sair. Todos os sete participantes relataram resolução dos sintomas sem necessidade de encaminhamento médico. Nenhuma sessão foi interrompida devido ao desconforto no simulador, e nenhum evento adverso que exigisse cuidados clínicos foi registrado. A carga cognitiva e o desconforto no simulador são apresentadas na Figura 5.

Figura 5: Carga cognitiva e desconforto no simulador ao longo das condições de treinamento. (A) Carga cognitiva, pontuada de 1 a 7, em que pontuações mais altas indicam maior carga de trabalho percebida. (B) Desconforto no simulador após a tarefa, pontuado de 0 a 10 e baseado em náusea, tontura, esforço ocular, dor de cabeça e desconforto no equilíbrio. As barras de erro indicam o desvio padrão. Clique aqui para visualizar uma versão maior desta figura.
Indicadores do processo da tarefa
Os indicadores do processo da tarefa foram utilizados para descrever o desempenho da equipe durante a tarefa colaborativa de treinamento de 20 min. A conclusão da tarefa foi de 71,4% no grupo desktop, 78,6% no grupo em escala de sala e 85,7% no grupo em grande espaço. O tempo médio de conclusão foi de 1.041,6 ± 162,4 s no grupo desktop, 984,3 ± 151,8 s no grupo em escala de sala e 931,7 ± 139,6 s no grupo em grande espaço. Como as equipes incompletas tiveram um limite de tempo de 1.200 s, o tempo de conclusão foi interpretado de forma descritiva.
O número médio de recursos corretos selecionados foi de 2,21 ± 0,70 no grupo de desktop, 2,43 ± 0,65 no grupo de escala ambiente e 2,64 ± 0,50 no grupo de grande espaço. O número médio de alertas de risco corretamente gerenciados foi de 1,93 ± 0,83, 2,21 ± 0,70 e 2,50 ± 0,65, respectivamente. O número médio de erros de trajeto foi de 2,07 ± 1,14 no grupo de desktop, 1,50 ± 0,94 no grupo de escala ambiente e 1,00 ± 0,78 no grupo de grande espaço. As interrupções por segurança foram infrequentes em todas as condições, com médias de 0,21 ± 0,43, 0,29 ± 0,47 e 0,36 ± 0,50, respectivamente. O status de conclusão da tarefa, tempo de conclusão, seleção correta de recursos, alertas de risco gerenciados corretamente, erros de trajeto e interrupções por segurança estão resumidos na Tabela 5.
Tabela 5: Indicadores do processo da tarefa e eventos de segurança. Esta tabela resume medidas objetivas de desempenho na tarefa, incluindo taxas de conclusão, erros de navegação no percurso e manuseio de riscos. Também são relatados o monitoramento de desconforto no simulador e eventos clínicos adversos registrados. Clique aqui para baixar esta tabela.
Associações entre presença, coordenação, engajamento e aprendizagem
As respostas psicométricas no nível dos participantes foram agregadas em médias de agrupamento no nível da equipe antes da integração com as medidas de coordenação avaliadas por observadores. A análise de correlação no nível da equipe revelou associações positivas entre presença espacial e engajamento na aprendizagem (r = 0.57), coordenação da equipe autoavaliada (r = 0.26) e coordenação avaliada por observadores (r = 0.32).
O padrão de correlação indicou sobreposição moderada entre presença, coordenação e engajamento, enquanto as correlações com o ganho de conhecimento foram menores. O padrão de correlação indicou sobreposição entre presença, coordenação e engajamento, enquanto as associações com o ganho de conhecimento foram menores. Essas análises foram exploratórias e não estabelecem trajetórias causais entre os resultados mensurados. A matriz de correlação é apresentada na Figura 6.

Figura 6: Matriz de correlação para presença, coordenação, engajamento e resultados de aprendizagem. O mapa de calor mostra os coeficientes de correlação de Pearson entre presença espacial, coordenação da equipe autoavaliada, coordenação da equipe avaliada por observador, engajamento na aprendizagem, conhecimento pós-treinamento, retenção do conhecimento após 2 semanas, carga cognitiva e ganho de conhecimento. Clique aqui para visualizar uma versão maior desta figura.
O grupo de realidade virtual colaborativa em grande espaço apresentou maior presença espacial, coordenação da equipe autoavaliada, coordenação da equipe avaliada por observador e engajamento na aprendizagem do que os grupos de comparação. Esses resultados principais permaneceram significativos após o controle do agrupamento por equipe e da correção da taxa de erro tipo I. Para os desfechos secundários, o ganho de conhecimento favoreceu o grupo de grande espaço, enquanto o conhecimento pós-treinamento ajustado e o conhecimento de retenção após duas semanas não diferiram significativamente entre as condições. A carga cognitiva não diferiu significativamente entre os grupos, e o desconforto simulador permaneceu leve em média, apesar dos escores mais elevados nas condições de realidade virtual.
DISPONIBILIDADE DE DADOS:
O conjunto de dados analítico com identificação removida, o dicionário de dados, as rubricas de pontuação e a sintaxe estatística utilizados para apoiar a reprodutibilidade estão disponíveis publicamente no repositório Zenodo - https://zenodo.org/records/21991446. Listas de verificação adicionais para relatórios, modelos dos instrumentos, regras de pontuação e documentação do conjunto de dados são fornecidos no Arquivo Suplementar 1.
Arquivo Suplementar 1: Materiais de Reprodutibilidade para o Estudo de Treinamento em Realidade Virtual Colaborativa em Ambiente Amplo. Este arquivo contém o questionário para participantes, o modelo do teste de conhecimento, a rubrica de coordenação avaliada por observador, o dicionário de dados, as regras de pontuação e limpeza, o esboço da sintaxe estatística, a estrutura do conjunto de dados analíticos com identificação removida e a lista de verificação para relatórios. Clique aqui para baixar este arquivo.