$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudo foi realizado de acordo com a Declaração de Helsinque e aprovado pelo Comitê de Ética do Hospital Sir Run Run Shaw, Faculdade de Medicina da Universidade de Zhejiang (Número de Aprovação: 0480, aprovado em 10 de agosto de 2025). Todos os participantes forneceram consentimento informado por escrito antes da participação.
Desenho e ambiente do estudo
Um estudo observacional prospectivo com alocação departamental baseada em clusters foi realizado de janeiro de 2024 a fevereiro de 2025 no Hospital Sir Run Run Shaw, Escola de Medicina da Universidade de Zhejiang, Hangzhou, China. A estratégia de alocação baseada em departamentos introduz elementos quase-experimentais nesse desenho; Assim, inferências causais devem ser interpretadas com a devida cautela16. O estudo utilizou uma comparação paralela com a alocação baseada na atribuição departamental para evitar o compartilhamento de informações entre grupos. A matrícula estratificada foi implementada para garantir características de base comparáveis. O hospital mantinha um laboratório dedicado de simulação equipado com ambientes padronizados de sala de cirurgia, instrumentos cirúrgicos, equipamentos de monitoramento e capacidade de gravação de vídeo.
Seleção de amostras e participantes
Profissionais de saúde foram recrutados por meio de amostragem aleatória estratificada de todos os funcionários perioperatórios elegíveis (n = 342) no Hospital Sir Run Run Shaw entre novembro de 2023 e janeiro de 2024. As variáveis de estratificação incluíam função profissional (enfermeiros, tecnólogos cirúrgicos e técnicos de anestesia), nível de experiência (<5, 5–10, 10–15 e >15 anos), nível educacional (cursos de associado, bacharelado e mestrado) e departamento clínico (cirurgia geral, cirurgia ortopédica, cirurgia cardiovascular e outras especialidades). Números aleatórios gerados por computador (software R, set.seed = 12345 para reprodutibilidade) foram aplicados em cada estrato usando a função de amostragem para garantir amostragem representativa em todas as categorias demográficas e profissionais. O tamanho da amostra foi calculado usando o software G*Power 3.1.9.7 com base em dados preliminares do piloto (n = 30) com um tamanho de efeito previsto de Cohen's d = 0,60, nível de significância bilateral α = 0,05 e potência estatística desejada (1 − β) = 0,80, indicando um requisito mínimo de 90 participantes (45 por grupo). Para levar em conta a taxa prevista de 15% de abandono (atrito) com base em dados históricos institucionais, a meta de matrícula foi fixada em 104 participantes. A matrícula real atingiu 120 participantes, fornecendo 87% de poder após contabilizar os últimos 11% de desistência.
Critérios de inclusão exigidos
(1) emprego atual no Hospital Sir Run Run Shaw em funções perioperatórias; (2) mínimo 6 meses de experiência em sala de cirurgia; (3) disponibilidade durante toda a duração de 13 meses do estudo; (4) disposição para participar de todas as atividades de avaliação; e (5) alfabetização básica em computadores, definida como a capacidade de navegar por navegadores web e usar teclado/mouse de forma independente.
Critérios de exclusão incluídos
Licença prolongada planejada durante o período de estudo, participação em outros programas de treinamento com instrumentos cirúrgicos nos últimos 6 meses, deficiência visual não corrigível para visão 20/40 ou melhor, e matrícula atual em programas formais de graduação em tecnologia cirúrgica. Um total de 120 participantes foram inicialmente recrutados, com 107 completando o protocolo completo do estudo (taxa de conclusão de 89,2%). Os motivos para a saída incluíram mudanças de emprego (n = 7), circunstâncias pessoais (n = 4) e dificuldades relacionadas à tecnologia (n = 2). A análise de atrito usando regressão logística não mostrou associação significativa entre as características de retirada e de base, incluindo idade (OR = 1,03, p = 0,52), gênero (OR = 0,87, p = 0,85), papel profissional (p = 0,73) ou escores de PIPS de base (OR = 1,01, p = 0,67), indicando um padrão de ausência aleatória confirmado pelo teste MCAR de Little (χ2 = 43,2, df = 38, p = 0,26).
Designação em grupo
Para minimizar os efeitos de contaminação inerentes às intervenções educacionais, os participantes foram designados para grupos de intervenção ou controle com base na afiliação departamental. Os departamentos (n = 8) foram agrupados em pares com base no volume de casos cirúrgicos e no tamanho da equipe e, em seguida, atribuídos aleatoriamente a APLS ou condições de controle usando randomização gerada por computador (software R, seed = 54321). Essa abordagem baseada em clusters foi adotada porque a randomização individual dentro dos departamentos poderia causar contaminação cruzada substancial à medida que colegas compartilham conhecimento e experiências de treinamento. Reconhece-se que a cultura departamental, a qualidade da liderança, as práticas educacionais básicas e a combinação de casos podem influenciar independentemente os resultados, representando fontes potenciais de confusão residual que não podem ser totalmente abordadas em um desenho randomizadonão individualizado 16. A amostragem estratificada garantiu características de linha de base comparáveis. Avaliadores de resultados que realizaram avaliações PIPS foram cegos para a atribuição em grupo por meio de identificadores codificados de participantes. Analistas estatísticos receberam conjuntos de dados desidentificados com rótulos de grupo mascarados até que as análises primárias fossem concluídas.
Arquitetura do sistema APLS e implementação técnica
O APLS compreende quatro componentes computacionais integrados operando em uma plataforma baseada em nuvem (Tabela de Materiais). O sistema foi desenvolvido usando frameworks de deep learning open-source e uma interface baseada na web (veja Tabela de Materiais) com protocolos RESTful API (Interface de programação de aplicações de transferência de estado representacional, permitindo comunicação padronizada baseada em HTTP entre o cliente front-end e os módulos de aprendizado de máquina do lado do servidor), autenticação baseada em JSON Web Token (JWT) (garantindo que apenas usuários autorizados e componentes do sistema possam acessar dados do aprendiz e modelar endpoints). e criptografia na camada de transporte TLS 1.3 (que protege todos os dados em trânsito entre dispositivos clientes, o servidor de aplicações e a infraestrutura de serviço de modelos baseada em nuvem) para segurança de dados. Uma descrição completa do ambiente de software, incluindo especificações de dependência (requirements.txt), estrutura de arquivos de configuração e comandos de inicialização do pipeline de dados, é fornecida no Arquivo Suplementar 1.
Configuração e calibração de hardware
Antes de cada sessão de treinamento, a seguinte sequência de calibração de hardware era realizada. Um dispositivo de rastreamento ocular (veja Tabela de Materiais) foi posicionado a 60–70 cm dos olhos do participante em um suporte ajustável em altura, e a calibração foi executada usando o protocolo padrão de 9 pontos do fabricante com precisão de ≤0,5° de ângulo visual. Um conjunto de oito câmeras (veja Tabela de Materiais) foi disposto em configuração circular com raio de 2,5 m a partir do centro da estação de treinamento, posicionado em alturas alternadas entre 1,8 m e 2,4 m, e calibrado usando o procedimento da varinha do fabricante com um limiar de erro residual de ≤0,3 mm. Marcadores refletivos (n = 16, diâmetro = 12,7 mm) foram fixados em marcos anatômicos padronizados em ambas as mãos e punhos, de acordo com o protocolo de colocação de marcadores descrito no Arquivo Suplementar 2. Dispositivos de monitoramento fisiológico foram instalados conforme as instruções do fabricante e verificados quanto à qualidade do sinal antes do início da sessão.
Componente 1: Sistema de classificação de fenótipos do aprendiz
O sistema de classificação emprega uma abordagem híbrida em duas etapas que combina aprendizado não supervisionado e supervisionado. No Estágio 1, o agrupamento k-means é usado em dados de avaliação de linha de base para descobrir agrupamentos naturais de aprendizes. As características de entrada (n = 37) incluem pontuações de domínio PIPS de referência (4 características), pontuações do inventário do estilo de aprendizado VARK (4 características), velocidade de processamento cognitivo de tarefas computarizadas de tempo de reação (3 características), pontuações de conforto tecnológico (1 característica), variáveis demográficas (3 características), capacidade de memória de trabalho a partir de testes de amplitude de dígitos (2 características), raciocínio espacial a partir de tarefas de rotação mental (1 característica), escores de referência de habilidades motoras finas (3 características), Cinco grandes traços de personalidade (5 características) e métricas de desempenho anteriores de registros institucionais (3 características). Especificações detalhadas de pré-processamento, procedimentos de otimização de hiperparâmetros e rankings de importância de características são fornecidos no Arquivo Suplementar 1 (Seção S2). Os três agrupamentos resultantes foram caracterizados como rápidos (30,9%), médios (49,1%) e aprendizes lentos (20,0%). No Estágio 2, a classificação supervisionada é realizada usando máquinas de vetores de suporte treinadas com rótulos de cluster para permitir a classificação em tempo real de novos aprendizes. O espaço completo de busca por hiperparâmetros, os resultados de validação cruzada e as métricas de classificação por classe são reportados no Arquivo Suplementar 1 (Seção S2.3).
Componente 2: Integração multimodal de dados e sistema de fusão de sensores
A plataforma integra cinco fluxos de dados heterogêneos: dados de rastreamento ocular, dados de captura de movimento, monitoramento fisiológico (variabilidade da frequência cardíaca, resposta galvânica da pele e cortisol salival), análise de desempenho via análise automatizada de vídeo e registro de interações. Especificações detalhadas dos sensores, pipelines de pré-processamento, procedimentos de extração de características e a arquitetura da rede neural convolucional para estimação do estado cognitivo são descritos no Arquivo Suplementar 1 (Seção S3). O sistema de fusão produz representações de estados cognitivos que são atualizadas a cada 1s e codificam atenção integrada, execução motora, carga cognitiva e desempenho da tarefa.
Componente 3: Motor de análise preditiva
O sistema de previsão em conjunto combina três algoritmos complementares: floresta aleatória, máquina de aumento de gradiente (XGBoost) e uma rede neural profunda com camadas de memória de longo curto prazo (LSTM) que processam embeddings cognitivos como séries temporais. A agregação de conjunto utiliza votação soft ponderada com pesos otimizados por dados de validação. As especificações algorítmicas completas, valores de hiperparâmetro, procedimentos de treinamento e diagnósticos de convergência são fornecidos no Arquivo Suplementar 1 (Seção S4). Os conjuntos de dados de treinamento, validação, implantação e avaliação eram estritamente separados; O desenvolvimento do modelo utilizou exclusivamente dados de um estudo piloto anterior com 150 participantes (80% treinamento, 20% validação), e os participantes atuais constituíram um conjunto de dados totalmente mantido para implantação. O retreinamento contínuo durante a implantação usou apenas os dados de interação dos 7 dias anteriores e não incorporou dados de avaliação de resultados, prevenindo assim o vazamento dos resultados para modelos de previsão.
Componente 4: Sistema de feedback adaptativo baseado em aprendizado por reforço
O sistema de feedback adaptativo emprega Q-learning, formulando a seleção de feedback como um processo de decisão de Markov. O espaço de estados (25 dimensões) codifica o estado cognitivo atual, o contexto temporal, os parâmetros da tarefa e as características do aprendiz. O espaço de ações compreende 25 ações discretas que representam combinações de modalidade de feedback, tempo e especificidade. A função de recompensa incorpora melhoria de desempenho, prevenção de sobrecarga cognitiva, manutenção do engajamento e latência de correção. A formulação matemática do espaço de estados, espaço de ações, função de recompensa, parâmetros de atualização do Q-learning e critérios de convergência é detalhada no Arquivo Suplementar 1 (Seção S5).
Fluxo de trabalho das sessões de treinamento
Cada sessão de treinamento da APLS ocorre de acordo com a seguinte sequência padronizada. (1) O participante faz login na plataforma APLS usando as credenciais atribuídas na estação de trabalho de treinamento designada. (2) A calibração de hardware foi verificada (eye-tracker, captura de movimento e sensores fisiológicos) com verificações automáticas de qualidade confirmando a integridade aceitável do sinal. (3) O sistema recupera a classificação atual do fenótipo do aprendiz do participante e a trajetória prevista de competência para configurar os parâmetros da sessão. (4) Um módulo inicial de aquecimento (5 min) apresenta uma revisão do conteúdo da sessão anterior, adaptada ao padrão de retenção do participante. (5) O módulo de treinamento central (40-50 min) apresenta a identificação, manuseio e tarefas procedimentais de instrumentos em níveis de dificuldade determinados pelo algoritmo adaptativo, com feedback multimodal em tempo real fornecido de acordo com uma política de Q-learning. (6) Um resumo da sessão e um painel de desempenho são exibidos, mostrando o progresso em relação à trajetória pessoal de aprendizagem do participante e aos marcos de competência. (7) O participante responde a uma breve pesquisa de satisfação (2 min). (8) Os dados da sessão são automaticamente enviados para o servidor na nuvem para atualização do modelo.
Procedimentos do grupo de controle
O grupo controle recebeu treinamento tradicional de instrumentos na sala de cirurgia, seguindo protocolos institucionais padronizados. O treinamento consistia em uma sessão teórica inicial de 8 horas em sala de aula por educadores de enfermagem sênior da sala de cirurgia (OR), cobrindo categorias de instrumentos, nomenclatura, princípios de manuseio e técnica estéril; um manual de treinamento impresso (187 páginas) contendo fotografias de instrumentos, especificações e descrições organizadas por especialidade cirúrgica; dois workshops práticos de 4 horas em laboratórios de simulação com conjuntos físicos de instrumentos sob supervisão do instrutor (proporção instrutor-aprendiz 1:6); acesso ao sistema de gestão institucional de aprendizagem contendo materiais digitais de treinamento para revisão autodirigida; e sessões trimestrais de atualização agendadas (2 h) revisando instrumentos comumente confundidos. O tempo total estruturado de instrução foi de 20 horas durante o período de estudo. Nenhum algoritmo adaptativo, caminhos personalizados ou componentes aprimorados por IA foram incorporados.
Medidas de resultado
O resultado primário foi a retenção de conhecimento avaliada aos 12 meses após o treinamento, utilizando a Escala de Proficiência em Instrumentos Perioperatórios (PIPS) validada. O processo completo de desenvolvimento do PIPS, incluindo a geração de itens a partir de uma revisão bibliográfica e grupos focais de especialistas, validação de conteúdo Delphi modificada em três rodadas (índice de validade de conteúdo = 0,94), análise fatorial exploratória e confirmatória, e a rubrica completa de pontuação ancorada comportamentalmente, está documentado no Arquivo Suplementar 3. O instrumento demonstrou fortes propriedades psicométricas (α de Cronbach = 0,92, teste-re-teste ICC = 0,91 em intervalos de 2 semanas). O PIPS consiste em 24 itens distribuídos em quatro domínios: identificação de instrumentos (6 itens), proficiência em manuseio (6 itens), protocolos de segurança (6 itens) e comunicação com equipes (6 itens). Cada item utiliza uma escala de Likert de cinco pontos (1 = iniciante a 5 = especialista) com descritores ancorados no comportamento. A pontuação total varia de 24 a 120, com pontuações mais altas indicando maior proficiência.
As avaliações PIPS foram conduzidas por avaliadores treinados (seis enfermeiros cirúrgicos com >10 anos de experiência em cirurgia que completaram um programa padronizado de treinamento de 8 horas) no começo, imediatamente após a intervenção e nos acompanhamentos de 1, 3, 6 e 12 meses. Os avaliadores foram cegados para a tarefa em grupo por meio de identificadores codificados dos participantes e avaliaram gravações de vídeo editadas para remover quaisquer elementos visíveis de interface ou displays de feedback específicos do APLS. Os avaliadores não foram informados sobre qual modalidade de treinamento os participantes haviam recebido. A confiabilidade entre avaliadores foi estabelecida por meio da codificação dupla de 20% das avaliações (n = 128), alcançando um ICC > 0,85 em todos os domínios (pontuação total ICC = 0,89, IC 95%: 0,85-0,92).
Os resultados secundários foram os seguintes: (1) competência prática avaliada por meio da avaliação estruturada objetiva de habilidades técnicas (OSATS) adaptada para o manuseio de instrumentos, compreendendo seis estações padronizadas (máximo 30 pontos), administrada por avaliadores especialistas cegados (ICC = 0,87) no início da linha de partida e aos 3, 6 e 12 meses. (2) A eficiência do tempo de treinamento foi medida como o total de horas para atingir o limite de competência (PIPS ≥ 75). (3) A relação custo-efetividade é calculada como o custo por aprendiz competente, incorporando custos diretos e indiretos, com custos normalizados para 2024 yuans chineses usando dados contábeis institucionais. (4) A satisfação do aprendiz foi avaliada usando um questionário da escala Likert de 5 pontos (27 itens, consistência interna α = 0,91). (5) Métricas exploratórias de desempenho clínico dos sistemas institucionais de relatórios de segurança: relatórios de incidentes relacionados a instrumentos durante o período pós-treinamento de 12 meses, com taxas por 1.000 casos cirúrgicos ajustadas pela complexidade do caso. Os desfechos dos incidentes de segurança foram classificados como exploratórios porque o estudo não foi alimentado para detectar diferenças nesses eventos de baixa frequência.
Métodos de análise estatística
Todas as análises estatísticas foram conduzidas usando a versão R 4.3.0 com a interface RStudio e os seguintes pacotes: lme4 para modelos de efeitos mistos, emmeans ("médias marginais estimadas"; um pacote R para calcular médias de grupo ajustadas pelo modelo e realizar comparações post hoc de Tukey, Bonferroni ou Scheffé a partir de modelos ajustados de efeitos mistos), psych para análises psicométricas, effsize (um pacote R para calcular tamanhos padronizados de efeito, incluindo d de Cohen e g de Hedges, com intervalos de confiança) para cálculos de tamanho de efeito, e camundongos para imputação múltipla. O limiar de significância foi estabelecido a priori em α = 0,05 (bidirecional) para todos os testes de hipótese.
Múltiplas correções comparativas foram aplicadas da seguinte forma. Para o resultado primário (escore total PIPS entre os pontos de tempo), a inferência foi extraída da interação Group × Time dentro do modelo linear de efeitos mistos usando graus de liberdade de Kenward-Roger, que não requer correção separada para múltiplos pontos de tempo. Para as subescalas do domínio PIPS (quatro comparações simultâneas), foi aplicada a correção de Bonferroni (ajustada α = 0,0125). Para os desfechos secundários (quatro medidas: pontuação de eficiência do OR, incidentes de segurança, pontuação de comunicação do TEAM e frequência de erros), foi aplicado o procedimento de taxa de falsas descobertas de Benjamini-Hochberg (q = 0,05). Para métricas de desempenho do sistema de IA (dez comparações internas), foi aplicada a correção de Bonferroni (ajustada α = 0,005). Todos os valores-p relatados e determinações de significância referenciam explicitamente a correção aplicável.
Todos os desfechos primários e secundários entre grupos foram analisados usando modelos lineares de efeitos mistos com efeitos fixos para grupo, tempo e sua interação, e interceptos aleatórios tanto para participantes quanto para departamentos (para levar em conta a correlação intraclasse resultante da alocação baseada em clusters). O coeficiente de correlação intraclasse no nível do departamento foi estimado para quantificar o grau de agrupamento. Padrões de dados ausentes foram avaliados usando o teste MCAR de Little; os dados foram considerados completamente ausentes aleatoriamente e foram tratados por meio de múltiplas imputações usando correspondência preditiva de médias (m = 20 conjuntos de dados imputados, resultados agrupados pelas regras de Rubin). Análises de sensibilidade com análise completa de casos, números variados de imputação (m = 10, m = 50) e cenários de pior e melhor caso avaliaram a robustez.