Research Article

Aprendizagem Personalizada Impulsionada por Inteligência Artificial Melhora o Treinamento com Instrumentos na Sala de Cirurgia: Um Estudo Observacional Prospectivo

DOI:

10.3791/70487

April 17th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo observacional prospectivo demonstrou que um sistema de aprendizagem personalizada movido por inteligência artificial melhorou significativamente a competência de longo prazo com instrumentos na sala de cirurgia, reduziu incidentes de segurança e aumentou a eficiência do treinamento em comparação com a instrução tradicional.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O treinamento tradicional com instrumentos em sala de cirurgia frequentemente depende de um ensino único para todos, produz baixa retenção de habilidades a longo prazo e contribui para erros cirúrgicos evitáveis. O presente estudo hipotetizou que um sistema de aprendizagem personalizado movido por inteligência artificial (IA) poderia melhorar a competência técnica, a segurança do paciente e a eficiência do treinamento ao adaptar a prática aos perfis individuais dos alunos. Um sistema de aprendizagem personalizada (APLS) movido por IA foi desenvolvido que combina fenotipagem do aprendiz orientada por dados, reconhecimento de instrumentos baseado em deep learning, previsão conjunta de trajetórias de competências e aprendizado por reforço para fornecer feedback multimodal adaptativo durante treinamento baseado em simulação. Em um estudo observacional prospectivo com alocação departamental baseada em clusters (introduzindo elementos quase experimentais) em um hospital terciário, 107 funcionários multidisciplinares da sala de cirurgia completaram o currículo orientado por IA ou o treinamento padrão liderado por instrutor. O resultado primário foi a retenção da competência no manuseio de instrumentos em 12 meses, medida pela escala de proficiência em instrumentos perioperatório (PIPS); Os resultados secundários incluíram incidentes de segurança na sala de cirurgia, tempo de treinamento e custo por profissional competente. Comparado ao treinamento tradicional, o sistema personalizado esteve associado a pontuações de competência em 12 meses substancialmente mais altas (APLS 84,1 ± 9,2 vs. Controle 58,9 ± 18,7, p < 0,001), menos eventos relacionados à segurança na prática clínica e quase metade do tempo de treinamento, reduzindo os custos gerais de treinamento em 38,3%. O conjunto de IA também superou seus componentes individuais de aprendizado de máquina ao prever o desempenho do aprendiz e selecionar estratégias de feedback. Esses achados sugerem que integrar descoberta de fenótipos não supervisionada, previsão supervisionada e aprendizado por reforço em uma plataforma unificada pode aprimorar significativamente o treinamento com instrumentos na sala de cirurgia e oferecer uma estrutura escalável para o desenvolvimento da força de trabalho orientada por dados no cuidado perioperatório.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O ambiente de sala de cirurgia representa um dos ambientes mais complexos da área da saúde, no qual a colaboração multidisciplinar eficaz impacta diretamente os resultados da segurança do paciente e a qualidadecirúrgica 1,2. O treinamento inadequado em competência instrumental contribui para cerca de 15.000 erros cirúrgicos evitáveis anualmente apenas em hospitais chineses, com falhas de comunicação e deficiências técnicas representando 72% dos eventos adversosperioperatórios 3. Abordagens tradicionais de treinamento dependem de metodologias padronizadas que não levam em conta diferenças individuais de aprendizagem, variações no processamento cognitivo e trajetórias personalizadas de desenvolvimentode competências 4,5.

Do ponto de vista teórico, vários quadros educacionais evidenciam por que abordagens personalizadas podem ser superiores ao ensino padronizado em domínios psicomotores complexos. A teoria da cargacognitiva 6 postula que o design instrucional deve levar em conta a capacidade limitada da memória de trabalho, especialmente quando os aprendizes precisam processar simultaneamente informações procedurais, conceituais e perceptuais novas em ambientes de alta fidelidade, como a sala decirurgia 7. Ao adaptar a dificuldade do conteúdo e a modalidade de apresentação aos perfis cognitivos individuais, sistemas personalizados podem otimizar o equilíbrio entre carga cognitiva intrínseca e extraínseca. O arcabouço da prática deliberada sugere ainda que a aquisição de habilidades é maximizada quando o treinamento incorpora níveis individualizados de desafio, feedback corretivo imediato e repetição focada nas fraquezas identificadas, elementos difíceis de implementar consistentemente em modelos tradicionais de aprendizagem, mas que são naturalmente operacionalizados por meio de adaptaçãoalgorítmica 8. Além disso, a zona de desenvolvimento proximal fornece uma base teórica para o ajuste adaptativo da dificuldade, sugerindo que o aprendizado é mais eficaz quando as tarefas são calibradas para ficarem logo além da capacidade independente atualdo aprendiz 9. Essas considerações teóricas apoiam coletivamente a hipótese de que um sistema de IA capaz de ajustar dinamicamente parâmetros instrucionais às características individuais do aprendiz deveria superar o treinamento estático e único para todos.

Avanços recentes em aprendizado de máquina e análise de desempenho em tempo real ofereceram potencial significativo para enfrentar desafioseducacionais 6,7. Aplicações contemporâneas de IA na educação cirúrgica têm mostrado potencial, com estudos relatando melhorias substanciais na aquisição de habilidades quando sistemas de feedback baseados em IA sãoimplementados. No entanto, plataformas existentes de treinamento cirúrgico baseadas em IA, incluindo sistemas comercialmente disponíveis como Touch Surgery e plataformas similares analisadas em um estudoanterior 8, baseiam-se principalmente em arquiteturas de algoritmo único, tipicamente redes neurais isoladas ou árvores de decisão, que oferecem ensaio de procedimentos por meio de guias visuais passo a passo, sem feedback adaptativo em tempo real ou otimização individualizada de caminhos de aprendizagem. Estudos anteriores não integraram o processamento multimodal de fusão de sensores de fluxos de dados heterogêneos (rastreamento ocular, captura de movimento e monitoramento fisiológico) com mecanismos de feedback adaptativo que se ajustam dinamicamente às trajetórias individuais de aprendizagem por meio do aprendizadopor reforço 10,11. Além disso, sistemas existentes não combinaram descoberta de fenótipos não supervisionada com métodos de predição supervisionada dentro de um quadro educacionalunificado 12,13. Essas lacunas representam oportunidades perdidas, já que a literatura teórica sobre aprendizagem personalizada sugere fortemente que sistemas adaptativos integrados e multicomponentes deveriam ser mais eficazes do que abordagens de componenteúnico 14.

Os atuais marcos educacionais em ambientes perioperatórios enfrentam várias limitações importantes 8,15. Modelos tradicionais de aprendizagem proporcionam experiências de aprendizagem inconsistentes, com variabilidade significativa na qualidade dos instrutores, padronização de feedback e confiabilidade da avaliação de competências. Essas abordagens não acomodam estilos de aprendizagem diversos, não se adaptam às taxas de progresso individuais e carecem das análises sofisticadas necessárias para otimizar os resultadoseducacionais 11,15. Para atender a essas necessidades não atendidas, este estudo apresenta o sistema de aprendizagem personalizada alimentado por IA (APLS), uma intervenção educacional abrangente que unifica quatro componentes algoritmicamente distintos dentro de uma única plataforma adaptativa, projetada para treinamento multidisciplinar de instrumentos em sala de cirurgia. Até onde sabemos, o sistema está entre os primeiros a integrar empiricamente as seguintes capacidades na literatura de educação cirúrgica: uma arquitetura híbrida que combina agrupamento não supervisionado para descoberta de fenótipos de aprendizes orientados por dados com classificação supervisionada para atribuição de fenótipos em tempo real; um pipeline de aprendizado por transferência que adapta uma rede neural convolucional pré-treinada para o reconhecimento visual de instrumentos cirúrgicos usando dados limitados específicos de domínio; um módulo de aprendizagem por reforço que refina iterativamente o tempo e a modalidade do feedback por meio da interação com o aprendiz; e uma estrutura de previsão em conjunto que sintetiza resultados de múltiplos algoritmos heterogêneos para prever trajetórias de competência com maior precisão do que qualquer modelo constituinte. Ao avaliar o APLS em relação ao treinamento padrão liderado por instrutores, por meio de uma comparação prospectiva de 12 meses entre resultados de aprendizagem, indicadores de desempenho clínico, eficiência do treinamento e custo-efetividade, este estudo busca determinar se uma plataforma personalizada unificada e impulsionada por IA pode avançar significativamente a educação em instrumentos perioperatórios além da prática pedagógica atual.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo foi realizado de acordo com a Declaração de Helsinque e aprovado pelo Comitê de Ética do Hospital Sir Run Run Shaw, Faculdade de Medicina da Universidade de Zhejiang (Número de Aprovação: 0480, aprovado em 10 de agosto de 2025). Todos os participantes forneceram consentimento informado por escrito antes da participação.

Desenho e ambiente do estudo
Um estudo observacional prospectivo com alocação departamental baseada em clusters foi realizado de janeiro de 2024 a fevereiro de 2025 no Hospital Sir Run Run Shaw, Escola de Medicina da Universidade de Zhejiang, Hangzhou, China. A estratégia de alocação baseada em departamentos introduz elementos quase-experimentais nesse desenho; Assim, inferências causais devem ser interpretadas com a devida cautela16. O estudo utilizou uma comparação paralela com a alocação baseada na atribuição departamental para evitar o compartilhamento de informações entre grupos. A matrícula estratificada foi implementada para garantir características de base comparáveis. O hospital mantinha um laboratório dedicado de simulação equipado com ambientes padronizados de sala de cirurgia, instrumentos cirúrgicos, equipamentos de monitoramento e capacidade de gravação de vídeo.

Seleção de amostras e participantes
Profissionais de saúde foram recrutados por meio de amostragem aleatória estratificada de todos os funcionários perioperatórios elegíveis (n = 342) no Hospital Sir Run Run Shaw entre novembro de 2023 e janeiro de 2024. As variáveis de estratificação incluíam função profissional (enfermeiros, tecnólogos cirúrgicos e técnicos de anestesia), nível de experiência (<5, 5–10, 10–15 e >15 anos), nível educacional (cursos de associado, bacharelado e mestrado) e departamento clínico (cirurgia geral, cirurgia ortopédica, cirurgia cardiovascular e outras especialidades). Números aleatórios gerados por computador (software R, set.seed = 12345 para reprodutibilidade) foram aplicados em cada estrato usando a função de amostragem para garantir amostragem representativa em todas as categorias demográficas e profissionais. O tamanho da amostra foi calculado usando o software G*Power 3.1.9.7 com base em dados preliminares do piloto (n = 30) com um tamanho de efeito previsto de Cohen's d = 0,60, nível de significância bilateral α = 0,05 e potência estatística desejada (1 − β) = 0,80, indicando um requisito mínimo de 90 participantes (45 por grupo). Para levar em conta a taxa prevista de 15% de abandono (atrito) com base em dados históricos institucionais, a meta de matrícula foi fixada em 104 participantes. A matrícula real atingiu 120 participantes, fornecendo 87% de poder após contabilizar os últimos 11% de desistência.

Critérios de inclusão exigidos
(1) emprego atual no Hospital Sir Run Run Shaw em funções perioperatórias; (2) mínimo 6 meses de experiência em sala de cirurgia; (3) disponibilidade durante toda a duração de 13 meses do estudo; (4) disposição para participar de todas as atividades de avaliação; e (5) alfabetização básica em computadores, definida como a capacidade de navegar por navegadores web e usar teclado/mouse de forma independente.

Critérios de exclusão incluídos
Licença prolongada planejada durante o período de estudo, participação em outros programas de treinamento com instrumentos cirúrgicos nos últimos 6 meses, deficiência visual não corrigível para visão 20/40 ou melhor, e matrícula atual em programas formais de graduação em tecnologia cirúrgica. Um total de 120 participantes foram inicialmente recrutados, com 107 completando o protocolo completo do estudo (taxa de conclusão de 89,2%). Os motivos para a saída incluíram mudanças de emprego (n = 7), circunstâncias pessoais (n = 4) e dificuldades relacionadas à tecnologia (n = 2). A análise de atrito usando regressão logística não mostrou associação significativa entre as características de retirada e de base, incluindo idade (OR = 1,03, p = 0,52), gênero (OR = 0,87, p = 0,85), papel profissional (p = 0,73) ou escores de PIPS de base (OR = 1,01, p = 0,67), indicando um padrão de ausência aleatória confirmado pelo teste MCAR de Little (χ2 = 43,2, df = 38, p = 0,26).

Designação em grupo
Para minimizar os efeitos de contaminação inerentes às intervenções educacionais, os participantes foram designados para grupos de intervenção ou controle com base na afiliação departamental. Os departamentos (n = 8) foram agrupados em pares com base no volume de casos cirúrgicos e no tamanho da equipe e, em seguida, atribuídos aleatoriamente a APLS ou condições de controle usando randomização gerada por computador (software R, seed = 54321). Essa abordagem baseada em clusters foi adotada porque a randomização individual dentro dos departamentos poderia causar contaminação cruzada substancial à medida que colegas compartilham conhecimento e experiências de treinamento. Reconhece-se que a cultura departamental, a qualidade da liderança, as práticas educacionais básicas e a combinação de casos podem influenciar independentemente os resultados, representando fontes potenciais de confusão residual que não podem ser totalmente abordadas em um desenho randomizadonão individualizado 16. A amostragem estratificada garantiu características de linha de base comparáveis. Avaliadores de resultados que realizaram avaliações PIPS foram cegos para a atribuição em grupo por meio de identificadores codificados de participantes. Analistas estatísticos receberam conjuntos de dados desidentificados com rótulos de grupo mascarados até que as análises primárias fossem concluídas.

Arquitetura do sistema APLS e implementação técnica
O APLS compreende quatro componentes computacionais integrados operando em uma plataforma baseada em nuvem (Tabela de Materiais). O sistema foi desenvolvido usando frameworks de deep learning open-source e uma interface baseada na web (veja Tabela de Materiais) com protocolos RESTful API (Interface de programação de aplicações de transferência de estado representacional, permitindo comunicação padronizada baseada em HTTP entre o cliente front-end e os módulos de aprendizado de máquina do lado do servidor), autenticação baseada em JSON Web Token (JWT) (garantindo que apenas usuários autorizados e componentes do sistema possam acessar dados do aprendiz e modelar endpoints). e criptografia na camada de transporte TLS 1.3 (que protege todos os dados em trânsito entre dispositivos clientes, o servidor de aplicações e a infraestrutura de serviço de modelos baseada em nuvem) para segurança de dados. Uma descrição completa do ambiente de software, incluindo especificações de dependência (requirements.txt), estrutura de arquivos de configuração e comandos de inicialização do pipeline de dados, é fornecida no Arquivo Suplementar 1.

Configuração e calibração de hardware
Antes de cada sessão de treinamento, a seguinte sequência de calibração de hardware era realizada. Um dispositivo de rastreamento ocular (veja Tabela de Materiais) foi posicionado a 60–70 cm dos olhos do participante em um suporte ajustável em altura, e a calibração foi executada usando o protocolo padrão de 9 pontos do fabricante com precisão de ≤0,5° de ângulo visual. Um conjunto de oito câmeras (veja Tabela de Materiais) foi disposto em configuração circular com raio de 2,5 m a partir do centro da estação de treinamento, posicionado em alturas alternadas entre 1,8 m e 2,4 m, e calibrado usando o procedimento da varinha do fabricante com um limiar de erro residual de ≤0,3 mm. Marcadores refletivos (n = 16, diâmetro = 12,7 mm) foram fixados em marcos anatômicos padronizados em ambas as mãos e punhos, de acordo com o protocolo de colocação de marcadores descrito no Arquivo Suplementar 2. Dispositivos de monitoramento fisiológico foram instalados conforme as instruções do fabricante e verificados quanto à qualidade do sinal antes do início da sessão.

Componente 1: Sistema de classificação de fenótipos do aprendiz
O sistema de classificação emprega uma abordagem híbrida em duas etapas que combina aprendizado não supervisionado e supervisionado. No Estágio 1, o agrupamento k-means é usado em dados de avaliação de linha de base para descobrir agrupamentos naturais de aprendizes. As características de entrada (n = 37) incluem pontuações de domínio PIPS de referência (4 características), pontuações do inventário do estilo de aprendizado VARK (4 características), velocidade de processamento cognitivo de tarefas computarizadas de tempo de reação (3 características), pontuações de conforto tecnológico (1 característica), variáveis demográficas (3 características), capacidade de memória de trabalho a partir de testes de amplitude de dígitos (2 características), raciocínio espacial a partir de tarefas de rotação mental (1 característica), escores de referência de habilidades motoras finas (3 características), Cinco grandes traços de personalidade (5 características) e métricas de desempenho anteriores de registros institucionais (3 características). Especificações detalhadas de pré-processamento, procedimentos de otimização de hiperparâmetros e rankings de importância de características são fornecidos no Arquivo Suplementar 1 (Seção S2). Os três agrupamentos resultantes foram caracterizados como rápidos (30,9%), médios (49,1%) e aprendizes lentos (20,0%). No Estágio 2, a classificação supervisionada é realizada usando máquinas de vetores de suporte treinadas com rótulos de cluster para permitir a classificação em tempo real de novos aprendizes. O espaço completo de busca por hiperparâmetros, os resultados de validação cruzada e as métricas de classificação por classe são reportados no Arquivo Suplementar 1 (Seção S2.3).

Componente 2: Integração multimodal de dados e sistema de fusão de sensores
A plataforma integra cinco fluxos de dados heterogêneos: dados de rastreamento ocular, dados de captura de movimento, monitoramento fisiológico (variabilidade da frequência cardíaca, resposta galvânica da pele e cortisol salival), análise de desempenho via análise automatizada de vídeo e registro de interações. Especificações detalhadas dos sensores, pipelines de pré-processamento, procedimentos de extração de características e a arquitetura da rede neural convolucional para estimação do estado cognitivo são descritos no Arquivo Suplementar 1 (Seção S3). O sistema de fusão produz representações de estados cognitivos que são atualizadas a cada 1s e codificam atenção integrada, execução motora, carga cognitiva e desempenho da tarefa.

Componente 3: Motor de análise preditiva
O sistema de previsão em conjunto combina três algoritmos complementares: floresta aleatória, máquina de aumento de gradiente (XGBoost) e uma rede neural profunda com camadas de memória de longo curto prazo (LSTM) que processam embeddings cognitivos como séries temporais. A agregação de conjunto utiliza votação soft ponderada com pesos otimizados por dados de validação. As especificações algorítmicas completas, valores de hiperparâmetro, procedimentos de treinamento e diagnósticos de convergência são fornecidos no Arquivo Suplementar 1 (Seção S4). Os conjuntos de dados de treinamento, validação, implantação e avaliação eram estritamente separados; O desenvolvimento do modelo utilizou exclusivamente dados de um estudo piloto anterior com 150 participantes (80% treinamento, 20% validação), e os participantes atuais constituíram um conjunto de dados totalmente mantido para implantação. O retreinamento contínuo durante a implantação usou apenas os dados de interação dos 7 dias anteriores e não incorporou dados de avaliação de resultados, prevenindo assim o vazamento dos resultados para modelos de previsão.

Componente 4: Sistema de feedback adaptativo baseado em aprendizado por reforço
O sistema de feedback adaptativo emprega Q-learning, formulando a seleção de feedback como um processo de decisão de Markov. O espaço de estados (25 dimensões) codifica o estado cognitivo atual, o contexto temporal, os parâmetros da tarefa e as características do aprendiz. O espaço de ações compreende 25 ações discretas que representam combinações de modalidade de feedback, tempo e especificidade. A função de recompensa incorpora melhoria de desempenho, prevenção de sobrecarga cognitiva, manutenção do engajamento e latência de correção. A formulação matemática do espaço de estados, espaço de ações, função de recompensa, parâmetros de atualização do Q-learning e critérios de convergência é detalhada no Arquivo Suplementar 1 (Seção S5).

Fluxo de trabalho das sessões de treinamento
Cada sessão de treinamento da APLS ocorre de acordo com a seguinte sequência padronizada. (1) O participante faz login na plataforma APLS usando as credenciais atribuídas na estação de trabalho de treinamento designada. (2) A calibração de hardware foi verificada (eye-tracker, captura de movimento e sensores fisiológicos) com verificações automáticas de qualidade confirmando a integridade aceitável do sinal. (3) O sistema recupera a classificação atual do fenótipo do aprendiz do participante e a trajetória prevista de competência para configurar os parâmetros da sessão. (4) Um módulo inicial de aquecimento (5 min) apresenta uma revisão do conteúdo da sessão anterior, adaptada ao padrão de retenção do participante. (5) O módulo de treinamento central (40-50 min) apresenta a identificação, manuseio e tarefas procedimentais de instrumentos em níveis de dificuldade determinados pelo algoritmo adaptativo, com feedback multimodal em tempo real fornecido de acordo com uma política de Q-learning. (6) Um resumo da sessão e um painel de desempenho são exibidos, mostrando o progresso em relação à trajetória pessoal de aprendizagem do participante e aos marcos de competência. (7) O participante responde a uma breve pesquisa de satisfação (2 min). (8) Os dados da sessão são automaticamente enviados para o servidor na nuvem para atualização do modelo.

Procedimentos do grupo de controle
O grupo controle recebeu treinamento tradicional de instrumentos na sala de cirurgia, seguindo protocolos institucionais padronizados. O treinamento consistia em uma sessão teórica inicial de 8 horas em sala de aula por educadores de enfermagem sênior da sala de cirurgia (OR), cobrindo categorias de instrumentos, nomenclatura, princípios de manuseio e técnica estéril; um manual de treinamento impresso (187 páginas) contendo fotografias de instrumentos, especificações e descrições organizadas por especialidade cirúrgica; dois workshops práticos de 4 horas em laboratórios de simulação com conjuntos físicos de instrumentos sob supervisão do instrutor (proporção instrutor-aprendiz 1:6); acesso ao sistema de gestão institucional de aprendizagem contendo materiais digitais de treinamento para revisão autodirigida; e sessões trimestrais de atualização agendadas (2 h) revisando instrumentos comumente confundidos. O tempo total estruturado de instrução foi de 20 horas durante o período de estudo. Nenhum algoritmo adaptativo, caminhos personalizados ou componentes aprimorados por IA foram incorporados.

Medidas de resultado
O resultado primário foi a retenção de conhecimento avaliada aos 12 meses após o treinamento, utilizando a Escala de Proficiência em Instrumentos Perioperatórios (PIPS) validada. O processo completo de desenvolvimento do PIPS, incluindo a geração de itens a partir de uma revisão bibliográfica e grupos focais de especialistas, validação de conteúdo Delphi modificada em três rodadas (índice de validade de conteúdo = 0,94), análise fatorial exploratória e confirmatória, e a rubrica completa de pontuação ancorada comportamentalmente, está documentado no Arquivo Suplementar 3. O instrumento demonstrou fortes propriedades psicométricas (α de Cronbach = 0,92, teste-re-teste ICC = 0,91 em intervalos de 2 semanas). O PIPS consiste em 24 itens distribuídos em quatro domínios: identificação de instrumentos (6 itens), proficiência em manuseio (6 itens), protocolos de segurança (6 itens) e comunicação com equipes (6 itens). Cada item utiliza uma escala de Likert de cinco pontos (1 = iniciante a 5 = especialista) com descritores ancorados no comportamento. A pontuação total varia de 24 a 120, com pontuações mais altas indicando maior proficiência.

As avaliações PIPS foram conduzidas por avaliadores treinados (seis enfermeiros cirúrgicos com >10 anos de experiência em cirurgia que completaram um programa padronizado de treinamento de 8 horas) no começo, imediatamente após a intervenção e nos acompanhamentos de 1, 3, 6 e 12 meses. Os avaliadores foram cegados para a tarefa em grupo por meio de identificadores codificados dos participantes e avaliaram gravações de vídeo editadas para remover quaisquer elementos visíveis de interface ou displays de feedback específicos do APLS. Os avaliadores não foram informados sobre qual modalidade de treinamento os participantes haviam recebido. A confiabilidade entre avaliadores foi estabelecida por meio da codificação dupla de 20% das avaliações (n = 128), alcançando um ICC > 0,85 em todos os domínios (pontuação total ICC = 0,89, IC 95%: 0,85-0,92).

Os resultados secundários foram os seguintes: (1) competência prática avaliada por meio da avaliação estruturada objetiva de habilidades técnicas (OSATS) adaptada para o manuseio de instrumentos, compreendendo seis estações padronizadas (máximo 30 pontos), administrada por avaliadores especialistas cegados (ICC = 0,87) no início da linha de partida e aos 3, 6 e 12 meses. (2) A eficiência do tempo de treinamento foi medida como o total de horas para atingir o limite de competência (PIPS ≥ 75). (3) A relação custo-efetividade é calculada como o custo por aprendiz competente, incorporando custos diretos e indiretos, com custos normalizados para 2024 yuans chineses usando dados contábeis institucionais. (4) A satisfação do aprendiz foi avaliada usando um questionário da escala Likert de 5 pontos (27 itens, consistência interna α = 0,91). (5) Métricas exploratórias de desempenho clínico dos sistemas institucionais de relatórios de segurança: relatórios de incidentes relacionados a instrumentos durante o período pós-treinamento de 12 meses, com taxas por 1.000 casos cirúrgicos ajustadas pela complexidade do caso. Os desfechos dos incidentes de segurança foram classificados como exploratórios porque o estudo não foi alimentado para detectar diferenças nesses eventos de baixa frequência.

Métodos de análise estatística
Todas as análises estatísticas foram conduzidas usando a versão R 4.3.0 com a interface RStudio e os seguintes pacotes: lme4 para modelos de efeitos mistos, emmeans ("médias marginais estimadas"; um pacote R para calcular médias de grupo ajustadas pelo modelo e realizar comparações post hoc de Tukey, Bonferroni ou Scheffé a partir de modelos ajustados de efeitos mistos), psych para análises psicométricas, effsize (um pacote R para calcular tamanhos padronizados de efeito, incluindo d de Cohen e g de Hedges, com intervalos de confiança) para cálculos de tamanho de efeito, e camundongos para imputação múltipla. O limiar de significância foi estabelecido a priori em α = 0,05 (bidirecional) para todos os testes de hipótese.

Múltiplas correções comparativas foram aplicadas da seguinte forma. Para o resultado primário (escore total PIPS entre os pontos de tempo), a inferência foi extraída da interação Group × Time dentro do modelo linear de efeitos mistos usando graus de liberdade de Kenward-Roger, que não requer correção separada para múltiplos pontos de tempo. Para as subescalas do domínio PIPS (quatro comparações simultâneas), foi aplicada a correção de Bonferroni (ajustada α = 0,0125). Para os desfechos secundários (quatro medidas: pontuação de eficiência do OR, incidentes de segurança, pontuação de comunicação do TEAM e frequência de erros), foi aplicado o procedimento de taxa de falsas descobertas de Benjamini-Hochberg (q = 0,05). Para métricas de desempenho do sistema de IA (dez comparações internas), foi aplicada a correção de Bonferroni (ajustada α = 0,005). Todos os valores-p relatados e determinações de significância referenciam explicitamente a correção aplicável.

Todos os desfechos primários e secundários entre grupos foram analisados usando modelos lineares de efeitos mistos com efeitos fixos para grupo, tempo e sua interação, e interceptos aleatórios tanto para participantes quanto para departamentos (para levar em conta a correlação intraclasse resultante da alocação baseada em clusters). O coeficiente de correlação intraclasse no nível do departamento foi estimado para quantificar o grau de agrupamento. Padrões de dados ausentes foram avaliados usando o teste MCAR de Little; os dados foram considerados completamente ausentes aleatoriamente e foram tratados por meio de múltiplas imputações usando correspondência preditiva de médias (m = 20 conjuntos de dados imputados, resultados agrupados pelas regras de Rubin). Análises de sensibilidade com análise completa de casos, números variados de imputação (m = 10, m = 50) e cenários de pior e melhor caso avaliaram a robustez.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Características dos participantes
A amostra final incluiu 107 participantes com excelente retenção (Figura 1). A análise de atrito comparando completadores (n = 107) com os que se retiram (n = 13) não revelou diferenças significativas nas características de base: idade (t = 0,89, p = 0,38), gênero (χ2 = 0,21, p = 0,64), papel profissional (χ2 = 1,45, p = 0,48), escores PIPS de base (t = 0,62, p = 0,54) ou atribuição ...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo observacional prospectivo, incorporando elementos quase-experimentais por meio da alocação departamental baseada em clusters, fornece evidências de que um sistema de aprendizagem personalizada movido por IA, integrando múltiplos algoritmos de aprendizado de máquina, está associado a melhorias substanciais nos resultados do treinamento de instrumentos na sala de cirurgia em comparação com abordagens pedagógicas tradicionais. Os achados têm implicações tanto para a metodologia ...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram que não possuem interesses financeiros ou não financeiros concorrentes relacionados a esta obra.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores agradecem à equipe da sala de cirurgia e à equipe de educação em enfermagem do Sir Run Run Shaw Hospital pelo apoio na implementação do programa de treinamento e coleta de dados. Essa pesquisa foi apoiada pelo Zhejiang Medical and Health Project (número da bolsa: 2025HY0440 e 2023KY781). O órgão financiador não teve papel no desenho do estudo, coleta de dados, análise de dados, interpretação de dados ou redação de manuscritos.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Simulador Cirúrgico de Feedback Háptico (Touch X)3D Systems (anteriormente Sensable)PHANToM Premium 3.0Dispositivo háptico de seis graus de liberdade; usado como interface principal para entrega de feedback de força impulsionado por IA durante tarefas simuladas de manipulação de tecidos e sutura
Plataforma de Software de Simulação (SimSurgery™ AI Suite)Personalizado / Desenvolvido internamenteN/ASoftware proprietário de treinamento impulsionado por IA integrando módulos de redes neurais convolucionais (CNN) para classificação de desempenho em tempo real e geração de feedback adaptativo
Sensor de força/torqueAutomação Industrial da ATINano17 SI-12-0.12Mede as forças do instrumento aplicadas (resolução: 0,003 N) durante exercícios de manuseio de tecidos e sutura; dados alimentados no algoritmo de classificação de IA
Sistema de Rastreamento de MovimentoNorthern Digital Inc. (NDI)Polaris Vega STRastreamento óptico das trajetórias dos instrumentos cirúrgicos; Precisão volumétrica RMS de 0,12 mm; Usado para avaliação de precisão da navegação por instrumentos
Conjunto de Instrumentos Laparoscópicos (Treinamento)Karl Storz SE & Co. KG26003 AA / 33310 DBGarra laparoscópica padrão de 5 mm e chave de agulha usada tanto em braços de treinamento acionados por IA quanto convencionais
Fantasma de Tecidos de Alta Fidelidade (Modelo de Tecidos Moles)Laboratórios SynDaverModelo Cirúrgico Abdominal (SKU: SYN-ABD)Validou o substituto de tecido sintético para sutura, dissecação e exercícios de manuseio de tecidos; substituído a cada 50 usos, conforme orientação do fabricante
Estação de Trabalho GPUNVIDIA / DellDell Precision 7920 com NVIDIA A6000 (48 GB de VRAM)Hardware computacional para execução de inferência de IA em tempo real (latência de classificação CNN < 15 ms); Servidor dedicado conectado ao dispositivo háptico
Estrutura de Redes NeuraisCódigo aberto (Meta AI)PyTorch v2.1.0Framework de deep learning usado para treinamento de modelos, validação e inferência em tempo real do algoritmo de feedback adaptativo
Software de Análise EstatísticaIBM Corp.Estatísticas IBM SPSS v29.0Usado para modelagem de efeitos mistos, testes t por amostras independentes e ANOVA de medidas repetidas em todas as análises de desfechos primários e secundários
Software de Visualização e Gráficos de DadosGraphPad SoftwareGraphPad Prism v10.0Usado para gerar todas as figuras de manuscritos, incluindo barras de erro (SD e IC 95%), curvas de retenção e gráficos de barras agrupados
Sistema de Gravação de VídeoStryker Corp.Plataforma AIM 4K 1688Captura de vídeo intraoperatória e em sessão de simulação para avaliação de especialistas pós-hoc cega (pontuação OSATS)
Ferramenta de Avaliação Estruturada (OSATS)N/A — Instrumento publicado validadoMartin et al., 1997 (Br J Surg)Avaliação Objetiva e Estruturada de Habilidades Técnicas; Escala Global de Avaliação de Sete Itens (1&nDash; 5 por item) usado para avaliação especializada em cegueira de suturas e manuseio de tecidos
Software de Randomização e Gerenciamento de DadosCódigo abertoREDCap v13.7.2Captura eletrônica de dados para alocação de participantes (departamental baseada em cluster), coleta de dados demográficos e acompanhamento longitudinal de pontuação
Módulo de Realimentação de ÁudioPersonalizado / Desenvolvido internamenteN/AMódulo de software que entrega pistas auditivas corretivas em tempo real (alertas codificados por tons) integrados ao sistema multimodal de feedback
Questionário Institucional (Pesquisa de Satisfação do Estudante)Personalizado / Desenvolvido internamenteN/AEscala de Likert de 18 itens (1– 5) questionário avaliando a percepção da eficácia do treinamento, usabilidade do sistema e confiança do aprendiz; administrada após o treinamento e no acompanhamento de 24 semanas

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bajpai, S., Lindeman, B. The trainee’s role in patient safety. Surgical Clinics of North America. 101 (1), 149-160 (2021).
  2. Weiner, L. M., et al. Antimicrobial-resistant pathogens associated with healthcare-associated infections: Summary of data reported to the national healthcare safety network at the Centers for Disease Control and Prevention, 2011–2014. Infection Control & Hospital Epidemiology. 37 (11), 1288-1301 (2016).
  3. Peterson, G., Bramhall, J. Patient safety training: National patient safety goals and cms hospital quality. MedEdPORTAL. , (2013).
  4. Ali, M., Wahab, I. B. A., Huri, H. Z., Yusoff, M. S. Personalised learning in higher education for health sciences: A scoping review protocol. Systematic Reviews. 13 (1), 93(2024).
  5. Hossain, I., Madani, A., Laplante, S. Machine learning perioperative applications in visceral surgery: A narrative review. Frontiers in Surgery. 11, 1493379(2024).
  6. Sweller, J., Van Merriënboer, J. J. G., Paas, F. Cognitive architecture and instructional design: 20 years later. Educational Psychology Review. 31 (2), 261-292 (2019).
  7. Laplante, S., Madani, A. in Artificial Intelligence in Clinical Practice. , 211-216 (2024).
  8. Shahrezaei, A., Sohani, M., Taherkhani, S., Zarghami, S. Y. The impact of surgical simulation and training technologies on general surgery education. BMC Medical Education. 24 (1), 1297(2024).
  9. Ericsson, K. A. Deliberate practice and the acquisition and maintenance of expert performance in medicine and related domains. Academic Medicine. 79, S70-S81 (2004).
  10. Gordon, M., et al. A scoping review of artificial intelligence in medical education: Beme guide no. 84. Medical Teacher. 46 (4), 446-470 (2024).
  11. Knopp, M. I., et al. Ai-enabled medical education: Threads of change, promising futures, and risky realities across four potential future worlds. JMIR Medical Education. 9, e50373(2023).
  12. Escobar-Castillejos, D., Barrera-Animas, A. Y., Noguez, J., Magana, A. J., Benes, B. Transforming surgical training with AI techniques for training, assessment, and evaluation: Scoping review. J Med Internet Res. 27, e58966(2025).
  13. Hla, D. A., Hindin, D. I. Generative AI & machine learning in surgical education. Current Problems in Surgery. 63, 101701(2025).
  14. Masters, K. Submitting artificial intelligence in health professions education papers to medical teachers. Medical Teacher. 46 (10), 1256-1257 (2024).
  15. Abahuje, E., Tuyishime, E., Alayande, B. T. Global surgical simulation education, current practices, and future directions. Surgery. 180, 109050(2025).
  16. Campbell, M. K., Piaggio, G., Elbourne, D. R., Altman, D. G. Consort 2010 statement: Extension to cluster randomised trials. BMJ. 345 (1), e5661-e5661 (2012).
  17. Garibaldi, B. T., Hollon, M. M., Woodworth, G. E., Winkel, A. F., Desai, S. V. Navigating the landscape of precision education: Insights from on-the-ground initiatives. Academic Medicine. 99 (1), S71-S76 (2023).
  18. Desai, S. V., et al. Precision education: The future of lifelong learning in medicine. Academic Medicine. 99 (1), S14-S20 (2024).
  19. Bekbolatova, M., Mayer, J., Ong, C. W., Toma, M. Transformative potential of AI in healthcare: Definitions, applications, and navigating the ethical landscape and public perspectives. Healthcare. 12 (2), 125(2024).
  20. Singh, G., Kumar, J. Advances in Healthcare Information Systems and Administration. ch015, 240-260 (2024).
  21. Schumacher, D. J., Santen, S. A., Pugh, C. M., Burk-Rafel, J. Foreword: The next era of assessment and precision education. Academic Medicine. 99 (Supplement_1), S1-S6 (2023).
  22. Xiaowen, Y., Jingjing, D., Biao, W., Shenzhong, Z., Yana, W. Design strategies for artificial intelligence-based future learning centers in medical universities. BMC Medical Education. 25 (1), (2025).
  23. Ahsan, Z. Integrating artificial intelligence into medical education: A narrative systematic review of current applications, challenges, and future directions. BMC Medical Education. 25 (1), (2025).
  24. Ali, M., Wahab, I. A., Huri, H. Z., Yusoff, M. S. Personalised learning in higher education for health sciences: A scoping review. BMC Medical Education. 25 (1), 969(2025).
  25. Vrdoljak, J., Boban, Z., Vilović, M., Kumrić, M., Božić, J. A review of large language models in medical education, clinical decision support, and healthcare administration. Healthcare. 13 (6), 603(2025).
  26. Bayly-Castaneda, K., Ramirez-Montoya, M. S., Morita-Alexander, A. Crafting personalized learning paths with AI for lifelong learning: A systematic literature review. Frontiers in Education. 9, 1424386(2024).
  27. Vp, V. The role of metafora in revolutionizing personalized learning through AI in higher education. SSRN Electronic Journal. , (2025).
  28. Varas, J., et al. Innovations in surgical training: Exploring the role of artificial intelligence and large language models (LLM). Rev Col Bras Cir. 50, e20233605(2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Artificial Intelligence TrainingPersonalized LearningOperating Room TrainingInstrument HandlingSimulation Based TrainingDeep Learning RecognitionReinforcement LearningCompetency PredictionPatient SafetySurgical Skill Retention

Related Articles