$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudo foi conduzido em estrita conformidade com os princípios éticos estabelecidos na Declaração de Helsinque. O protocolo do estudo foi revisado e formalmente aprovado pelo Conselho de Revisão Institucional (IRB) da Universidade de Medicina de Chongqing (aprovação ética nº: 2026127). Antes da inscrição, todos os participantes receberam uma explicação abrangente dos objetivos, procedimentos e riscos potenciais do estudo, e, posteriormente, um consentimento informado por escrito. Para proteger a privacidade dos pacientes e garantir a confidencialidade dos dados, todas as informações coletadas foram totalmente anonimizadas e desidentificadas antes de serem acessadas para análise estatística. A lista completa de instrumentos de levantamento, formulários de consulta de especialistas e softwares analíticos utilizados neste estudo está detalhada na Tabela de Materiais.
Desenho do estudo e recrutamento de participantes
Um estudo metodológico em múltiplas etapas, composto por uma pesquisa transversal de linha de base e simulações preditivas baseadas em modelos subsequentes, foi realizado em cinco instituições de saúde primária. Os participantes foram recrutados utilizando uma estratégia estratificada de amostragem por conveniência durante suas visitas de acompanhamento rotineiras. Os critérios de elegibilidade incluíam: (1) adultos com 18 anos ou mais; (2) diagnosticado medicamente com pelo menos uma condição crônica (por exemplo, hipertensão, diabetes tipo 2) gerenciada na instituição participante por no mínimo seis meses; e (3) possuir a capacidade cognitiva de completar a avaliação de forma independente. As pesquisas foram realizadas presencialmente por equipe clínica treinada. Para tratar dados ausentes, o teste MCAR de Little foi inicialmente aplicado. Considerando que a taxa de dados ausentes era baixa (<5%) e completamente ausente de forma aleatória, múltiplas técnicas de imputação foram empregadas para lidar com respostas incompletas, garantindo a integridade do conjunto de dados. Para evitar superajuste e esclarecer a base amostral para cada etapa analítica, o conjunto de dados totalmente imputado (N = 433) foi estritamente particionado. Especificamente, 50% da amostra (n = 217) foi utilizada para análise fatorial exploratória (EFA) para estabelecer a estrutura fator. Os 50% restantes (n = 216) foram reservados para análise fatorial confirmatória (CFA), modelagem estrutural de equações (SEM) e estabelecimento de linha base para perfil de qualidade em nível institucional. Os cenários comparativos de validação do modelo e otimização simulada foram posteriormente derivados estritamente dessa segunda amostra de resistência (n = 216) para evitar vazamento de dados.
Estrutura conceitual e desenvolvimento de indicadores
A construção do sistema de índice de avaliação começou mapeando as cinco dimensões centrais do SERVQUAL — tangibilidade, confiabilidade, capacidade de resposta, garantia e empatia — para o fluxo de trabalho específico do manejo primário de doenças crônicas. Esse processo envolveu a integração de pontos concretos de contato, como criação de prontuário médico, distribuição farmacêutica e protocolos longitudinais de acompanhamento. Para garantir relevância para o público-alvo, o sistema de informação de atenção primária foi analisado para avaliar sua acessibilidade para pacientes idosos, seguido por refinamentos iterativos nos itens. Métricas específicas de confiabilidade focaram na precisão dos acompanhamentos e no compromisso da equipe, enquanto a resposta foi operacionalizada como a pontualidade das respostas às consultas dos pacientes (veja a Tabela 1 para definições operacionais). O arcabouço geral, incluindo as inter-relações entre dimensões, é conceituado nas Figuras 1 e 2.
Consulta de especialistas Delphi e validade de conteúdo
Um método Delphi de duas rodadas foi empregado para refinar o conjunto inicial de itens. Especialistas foram recrutados propositalmente com base em um conjunto multidimensional de critérios de elegibilidade para garantir autoridade profissional e rigor metodológico. Os candidatos eram convidados para o painel se atendessem aos seguintes requisitos: (1) possuíssem um título profissional sênior (por exemplo, Professor Associado, Médico Chefe ou Diretor de Enfermagem); (2) possuir no mínimo dez anos de experiência clínica, gerencial ou de pesquisa com foco específico em cuidados primários ou manejo de doenças crônicas; e (3) demonstrar um histórico reconhecido em avaliação de serviços de saúde ou desenvolvimento de políticas de saúde pública. O painel final, composto por quinze especialistas, representou uma coorte interdisciplinar, incluindo médicos de atenção primária (n = 5), gestores de enfermagem (n = 4), pesquisadores de saúde pública (n = 4) e administradores de políticas de saúde (n = 2). Essa composição diversificada e os rigorosos critérios de seleção garantiram diretamente a reprodutibilidade e credibilidade dos procedimentos subsequentes de validade de conteúdo e ponderação do AHP. Especialistas avaliaram a relevância e clareza de cada item usando uma escala de Likert de 4 pontos (1 = não relevante, 4 = altamente relevante). O consenso foi definido a priori como ≥80% de concordância entre especialistas que avaliaram um item como 3 ou 4. Itens com Índice de Validade de Conteúdo em Nível de Item (I-CVI) ≥ 0,78 foram mantidos (Tabela 2). Desentendimentos entre rodadas foram resolvidos por meio de feedback anônimo iterativo; Especialistas receberam pontuações agregadas da rodada anterior e foram autorizados a ajustar suas avaliações. Itens que não alcançaram consenso após a segunda rodada foram substancialmente revisados com base no feedback qualitativo de especialistas ou eliminados, culminando no índice final de validade de conteúdo em nível de escala (S-CVI)12,13.
Processo de hierarquia analítica (AHP) e mecanismo de pontuação
Para determinar os pesos relativos dos indicadores de avaliação, foi utilizado o método AHP. Uma subamostra intencional de nove especialistas seniores do painel Delphi completou uma escala fundamental de 9 pontos para construir matrizes de comparação par a par para todas as dimensões e subdimensões. O método da média geométrica foi usado para agregar os julgamentos dos especialistas. Uma razão de consistência (CR) foi calculada para cada matriz; apenas matrizes com CR de eram consideradas aceitáveis, garantindo consistência lógica nos julgamentos de especialistas. Os pesos globais finais (Wi) foram derivados multiplicando os pesos locais das subdimensões pelos pesos de suas dimensões parentais. A pontuação final de qualidade do serviço (SQ) para cada paciente foi calculada usando a fórmula:
SQ = ∑(Wi x Pi) (1)
onde Pi representa a pontuação de desempenho percebida do paciente para o item i. Notavelmente, este estudo adotou um método de pontuação apenas perceptiva (P) — consistente com o paradigma SERVPERF — em vez da abordagem tradicional baseada em lacunas (P-E). Essa escolha metodológica, medida em uma escala de Likert de 7 pontos (variando de 1 = "Fortemente Discordar" a 7 = "Fortemente Concordar"), foi implementada para aumentar a validade preditiva do modelo e minimizar a instabilidade de medição frequentemente associada à quantificação das expectativas dos pacientes em ambientes longitudinais de cuidados crônicos.
Validação psicométrica e modelagem de equações estruturais
O conjunto de dados dividido aleatoriamente foi submetido a avaliação psicométrica. Na primeira metade dos dados, a EFA foi realizada usando fatoração por eixo principal com rotação oblíqua promax, já que as dimensões do SERVQUAL foram hipotetizadas como correlacionadas. Os fatores foram mantidos com base nos autovalores >1 e na inspeção visual do lote de cascalho. Itens com cargas fatoriais <0,40 ou cargas cruzadas significativas foram excluídos. A segunda metade dos dados foi usada para o CFA para confirmar a estrutura fator. A estimativa de máxima verosimilhança (ML) foi empregada para a análise CFA e subsequentes do SEM. O ajuste do modelo foi avaliado usando limiares rigorosos estabelecidos na literatura psicométrica, que indicam um equilíbrio aceitável entre parcimônia do modelo e ajuste dos dados: índice comparativo de ajuste (CFI) > 0,90, índice Tucker-Lewis (TLI) > 0,90, erro quadrático médio de aproximação (RMSEA) < 0,08 e residual quadrático médio da raiz padronizada (SRMR) > 0,08.
Plano de comparação de modelos preditivos
Para avaliar a eficácia comparativa de diferentes estruturas avaliativas, foi realizada uma análise de modelagem preditiva. Para estabelecer a robustez metodológica do framework proposto, o modelo básico SERVQUAL foi comparado com três abordagens analíticas distintas: o AHP-SERVQUAL proposto, o modelo KANO e o método TOPSIS-RSR (Técnica para Preferência de Ordem por Similaridade com Solução Ideal combinada com Razão Rank-Som). O modelo KANO foi selecionado como comparador porque categoriza atributos de serviço em condutores de satisfação não lineares (por exemplo, necessidades básicas versus qualidades atrativas), oferecendo um contraste teórico com as suposições lineares do SERVQUAL. Por outro lado, o TOPSIS-RSR é uma ferramenta rigorosa de tomada de decisão multicritério (MCDM) amplamente utilizada para uma classificação institucional abrangente, servindo assim como um controle metodológico robusto para nosso sistema de pontuação baseado em AHP. Para executar a comparação, cada um dos quatro modelos foi aplicado independentemente ao conjunto de dados de validação de retenção (n = 216), incorporando parâmetros idênticos específicos de contexto (como acompanhamento digital e suporte à autogestão). O processo avaliativo posteriormente comparou quão eficazmente os índices de qualidade gerados por cada modelo se correlacionam com métricas externas de desempenho (frequência de reclamações e taxas de resolução de questões) e seu poder preditivo (R2) para a adesão do paciente. A precisão preditiva de cada modelo foi quantificada usando valores R2 gerados por regressão linear e SEM. Para garantir a parcimônia do modelo e evitar o excesso de ajuste, critérios de informação, especificamente o critério de informação de Akaike (AIC) e o critério de informação bayesiano (BIC), foram integrados ao processo de seleção. Por fim, foi realizada validação cruzada para avaliar a robustez dos modelos selecionados entre as cinco instituições participantes. As métricas comparativas para resolução de problemas, frequência de reclamações e poder preditivo geral (R2) são apresentadas nas Figuras 3 e 4.