$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Relatos de casos clínicos (CCRs) são um meio fundamental de compartilhar observações e insights em medicina. Estes servem como um mecanismo básico de comunicação e educação para os médicos e estudantes de medicina. Historicamente, CCRs também forneceram relatos de doenças emergentes, seus tratamentos e suas origens genéticas1,2,3,4. Por exemplo, o primeiro tratamento de raiva humana por Louis Pasteur em 18855,6 e a primeira aplicação de penicilina em pacientes7 eram ambos relataram através de CCRs. CCRs mais de 1,87 milhões foram publicados a partir de abril de 2018, com mais de meio milhão na última década; revistas continuam a fornecer novos espaços para esses relatórios8. Embora único em forma e conteúdo, CCRs contêm dados de texto que são em grande parte não-estruturados, contêm um vasto vocabulário e dizem respeito a fenômenos inter-relacionados, limitando a sua utilização como um recurso estruturado. Significativo esforço é necessário para extrair metadados detalhados (isto é, "dados sobre dados", ou neste caso, as descrições de conteúdo de documentos) de CCRs e estabelecê-los como um dados encontrável, acessível, interoperáveis e reutilizáveis (feira)9 recurso.
Aqui, descrevemos um processo para extrair texto e valores numéricos para padronizar a descrição dos conceitos biomédicos específicas dentro CCRs publicados. Esta metodologia inclui um modelo de metadados para orientar a anotação; Veja a Figura 1 para obter uma visão geral desse processo. Aplicação do processo de anotação para uma grande coleção de relatórios (por exemplo, vários milhares de um tipo específico de apresentação da doença) permite a montagem de um conjunto de textos clínicos anotados, gerenciável e estruturado alcançar legível por máquina documentação e fenômenos biomédicos incorporado em cada apresentação clínica. Apesar de formatos de dados, tais como aqueles fornecidos pelo HL7 (EG., versão 3 do padrão de mensagens10 ou o rápido de cuidados de saúde de recursos de interoperabilidade [FHIR]11), LOINC12e revisão 10 da estatística internacional Classificação das doenças e problemas de saúde relacionados (CID-10)13 fornecer padrões para a descrição e a troca de observações clínicas, eles não capturar o texto em torno destes dados, nem eles pretendem. Os resultados de nossa metodologia são mais utilizados para impor a estrutura na CCRs e facilitar a análise posterior, normalização através de vocabulários controlados e sistemas de codificação (por exemplo., CID-10), e/ou conversão para os formatos de dados clínicos listados acima .
Mineração CCRs é uma área ativa de trabalho dentro de informática biomédica e clínica. Embora o caso de propostas anteriores para padronizar a estrutura de relatórios (EG., usando HL7 v 2.514 ou padronizado fenótipo terminologia15) são louváveis, é provável que CCRs continuará a acompanhar uma variedade de diferentes formas de linguagem natural e layouts de documento, como eles têm para a maior parte do século passado. Sob condições ideais, autores de relatos de casos novos sigam cuidados orientações16 para garantir que eles são abrangentes. Abordagens sensíveis à linguagem natural e de sua relação com conceitos médicos, portanto, podem ser mais eficazes em trabalhar com relatórios novos e arquivados. Recursos como ofício17 e aqueles produziram pela informática para integrar a biologia e a curadoria de18 cabeceira (i2b2) suporta processamento de linguagem natural (NLP) abordagens ainda não especificamente enfocam CCRs ou narrativas clínicas. Da mesma forma, instrumentos médicos de PNL como cTAKES19 e braçadeira20 têm sido desenvolvidos, mas geralmente identificam palavras específicas ou frases (ou seja, entidades) dentro de documentos, ao invés dos conceitos gerais comumente descritos em CCRs.
Nós projetamos um modelo de metadados padronizados para recursos comumente incluídos dentro CCRs. Este modelo define recursos para impor a estrutura na CCRs — um precursor essencial para comparações em profundidade do conteúdo do documento-ainda permite flexibilidade suficiente reter o contexto semântico. Embora nós projetamos o formato associado com este modelo para ser apropriado para anotação manual e mineração de texto computacionalmente assistida, garantimos que é particularmente fácil de usar para manuais anotadores. Nossa abordagem visivelmente difere de mais intricado (e, portanto, menos pesquisadores imediatamente compreensíveis para destreinado) estruturas como FHIR21. O protocolo seguinte descreve como isolar os recursos de documento correspondente a cada tipo de dados de modelo, com um único conjunto de valores correspondentes aos de um único CCR.
Os tipos de dados dentro do modelo são aqueles mais descritivo para CCRs e focada no paciente documentos médicos em geral. Anotação destas características promove Encontrabilidade, acessibilidade, interoperabilidade e reutilização de texto CCR, principalmente, dando-lhe estrutura. Os tipos de dados são em quatro categorias gerais: identificação do documento e anotação, identificação de relato de caso (isto é, Propriedades de nível de documento), conceitos de conteúdo médicos (principalmente nível de conceito Propriedades) e agradecimentos (ou seja, recursos, fornecendo evidências de financiamento). Neste processo de anotação, cada documento inclui o texto completo de um CCR, omitindo qualquer material de conteúdo de documento independente para o caso (por exemplo, protocolos experimentais). CCRs são geralmente menos de 1.000 palavras cada; um único corpus idealmente devem ser indexado pelo mesmo banco de dados bibliográfico e ser na mesma língua escrita.
O produto da abordagem descrita aqui, quando aplicado a um corpus CCR, é um conjunto estruturado de texto clínico anotado. Enquanto esta metodologia pode ser realizada totalmente manualmente e foi concebida para ser realizado por especialistas de domínio sem qualquer experiência de informática, complementa as abordagens de processamento de linguagem natural especificadas acima e fornece dados apropriados para análise computacional. Tais análises podem ser de interesse para o público de pesquisadores, além daqueles que leem frequentemente CCRs, incluindo:
- aqueles preocupados com apresentações da doença, sua sintomatologia chave, abordagens usuais de diagnósticos e tratamentos
- aqueles que desejarem comparar os resultados dos ensaios clínicos com eventos descritos na literatura clínica, potencialmente fornecer observações adicionais e maior poder estatístico.
- Bioinformática, informática biomédica e pesquisadores de ciência de computador que exigem conjuntos de dados estruturados linguagem médica ou entendimentos de alto nível das narrativas médicas
- Pesquisadores de política de governo com foco em ensaios clínicos como podem melhor refletir como o diagnóstico e tratamento, como ocorre na realidade
Reforçando a estrutura na CCRs pode oferecer suporte a inúmeros esforços subsequentes para compreender melhor tanto linguagem médica e biomédicos fenômenos.