$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Стратегия поиска и выбор исследования
С января 2016 по октябрь 2025 года был проведен целевый, несистематический поиск литературы на PubMed, Embase и Web of Science. Дата начала 2016 года была выбрана для отражения фундаментальных публикаций в области машинного обучения, предшествовавших недавнему всплеску исследований в области глубокого обучения, сохраняя при этом современный акцент; её выбор особенно обоснован включением Myers et al. (2016)10, знакового исследования, которое установило основные методологические подходы к прогнозированию ICP на основе ML. Поиск дополнялся ручным отбором списков литературы выявленных систематических обзоров и первичных исследований.
Поисковые запросы комбинировались с использованием булевых операторов и включали: «травматическое повреждение мозга», «ЧМТ», «искусственный интеллект», «машинное обучение», «глубокое обучение», «нейронная сеть», «внутричерепное давление», «судороги», «коагулопатия», «сепсис», «пневмония, связанная с аппаратом искусственной вентиляции лёгких лёгких лёгких аппаратов», «прогнозирование исхода» и «прогнозирование».
Критерии включения:
(1) оригинальные исследования или опубликованные систематические обзоры; (2) сосредоточиться на прогнозировании вторичных осложнений или клинических исходов с помощью ИИ или МТ у пациентов с ЧМТ; (3) отчётность хотя бы по одной количественной метрике эффективности (например, AUC, чувствительность/специфичность, точность); (4) публикация в рецензируемом журнале или индексированные материалы конференций с доступным полным текстом.
Критерии исключения:
(1) исследования, использующие только традиционные статистические модели без компонентов ИИ или МН; (2) исследования, ограниченные классификацией тяжести травмы или характеристикой первичной травмы без прогнозирования осложнений или исходов; (3) доклинические (на животных) или in vitro исследования; (4) обзор статей без первичных данных, относящихся к интересующим целям прогноза.
Пятнадцать первичных исследований были выбраны в качестве репрезентативных примеров в пяти областях прогнозирования, с приоритетом по методологическому качеству, разнообразию подходов к валидации и клинической значимости. Два дополнительных исследования прогнозирования ICP были выявлены посредством ручного отслеживания ссылок и включены для более широкого охват этой области. Как повествование, а не систематический обзор, отбор был направлен на представительное освещение, а не на исчерпывающий перепис; Смещение отбора нельзя полностью исключить. К отдельным исследованиям не применялся формальный инструмент оценки качества или риска предвзятости (например, контрольный список отчетности PROBAST или TRIPOD) — ограничение, рассмотренное в разделе «Ограничения».
Клиническая значимость прогнозирования вторичных осложнений
Вторичные осложнения после ЧМТ распространены, часто их можно предотвратить при своевременном вмешательстве и существенно влияют на клиническиерезультаты 3,5. Понимание клинического контекста каждого типа осложнений объясняет, почему инструменты прогнозирования могут оказаться преобразующими в практике интенсивной терапии. Повышенный ИМП является одним из самых значимых и критически критически важных осложнений после тяжёлогоЧМТ 4,10. Когда ICP стабильно превышает 20–22 мм рт. ст., давление перфузии мозга падает, и ишемическое вторичное повреждениераспространяется 4. Если бы клиницисты могли надежно предугадывать кризисы ВЦП до их начала, они могли бы проактивно оптимизировать положение головы, снизить седацию, провести осмотическую терапию или подготовить хирургическую декомпрессию — переходы от реактивного управления кризисами к профилактическим вмешательствам, которые могли бы значительно снизить нагрузку на вторичные ишемическиеповреждения 10,11.
Ранние посттравматические приступы могут вызывать вторичные повреждения из-за повышенного метаболического спроса, длительной эксайтотоксичности и распространения корковых деполяризаций. Точная стратификация рисков будет определять решения о профилактической противосудорожной терапии, пороге непрерывного электроэнцефалографического (ЭЭГ) мониторинга и интенсивности наблюдения заприступами 12,13. ТИК поражает до 60% пациентов с тяжёлым ЧМТ и связан с ростом смертности в три или четырераза 14,15,16. Раннее выявление коагулопатических пациентов позволяет целенаправленно корректировать коагуляцию до ухудшения кровотечения. Длительное интенсивное лечение с искусственной вентиляцией и инвазивным мониторингом значительно повышает риск заражения, а инструменты прогнозирования на базеИИ 17,18 могут позволить стратифицированные протоколы профилактики инфекций по риску существенно снизить уровень осложнений инфекции. Во всех этих областях точное прогнозирование также влияет на принятие решений интенсивности лечения, семейное общение, планирование реабилитации и обсуждение целейухода 5,7,19.
Современные данные в пользу прогнозирования на основе ИИ
Исследования, изучающие прогнозирование ИИ при ЧМТ, значительно расширились за последнее десятилетие 5,6,7. Систематический обзор и метаанализ Курвиля и соавторов показали, что алгоритмы ML могут превосходить традиционные логистические регрессионные модели в прогнозировании неблагоприятных исходов ЧМТ, при этом балл GCS, возраст пациента и выбранные биомаркеры сыворотки считаются наиболее последовательно важными прогностическимипризнаками 6. Комплексный систематический обзор Малхотры и др., включающий 39 исследований и 592 323 пациента, подтвердил, что самые сильные предиктивные факторы — возраст, балл GCS, зрачковый ответ и результаты КТ — существенно пересекаются с особенностями, которые опытные клиницисты уже учитывают в своихрассуждениях 5,7. Когда модели ИИ ограничены теми же переменными, что и традиционные калькуляторы, прирост точности может бытьскромным 6. Однако при доступе к более богатым, продольным потокам данных — непрерывным физиологическим тенденциям, серийным лабораторным панелям и количественной нейровизуализации — подходы ИИ могут предоставлять больше преимуществ по сравнению с традиционными инструментами. Характеристики и стратегии валидации репрезентативных исследований в этих пяти областях изложены в таблице 1, а концептуальный конвейер прогнозирования иллюстрируется на рисунке 1.
Прогнозирование внутричерепного давления
Из всех доменов вторичных осложнений прогнозирование ICP накопило наиболее надёжную базу доказательств. Системы ИИ могут предсказывать опасные высоты ICP примерно за 30 минут вперёд, предоставляя потенциально практическое окно для профилактическоговмешательства 10,11. Майерс и соавторы заложили базовую методологию с использованием машинного обучения для прогнозирования как кризисов ICP, так и кризиса парциального давления кислорода в мозговой ткани (PbtO₂) на основе непрерывного мониторингареанимации 10. Впоследствии Карра и соавторы разработали и внешне валидировали модели машинного обучения для прогнозирования вредных накопленных доз ICP с использованием набора данных Collaborative European NeuroTrauma Effectiveness Research in Traumatic Brain Injury (CENTER-TBI), демонстрируя надёжную межцентровуюобобщимость 11. Ли и соавт. разработали гибридную архитектуру сверточной нейронной сети (CNN) с долговременной краткосрочной памятью (LSTM), применяемую к непрерывным данным ICP-волн, обеспечивая точное прогнозирование траектории ICP внутрипациента 20. Матачиньский и др. предложили объяснимый комитет по моделям на базе TabNet, применяемый к мультимодальным физиологическим метрикам, полученным на основе сигналов, с высоким воспоминанием (0,94) для прогнозирования кризисов ICP за 30 минут вперёд и улучшением традиционных пороговыхподходов 21. Эта область выигрывает благодаря множеству независимых исследований репликации, внешней валидации и чёткой физиологической обоснованности клинической эффективности ранних предсказаний.
Прогнозирование посттравматических приступов
Для посттравматических приступов исследования с использованием нейровизуализации и ЭЭГ показали умеренную дискриминационную эффективность при выявлении пациентов из группы высокогориска 12,13. Гарнер и др. применили случайный лесной классификатор к данным функциональной магнитно-резонансной томографии (fMRI) в состоянии покоя у пациентов с ЧМТ, достигнув 69% чистой точности перекрёстной валидации для прогнозирования предрасположенности ксудорогам 12. Фагихпирайеш и др. применили глубокое обучение к данным ЭЭГ для выявления эпилептиформных аномалий при острой ЧМТ, сообщив о чувствительности 0,78 и специфичности 0,8413. Эти результаты требуют критической методологической оценки: ранние посттравматические приступы возникают примерно у 4–15% пациентов с тяжёлойЧМТ 22,23, что создаёт значительный дисбаланс классов в наборах данных прогнозов. В этом контексте точность 69% не является существенно выше наивного классификатора, предсказывающего отрицательный класс для всех наблюдений; AUC и площадь под кривой точного воспоминания являются гораздо более информативными показателями эффективности для таких дисбалансированных клинических задач прогнозирования, и ни одна из них не была описана Гарнером и соавторами. Примечательно, что оба исследования в этой области публиковались как индексированные материалы конференций, а не полноценные рецензируемые статьи, что ещё больше подчёркивает зарождающееся состояние этой базы доказательств. Прогнозирование приступов в настоящее время представляет собой наименее зрелую область доказательств, без опубликованных внешних валидационных исследований, ограниченных размеров выборки и показателей эффективности, которые требуют осторожной интерпретации.
Прогноз TIC
Для TIC Янг и соавторы разработали модели машинного обучения с использованием XGBoost, случайного леса и логистических регрессионных классификаторов, достигнув значений AUC 0,82–0,85 при внутренней валидации в специфической для TBIкогорте 24. Ли К. и др. независимо разработали модель ML-ансамбля для прогнозирования острой травматической коагулопатии у пациентов с травмами, поступивших в неотложную помощь, сообщив о AUC 0,8925. Эти дополнительные исследования демонстрируют согласованные профили эффективности в частично пересекающихся популяциях пациентов. Сюн и др. применили десять кросс-центровых моделей на 13 235 пациентах с общей травмой (включая, но не ограничиваясь, случаями ЧМТ) и продемонстрировали стабильные результаты внешней валидации в четырёх независимыхучреждениях 26; однако обобщимость этих результатов, касающихся коагулопатии, связанной с ЧМТ, требует дальнейшей оценки в специализированных когортах ЧМТ. Прогноз коагулопатии обладает умеренной зрелостью доказательств: результаты внутренней валидации одинаковы во всех исследованиях, но внешняя валидация, специфичная для ЧМТ, особенно для высоколетального коагулопатического фенотипа, поражающего до 60% тяжелых пациентов ЧМТ и увеличивающего смертность втри-четыре раза 15,16 — остаётся незаполненным пробелом.
Сепсис и прогнозирование инфекции
Лю и соавторы разработали объяснимую модель на базе XGBoost, специально разработанную для прогнозирования сепсиса, связанного с ЧМТ, достигнув AUC 0,81 при внутренней валидации и 0,76 при внешней валидации с использованием базы данных eICU Collaborative ResearchDatabase 17. Аддитивные объяснения Шапли (SHAP) обеспечивали прозрачную атрибуцию признаков, выявляя ключевые предикторы сепсиса, включая биомаркеры воспалительных и ранние клинические сигналы ухудшения. Ху и соавт. разработали и внутренне валидировали модели ML — включающие логистическую регрессию, случайный лес и XGBoost — для стратификации риска сепсиса за 30 дней при госпитализации в ЧМТ у пациентов с ЧМТ, достигнув AUC 0,7918. Ли и соавт. разработали модель XGBoost в реальном времени для прогнозирования сепсиса, используя ежечасные данные MIMIC-IV у пациентов с травмами, при этом временная валидация подтвердила устойчивую предиктивную эффективность в течение курса27 в отделении интенсивной терапии. Ванг и соавт. продемонстрировали эффективное предсказание пневмонии, связанной с аппаратом искусственной вентиляции лёгких аппаратов (VAP), у пациентов с ЧМТ с использованием ансамблевых методов, применяемых к MIMIC-III, достигнув AUC 0,8728. Наличие внешне валидированной модели (Лю и др.) отличает литературу по прогнозированию сепсиса; Однако все четыре исследования опирались на ретроспективные административные или регистратурные базы данных, а не на потенциальные когорты пациентов, что ограничивало обобщаемость представленных оценок эффективности.
Прогнозирование смертности и функциональных исходов
Прогнозирование смертности и функциональных исходов имеет самую крупную и наиболее широко проверенную базу доказательств среди рассмотренных областей. Пис и соавторы разработали модель глубокого обучения с использованием КТ головы, которая достигла AUC 0,92 для прогнозирования смертности при внутренней валидации, превысив как модель IMPACT, так и результатынейрохирурга 29. При внешней валидации с использованием набора данных Transforming Research and Clinical Knowledge in Traumatic Brain Injury (TRACK-TBI) производительность модели снизилась до AUC 0,80 — уровня, сопоставимого с моделью IMPACT — что подчёркивает хорошо известный риск оптимистичных оценок внутреннейвалидации 29. Хиби и соавторы разработали мультимодальную модель прогнозирования ML, интегрирующую клинические данные и количественную КТ-визуализацию, используя как наборы данных CENTER-TBI, так и Comparative Indian Neurotrauma Effectiveness Research in Traumatic Brain Injury (CINTER-TBI), демонстрируя, что мультимодальное слияние данных повышает точность прогнозирования за пределами унимодальныхподходов 30. Уорман и др. сравнили результаты прогнозирования смертности ML в странах с высоким уровнем дохода (HIC) и странах с низким и средним уровнем дохода (LMIC), представляя собой анализ обобщённости между популяциями, а не стандартную внутреннюю или внешнюю валидацию; Ухудшение эффективности в условиях низкой перспективы (LMIC) выявило важные ограничения, связанные скапиталом 31. Радж и соавторы разработали динамические модели прогнозирования смертности с использованием логистической регрессии, применяемой к развивающимся физиологическим данным отделения интенсивной терапии, при этом AUC улучшился с 0,67–0,72 на первый день до 0,81–0,84 к пятому дню мониторинга, что показало превосходство по сравнению со статическими моделями на базегоспитализации 32. Эти исследования в совокупности представляют собой наиболее развитую базу доказательств для прогнозирования ИИ при ЧМТ, с многочисленными успешными международными внешними валидациями.
Критические барьеры при оценке и реализации
Предиктивная дискриминация против клинической полезности
Фундаментальное различие — часто смешиваемое в опубликованной литературе — отделяет предиктивную дискриминацию от доказательств клинической полезности. Предиктивная дискриминация, количественно оцениваемая с помощью AUC, измеряет способность модели ранжировать пациентов по риску; Она не определяет, улучшает ли действие этих прогнозов клинические результаты. Для ответственного клинического внедрения требуется полная цепочка доказательств: (1) калибровка, подтверждающая соответствие прогнозируемых вероятностей частоте наблюдаемых событий; (2) анализ кривой принятия решений (DCA), демонстрирующий чистую клиническую пользу по диапазону порогов принятия решений; и (3) проспективные — желательно рандомизированные — доказательства того, что клинические вмешательства, управляемые алгоритмом, приводят к улучшению результатов, ориентированных на пациента. Ни одно опубликованное исследование прогнозирования ИИ по ЧМТ пока не завершило эту цепочку доказательств, что является самым критичным пробелом в доказательствах в этой области.
Валидация и методологическая строгость
Значения AUC, представленные в обзорных исследованиях, должны интерпретироваться с учетом существенных методологическихограничений 5,33. Большинство опубликованных моделей не имеют внешней валидации независимых наборов данных; из 39 исследований, рассмотренных Малхотрой и др., только примерно одна треть прошла внешнюювалидацию 5. Применение инструмента количественной оценки APPRAISE-AI показало, что методологическое поведение (медианный балл 35%), надёжность результатов (20%) и воспроизводимость (35%) были самыми низкими показателями в этойлитературе 5. Ни одно рандомизированное исследование не показало, что клинические решения, управляемые ИИ, улучшают результаты пациентов — это критический пробел в доказательствах, который невозможно преодолеть только ретроспективными метриками точности.
Калибровка, дисбаланс классов и базовые компараторы
Помимо дискриминации, ряд дополнительных методологических недостатков ограничивает интерпретацию опубликованных результатов. Калибровка редко оценивается или сообщается; Хорошо различающая, но плохо откалиброванная модель может систематически искажать абсолютный риск, потенциально вводя в заблуждение клинические решения. Классовый дисбаланс является повсеместной проблемой при прогнозировании осложнений: редкие события, такие как посттравматические судороги, создают наборы данных, основанные на негативных наблюдениях, завышение метрик точности без предоставления значимой предиктивной полезности. Стратегии по преодолению классового дисбаланса — включая перевыборку, обучение с учётом затрат и корректирование порога принятия решений — представляются непоследовательно. Сравнительная оценка с сильными логистическими регрессионными базами часто опускается, что затрудняет определение, отражают ли прирост производительности реальные преимущества, специфичные для машинного обучения, или просто адекватную инженерию функций. DCA демонстрирует чистую клиническую пользу менее чем в одной пятой рассмотренных исследованиях.
Интерпретируемость
Многие высокоэффективные модели ИИ функционируют как чёрные ящики, предоставляя прогнозы без интерпретируемогообоснования 5,6,33,34. Лондон рассмотрел теоретические компромиссы между точностью и объяснимостью в медицинском ИИ, отметив, что непрозрачное принятие решений уже распространено в медицине, и что ожидания объяснимости, возможно, потребуетсякалибровка 33. Хассия и др. представили всесторонний технический обзор объяснимых методологий ИИ, применимых в клиническихусловиях 35. Гассеми и др. выдвинули противоположную точку зрения, утверждая, что современные объяснимые подходы ИИ могут давать ложные уверенности в вопросах безопасности и ответственности без существенного улучшения качества принятия решений на уровнепациентов 36. Клиницисты разумно неосторожно доверяют результатам, которые не могут самостоятельно оценить, а медико-правовые последствия решений, повлиянных на ИИ, остаются нерешёнными в большинстве юрисдикций.
Инфраструктура, интеграция и усталость от оповещений
Практическое внедрение требует вычислительной инфраструктуры, конвейеров интеграции данных и возможностей по поддержанию систем, которых у многих учреждений — особенно в условиях с меньшими ресурсами — сейчаснет 5. Системы прогнозирования в реальном времени необходимо тщательно откалибровать, чтобы сбалансировать чувствительность и специфичность, чтобы избежать усталости от тревоги — хорошо задокументированной угрозы безопасности пациентов в условиях интенсивной терапии. Интеграция с существующими платформами электронных медицинских карт создаёт значительные проблемы совместимости, задержки и нарушения рабочих процессов, которые редко решаются в опубликованных исследованиях по разработке алгоритмов.
Справедливость и обобщаемость
Системы ИИ, обученные на нерепрезентативных наборах данных, могут работать неравномерно — и потенциально вредно — в подгруппахпациентов 5,31. Большинство рассмотренных моделей были разработаны на основе данных высокодоходных академических медицинских центров, что создаёт риск географических, институциональных и демографических смещенийв результатах 5. Уорман и соавторы явно рассмотрели эту проблему, продемонстрировав измеримое ухудшение производительности при применении моделей, обученных на HIC, в условияхLMIC 31. Ни одно из рассмотренных исследований не оценивало формально эффективность модели по демографическим подгруппам, определяемым по возрасту, полу, расе или этнической принадлежности — что является фундаментальным упущением, учитывая разнообразие популяций, обслуживаемых травматологическими центрами ЧМТ по всему миру.
Сравнительная зрелость доказательств в различных областях прогнозирования
Пять рассмотренных доменов прогнозирования существенно различаются по зрелости доказательств. Прогнозирование ICP имеет прочную основу: оно выигрывает от фундаментальных исследований, внешней валидации с использованием данных CENTER-TBI, независимой репликации в нескольких группах и четко сформулированного, физиологически правдоподобного клинического рабочего процесса для реализации предсказаний. Прогнозирование смертности и функциональных исходов имеет наибольшую опубликованную литературу, включая множество международных внешних валидационных исследований с использованием наборов данных TRACK-TBI, CENTER-TBI и CINTER-TBI. Прогнозирование коагулопатии демонстрирует стабильную внутреннюю валидационную эффективность, но специфическая для ЧМТ внешняя валидация по-прежнему отсутствует в литературе. Прогнозирование сепсиса имеет по крайней мере одну внешне валидированную модель (Лю и др.), но зависимость от административных баз данных ограничивает доверие к обобщённости производительности. Прогноз приступов имеет наименее зрелую базу доказательств: внешней валидации нет, доступных исследований небольшой, а классовый дисбаланс существенно ограничивает интерпретацию представленных показателей эффективности. Эта разница в зрелости имеет прямые последствия для приоритетизации инвестиций в исследования и для осторожности, необходимой в будущих обсуждениях клинического перевода.
Будущие направления и приоритеты исследований
Строгая, предварительно зарегистрированная внешняя валидация в различных клинических условиях составляет самый насущный приоритетисследований 5,6. Межинституциональные рамки, такие как CENTER-TBI и TRACK-TBI, предоставляют устоявшиеся шаблоны и инфраструктуру для такойвалидации 29,30. Для определения того, действительно ли эти инструменты действительно улучшают результаты лечения пациентов за пределами стандартного ухода, необходимы проспективные исследования, включая рандомизированные платформенные испытания с руководствомИИ. Разработка систем ИИ, предоставляющих клинически интерпретируемые, конкретные для конкретного случая объяснения, значительно повысит доверие клиницистов, выявит режимы отказа и способствует одобрениюрегуляторов 5,6,33,34. Методологические улучшения — стандартизированная калибровочная оценка, DCA как обязательный показатель эффективности, прозрачное управление дисбалансом классов и сравнение с сильными клиническими базовыми стандартами — должны стать минимальными стандартами отчетности. Исследования, специально разработанные для оценки прогнозной эффективности по демографическим и географическим подгруппам, необходимы для принятия широкой клиническойрекомендации 5,31. Принятие стандарта отчетности TRIPOD для прозрачности моделей предсказания и инструмента оценки риска смещения PROBAST должно быть обязательным для журналов, публикующихся в этой области, для повышения воспроизводимости и сопоставимости.
Этические соображения
Интеграция инструментов прогнозирования ИИ в медицину интенсивной терапии поднимает этические вопросы, выходящие далеко за рамки техническихпоказателей эффективности 5,33. Вопросы равенства являются центральными: модели, обученные на нерепрезентативных популяциях пациентов, могут систематически ставить пациентов из недостаточно представленных групп, потенциально увеличивая, а не сужая существующие различия в результатах ЧМТ. Ответственная разработка инструментов требует целенаправленного обучения, диверсификации данных и обязательной оценки эффективности подгрупп перед любым развертыванием. Прозрачность и ответственность за клинические решения, повлиянные на ИИ, остаются нерешёнными: когда рекомендация ИИ способствует неблагоприятному исходу, вопросы ответственности и информированного согласия пока не рассматриваются должным образом в существующих правовых или нормативныхрамках 33,34. Вовлечение пациентов и семей в принятие решений по внедрению ИИ и чёткая коммуникация вероятностного и неопределённого характера прогнозов ИИ являются дополнительными этическими обязанностями для внедряющих организаций.
Ограничения данного обзора
Ряд ограничений этого обзора заслуживают явного признания. Во-первых, в качестве повествовательного, а не систематического обзора, формальные протоколы поиска литературы, документация потока PRISMA и исчерпывающее перечисление исследований не использовались; Отбор исследований основывался на репрезентативном охвате, и смещение отбора нельзя исключать. Во-вторых, никакой формальный инструмент оценки качества или риска предвзятости — такой как PROBAST или контрольный список отчётности TRIPOD — не применялся к отдельным рассмотренным исследованиям, что ограничивало доверие к выводам о качестве доказательств. В-третьих, быстро меняющаяся литература в этой области означает, что исследования, опубликованные после порогового отметки поиска в октябре 2025 года, могут устранить некоторые выявленные ограничения. В-четвёртых, публикационная смещённость, вероятно, завышает кажущуюся точность моделей ИИ в сохраняемой литературе, поскольку исследования с низкой прогнозной эффективностью систематически реже публикуются. В-пятых, гетерогенность определений исходов, состава случаев пациентов, источников данных и показателей эффективности между исследованиями ограничивает прямые сравнения между исследованиями и метааналитический синтез.