$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Обзор TAR
Патогенез ТАР
ТАР охватывает широкий спектр клинических проявлений и патофизиологических механизмов (Таблица I). Эти реакции в основном классифицируются на иммунно-опосредованные и неиммунно-опосредованныеподтипы 7,9,18,19. Иммунно-опосредованные реакции обычно включают взаимодействие антиген-антитела, что приводит к гемолизу или системным воспалительным реакциям. Примером является несовместимость ABO, которая может вызвать острые гемолитические реакции переливания (AHTR). Это состояние проявляется в виде лихорадки, боли в боку, гипертонии, распространённой внутрисосудистой свертываемости (ДИК) и острой почечнойнедостаточности 7,9,20. Кроме того, реакции гиперчувствительности типа I могут вызвать аллергические реакции переливания, клинические проявления которых варьируются от лёгкой крапивницы до угрожающей жизни анафилаксии. Примечательно, что эти реакции часто связаны с продуктами тромбоцитов из-за наличия остаточных донорских плазменных белков, включая молекулы субпыльцовыхаллергенов 18,21,22,23. TRALI клинически определяется как острое начало гипоксемии и некардиогенного отёка лёгких в течение 6 часов после трансфузии. Патогенез в основном связан с антителами, полученными от донора, против человеческих лейкоцитарных антигенов (HLA) или гранулоцитарно-специфическихантигенов 21,22,24. Примечательно, что некоторые антигены группы крови, такие как антигены системы Кидд, могут запускать отложенные гемолитические трансфузионные реакции, также известные как DHTR, при воздействии донорских антител к HLA. Отдельно, TRALI, являющийся видом острого поражения лёгких, связанным с переливанием, представляет собой отдельную патологическую сущность, опосредованную донорскими антителами к HLA через механизмы активациинейтрофилов 6,22. Неиммунно-опосредованные реакции трансфузии охватывают несколько клинических видов, включая септические реакции из-за бактериального загрязнения, перегрузки объема, механического или термического гемолиза и перегрузки кровообращения (TACO)9,23. Реакции септической трансфузии возникают при инфузии кровяных продуктов, заражённых бактериями, чаще всего Staphylococcus spp., Staphylococcus aureus и Escherichia coli в тромбоцитах, а также Yersinia enterocolitica в эритроцитах. Клинически у них наблюдается высокая температура, ригорация, гипотензия, и они могут быстро перейти в шок. Примечательно, что с внедрением высокочувствительного скрининга патогенов риск классических инфекций, передающихся через трансфузию (ТТИ, например, ВИЧ, ВГС) был значительно снижен. В результате септические реакции, особенно при переливании тромбоцитов, которые хранятся при комнатной температуре, теперь чаще сообщаются как инфекционные осложнения переливания, чем ТТИ. Инфекции, передающиеся через трансфузию, которые могут быть вызваны различными патогенами, такими как вирусы, бактерии и паразиты, могут запускать ТАР, активируя врождённую иммунную систему. Недавние систематические обзоры подчёркивают, что комплексный скрининг иммуногенных патогенов остаётся основной проблемой в предотвращении инфекционно-связанногоTAR 25,26,27,28 (Таблица 1).
Эпидемиология ТАР
В развитых странах общая заболеваемость ТАР остаётся относительно низкой. Текущие данные наблюдения показывают, что аллергические реакции и лихорадочные негемолитические трансфузионные реакции (FNHTR) являются одними из наиболее часто сообщаемых побочных эффектов, при этом аллергические реакции сейчас встречаются чаще, чем FNHTR, во многих системах отчётности. Отсроченные серологические реакции переливания (DSTR) сообщаютсяреже 5,9,29. Тем не менее, ТАР продолжает представлять значительные клинические проблемы в развивающихся странах и отдельных популяциях, при этом повышенный профиль риска обусловлен многофакторными детерминантами, включая вариации стандартизированных протоколов скрининга, неоптимальные процедуры обращения с кровяными продуктами, гетерогенные практики переливания и популяционно-специфические генетическиепредрасположенности 26,27. Пациенты с серповидноклеточной анемией особенно подвержены гемолитическим трансфузионным реакциям и аллоиммунизации. Этот повышенный риск связывают с хроническим воспалением, фенотипическими различиями в антигенах эритроцитов между преимущественно белыми донорами и пациентами с СКД африканского происхождения, а также высоким жизненным воздействием переливания, а не наличием самого серповидногогемоглобина 20,30. Примечательно, что недавние данные наблюдения крупных китайских медицинских центров показали более высокую заболеваемость аллергическим ТАР в детских и неонатальных популяциях, чем у взрослых, что связано с различными порогами переливания и клинической практикой. В то же время европейские когорты демонстрируют противоположную эпидемиологическую закономерность в этихвозрастных группах 19, 31 и 32 года. Например, Го К. и др. 19 сообщили, что дети в крупном китайском национальном центре испытывали аллергические реакции чаще, чем взрослые, тогда как у новорождённых пороги и практики переливания крови значительно различаются по всейЕвропе 33.
Текущие клинические испытания, разрабатывающие модели оценки риска TAR, используют три основных стратегических подхода, включая стратифицированные меры с рисками, системы непрерывного мониторинга в реальном времени и персонализированные протоколы управления для групп высокого риска. Эти модели риска демонстрируют бимодальную систему классификации, включающую как комплексные инструменты скрининга с универсальным применением для реципиентов трансфузии, так и специализированные предиктивные алгоритмы, предназначенные для выявления специфических подтипов побочныхреакций 34,35. Обобщённые инструменты оценки риска, продемонстрированные системой UK Serious Hazards of Transfusion (SHOT), используют наборы данных на уровне популяции для стратификации реципиентов трансфузии. Эти системы демонстрируют особую эффективность при выявлении когорт высокого риска, включая пациентов с историей множественных переливаний или аутоиммунныхрасстройств 36. Традиционная методология оценки риска трансфузии и клинических знаний (TRACK) использует статические метрики эффективности с заранее установленными пороговыми значениями для количественной оценки эффективности модели в пределах заранее определённых границ принятия решений. Этот подход характеризует предсказательные возможности модели при ограниченных операционныхпараметрах 37. Недавние достижения позволили создать новые инструменты стратификации рисков для прогнозирования трансфузии. Новая система SCORE включает шесть клинически валидированных предиктивных факторов для оценки вероятности трансфузии. Сравнительные анализы показывают, что эта упрощённая модель достигает сопоставимой точности предсказания и калибровочной эффективности с традиционным показателем TRACK при прогнозировании потребностей в переливании вкардиохирургических процедурах 38.
В дополнение к конкретным моделям реакций, недавно были изучены многие модели invivo 39. TRALI — это клинически значимое осложнение, профиль риска которого определяется взаимодействием антител, полученных от донора на анти-лейкоцитарные/нейтрофильные антигены (anti-HLA/HNA), повышенных воспалительных биомаркеров реципиента, включая интерлейкин-6, и введённого объёматрансфузии 34,39,40. Риск перегрузки кровообращения (TACO), связанный с трансфузией, часто оценивается с помощью клинических систем оценки, включающих такие параметры, как повышенный уровень натриуретических пептидов типа B (BNP или NT-proBNP), история сердечно-сосудистых нарушений, высокая частота переливания и положительный баланс жидкости. Риск иммунно-опосредованного гемолиза предварительно оценивается с помощью скрининга антител с помощью косвенного теста на антиглобулин (косвенный тест Кумбса), который выявляет клинически значимые аллоантитела в плазме реципиента. Идентификация этих антител позволяет отбирать антиген-отрицательные единицы крови для переливания, тем самым предотвращая реакции антиген-антитела, которые в противном случае вызвали бы гемолиз. История переливания пациента также критически важна для выявления предшествующей сенсибилизации и риска задержки гемолитических реакций. Эти механистические модели интегрируют многомерные клинические и лабораторные параметры для повышения точности прогнозирования неблагоприятныхреакций 34,39,41. Кроме того, были разработаны протоколы массового переливания (MTP) для снижения смертности, связанной с геморрагическим шоком, у пациентов с тяжело кровоточающими травмами или хирургическими операциями, путем стандартизации соотношения эритроцитов, плазмы итромбоцитов 42,43. Однако эти практики снизили заболеваемость, связанную с трансфузией, и не полностью отражают сложное взаимодействие иммунологических и неиммунологических переменных, определяющих безопасность трансфузии. Многие существующие системы и протоколы оценки были проверены в контролируемых условиях или в узких группах пациентов, что делает их неоптимальными в реальных гетерогенныхусловиях 16, 44, 45, 46. Эволюция профилей патогенов, изменения в популяциях доноров и сложность современной медицинской помощи дополнительно бросают вызов статичнымподходам 25,26,47. Этот контекст вызвал растущий интерес к применению машинного обучения для совершенствования оценки риска переливания, объединяя клинические данные, лабораторные результаты и новые области, такие как мультиомика, для создания более мощных предиктивных моделей (Рисунок 1)48,49,50.
Современная модель клинической оценки рисков с помощью машинного обучения
Машинное обучение (ML), как базовая парадигма искусственного интеллекта, способствует адаптивному принятию решений через автоматическое обнаружение скрытых шаблонов данных и индуктивную генерацию предиктивных моделей, тем самым обходя явное процедурное программирование и обеспечивая непрерывное совершенствование производительности в сложных, развивающихся областях, включая медицинскую диагностику ипрогнозирование 51. Эволюция машинного обучения прошла через три отдельных этапа: (1) фундаментальную эпоху, которая заложила теоретическуюоснову 52; (2) алгоритмический ренессанс, отмеченный значительными достижениями в области опорных векторных машин и ансамблевыхметодов 53; и (3) революция глубокого обучения, когда сверточные и рекуррентные нейронные сети, подпитываемые ускорением GPU и большими данными, инициировали трансформационные сдвиги парадигмы в различныхобластях 54. В медицинских приложениях они произвели революцию в диагностике медицинских изображений и обнаружениибиомаркеров 55.
Современные системы машинного обучения классифицируются на три основные парадигмы в зависимости от механизмов обучения: (1) контролируемое обучение, которое опирается на маркированные обучающие наборы для предиктивного моделирования; (2) неконтролируемое обучение, которое выявляет скрытые структуры из неаннотированных данных; и (3) глубокое обучение, которое использует иерархические нейронные архитектуры для автоматизированной абстракции признаков. Вместе эти парадигмы составляют фундаментальные методологии, лежащие в основе современных приложенийИИ 56.
В последние годы ML получил широкое применение в разработке медицинских диагностических маркеров, оценке прогноза и построении моделейриска 57,58. Медицинские данные часто обладают высокой размерностью, что создаёт значительные трудности для эффективного анализа традиционнымиметодами 14,59. Методы машинного обучения отлично извлекают критические признаки из таких сложных наборов данных, что облегчает их идентификацию. Применение ML в трансфузионной медицине быстро развивается. Например, модели машинного обучения продемонстрировали превосходные результаты в таких задачах, как классификация медицинских изображений и патологический анализ, что привело к значительному улучшению точности ранней диагностики и стратификациипрогноза 60,61. Используя специфические данные пациента, такие как геномные и метаболомные профили, ML может прогнозировать персонализированные ответы на лечение, продвигая область прецизионноймедицины 62. Помимо прогнозирования необходимости переливания, ML также применяется для оптимизации управления кровяными продуктами. Исследования использовали машинное обучение для таких задач, как прогнозирование использования тромбоцитов и персонализация предоперационных заказов крови, демонстрируя потенциал для улучшения управления запасами и снижения потерь.
Кроме того, ML позволяет интегрировать многоисточниковые данные, включая визуализацию, геномику и электронные медицинские записи (EHR), для создания комплексных предиктивныхмоделей 63. Кроме того, ML поддерживает оповещения о рисках в реальном времени, такие как прогнозирование сепсиса для пациентов в отделениях интенсивной терапии, и автоматизирует диагностические рабочие процессы, тем самым снижая нагрузку на медицинскихработников 64. ML значительно повысил точность моделей прогноза рака и разработки таргеней, интегрируя мультиомические данные, анализируя сложные паттерны и ускоряя разработку лекарств. Кроме того, машинное обучение повышает точность диагностики, выявляя как известные, так и неизвестные закономерности, указывающие на наличие или отсутствие рака65. Симуляционное исследование показало, что радиологи могут пропускать прогнозируемые отрицательные случаи, снижая нагрузку до считывания только 80,7% маммограмм при сохранении общей чувствительности и специфичности. Было показано, что модели CNN могут использоваться для сегментирования функциональных тканей с ультразвуковых изображений молочной железы, что помогает клиницистам в интерпретации и диагностике этихизображений 66. Прогноз и выбор лечения во многом зависят от характеристик опухоли, многие из которых можно предсказать с помощью моделей машинного обучения на основе изображений. Некоторые исследователи применяли 3D-CNN для прогнозирования статуса мутации EGFR при аденокарциноме лёгких из ручно выбранных интересующих областей (ROI) на КТ, предлагая неинвазивную альтернативу генотипированию рака и информируя потенциальные терапевтическиестратегии 67. Новые геномные технологии, такие как одноклеточная транскриптомика и пространственная транскриптомика, несут значительный потенциал для революционизации гистопатологической характеристики солидных опухолей. В частности, одноклеточная транскриптомика позволяет детально анализировать клеточный состав, позволяя ML-моделям предсказывать ответы на лечение рака и потенциальные механизмы лекарственнойрезистентности 68.
Глубокое обучение (DL), как подотрасль машинного обучения, использует алгоритмы многоуровневых нейронных сетей, вдохновлённые нейронной архитектурой мозга, для предиктивного моделирования69. В отличие от методов машинного обучения, таких как логистическая регрессия, которые используют архитектуру нейронных сетей, DL позволяет моделям масштабироваться экспоненциально с увеличением объёма и размерности данных69. DL широко применяется в медицинских приложениях. В последние годы новые методы глубокого обучения широко применяются для диагностики, прогнозирования и определения терапевтических схем рака. Различные архитектуры нейронных сетей, включая многоуровневые перцептроны (MLP), рекуррентные нейронные сети (RNN) и сверточные нейронные сети (CNN), служат основой для передовых методологий69. Исследования ввели модель CNN, способная предсказывать риск рака не только на уровне изображения, но и пикселей, предоставляя тепловые карты, выделяющие регионы, наиболее вероятные к развитию злокачественных опухолей.70. Интеграция глубоких CNN в гистологические системы оценки рака оказалась успешной: исследования показывают, что эти модели могут достигать эффективности, сопоставимые с человеческими патологами, при оценке рака простаты, молочной железы, толстой кишки и лимфомы71,72,73,74,75. Исследователи показали, что сегментирование раковых тканей с помощью генератора на базе CNN может помочь классификатору на базе CNN в прогнозировании степени рака предстательной железы76. Некоторые исследователи использовали гибридную модель сверточной нейронной сети (GCNN) для отображения профилей экспрессии генов в сеть взаимодействия белков STRING (PPI), что позволяет предсказывать молекулярные подтипы рака молочной железы69,77. Машинное обучение также показало значительную применимость к нераковым заболеваниям, особенно в диагностическом моделировании. Например, исследования проводили внешнее и проспективное обучение и валидацию моделей машинного обучения для прогнозирования смертности и критических событий среди пациентов с COVID-19 в различных временных периодах. Эти модели успешно выявили пациентов из группы высокого риска и прояснили основные взаимосвязи, способствующие прогнозированию результатов78. Традиционные радиомикрофонные модели преимущественно опираются на ручные инженерные функции, явно полученные из медицинских изображений. Исследователи изучали, могут ли глубокие признаки, извлеченные с помощью трансферного обучения, использоваться для генерации радиомических сигнатур с целью прогнозирования общей выживаемости (OS) пациентов с глиобластомой мультиформой (GBM)79. В последние годы ML продемонстрировала значительные достижения в микробиологии80. Ключевым применением в этой области является возможность медицинских работников быстро и точно диагностировать микроорганизмы, ответственные за инфекционные заболевания у пациентов, что критически важно для определения подходящих стратегий лечения. Модели машинного обучения могут добиваться точных диагнозов при предоставлении соответствующих входных данных80. Было показано, что использование предварительно обученной сверточной нейронной сети (CNN) в качестве экстрактора признаков в сочетании с кросс-валидацией на уровне пациента позволяет эффективно различать клетки, инфицированные малярией, от неинфицированных клеток, тем самым улучшая процессы скрининга заболеваний81. Была разработана модель машинного обучения, основанная на когорте из 1 839 бактериальных изолятов из Великобритании, для классификации профилей устойчивости Mycobacterium tuberculosis (M. tuberculosis) до восьми противотуберкулёзных препаратов (изониазид, рифампицин, этамбутол, пиразинамид, ципрофлоксацин, моксифлоксацин, офлоксацин и стрептомицин), включая многолекарственно устойчивый туберкулёз. По сравнению с предыдущими методами, наиболее эффективная модель улучшила чувствительность к изониазиду, рифампицину и этамбутолу на 2–4%, достигнув чувствительности 97% (P < 0.01). The sensitivity for ciprofloxacin and multidrug-resistant tuberculosis increased to 96%. For moxifloxacin and ofloxacin, the sensitivity increased from 83% and 81%, respectively, based on known resistance alleles, to 95% and 96% (P < 0.01), representing improvements of 12% and 15%, respectively. Notably, compared with rule-based approaches, the model enhanced the sensitivity for pyrazinamide and streptomycin by 15% and 24%, respectively, reaching 84% and 87% (P < 0.01). The top-performing model also increased the area under the ROC curve for pyrazinamide and streptomycin by 10% (P < 0.01) and for other drugs by 4-8% (P < 0.01).
Например, модели DL обычно обучаются анализировать маммографические изображения с целью прогнозирования вероятности развития рака у пациентав будущем 82. Кроме того, некоторые исследователи подчеркивают преимущества этого метода прямого прогнозирования риска, указывая на то, что оценка риска рака молочной железы, полученная моделлю сверточной нейронной сети Inception-ResNet-v2, более точна, чем результат, полученный в клинической оценке плотностигруди 83. Аналогично, некоторые исследователи разработали модель маммографии на основе DL, которая превосходит модель риска Тайрера-Кузика, основанную на клинических особенностях, таких как возраст пациентки, при прогнозировании пятилетнего риска развития рака молочной железы уженщин 84 года.
Кроме того, машинное обучение применяется в трансфузионной медицине. Растущий интерес к применению ИИ в трансфузионной медицине подчёркивает его включение в крупные профессиональные форумы, такие как специализированная конференция, организованная Рабочей группой по клинической трансфузии Международного общества переливания крови (ISBT), которая исследует потенциал ИИ в практике, образовании и исследованияхТМ 85. Переливание крови (БТ) является важнейшим компонентом медицинской помощи хирургическим пациентам в отделении интенсивной терапии. В этом исследовании проанализировали данные 9 118 пациентов хирургических отделений интенсивной терапии из базы данных UMC, используя машинное обучение для прогнозирования потребностей в переливании крови. Сравнивая работу алгоритмов XGBoost и логистической регрессии (LR) с использованием данных за 6 часов до госпитализации в отделение интенсивной терапии и через 1, 2, 3 и 6 часов после госпитализации, исследование выявило значительные различия в характеристиках пациентов между группами, проходящими переливание и нетрансфузионными группами. Эти результаты подтверждают возможность машинного обучения в прогнозировании потребностей в переливании крови для хирургических пациентов в отделении интенсивной терапии86. Аллогенные переливания крови часто требуются при операциях на тазобедренном суставе, но связаны с повышенным риском заболеваемости. Точное прогнозирование потребностей в переливании необходим для минимизации отходов кровяных продуктов и оптимизации предоперационных решений. Недавние исследования выработали 14 алгоритмов машинного обучения для прогнозирования рисков переливания, включая демографические данные пациентов, лабораторные результаты до операции и хирургическую информацию. Производительность модели оценивалась с помощью разборки, калибровки и анализа кривой принятия решения. Для интерпретации моделей использовались аддитивные объяснения SHapley (SHAPs), при этом гребневой классификатор показал наивысшую предсказательную точность, достигнув AUC 0,85 (95% CI: 0,81-0,88) и балл Брайера 0,21. Модель машинного обучения этого исследования продемонстрировала высокую предиктивную эффективность для необходимости переливания крови при операциях на тазобедренном суставе, используя доступные клиническиепеременные 87.
Кроме того, машинное обучение успешно интегрировано в разработку лекарств, решая такие задачи, как время и вычислительные затраты, при этом повышаянадёжность до 88,89. Используя трёхмерную среду связывания с лигандами белков, машинное обучение облегчает определение структур целевых белков — ключевой этап в открытиилекарств 90. Например, AlphaFold, инструмент на базе искусственного интеллекта, может быть натренирован непосредственно на данных Protein Data Bank (PDB) и способен предсказывать 3D-структуры белков по аминокислотнымпоследовательностям 91. AlphaFold использует двухэтапный процесс: во-первых, CNN преобразует аминокислотную последовательность белка в матрицы углов расстояния и кручения; во-вторых, методы градиентной оптимизации преобразуют эти матрицы в трёхмерную структурубелка 92.
Scikit-learn (sklearn) — это библиотека машинного обучения на Python, широко признанная своей простотой использования, обширной документацией и надёжной поддержкойсообщества 93. Он предоставляет комплексный набор контролируемых методов, таких как логистическая регрессия, машины поддержки векторов и случайные леса, а также неконтролируемые методы, включая кластеризацию и уменьшениеразмерности 93. Также он предоставляет конвейеры, которые упрощают предобработку данных, обучение моделей, кросс-валидацию и настройку гиперпараметров в единомфреймворке 93. Инструменты для интерпретации моделей, включая значимость признаков перестановки и графики частичной зависимости, наряду с продвинутыми ансамблевыми методами, такими как случайный лес и усиление градиента, стабильно демонстрируют устойчивую предиктивную эффективность в контекстахздравоохранения 45,93.
Учитывая эти особенности, SK-learn широко применяется в медицинских исследованиях для таких задач, как диагностиказаболеваний 12,94, прогнозирование выживаемости95, анализ больших наборов данныхвизуализации 96 и создание моделей прогнозирования рисков для использования припереливании крови 97. В этом разделе подробно рассматриваются конкретные случаи применения и техническая реализация, а также демонстрируются преимущества SK-learn в построении моделей диагностики заболеваний и оценки риска (рисунок 2). С особым вниманием к области рака, где её применение наиболее обширно и зрело, мы анализируем успешные практики и решаем существующие задачи12, 93, 95 и 98. Кроме того, мы исследуем, как эти инсайты могут служить ценными справочниками и вдохновением для разработки моделей прогнозирования рисков TAR.
SK-learn предоставляет надёжную алгоритмическую структуру, интегрирующую традиционные методы машинного обучения — включая поддерживающие векторные машины (SVM), случайные леса и логистическую регрессию — с методами глубокого обучения, такими как классификатор многоуровневого перцептрона (MLP), что делает его отлично подходящим для моделирования различных наборов данных по раковым заболеваниям. Например, при разработке новой гистологической системы диагностики адренокортикальной карциномы исследователи использовали библиотеку sklearn в Python для построения многомерной математической модели. Эта модель достигла общей диагностической точности 100%, что продемонстрировало широкую применимость ко всем морфологическимвариантам 99.
Кроме того, инструменты SK-learn, GridSearchCV и RandomizedSearchCV позволяют автоматизировать оптимизацию гиперпараметров. Например, при прогнозировании метастазирования лимфатических узлов параметры модели XGBoost были тонко настроены с помощью перекрёстной валидации, что дало значение AUC 0,95212. Например, аппарат опорного вектора (SVM) демонстрирует превосходные результаты в задачах классификации рака молочной железы. Его нелинейная функция ядра позволяет эффективно обрабатывать данные изображения с большими размерностями. Исследование, анализировавшее спектральные данные пациентов с раком полости рта, показало, что SVM в сочетании с рекурсивным устранением признаков (RFE) достигает чувствительности 95% и специфичности 96%, значительно превосходя традиционный линейный дискриминантный анализ Фишера (FLD)100. Кроме того, сравнительный анализ, проведённый на наборе данных по раку молочной железы UCI, показал, что SVM превосходит как кластеризацию K-средних, так и искусственные нейронные сети по точности классификации и возможностям обобщения101. Способность SVM обрабатывать данные с высокой размерностью столь же важна для прогнозирования TAR, где модели должны интегрировать множество клинических и лабораторных параметров.
Метод случайного леса демонстрирует превосходные результаты в анализе важности признаков. Некоторые исследователи использовали случайные леса для интеграции геномных и клинических данных и выявления ключевых признаков, связанных с прогнозом рака молочной железы. Результаты кластеризации были существенно коррелированы с клиническимирезультатами 102. Этот подход можно напрямую перенести в моделирование TAR для выявления наиболее влиятельных факторов риска, таких как специфические антитела донора или воспалительные маркеры реципиента, из широкого спектра признаков кандидатов.
XGBoost, как репрезентативный алгоритм градиентного бустинга, демонстрирует выдающуюся эффективность в прогнозировании стадий рака. Исследование, основанное на мультиомических данных TCGA, показало, что XGBoost в сочетании с особенностями метилирования ДНК может дополнительно повысить прогнозную эффективность классификационноймодели 103. В другом исследовании метастазирования рака молочной железы XGBoost оптимизировал свои гиперпараметры с помощью Grid-Search CV и был объединён с визуализацией значений SHAP. Были успешно идентифицированы шесть ключевых генов, таких как SQSTM1 и GDF9. AUC модели достиг 0,82, что дало новые биомаркеры для прогнозирования рискаметастазирования 104. Сочетание высокоэффективных ансамблевых методов, таких как XGBoost, с объяснением SHAP — это мощная парадигма, которую можно принять для моделей TAR, чтобы предоставить клиницистам прозрачные и практические оценки рисков.
SK-learn предоставляет стандартизированный набор инструментов предварительной обработки данных, который эффективно решает проблемы высокой размерности, дисбаланса и недостающих значений в данных о раке. Например, при прогнозировании колоректального рака была использована логистическая регрессионная модель, скринингующая четыре основных индикатора, таких как CEA и гемоглобин, для построения неинвазивной диагностической модели с площадью под кривой (AUC) 0,849, значительно превосходящей обнаружение по одному опухоловомумаркеру 105. Что касается несбалансированной обработки данных, комбинируя технику перевыборки SMOTE из библиотеки несбалансированного обучения, XGBoost повысил чувствительность меньшинственного класса (злокачественных образцов) на 8,36% в классификации рака молочной железы, и значение F1 достигло 96,2%106.
Сочетание SK-learn с такими инструментами, как SHAP и eli5, обеспечивает прозрачную интерпретацию для моделей рака. При прогнозировании метастазирования сторожевых лимфатических узлов при раке молочной железы модель XGBoost, визуализированная через значения SHAP, показывает, что ультразвуковые признаки, такие как «подозрительные лимфатические узлы» и «маргинальная спикуляция», оказывают наибольший вклад в риск метастазирования, что в полной степени соответствует клинической диагностическойлогике 12.
SK-learn продемонстрировал значительные преимущества в исследованиях, связанных с нераковыми заболеваниями. Нераковые заболевания часто требуют интеграции многоисточниковых данных, включая электронные медицинские записи (EHR), визуализацию, геномику, протеомику и другие. SK-learn способен консолидировать ЭМК пациентов, генетические профили и информацию о образе жизни для прогнозирования риска связанных заболеваний с повышенной точностью. Например, алгоритм случайного леса из SK-learn был использован для интеграции данных ЭМК с целью прогнозирования риска сердечно-сосудистых заболеваний. Этот подход не только значительно повысил точность прогнозирования сердечно-сосудистых рисков, но и увеличил число пациентов, которые могли бы получить пользу от профилактических вмешательств, минимизируя ненужное лечение для других107. Исследователи использовали библиотеку машинного обучения SK-learn от Python для разработки и обучения пяти различных моделей ИИ — логистической регрессии, случайного леса, AdaBoost, CATBoost и LightGBM — для прогнозирования послеоперационных повторных разрывов ротаторной манжеты после артроскопического ремонта ротаторной манжеты (ARCR). Обученные модели впоследствии применялись к тестовому набору данных для оценки. Особенно стоит отметить, что модель LightGBM достигла AUC 0,87, что продемонстрировало её превосходную предиктивную эффективность при оценке вероятности повторного разрыва послеARCR 108.
Хотя sklearn широко используется в области медицинского прогнозирования, в настоящее время не существует прямой литературы по его применению для прогнозирования неблагоприятных реакций переливания. Этот пробел не указывает на технический дефект, а скорее подчеркивает уникальные вызовы и неиспользованный потенциал прогнозирования неблагоприятных реакций переливания.
Традиционные методы оценки рисков побочных реакций при переливании крови в основном основаны на статических клинических показателях, ретроспективном анализе медицинской истории и стандартизированных скрининговых анкетах, которые имеют множествоограничений 109, 110, 111. События TAR крайне редки. Частота реакций переливания в общей взрослой популяции составляет примерно 2%, что приводит к крайне несбалансированнойкатегории 112. Этот дисбаланс заставляет стандартные классификаторы отдавать приоритет точности класса большинства по сравнению с классом меньшинства. Для решения этой проблемы модуль sklearn disбалансированного обучения, такой как SMOTE+ENN, предлагает хорошо зарекомендовавшее решение для ребалансировки набора данных. Множество факторов способствуют возникновению побочных реакций после переливаниякрови 113. SK-learn обеспечивает эффективную предварительную обработку собранных данных, облегчая последующий анализ. Использование трансформаторов столбцов для гетерогенной предобработки и объединения признаков для мультимодального слияния признаков позволяет бесшовно интегрировать структурированныеданные 114,115. В клиническом принятии решений прозрачность модели имеет решающее значение. SHAP/LIME совместим с моделями sklearn, включая TreeExplainer для случайных лесов, обеспечивая соблюдение нормативных требований при сохранении прогностическойэффективности 116 117.
Чтобы преобразовать обсуждаемые возможности sklearn в конкретную стратегию прогнозирования TAR, мы предлагаем практический конвейер моделирования, следуя установленной дорожной карте машинного обучения (рисунок 3). Эта структура разработана для решения специфических проблем ТАР, таких как гетерогенность данных и крайний классовый дисбаланс.
Разработка надёжной предиктивной модели неблагоприятных реакций при переливании требует комплексного аналитического конвейера. Этот процесс начинается с интеграции и предварительной обработки мультимодальных клинических данных, охватывающих демографию пациентов, жизненно важные показатели, лабораторные показатели, детали переливания и характеристики доноров. Гетерогенные типы данных эффективно консолидируются с помощью ColumnTransformer от sklearn внутри конвейера для применения соответствующего масштабирования и кодирования, создавая единый набор данных для анализа. Критически важным следующим шагом является устранение глубокого классового дисбаланса, присущего редким событиям ТАР; метки, определяемые строго оценёнными результатами, могут быть перебалансированы с помощью таких методов, как SMOTE-ENN из совместимой библиотеки небалансированного обучения, чтобы предотвратить смещение модели. После подготовки данных несколько алгоритмов обучаются и оцениваются с помощью согласованного API sklearn, при этом настройка и калибровка гиперпараметров проводятся через GridSearchCV для оптимизации производительности и обеспечения надёжных оценок вероятности. Для укрепления клинического доверия и предоставления механистических инсайтов прогнозы модели интерпретируются с помощью таких инструментов, как SHAP, которые могут количественно оценить вклад конкретных признаков в риск индивида. Обобщаемость модели затем тщательно проверяется с помощью надёжных методов, таких как вложенная кросс-валидация данных из разных когорт пациентов. Наконец, для возможного клинического перевода весь обученный конвейер может быть сериализован и интегрирован в электронные системы медицинских карт, функционируя как инструмент поддержки принятия решений в реальном времени, предоставляющий интерпретируемые оценки риска клиницистам на месте оказания помощи.
В этом обзоре мы начинаем с представления TAR, обобщения существующих моделей TAR, представления концепции машинного обучения, выделения преимуществ машинного обучения и обсуждения его применения в прогнозировании заболеваний. Далее мы исследуем потенциал применения машинного обучения в TAR, предоставляя рекомендации для будущих исследователей по разработке моделей обучения TAR-SK. Кроме того, мы подробно рассматриваем потенциальную роль SK-learn в оценке риска TAR, но подчёркиваем, что значительные ограничения существенно ограничивают его клиническое применение. Текущие модели TAR преимущественно опираются на ретроспективные одноцентровые наборы данных, которые могут не учитывать региональные различия в практике переливания, демографические особенности, такие как возрастные различия между педиатрической и взрослой популяциями, или генетическую восприимчивость в различныхпопуляциях 19,26,31,32 . Кроме того, эти модели недостаточно интегрируют мультиомические данные, включая профили донорских HLA-антител и воспалительные протеомики реципиента, которые критически важны для понимания иммунно-опосредованных механизмов TAR, таких как TRALI. Это ограничение ограничивает их способность различать иммунные и неиммунныеподтипы 25,40. Интерпретируемость остаётся ключевой проблемой: хотя SK-learn предоставляет такие инструменты, как значения SHAP, если алгоритмические прогнозы, такие как редкие генетические маркеры, не имеют биологической валидации как факторы риска, клиницисты могут колебаться в принятии этих моделей, что приведёт к разрыву между результатами машинного обучения и клиническойинтуицией 14,50. Практическая реализация также сталкивается с проблемами, такими как необходимость надёжной вычислительной инфраструктуры и стандартизированной предварительной обработки данных электронных медицинских карт (EHR), которые часто недоступны в условиях с ограниченнымиресурсами 47,87.
Для устранения этих пробелов будущие исследования должны уделять приоритетное внимание перспективному многоцентровому сбору данных, таким как интеграция наборов данных из международных реестров TAR, включая британскую систему SHOT и китайские педиатрические когорты, чтобы снизить смещение отбора и повысить обобщимостьмоделей 19,36. Включение мультимодальных данных, включая секвенирование донорской крови и воспалительных белковых маркеров, может улучшить классификацию подтипов TAR, аналогично улучшению чувствительности на 12-24%, наблюдаемому в исследованиях прогнозирования резистентности к туберкулёзу73. Сотрудничество с иммунологами для проверки механизмов, таких как связывание признаков риска, выявленных по SK-обучению — специфических комбинаций антител HLA — с тестами активации комплемента in vitro, может сократить разрыв между алгоритмическими предсказаниями и биологическимимеханизмами 22,24. Разработка удобных инструментов клинической поддержки принятия решений, способных автоматически извлекать функции в реальном времени из ЭМК, такие как объем трансфузии и уровни BNP, а также предоставлять интерпретируемые оценки риска наряду с традиционными диагностическими критериями, является необходимым для бесшовной интеграции в клинические рабочиепроцессы 97,107.
По сравнению с традиционными моделями TAR, такими как сопоставление ABO/Rh и TRACK scores, SK-learn обладает значительными преимуществами. Например, ансамблевые алгоритмы, такие как LightGBM, отлично моделируют нелинейные взаимодействия между факторами риска, такими как донорские антитела к HLA и уровни IL-6 реципиента, что приводит к увеличению чувствительности на 12–24% в исследованиях прогнозирования резистентности к антибиотикам. Инструменты приоритизации признаков на основе данных, такие как важность признаков перестановки, могут выявлять новые индикаторы риска, включая продолжительность хранения крови и невыявленные осложнения, выходящие за рамки заранее установленных клиническихзнаний 45,93. Кроме того, открытая архитектура и умеренные вычислительные требования делают её применимой в условиях с ограниченными ресурсами, в отличие от фреймворков глубокогообучения 69,93.
Чтобы превратить этот потенциал в клиническое воздействие, будущая работа должна сосредоточиться на нескольких ключевых направлениях. Во-первых, проспективный многоцентровый сбор данных необходим для преодоления смещения отбора и повышения обобщённости моделей среди различных популяций. Во-вторых, интеграция мультимодальных данных (например, профили донорских антител, воспалительные маркеры реципиента) обеспечит более комплексный набор функций, позволяя моделям sklearn лучше различать подтипы TAR и фиксировать сложные взаимодействия рисков. В-третьих, биологическая валидация алгоритмически выявленных признаков риска (например, связывание специфических антител HLA с in vitro анализами) имеет решающее значение для преодоления разрыва между статистическим прогнозированием и механистическим пониманием, тем самым формируя клиническое доверие. Наконец, разработка удобных для пользователя и интерпретируемых клинических инструментов, предоставляющих оценки рисков в реальном времени, позволит бесшовно интегрировать эти модели в рутинный рабочий процесс, смещая парадигму от управления реакциями к превентивной профилактике.
В заключение, этот обзор подчеркивает трансформационный потенциал SK-learn в оценке риска переливания крови, учитывая ограничения традиционных методов на основе правил. Интегрируя сложные клинические данные, приоритизируя признаки риска и предоставляя интерпретируемые прогнозы, SK-learn служит краеугольным камнем для прецизионной трансфузионной медицины. Однако для реализации этого потенциала требуется междисциплинарное сотрудничество, масштабная многоцентровая валидация моделей SK-learn, интеграция мультиомики и клинических данных в реальном времени, а также разработка подходящих для клиницистам инструментов для связи алгоритмических инсайтов с биологическими механизмами.