ПРИМЕЧАНИЕ: Реагенты и оборудование, использованные в этом исследовании, перечислены в Таблице материалов.
Сбор и предобработка клинических данных
Для изучения молекулярных сигнатур ХОБЛ из базы данных Gene Expression Omnibus (GEO) были извлечены транскриптомические наборы данных. Всего было выбрано пять наборов данных: GSE11784, GSE12472, GSE16972, GSE38974 и GSE222965. Исходные данные и файлы аннотаций платформы были скачаны для картирования зонда в ген. Когда несколько зондов нацеливались на один ген, максимальное значение экспрессии сохранялось. Полученные матрицы экспрессии генов (строки как гены, столбцы как образцы) были объединены в единый набор данных открытия. Для учёта технических различий между различными платформами микромассивов и когортами исследований была выполнена пакетная коррекция с использованием алгоритма ComBat из пакета sva R. Эффективность коррекции была подтверждена с помощью графиков анализа основных компонентов (PCA). После пакетной коррекции объединённый набор данных обнаружения использовался для дифференциального анализа. Дифференцированно экспрессируемые гены (DEG) между пациентами с ХОБЛ и здоровыми контролями были выявлены с помощью лимма-пакета. Пороги значимости были установлены на уровне |logFC| ≥ 1 и p ≤ 0,05.
Для выявления наиболее надёжных характеристических генов были интегрированы три независимых алгоритма машинного обучения. Для обеспечения надёжности моделей и предотвращения утечки данных процесс выбора признаков был встроен в циклы перекрёстной проверки, где это было применимо, а набор данных обнаружения строго отделялся от независимых наборов валидации. Модель LASSO применялась к DEG с помощью пакета glmnet. Мы применили 10-кратную кросс-валидацию для определения оптимального штрафного параметра. Оптимальное значение штрафного параметра, соответствующее минимальной ошибке перекрёстной валидации, было выбрано в качестве порога для выявления основных признаков. SVM использовался для ранжирования генов на основе их дискриминационной способности. Была реализована 10-кратная стратегия кросс-валидации для выявления точки минимальной ошибки обобщения, тем самым определив оптимальное количество характерных генов. Пакет randomForest использовался для ранжирования DEG по их среднему снижению точности и индексу Gini. Гены с наивысшими баллами важности были выбраны как признаки, связанные с заболеванием.
Пересечение признаков, выявленных LASSO, SVM и randomForest, было взято для определения окончательных основных характеристик генов. Диагностическая эффективность этих генов оценивалась с помощью анализа по рабочей характеристике приёмника (ROC). Область под кривой (AUC) и соответствующие 95% доверительные интервалы (CI) были рассчитаны с помощью пакета pROC. Ген считался обладающим высокой диагностической ценностью, если AUC > 0,70. Наконец, уровни экспрессии и диагностическая точность этих генов были дополнительно подтверждены в независимом наборе валидации для обеспечения обобщимости результатов.
С помощью PubChem (https://pubchem.ncbi.nlm.nih.gov/) и drugbank (https://go.drugbank.com/) было получено всего 12 специфических профилей лекарств, таких как LABA, LAMA, SABA, SAMA, флутиказон пропионат, будесонид, беклометазон, флутиказон, сальметерол, умэклидиний, вилантерол, теофиллин. Собранные мишени калибровались с помощью базы данных Uniprot (https://www.uniprot.org/), в ходе которой нечеловеческие гены удалялись, а недействительные дублирующиеся мишени удалялись для получения стандартизированных названий генов. Вводя ключевое слово «хроническая обструктивная болезнь лёгких», «ХОБЛ» в базах данных GeneCards (https://www.genecards.org/), OMIM (https://www.omim.org/) и DisGENET (https://www.disgenet.org/), были извлечены целевые объекты, связанные с заболеванием. Все мишени из трёх баз данных были консолидированы в файл Excel, дублирующиеся гены удалялись, а данные калибровались с помощью базы данных Uniprot для получения конечной информации о гене-мишени заболевания.
Разработка моделей машинного обучения
Был построен мультиалгоритмический фреймворк машинного обучения с последующим использованием R-пакетов glmnet, e1071 и randomForest. В частности, регрессия LASSO проводилась для уменьшения размерности на основе штрафов, анализ Support Vector Machine (SVM) применялся для оценки ошибок валидации на основе группировки выборок, а Random Forest использовался для фильтрации признаков по показателям важности. Этот процесс дал соответствующие диагностические визуализации, включая кривые перекрёстной валидации и графики пузырьков важности генов. После построения модели был проведён анализ диаграммы Венна на генных наборах, идентифицированных этими множественными алгоритмами, чтобы выделить перекрывающиеся гены признаков «пересечения», тем самым повышая надёжность потенциальных биомаркеров. Затем экспрессионная матрица этих генов пересечения была извлечена для визуализации межгрупповых различий экспрессии с помощью скрипичных графиков. Наконец, кривые ROC генерировались с помощью итеративных петель для каждого гена для вычисления площади под кривой (AUC), подтверждая их диагностическую ценность как кандидатов в биомаркеры.
Индукция животных моделей
Экспериментальный протокол был утверждён Комитетом по этике животных Медицинского университета Гуйчжоу (2303411) и соответствовал рекомендациям ARRIVE и нормативам по благополучию животных. Всего 72 самца крыс рода Спраг-Доули (SD) с классом SPF (230 ± 20 г). После 1 недели адаптивного содержания в стандартных условиях (25 ± 1 °C, влажность 50 ± 5%, 12 часов цикла светло-тёмно) крысы случайным образом делили на контрольную группу (группа C) (n = 24) и группу модели (группа M) (n = 48).
Группа M подвергалась двуфакторному моделированию: периодическому воздействию сигаретного дыма (9 недель, 6 дней в неделю, 3 сигареты исследовательского уровня в день, разделённые на 2 сеанса, по 30 минут на сеанс) и внутритрахеальном инстилляции ЛПС (200 мкг за инстилляцию, раз в две недели)18,19. Группа C получила эквивалентный объём нормального физиологического раствора. После успешного моделирования группы случайным образом были разделены на группу M (n = 12), группу с высокими дозами BTHTT (группа H) (высокая, клиническая доза 1×, n = 12) и группу с низкой дозой BTHTT (группа L) (низкая — 1/2× клиническая доза, n = 12), с непрерывным вмешательством в течение 2 недель. Группы C и M синхронно получали дистиллированную воду.
Параметры массы тела и спонтанной активности фиксировались еженедельно. В конце моделирования и лечения были собраны лёгочные ткани, сыворотка, а также сывороточная и бронхоальвеолярная жидкость для промывания (BALF). Уровни воспалительных маркеров (например, TNF-α, IL-1β, IL-6, IL-8, OPN и MCP-1) измерялись с помощью ELISA согласно инструкциям комплекта. Также были проведены тканевые патологии и мультиомические анализы.
Применение лечения
Buti Huatan Tang (BTHTT) состоит из девяти традиционных китайских лекарственных трав: Astragalus membranaceus (Fisch.) Бге. (Astragali Radix, 15 г), Pseudostellaria heterophylla (Miq.) Pax (Pseudostellariae Radix, 15 г), Cinnamomum cassia (L.) J. Presl (Cinnamomi Cortex, 15 г), Angelica sinensis (Oliv.) Diels (Angelicae sinensis radix, 10 г), Salvia miltiorrhiza Bge. (Salviae miltiorrhizae Radix et Rhizoma, 15 г), Perilla frutescens (L.) Britt. (Perillae Folium, 10 г), Raphanus sativus L. (Naphani Semen, 10 г), Lepidium apetalum Willd. (Descurainiae Semen, 10 г) и Mahonia fortunei (Lindl.) Федде (Mahoniae Folium, 10 г). Травяные материалы замачивались в воде в 10 раз больше их общего веса в течение 30 минут, а затем отваривались в течение 1 часа. Напой был профильтрован, а фильтрат собран и разделён на три равные порции для внутреннего введения.
Исходя из клинической безопасности и эффективности, стандартная доза BTHTT для взрослых составляла 1,57 г∙кг-1∙день-1 в соответствии с клиническими рекомендациями по медикаментазным препаратам. Учитывая коэффициент конверсии дозы у крыс, который показывал, что стандартная доза лекарства для крыс составляет 6,3× человеческой стандартной дозы, соответствующая группа H для крыс была установлена на уровне 9,9 г∙кг-1∙день-1, а группа L — на половине этой дозы (4,95 г∙кг-1∙день-1). Учитывая, что окончательный концентрированный объём BTHTT составлял 50 мл, введённый объем для группы H у крыс составлял примерно 1,6 мл, а для группы L — примерно 0,8 мл. Препарат вводили один раз в день перорально.
Сбор тканей и BALF
В экспериментальных конечных точках (9-я и 11-я недели) крыс анестезировали через внутрибрюшинную инъекцию пентобарбитала 5% натрия (1 мл/100 г). Из портальной вены собирали кровь, оставляли стоять 30 минут при комнатной температуре, затем центрифугировали при 13 000 × г в течение 15 минут при 4 °C. Супернатант хранился при -80 °C. Ткани лёгких быстро замораживались в жидком азоте и хранили при -80 °C. BALF собирали тремя последовательными промывами с холодным PBS.
Анализ транскриптомики
Общая РНК была извлечена из лёгких тканей с контролем качества с помощью (A 260/A 280 > 1.8) (RIN ≥ 7.0. Были созданы библиотеки секвенирования РНК: мРНК обогащалась олиго(dT), фрагментовалась и использовалась для синтеза двухцепочечной кДНК, которая затем была связана с адаптерными олигонуклеотидами и усилена с помощью ПЦР. Библиотеки количественно оценивались и проверялись по качеству перед секвенированием. Включая инспекцию распределения содержимого, анализ плотности FPKM каждого образца и общий анализ оценки качестваРНК-seq 20.
Исходные данные транскриптомики, полученные платформой секвенирования, обрабатывались с помощью скриптов Perl для удаления последовательностей адаптеров и чтений низкого качества (чтения с Q ≤ 25 оснований составляют > 60% или скорость N > 5%). После этого процесса фильтрации были получены чистые показания. Чистые считывания были выровнены с референсным геномом с помощью HISAT2, а уровни экспрессии генов количественно оценивались для расчёта значений FPKM. Был проведён дифференциальный анализ экспрессии (с критериями скрининга |log2FC| > 1 и p-adj < 0,05). Аннотация транскрипционных факторов была основана на базах данных TFDB или Pfam/DBD животных, сопоставивших идентификаторы генов и информацию о белковыхдоменах 21.
Была применена ортологичная стратегия картирования генов для обеспечения методологической строгости для межвидовой валидации. Эта стратегия заключалась в получении ортологов у крыс для основных человеческих генов (например, SRPX2, IL-1R2, TFF3) с использованием баз данных NCBI HomoloGene и Ensembl BioMart. Отбор был ограничен парами генов, демонстрирующих чёткое соотношение «один к одному» и высокий уровень последовательностей белков. В случаях, когда присутствовало несколько кандидатов, предпочтение отдавалось ортологичным парам, сертифицированным HGNC. Для обеспечения высокой точности обнаружения были разработаны специальные праймеры RT-qPCR на основе мРНК-последовательностей идентифицированных ортологов крыс. Критерии валидации определялись согласованностью направления выражения и функциональной верификацией. Согласованность направления экспрессии: В модели ХОБЛ у крыс, вызванной дымом, RT-qPCR показало, что тенденции экспрессии целевых генов в ткани лёгких крыс полностью совпадают с теми, что наблюдаются в клинических наборах GEO на людях. Гены, демонстрирующие одинаковую полярность изменений между видами, считались обладающими сохранением как биомаркеры болезни. Патологическая верификация: При согласованности экспрессии был проведён корреляционный анализ для подтверждения участия этих генов в патологической эволюции ХОБЛ.
Рабочий процесс метаболомики
Ткань легких (20–50 мг) была гомогенизирована в предварительно охлаждённой воде метанола-ацетонитрила (2:2:1, v/v) и соникирована в ледяной ванне. Гомогенат был центрифугирован 13 000 × г в течение 20 минут при 4 °C. Супернатант был концентрирован в вакууме, повторно растворён в воде с ацетонитрилом (1:1, v/v) и профильтрован через мембрану диаметром 0,22 мкм для анализаLC-MS 22.
Хроматографическое разделение осуществлялось с помощью амидной колонки UPLC (1,7 мкм, 2,1 мм × 100 мм). Температура колонны поддерживалась на уровне 25 °C. Подвижная фаза состояла из (А) воды с содержанием 25 мМ ацетата аммония и 25 мМ аммиака, а также (Б) ацетонитрила. Расход был установлен на уровне 0,5 мл/мин, а объём впрыска — 2 мкл. Программа элюирования градиента была следующей: 0–0,5 мин, 95% B; 0,5–7 мин, линейное снижение B с 95% до 65%; 7–8 мин, линейное снижение B с 65% до 40%; 8–9 мин, B удерживалась на 40%; 9–9,1 мин, линейное увеличение B с 40% до 95%; 9,1–12 мин, B держится на 95%. В течение всего анализа образцы поддерживались при 4 °C в автопробосборнике. Для обеспечения стабильности системы и надёжности экспериментальных данных выборки анализировались в случайной последовательности, при этом в очереди размещались образцы контроля качества (QC). Масс-спектрометрический анализ проводился с использованием системы ультравысокопроизводительной жидкостной хроматографии (UHPLC), связанной с масс-спектрометром. Образцы ионизировались с помощью электрораспылительной ионизации (ESI) как в положительном, так и в отрицательном ионном режимах. Настройки источника ESI и MS были следующими: небулайзерный газ (Газ 1) был установлен на 50, вспомогательный газ (Газ 2) — на 2, температура ионного источника — на 350 °C, а напряжение распыления (ISVF) — на 3 500 В в режиме положительных ионов и 2 800 В в отрицательном режиме. Диапазон масс для MS1 был установлен от 70 до 1 200 Да, с разрешением 60 000 и временем накопления сканирования 100 мс. Для MS2 использовалось получение данных, зависимое от данных (DDA) с ступенчатой энергией столкновения. Массовый диапазон для MS2 также был установлен от 70 до 1 200 Да, с разрешением 60 000 и временем накопления сканирования 100 мс. Динамическое время исключения было установлено в 4 секунды.
Сырые метаболомные данные преобразовывались в формат mzXML и затем обрабатывались для выравнивания пиков, коррекции времени удержания и извлечения пиковых зон. Рабочий процесс предварительной обработки данных включал следующие этапы: во-первых, были удалены пики ионов с отсутствующей скоростью > 50%. Во-вторых, оставшиеся недостающие значения были введены с помощью алгоритма KNN. В-третьих, метаболические признаки с относительным стандартным отклонением (RSD) >50% были отброшены. Качество экспериментальных данных оценивалось с помощью анализа основных компонентов (PCA) и кластеризации образцов контроля качества. Последующие анализы включали одномерную статистику (например, t-тесты), многомерную статистику (PLS-DA), дифференциальный скрининг метаболитов (VIP > 1 и p < 0,05) и анализ обогащения путей KEGG (гипергеометрический тест).
Создание аналитических методов для компонентов in vivo и in vitro
Подготовка образцов BTHTT для in vitro тестирования: BTHTT извлекалась натоком в воде (2 x 30 мин), концентрирована до 1,1–1,2 г/мл, а затем сублимирована. Перед анализом 600 мкл сублимированного порошкового раствора смешивали с 400 мкл метанола, повторно растворяли в 40% метанола и центрифугировали для сбора супернатанта.
Подготовка образцов BTHTT для in vivo тестирования: сыворотка была депротеинизирована путём смешивания с метанолом (1:1) и осадки при −20 °C в течение 30 минут, после чего центрифугировали в течение 20 минут. Супернатант был вакуумно высушен и повторно растворён в 40% метанола для получения окончательного образца. Для приготовления образцов пустой сыворотки + BTHTT соответствующее количество пустой сыворотки добавлялось супернатантом BTHTT in vitro , и оставшиеся этапы выполнялись как описано.
Образцы разделялись с помощью системы UHPLC, оснащённой колонкой обратной фазы UPLC (2,1 мм × 100 мм, 1,8 мкм). Температура колонны поддерживалась на уровне 35 °C, а расход устанавливался на уровне 0,3 мл/мин. Подвижная фаза состояла из (A) 0,1% муравьиной кислоты в воде и (B) 0,1% муравьиной кислоты в ацетонитриле. Градиентная элюция выполнялась, как показано в Таблице 1.
Для получения спектров MS1 и MS2 использовался масс-спектрометр. Масс-спектрометр был объединён с системой UHPLC и работал как в положительном, так и в отрицательном ESI-режиме. Параметры ESI были следующими: напряжение распыления 3 800 В (ESI+) / 3500 В (ESI-), давление оболочного газа 45 арб, давление вспомогательного газа 20 арб, температура ионной передаточной трубки 320 °C, температура испарителя 350 °C. Режим обнаружения был установлен на полный сканированный/зависимый от данных MS2 (Full-MS/dd-MS2) с разрешением 60 000 для MS1 и 15 000 для MS2. Топ-10 ионов MS1 были выбраны для фрагментации MS/MS с пошаговыми нормализованными энергиями столкновения 20, 40 и 60. Массовый диапазон для MS1 был установлен от 90 до 1300 Да.
Для анализа in vivo , включая образцы с пустыми группами, узоры дозированных групп и образцы с пустой группой + BTHTT, было точно введено 6 мкл каждого образца. Для экстракорпорального анализа BTHTT было введено 2 мкл образца. Каждая партия образцов с пустыми и дозированными группами вводилась один раз, в то время как образцы пустой группы + BTHTT — в тройном экземпляре, а образцы BTHTT — в квинтупликате.
Данные в формате mzXML были обработаны, а соединения идентифицированы на основе локальной коммерческой масс-спектрометрии высокого разрешения ТКМ. Критерии идентификации были установлены следующим образом: массовая ошибка <25 ppm для MS1 и совпадение > 0,7 для MS2 (где оценка отражала сходство ионов фрагментов, при этом ≥0,7 — надёжный порог)25,26. Статистический анализ включал подсчёт и классификацию соединений (например, флавоноидов, алкалоидов), что проводилось совместно с аннотациями из базы масс-спектрометрии27.
Молекулярное стыковка и моделирование MD
Для изучения возможных режимов связывания между выявленными характерными белками и соответствующими лигандами был проведён in silico молекулярный стыкинг. Трёхмерные структуры малых молекул были извлечены из базы данных PubChem и оптимизированы их геометрические конфигурации. Кристаллические структуры целевых белков были получены из Белкового банка данных RCSB (PDB). С помощью PyMOL были удалены молекулы воды и гетероатомы, а также извлечены кокристаллизованные лиганды для определения координат активного сайта. Были добавлены атомы водорода, а заряды Гастайгера назначались с помощью программного обеспечения. Проводились симуляции стыковки, генерируя 15 независимых конформаций за запуск. Для дальнейшего анализа была выбрана конформация с наименьшей энергией связи. Для тщательной характеристики нековалентных взаимодействий были проанализированы комплексы рецептор-лиганд с помощью профилера взаимодействия белков и лигандов (PLIP). ПРИМЕЧАНИЕ: Важно подчеркнуть, что эти результаты стыковки обеспечивают структурную поддержку потенциальным молекулярным взаимодействиям и служат основой для дальнейшей динамической усовершенствования; однако они не являются самостоятельным доказательством биологической эффективности.
Для оценки стабильности и конформационной эволюции предсказанных комплексов белков-лиганд при физиологически значимых условиях были проведены молекулярно-динамические симуляции с использованием программного обеспечения GROMACS. Топологические файлы как для белков, так и для лигандов были сгенерированы на основе силового поля GROMOS96 43a1. Каждый комплекс располагался в центре додекаэдрической коробки, поддерживая минимальное расстояние 1,0 нм от краёв коробки, и растворялся с помощью водной модели SPC. Для обеспечения электрической нейтральности в систему добавлялись ионы натрия или хлорида по мере необходимости. Минимизация энергии выполнялась с использованием самого крутого алгоритма спуска до тех пор, пока максимальная сила не остановилась менее 1 000,0 кДж∙моль-1∙нм-1. Система затем была уравновешена в два этапа: сначала использовался ансамбль NVT для нагрева до 300 K с мощностью 100 ps, используя термостат V-rescale; во-вторых, для стабилизации давления при 1 бар более 100 пс использовался ансамбль NPT с помощью баростата Парринелло-Рахмана. Производственные симуляции проводились общей длительностью 10 нс с временным шагом 2 fs. Дальние электростатические взаимодействия рассчитывались с использованием метода Particle Mesh Ewald (PME), тогда как короткие действия ван-дер-Ваальса и электростатические взаимодействия управлялись с радиусом среза 1,2 нм. Для обеспечения надёжности симуляций были проведены три независимых запуска, где это было возможно. Стабильность комплексов количественно оценивалась путём расчёта отклонения по корню (RMSD) и среднеквадратичной флуктуации корня (RMSF) атомов основного белка относительно исходной структуры. Достижение плато в профиле RMSD использовалось в качестве основного критерия для уравновесения системы и структурной стабильности.
Общий статистический анализ
В этом эксперименте групповые расчёты проводились с использованием t-тестов или одностороннего анализа дисперсии (ANOVA).