Этот протокол описывает полезный инструмент для выявления значительных молекулярных изменений при раке и приводит к разработке новых диагностических и терапевтических подходов к плоскоклеточному раку пищевода.
Методическая статья
Этот протокол описывает полезный инструмент для выявления значительных молекулярных изменений при раке и приводит к разработке новых диагностических и терапевтических подходов к плоскоклеточному раку пищевода.
Рак пищевода (ЭК) занимает8-е место среди наиболее агрессивных злокачественных новообразований, и его лечение остается сложным из-за отсутствия биомаркеров, способствующих раннему выявлению. ЭК проявляется в двух основных гистологических формах - аденокарциноме (EAD) и плоскоклеточном раке (ESCC) - обе демонстрируют различия в заболеваемости в географически различных популяциях. Высокопроизводительные технологии меняют представление о болезнях, в том числе о раке. Существенной проблемой для научного сообщества является работа с разрозненными данными в литературе. Чтобы решить эту проблему, предлагается простой конвейер для анализа общедоступных наборов данных микрочипов и сбора дифференциально регулируемых молекул между раком и нормальными условиями. Конвейер может служить стандартным подходом для дифференциального анализа экспрессии генов, идентифицируя гены, дифференциально экспрессируемые между раком и нормальными тканями или между различными подтипами рака. Конвейер включает в себя несколько этапов, включая предварительную обработку данных (включая контроль качества и нормализацию необработанных данных экспрессии генов для устранения технических различий между образцами), дифференциальный анализ экспрессии (идентификацию генов, дифференциально экспрессирующихся между двумя или более группами образцов с помощью статистических тестов, таких как t-тесты., ANOVA или линейные модели), функциональный анализ (использование инструментов биоинформатики для идентификации обогащенных биологических путей и функций в дифференциально экспрессируемых генах) и валидация (включающая валидацию с использованием независимых наборов данных или экспериментальных методов, таких как кПЦР или иммуногистохимия). С помощью этого конвейера можно получить набор дифференциально экспрессируемых молекул (ЦМР) для любого типа рака, включая рак пищевода. Этот компендиум может быть использован для определения потенциальных биомаркеров и мишеней для лекарств от рака, а также для улучшения понимания молекулярных механизмов, лежащих в основе заболевания. Кроме того, популяционно-специфический скрининг рака пищевода с использованием этого конвейера поможет определить конкретные мишени для лекарств для отдельных групп населения, что приведет к персонализированному лечению заболевания.
Вызывает тревогу тот факт, что ЭК занимает восьмое место среди наиболее распространенных видов рака в мире и шестое место среди смертей во всем мире. Китай, Индия и Иран имеют тревожно высокий уровень заболеваемости и смертности. Существует два основных типа ЭК: аденокарцинома пищевода (EAC или EAD) и плоскоклеточная карцинома пищевода (ESCC)1. EAC более распространен в западном мире, в то время как ESCC более распространен в восточных странах, особенно в Китаеи Иране. С ЭК связано несколько факторов риска, включая употребление табака и алкоголя, ожирение и гастроэзофагеальную рефлюксную болезнь (ГЭРБ). Кроме того, диетические факторы, такие как недостаток фруктов и овощей и потребление горячих напитков и продуктов питания, связаны с риском ESCC в районах высокого риска. Ранняя диагностика и лечение важны для улучшения исходов лечения пациентов с EC 3,4. Поэтому важно повышать осведомленность о факторах риска, признаках и симптомах ЭК, а также поощрять регулярный скрининг лиц с высоким риском. Кроме того, усилия по устранению модифицируемых факторов риска, таких как употребление табака и алкоголя, а также нездоровые пищевые привычки, могут помочь снизить частоту ЭК. ЭАД возникает в клетках желез, вырабатывающих слизь, в нижней части пищевода, рядом с желудком. Он часто связан с ГЭРБ, при которой желудочная кислота и содержимое возвращаются в пищевод. Напротив, ESCC возникает из плоских, тонких клеток, выстилающих верхнюю часть пищевода5. Он более распространен в регионах, где широко распространено употребление табака и алкоголя, таких как Китай и Иран.
Среди различных состояний, связанных с пищеводом, пищевод Барретта (БЭ), состояние, при котором слизистая оболочка пищевода заменяется железистыми клетками, является известным предшественником EAC6. Стоит отметить, что ПБ может развиваться и без ГЭРБ, но наличие ГЭРБ увеличивает риск развития ПБ в 3 – 5 раз. Кроме того, наличие ПБ увеличивает риск развития ЭАЦ в 50-100раз7. Кроме того, горячая или острая пища и жидкости были связаны с ESCC, но не с EAC. Понимание факторов риска развития ЭК важно для его профилактики и раннего выявления. Усилия по устранению изменяемых факторов риска, таких как употребление табака, употребление алкоголя, ожирение и нездоровые пищевые привычки, могут помочь снизить заболеваемость ЭК. Кроме того, рутинный скрининг и эпиднадзор за лицами с высоким риском, такими как лица с дисфагией или ПБ, могут улучшить исходы, обеспечивая раннее выявление и лечение.
Безусловно, исследования, основанные на омиксах, включая геномику, транскриптомику, протеомику, метиломику, микроРНКомику и метаболомику, внесли большой вклад в наше понимание ЭК, особенно ESCC 8,9,10,11,12,13. Эти исследования позволили идентифицировать новые биомаркеры, потенциальные терапевтические мишени и новые пути, участвующие в развитии и прогрессировании ESCC. Тем не менее, данные, полученные в результате этих исследований, разбросаны по всей литературе, что затрудняет доступ научного сообщества к этой информации и ее использование. Поэтому важно создать репозиторий или базу данных, в которой собраны данные, полученные в результате высоко- или низкопроизводительных исследований конкретных видов рака. Такой пакет может быть оптимизирован и сделан путем внедрения некоторых основных рекомендаций. Эти рекомендации включают в себя отбор релевантных исследований, извлечение и систематизацию данных из этих исследований, а также обеспечение качества и согласованности данных. Кроме того, компендиум следует регулярно обновлять, чтобы включать в него новые исследования и данные по мере их появления. Исследователи могут использовать единую платформу для получения и анализа данных о конкретном раке, создавая компендиум или базу данных, объединяющую данные различных исследований. Это поможет ускорить исследовательскую работу и, в конечном итоге, приведет к более эффективным методам лечения и лучшим результатам лечения онкологических больных.
Разработка компендиума по раку включает в себя данные как низкопроизводительных, так и высокопроизводительных исследований. Этот компендиум станет ценным ресурсом для исследователей, стремящихся определить потенциальные диагностические или терапевтические мишени для рака. Одним из способов создания этой коллекции является просмотр исследований микрочипов, доступных в общедоступных репозиториях, таких как Gene Expression Omnibus (GEO). Исследования на микрочипах могут предоставить информацию об уровнях экспрессии генов в раковых клетках, и эти данные могут быть использованы для идентификации дифференциально экспрессируемых генов (DEG), которые могут играть роль в развитии и прогрессировании рака.
Однако следует отметить, что в разных исследованиях могли использоваться разные методы анализа своих данных, что могло привести к выявлению различных DEG. Поэтому важно тщательно проанализировать каждое исследование и учесть любые потенциальные погрешности или ограничения при объединении данных для компендиума. Как только данные собраны на общей платформе, исследователи могут использовать их для определения потенциальных молекулярных мишеней для дальнейшего изучения. К ним относятся изучение экспрессии определенного гена в клинических образцах или проведение механистических исследований, чтобы понять, как конкретный ген или белок участвует в развитии и прогрессировании рака. В целом, создание набора данных о раке станет ценным ресурсом для исследователей рака и поможет определить новые мишени для диагностики и терапевтических вмешательств.
1. Ручное курирование дифференциально регулируемых молекул в ESCC
2. Поиск релевантных исследований с помощью PubMed
3. Поиск релевантных исследований с использованием омнибуса экспрессии генов (GEO)
ПРИМЕЧАНИЕ: Gene expression omnibus (GEO) — это свободно доступный репозиторий для хранения данных на ДНК-микрочипах. Обилие данных, доступных в GEO, является хорошим ресурсом для интеллектуального анализа данных для выявления дифференциально регулируемых молекул между раком/заболеваниями и нормальными условиями.
4. Микроматричный анализ с помощью GEO2R
ПРИМЕЧАНИЕ: Первое, что нужно сделать, это найти соответствующие исследования с использованием булевых операторов (AND, OR, NOT). Они будут использоваться в сочетании с ключевыми словами «плоскоклеточная карцинома пищевода», «ESCC» или «плоскоклеточная карцинома пищевода». GEO2R (см. Таблицу материалов) — это свободно доступный пакет на языке R, интегрированный с GEO, что позволяет пользователям анализировать данные исследований на микрочипах в удобной для пользователя форме. Он взаимодействует с идентификаторами записей GEO и предоставляет интерфейс для выполнения сложного анализа на основе R для идентификации DEG с использованием пакетов Bioconductor R для серверной части. Этот пакет не только преобразует данные ГЕО, но и представляет их выходные данные в виде .txt таблиц, которые могут быть в дальнейшем изменены в соответствии с потребностямипользователей16. Пакет GEO2R представляет гены в порядке статистической значимости на основе p-значения, но порядок может быть отсортирован на основе логарифмического2-кратного изменения. Кроме того, пользователи могут просматривать профили экспрессии генов в виде изображений профилей GEO. В отличие от других инструментов анализа, GEO2R не зависит от выбранных записей набора данных и может напрямую опрашивать фактические данные, предоставленные исследователями. Более 90% исследований ГСО могут быть проанализированы с помощью этого метода17. Рабочий процесс GEO2R с этапами, связанными с анализом данных микрочипов с использованием GEO2R, показан на рисунке 1.
5. Поиск псевдонима для гена/белка
6. Поиск официального символа гена для ДЭГ
7. Нахождение генного локуса ДЭГ
8. Поиск информации о ДЭГ в локусе OMIM Pagegene ДЭГ
9. Определение локализации белка, домена и мотива, а также секреторной природы белка, кодируемого геном
10. Отбор белка для валидации и дальнейшая оценка для диагностики или прогноза интересующего злокачественного новообразования
ПРИМЕЧАНИЕ: После того, как уникальные молекулы идентифицированы, самая большая проблема заключается в том, как их проверить. Обычно исследование с помощью микрочипов обеспечивает экспрессию на уровнях мРНК, но для диагностики или прогноза заболевания решающее значение имеет считывание уровней белка. Для того же пациента или полученные от пациента образцы или клеточные линии одного и того же рака должны быть проверены, чтобы узнать, действительно ли молекула экспрессируется там и способна ли она различать рак и нормальный, хороший и плохой прогноз, а также дифференцировать ранние и поздние стадии заболевания. Для валидации молекулы-кандидата полезными методами являются вестерн-блоттинг, иммуноферментные анализы, т.е. ИФА, иммунопреципитация, иммуногистохимия, иммуноцитохимия или анализ 18,19,20. В то же время, все эти анализы требуют наличия антител для обнаружения антигена, присутствующего в образцах. Антитела – это дорогостоящие средства, поэтому всегда лучше подбирать антитела, исходя из следующих пунктов:
В качестве примера была использована GSE161533 присоединения GEO для изучения дифференциально исследованных генов в ESCC. Репрезентативные результаты анализа представлены на рисунке 3. GEO2R генерирует график вулкана, который полезен для выявления событий, которые существенно различаются между двумя группами испытуемых. Вулканический график представляет общее распределение генов с преобразованной значимостью (p-значением) -log10 по оси y и изменениями складок (с преобразованным изменениемlog-2) по оси x (рисунок 3A), и он полезен для визуализации генов, которые экспрессируются дифференциально. Выделенные гены достоверно дифференциально экспрессируются при стандартном прибавочном p-значении, равном 0,05 (синий = подавленный, красный = повышенный).
График средней разности (MD) показывает log2-кратное изменение в зависимости от . средних значений экспрессии log2 и полезен для визуализации генов, которые дифференциально экспрессируются. На MD-графике гены, в которых преобразован log2 , изменяются по оси y, а экспрессия среднего значения — по оси x (рис. 3B). Выделенные гены достоверно дифференциально экспрессируются при стандартном прилагательном p-значении, равном 0,05 (синий = подавленный, красный = повышенный). Вулканические графики сталкиваются с теми же проблемами, что и графики MA, с точки зрения отображения информации только от двух обработок одновременно21.
Кроме того, для оценки родства между ESCC и нормальными образцами была использована функция Uniform Manifold Approximation and Projection (UMAP)22 (рисунок 3C). Хотя большинство образцов относились к соответствующим категориям, два образца ESCC были обнаружены в обычных образцах.
Компания GEO2R представила двухмерный интерактивный график плотности экспрессии (рисунок 3D), который эффективно продемонстрировал плотность экспрессии в наборе данных. Этот график полезен для определения необходимости нормализации для DEG. На этом графике ось y обозначает плотность, а ось x обозначает интенсивность как для ESCC (зеленый цвет), так и для нормального (фиолетовый цвет).
Распределение значений по различным выборкам, включая ESCC и нормаль, показано на ящичковой диаграмме. Эти распределения дают представление о том, действительно ли образцы пригодны для анализа дифференциальной экспрессии. Медианные значения ясно указывают на то, что данные нормализованы и перекрестно сопоставимы (рисунок 3E).
Идентифицированные гены фильтруются на основе p < 0,05 и критериев кратного изменения. Из анализа были исключены неизмененные гены (с изменением кратности в диапазоне <2,0->0,50). Далее, если сравнивать с ранее опубликованным исследованием, общих обнаруженных генов всего 514, но уникальное количество полученных генов составляет 1193. Важно отметить, что идентификация уникальных генов с помощью GEO2R может помочь не только уменьшить избыточность, но и обогатить компендиум.
Частичный список DEG приведен в Таблице 1, а полный список DEG представлен в Дополнительном файле 1. Некоторые из активированных генов принадлежат к внеклеточному матриксу, такие как MMP1 8,23,24, MMP12 23,25, SPP1 8,26, POSTN9 и VCAN 8,27. Среди других генов, перечисленных в таблице 1, можно отметить CMPK2, AURKA28,29, CHEK127 и CDK130, а также EMP127, PTK631,32, GPX327, DPT33, FHL1 34,35 и CRNN 8,36 понижаются при ESCC по сравнению с нормальным эпителием. POSTN (периостин) был повышен при ESCC, а также был зарегистрирован в случае аденокарциномы пищевода. В предыдущем исследовании, посвященном ESCC, сообщалось, что экспрессия белка POSTN наблюдалась не только в стромальном регионе, но и в опухолевых клетках, что позволяет предположить, что существует взаимодействие между опухолью имикроокружением. Периостин — это белок, который в первую очередь секретируется мезенхимальными клетками и играет решающую роль в регуляции, адгезии и дифференцировке остеобластов, а также в заживлении ран. Кроме того, периостин участвует в прогрессировании опухоли и метастазировании при различных видах рака, включая ESCC. Исследования показали, что периостин участвует в эпителиально-мезенхимальном переходе (ЭМП) при раке и ангиогенезе опухолей, способствуя миграции клеток, подвижности, адгезии и метастатическому росту клеток опухолей. В пищеводе Барретта, предраковом состоянии пищевода, наблюдается значительная апрегуляция POSTN, гена, который кодирует периостин, по сравнению снормальной тканью пищевода. При эозинофильном эзофагите, воспалительном заболевании пищевода, уровни мРНК периостина и экспрессии белков повышены по сравнению с нормальным эпителием пищевода. Аналогичным образом, в ESCC было обнаружено, что POSTN в 11 раз активируется при анализе экспрессии генов9. Эти результаты свидетельствуют о том, что POSTN может служить потенциальным биомаркером ESCC и других видов рака. Кроме того, сообщается о повышенных уровнях сывороточного POSTN у пациентов с раком молочной железы с диагональными костными метастазами, что свидетельствует о том, что POSTN также может быть дополнительно исследован в качестве потенциального метастатического биомаркера в сыворотке крови пациентов с ESCC. В целом, POSTN, по-видимому, играет важную роль в прогрессировании опухоли и может иметь потенциальные клинические последствия для диагностики, прогноза и лечения рака.
Хромосомное распределение ДЭГ по отдельным хромосомам показывает, что максимальное количество генов было из хромосом 1-6 и X (рис. 4). Анализ путей на основе ShinyGO показал, что при анализе DEGs выявляется ряд важнейших путей. Некоторые из них включали сигнальный путь IL-17, переваривание и абсорбцию белка, взаимодействие рецептора ECM, сигнальный путь TNF, сигнальный путь Toll-подобного рецептора, сигнальный путь хемокинов, взаимодействие цитокинового рецептора, алкогольное заболевание печени, микроРНК при раке, нарушение регуляции транскрипции при раке, клеточный цикл и сигнальный путь NONO-подобных рецепторов в ESCC. Кроме того, обогащение GO-терм в ДЭГ осуществлялось с помощью анализа g:Profiler. Были обогащены различные термины GO для молекулярной функции (GO: MF), клеточных компонентов (GO: CC) и биологических процессов (GO: BP) (рис. 5). Перечень этих GO-термов приведен в таблице 2.

Рисунок 1: Схематическое изображение для обработки исследований плоскоклеточного рака пищевода, доступных в омнибусе экспрессии генов с использованием программы GEO2R. На схеме показаны различные этапы, связанные с идентификацией дифференциально регулируемых генов (DEG) или дифференциально регулируемых молекул (DEM), включая критерии отбора DEG, основанные на изменении кратности >2,0 раза и p < 0,05 для повышенных и <0,5 и p-значения <0,05 для пониженных. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Рисунок 2: Схематическое изображение для поиска дополнительной информации о дифференциально регулируемых генах плоскоклеточного рака пищевода, доступной с использованием других общедоступных ресурсов. Кроме того, информация о DEG имеет решающее значение при принятии решения о необходимости выбора DEG для дальнейшей валидации и оценки в клинических условиях. Такая информация, как извлечение псевдонима, официальный символ гена, местоположение/локус гена, OMIM, домен/мотив, секреторная природа белка и наличие подходящих антител для валидации на уровне белка, может быть получена из различных онлайн-ресурсов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Рисунок 3: Распределение исследования с присоединением к GEO GSE161533 с использованием программы GEO2R для идентификации DEGs между ESCC и нормой. Программа GEO2R использовалась с параметрами по умолчанию, которые дают начало (A) графику Вулкана, представляющему распределение генов с преобразованной значимостью (p-значением) -log10 по оси y и изменениями фолда (с преобразованным изменениемlog-2) по оси x, (B) графиком MD-графика, отображающим log2-кратное изменение по сравнению со средними значениями экспрессии log2 для визуализации дифференциально экспрессируемых генов, (C) UMAP (Uniform Manifold Approximation and Projection) показывает разделение выборок на основе их типов, (D) График плотности экспрессии дополняет его, проверяя нормализацию данных перед анализом дифференциальной экспрессии, (E) Блочная диаграмма, показывающая медианноцентрированные значения по выборкам, чтобы показать, что нормализация данных является кросс-сопоставимой. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Рисунок 4: Распределение ДЭГ по различным хромосомным локусам с использованием инструмента обогащения ShinyGO. (А) Уникальные гены были идентифицированы путем создания диаграммы Венна для сравнения текущих и ранее опубликованных исследований. (Б) Распределение ДЭГ по различным хромосомам в геноме. (C) Путь обогащения для ДЭГ с использованием анализа обогащения на основе ShinyGO. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Рисунок 5: Манхэттенские графики для иллюстрации обогащения генов-мишеней терминами GO с помощью g: Profiler. Дифференциально экспрессируемые гены анализировали с помощью g:Profiler и обогащения в терминах ГО (MF: молекулярная функция; БП: биологический процесс; CC: клеточный компонент) и KEGG через пути Reactome (REAC), WiKi-пути (WP), фактор транскрипции (TF) и мишенное основание микроРНК (MIRNA) были графически изображены на графике Манхэттена, где ось x представляет собой функциональные термины GO, раскрашенные по категориям. Каждая цветная точка представляет термин GO. По оси y отображаются скорректированные p-значения -log10. Члены GO, которые являются статистически значимыми для ESCC, показаны на оси x. MF: Молекулярная функция; БП: Биологический процесс; CC: Клеточный компонент; МИРНК: микроРНК; ГП: Фенотип человека. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Таблица 1: Частичный список дифференциально экспрессируемых генов в ESCC. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Таблица 2: Обогащение терминов GO в ESCC с помощью g: Profiler. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Дополнительный файл 1: Полный список дифференциально экспрессируемых генов в ESCC. Пожалуйста, нажмите здесь, чтобы загрузить этот файл.
С момента внедрения высокопроизводительных методов OMICS в биологию рака скорость генерации данных значительно возросла. Это создает проблему для исследователей, особенно тех, кто не разбирается в компьютерах. Для преодоления с годами биоинформатики приходят к идее разработки базы данных, которая обеспечивала бы данные в организованном виде. Это вызвало положительный отклик у исследователей, особенно у тех, кто не интересуется технологиями. Более того, разрозненные данные OMICS тут и там в литературе никому не нужны. Поэтому, чтобы правильно использовать это, всегда существовала потребность в общей платформе, куда исследователи со специализированными интересами могли бы обращаться и получать доступ к данным. Существует ряд баз данных по различным видам рака, включая ONCOMINE38, ESCC ATLAS39, базу данных по раку поджелудочной железы (PCD)40 и DDEC41.
Концепция дифференциально экспрессируемых генов (DEGs) возникает в результате анализа данных секвенирования РНК, в ходе которого идентифицируются гены, которые имеют значительные изменения в уровнях экспрессии при двух или более состояниях (например, рак по сравнению с нормой или лечение по сравнению с контролем). Для определения ДЭГ было разработано несколько инструментов, которые выполняют статистические тесты, основанные на количественной оценке экспрессии генов, полученных в результате вычислительного анализа либо необработанных прочтений РНК-секвенирования, либо отношений интенсивности, генерируемых между зондом и целевой последовательностью в группе рака и нормальной жизни. Эти инструменты предоставляют информацию, связанную с уровнем экспрессии и попарной величиной разницы для каждого гена. Анализ дифференциальной экспрессии генов (DGE) полезен для понимания генетических механизмов, которые способствуют фенотипическим различиям в организмах. Анализ DGE применяется для изучения различных биологических процессов, включая обнаружение происхождения опухоли и/или анализ микробиома. Идентифицируя DEG, этот анализ может дать представление об основных генетических факторах, которые способствуют этим биологическим процессам, участвующим в онкогенезе ESCC21.
Метод инструмента GEO2R, который находится в открытом доступе и является наиболее предпочтительным методом, поскольку большинство исследований, доступных в литературе, были проанализированы с использованием различных алгоритмов, что привело к огромным различиям в анализе данных; Поэтому, чтобы избежать этих различий, была использована эта удобная платформа, потому что она бесплатна и проста в использовании. Это позволяет сравнивать такие состояния, как «Рак против нормального» или «Лечение против отсутствия лечения».
В данном случае ESCC был выбран потому, что это новый вид рака желудочно-кишечного тракта (ЖКТ) в Индии и Китае. Мы выбираем GSE161533 присоединения к GEO для анализа с помощью GEO2R для определения DEGs между ESCC и . нормальный. Исследование было выбрано потому, что в него не включались пациенты с ESCC, которые ранее получали химиотерапию или лучевую терапию. Предпочтительно использовать парные образцы, если таковые имеются (ESCC и смежная норма от одного и того же пациента) для любого анализа. Это связано с тем, что геном ESCC и нормальные ткани одного и того же пациента должны быть очень похожими, поскольку они происходят из одного и того же генетического фона и потому что ткани находятся в одной и той же среде. Использование парных образцов помогает избежать систематической ошибки в анализе, которая может возникнуть при сравнении ESCC и нормальных тканей разных пациентов с разным генетическим фоном. Использование парных образцов позволяет более точно идентифицировать различия в экспрессии генов между ESCC и нормальными тканями у одного пациента, что может помочь улучшить специфичность результатов. Этот подход часто используется в исследованиях экспрессии генов для контроля индивидуальной изменчивости и повышения аналитической мощности.
Мы взяли все образцы данных у субъектов, участвующих в исследовании, и использовали платформу GEO2R для анализа данных об экспрессии генов. Сначала мы распределили образцы рака, а затем нормальные образцы. После назначения этих образцов параметры по умолчанию, доступные в базе данных GEO2R, использовались для идентификации образцов рака или лечения, а также нормальных или контрольных образцов. Чтобы дифференцировать рак от нормальных образцов, было установлено скорректированное пороговое значение p-значения (прил. P Val) менее 0,05 и порог кратного изменения >2,0 для агитированных генов, а скорректированное p-значение (прил. P Val) менее чем на 0,05 меньше и порог кратного изменения <0,5 для подавленных генов. Эти пороговые значения обычно используются в исследованиях экспрессии генов для идентификации дифференциально экспрессируемых генов между раком и нормой. Важно отметить, что выбор пороговых значений значимости может повлиять на количество и идентичность генов, идентифицированных как дифференциально экспрессирующиеся. Кроме того, важно тщательно оценить биологическую значимость идентифицированных генов и провести дальнейшие валидационные исследования для подтверждения результатов.
В литературе наблюдается тенденция сообщать только о генах с как минимум 2-кратным изменением для повышенных и <0,5-кратным изменением для подавленных генов, особеннов исследованиях микрочипов и протеомики. В более ранних исследованиях изменение кратности в >1,5 раза считалось повышенным, а изменение в <0,67 раза для генов с подавленной регуляцией43,44, но тенденции в литературе за последнее десятилетие ясно показывают, что более высокое изменение кратности предпочтительнее в основном потому, что когда эксперименты по валидации проводятся на кандидатах с низким кратным значением, они либо слабы, либо вообще не обнаруживают корреляциимежду данными по уровням мРНК и белков. Есть темная сторона выбора более высокого кратного изменения заключается в том, что иногда вы пропускаете некоторые молекулы, которые биологически значимы для болезни или рака, но просто опускаются из-за предпочтительного предела для включения в список DEGs/DEM. Кроме того, в литературе высказывается предвзятое мнение о том, что ДЭГ особенно предпочитают сверхрегулируемые или сверхэкспрессированные молекулы, а не недостаточно экспрессированные. Более того, если экспрессия молекул соответствует одним и тем же паттернам апрегуляции или сверхэкспрессии в нескольких исследованиях, независимо от того, относятся ли они к одному и тому же раку или заболеванию, это является предпочтительным подходом среди ученых. Кроме того, если один и тот же паттерн гиперэкспрессии наблюдается при нескольких заболеваниях и описан в литературе, он снова широко принимается в научном сообществе.
Кроме того, сходство заболеваний зависит от того, используются ли для сравнения данные микрочипов или литература. Наконец, расплывчато определенные описания величин дифференциальной экспрессии в литературе демонстрируют лишь ограниченную корреляцию с данными микрочипов по изменению кратности46.
Кроме того, компендиум может содержать дополнительную информацию из таких баз данных, как NCBI Entrez gene47, HGNC48, OMIM49, HPRD50,51, Ensemble52, KEGG53, WikiPathways54, GO55, miRBase56 и DGV57. При использовании GEO2R оценка UMAP показывает, как связаны выборки. В текущем анализе две выборки ESCC заполняются нормальными выборками, что говорит о том, что либо имеет место ошибка выборки, либо выборки ESCC достаточно неоднородны, чтобы появиться в группе нормальных образцов.
Инструмент GEO2R удобен в использовании и легко доступен, но у него есть некоторые ограничения. В GEO2R отсутствует возможность генерировать графики PCA и тепловые карты или фильтровать образцы после контроля качества. Он предоставляет только одну диаграмму Венна для сравнения образцов в рамках одного ряда. GEO2R ограничен файлами матрицы серий, что предотвращает сравнение между рядами. Кроме того, GEO2R анализирует только данные микрочипов и не имеет контроля качества для нормальности образца или перекрестной сопоставимости. GEO2R не позволяет использовать неограниченное количество результатов поиска и отображает только 250 основных генов для любого заданного парного сравнения в наборе данных. Он также анализирует наборы данных с недостаточным количеством повторений выборки для надежного статистического анализа. GEO2R предоставляет данные в виде изменения свертки журнала, что потребовало преобразования в изменение свертки либо с помощью r, либо на листе Excel. Кроме того, для представления повышающих и понижаемых генов необходимо использовать другое программное обеспечение или онлайн-инструмент для создания тепловой карты 58,59,60.
Подводя итог, можно сказать, что в этой статье представлен простой конвейер, который может быть использован для составления компендиума по любому виду злокачественных новообразований с незначительными изменениями. Компендиумы необходимы в настоящее время для поддержки ученых-биомедиков, особенно в открытии биомаркеров, предоставляя молекулы-кандидаты для валидации в клинических условиях для их использования для прогнозирования или диагностики.
Авторам нечего раскрывать.
MKK является получателем заочного гранта TARE Fellowship (Grant # TAR/2018/001054) (Grant # 5/13/55/2020/NCD-III) от Совета по научным и инженерным исследованиям (SERB), Департамент науки и технологий, и Индийского совета медицинских исследований (ICMR), правительство Индии, Нью-Дели, соответственно.
| Имя | Компания | Каталожный номер | Комментарии |
|---|---|---|---|
| NCBI-PUBMED | NCBI | В соответствии с разделом 1. требуется для поиска литературы | |
| Ноутбук/Macbook или персональный компьютер с возможностью подключения к Интернету и веб-браузером. | |||
| g:Profiler | ELIXIR infrastructure | https://biit.cs.ut.ee/gprofiler/gost | Ссылка на раздел 4.10. требуется для обогащения GO:MF, GO:BP и GO:CC |
| Gene expression omnibus | NCBI | https://www.ncbi.nlm.nih.gov/geo/ | Ссылка на раздел 3.1. требуется для поиска в базе данных исследований микрочипов |
| GEO2R | NCBI | https://www.ncbi.nlm.nih.gov/geo/geo2r/ | Ссылаясь на раздел 3.2. Обязательный для анализа данных с помощью инструмента GEO2R |
| https://www.google.com | Ссылаясь на раздел 1.1. Обязательный для поиска литературы | ||
| HGNC | HGNC является комитет Организации по геному человека (HUGO) | https://www.genenames.org | Ссылаясь на раздел 6.1 требуемый для знания официального символа гена DEGs |
| Институт | биоинформатики HPRD, Банглуру | http://hprd.org | Ссылка на раздел 5.1 обязательна для получения информации об архитектуре белка |
| OMIM | Университет Джонса Хопкинса, Балтимор | http://www.omim.org/entry | Ссылаясь на раздел 8.1 Требуется знать идентификатор OMIM конкретного гена / Программа |
| DEG Pangloss | разработанная Крисом Зайделом | http://www.pangloss.com/seidel/Protocols/venn.cgi | Ссылка на раздел 4.9. требуется для создания диаграммы Венна |
| PANTHER | Thomas в Университете Южной Калифорнии | http://www.pantherdb.org/geneListAnalysis.do | Ссылаясь на раздел 4.10. требуется для обогащения GO:MF, GO:BP и GO:CC |
| ShinyGO | Университет штата Южная Дакота | http://bioinformatics.sdstate.edu/go | Ссылка на раздел 4.10. требуется для распределения ДЭГ на хромосомах |