이 프로토콜은 암의 중요한 분자 변화를 식별하는 데 유용한 도구를 설명하고 식도 편평 세포 암종에 대한 새로운 진단 및 치료 접근법의 개발로 이어집니다.
이 프로토콜은 암의 중요한 분자 변화를 식별하는 데 유용한 도구를 설명하고 식도 편평 세포 암종에 대한 새로운 진단 및 치료 접근법의 개발로 이어집니다.
식도암(EC)은 8번째로 공격적인 악성 종양으로 꼽히며, 조기 발견을 용이하게 하는 바이오마커가 없기 때문에 치료가 여전히 어렵습니다. EC는 선암종(adenocarcinoma, EAD)과 편평세포암(squamous cell carcinoma, ESCC)의 두 가지 주요 조직학적 형태로 나타나며, 둘 다 지리적으로 구별되는 인구 집단에 따라 발병률의 차이를 보입니다. 고처리량 기술은 암을 포함한 질병에 대한 이해를 변화시키고 있습니다. 과학계의 중요한 과제는 문헌에 흩어져 있는 데이터를 처리하는 것입니다. 이 문제를 해결하기 위해 공개적으로 사용 가능한 마이크로어레이 데이터 세트를 분석하고 암과 정상 상태 사이에서 차등적으로 조절되는 분자를 수집하기 위한 간단한 파이프라인이 제안됩니다. 파이프라인은 차등 유전자 발현 분석을 위한 표준 접근법으로 사용될 수 있으며, 암과 정상 조직 간 또는 다른 암 아형 간에 차등적으로 발현된 유전자를 식별할 수 있습니다. 파이프라인에는 데이터 전처리(샘플 간의 기술적 차이를 제거하기 위해 원시 유전자 발현 데이터의 품질 관리 및 정규화 포함), 차등 발현 분석( t-test와 같은 통계 테스트를 사용하여 두 개 이상의 샘플 그룹 간에 차등적으로 발현된 유전자 식별)을 포함한 여러 단계가 포함됩니다., ANOVA 또는 선형 모델), 기능 분석(생물정보학 도구를 사용하여 차등적으로 발현된 유전자에서 풍부한 생물학적 경로 및 기능 식별) 및 검증(독립적인 데이터 세트 또는 qPCR 또는 면역조직화학과 같은 실험 방법을 사용한 검증 포함). 이 파이프라인을 사용하면 식도암을 포함한 모든 유형의 암에 대해 차등적으로 발현된 분자(DEM) 집합을 생성할 수 있습니다. 이 개요서는 암에 대한 잠재적인 바이오마커 및 약물 표적을 식별하고 질병의 기저에 있는 분자 메커니즘에 대한 이해를 향상시키는 데 사용할 수 있습니다. 또한 이 파이프라인을 사용하여 식도암에 대한 인구별 스크리닝은 개별 인구에 대한 특정 약물 표적을 식별하는 데 도움이 되어 질병에 대한 맞춤형 치료로 이어질 것입니다.
EC가 전 세계적으로 8번째로 흔한 암이자 전 세계적으로 6번째로 큰 사망 원인이라는 것은 놀라운 일입니다. 중국, 인도, 이란은 발병률과 사망률이 놀라울 정도로 높습니다. EC에는 식도 선암종(esophageal adenocarcinoma, EAC 또는 EAD)과 식도 편평 세포 암종(esophageal squamous cell carcinoma, ESCC)의 두 가지 주요 유형이 있습니다1. EAC는 서구 세계에서 더 흔한 반면 ESCC는 동부 국가, 특히 중국과 이란에서 더 일반적입니다2. EC와 관련된 몇 가지 위험 요인은 담배 및 알코올 사용, 비만, 위식도 역류 질환(GERD)을 포함합니다. 또한 과일과 채소 부족, 뜨거운 음료 및 음식 섭취와 같은 식이 요인은 고위험 지역의 ESCC 위험과 관련이 있습니다. 조기 진단과 치료는 EC 3,4 환자의 예후를 개선하는 데 중요하다. 따라서 EC의 위험 요인, 징후 및 증상에 대한 인식을 높이고 고위험군에 대한 정기적인 선별 검사를 장려하는 것이 중요합니다. 또한 담배 및 알코올 사용, 건강에 해로운 식습관과 같은 수정 가능한 위험 요인을 해결하려는 노력은 EC의 발병률을 줄이는 데 도움이 될 수 있습니다. EAD는 위 근처의 식도 하부에 있는 점액 생성 분비샘의 세포에서 발생합니다. 위산과 내용물이 식도로 돌아가는 GERD와 관련이 있는 경우가 많습니다. 이와는 대조적으로, ESCC는 식도의 상부를 감싸고 있는 평평하고 얇은 세포에서 발생합니다5. 중국과 이란과 같이 담배와 알코올 사용이 널리 퍼져 있는 지역에서 더 흔합니다.
식도와 관련된 다양한 질환 중, 식도 내벽이 선 세포로 대체되는 상태인 바렛 식도(Barrett's esophagus, BE)는 EAC6의 전구체로 알려져 있습니다. BE는 GERD가 없어도 발병할 수 있지만, GERD가 있으면 BE의 발병 위험이 3배에서 5배까지 증가한다는 점에 주목할 가치가 있습니다. 또한 BE의 존재는 EAC 발병 위험을 50-100배 증가시킵니다7. 또한 뜨겁거나 매운 음식 및 액체는 ESCC와 관련이 있지만 EAC와는 관련이 없습니다. EC의 위험 요인을 이해하는 것은 예방 및 조기 발견을 위해 중요합니다. 담배 사용, 음주, 비만, 건강에 해로운 식습관과 같은 수정 가능한 위험 요인을 해결하려는 노력은 EC의 발병률을 줄이는 데 도움이 될 수 있습니다. 또한, 삼킴곤란(BE)이 있는 환자와 같은 고위험군에 대한 정기 검사 및 감시는 조기 발견 및 치료를 가능하게 하여 결과를 개선할 수 있습니다.
유전체학(genomics), 전사체학(transcriptomics), 단백질체학(proteomics), 메틸체믹스(methylomics), miRNAomics(miRNAomics), 대사체학(metabolomics)을 포함한 오믹스(omics) 기반 연구가 EC에 대한 이해, 특히 ESCC 8,9,10,11,12,13에 크게 기여한 것은 분명한 사실입니다. 이러한 연구를 통해 ESCC의 발달 및 진행과 관련된 새로운 바이오마커, 잠재적인 치료 표적 및 새로운 경로를 식별할 수 있었습니다. 그러나 이러한 연구에서 생성된 데이터는 문헌 전체에 흩어져 있어 과학계가 이 정보에 액세스하고 사용하는 데 어려움을 겪고 있습니다. 따라서 특정 암에 대한 고처리량 또는 저처리량 연구에서 얻은 데이터를 컴파일하는 저장소 또는 데이터베이스를 만드는 것이 중요합니다. 이러한 패키지는 몇 가지 기본 지침을 구현하여 간소화하고 만들 수 있습니다. 이 지침에는 관련 연구 선정, 이러한 연구에서 데이터 추출 및 구성, 데이터 품질 및 일관성 보장이 포함됩니다. 또한, 새로운 연구와 데이터가 입수되는 대로 이를 반영하기 위해 개요서를 정기적으로 업데이트해야 한다. 연구원들은 단일 플랫폼을 사용하여 서로 다른 연구의 데이터를 결합하는 개요 또는 데이터베이스를 생성함으로써 특정 암에 대한 데이터를 검색하고 분석할 수 있습니다. 이는 연구 노력을 가속화하고 궁극적으로 암 환자를 위한 보다 효과적인 치료와 더 나은 결과로 이어지는 데 도움이 될 것입니다.
암 개요서의 개발에는 저처리량 및 고처리량 연구의 데이터가 모두 포함됩니다. 이 개요서는 암에 대한 잠재적인 진단 또는 치료 표적을 식별하려는 연구자에게 귀중한 자료가 될 것입니다. 이 컬렉션을 구축하는 한 가지 방법은 GEO(Gene Expression Omnibus)와 같이 공개적으로 액세스할 수 있는 저장소에서 사용할 수 있는 마이크로어레이 연구를 검토하는 것입니다. 마이크로어레이 연구는 암세포의 유전자 발현 수준에 대한 정보를 제공할 수 있으며, 이러한 데이터는 암 발병 및 진행에 중요한 역할을 할 수 있는 차등 발현 유전자(DEG)를 식별하는 데 사용할 수 있습니다.
그러나 다른 연구에서 데이터를 분석하기 위해 다른 방법을 사용했을 수 있으며, 이로 인해 다른 DEG가 식별되었을 수 있다는 점에 유의해야 합니다. 따라서 각 연구를 주의 깊게 검토하고 개요서를 위해 데이터를 통합할 때 잠재적인 편향이나 제한 사항을 고려하는 것이 중요합니다. 데이터가 공통 플랫폼에서 수집되면 연구원들은 이를 사용하여 추가 연구를 위한 잠재적인 분자 표적을 식별할 수 있습니다. 여기에는 임상 샘플에서 특정 유전자의 발현을 검사하거나 특정 유전자 또는 단백질이 암 발병 및 진행에 어떻게 관여하는지 이해하기 위한 기계론적 연구를 수행하는 것이 포함됩니다. 전반적으로 암 데이터 세트의 생성은 암 연구자에게 귀중한 자원이 될 것이며 진단 및 치료 개입을 위한 새로운 대상을 식별하는 데 도움이 될 것입니다.
1. ESCC에서 차등 조절된 분자의 수동 선별
2. PubMed를 사용하여 관련 연구 찾기
3. 유전자 발현 옴니버스(GEO)를 활용한 유의미한 연구 발굴
참고: 유전자 발현 옴니버스(GEO)는 DNA 마이크로어레이에 데이터를 저장하기 위해 무료로 사용할 수 있는 저장소입니다. GEO에서 사용할 수 있는 방대한 데이터는 암/질병과 정상 상태 간에 차등적으로 조절되는 분자를 식별하기 위한 데이터 마이닝에 좋은 리소스입니다.
4. GEO2R을 이용한 마이크로어레이 분석
참고: 첫 번째는 부울 연산자(AND, OR, NOT)를 사용하여 관련 연구를 찾는 것입니다. 이들은 '식도 편평 세포 암종', 'ESCC' 또는 '식도 편평 세포 암종'이라는 키워드와 함께 사용됩니다. GEO2R( 재료 표 참조)은 GEO와 통합된 무료로 사용할 수 있는 R 언어 패키지로, 사용자가 사용자 친화적인 방식으로 마이크로어레이 연구의 데이터를 분석할 수 있도록 합니다. GEO 항목 ID와 상호 작용하고 백엔드용 Bioconductor R 패키지를 사용하여 DEG를 식별하기 위해 복잡한 R 기반 분석을 수행하기 위한 인터페이스를 제공합니다. 이 패키지는 GEO 데이터를 변환할 뿐만 아니라 출력을 .txt 테이블 형태로 표시하며, 이는 사용자의 필요에 따라 추가로 수정될 수 있습니다16. GEO2R 패키지는 p-값을 기준으로 통계적으로 유의한 순서로 유전자를 표시하지만, 순서는 log2-fold 변화를 기준으로 정렬할 수 있습니다. 또한 사용자는 유전자 발현 프로파일을 GEO 프로파일 이미지로 볼 수 있습니다. 다른 분석 도구와 달리 GEO2R은 선택한 데이터 세트 기록과 독립적이며 조사자가 제출한 실제 데이터를 직접 조사할 수 있습니다. GEO 연구의 90% 이상이 이 방법을 사용하여 분석될 수 있다17. GEO2R을 사용하여 마이크로어레이 데이터 분석과 관련된 단계가 있는 GEO2R의 워크플로우는 그림 1에 나와 있습니다.
5. 유전자/단백질의 별칭 찾기
6. DEGs에 대한 공식 유전자 기호 찾기
7. DEG의 유전자 자리 찾기
8. DEG의 OMIM Pagegene 유전자 자리에서 DEG에 대한 정보 찾기
9. 유전자에 의해 암호화된 단백질의 단백질 국소화(localization), 영역(domain), 모티프(motif), 분비 성질(secretory nature) 파악
10. 검증을 위한 단백질에 대한 체리 피킹(Cherry Picking) 및 관심 악성 종양의 진단 또는 예후를 위한 추가 평가
참고: 고유한 분자가 식별되면 가장 큰 과제는 이를 검증하는 방법입니다. 일반적으로 마이크로어레이 연구는 mRNA 수준에서 발현을 제공하지만 질병 진단이나 예후를 위해서는 단백질 수준의 판독이 중요합니다. 이와 같이, 환자 또는 환자에서 파생된 동일한 암의 샘플 또는 세포주를 스크리닝하여 분자가 실제로 그곳에서 발현되는지, 암과 정상 예후, 좋은 예후와 나쁜 예후를 구별할 수 있는지, 또는 질병의 초기와 말기를 구별할 수 있는지 여부를 파악해야 합니다. 후보 분자를 검증하기 위해 웨스턴 블롯, 효소 결합 면역흡착 분석법, 즉 ELISA, 면역침전, 면역조직화학, 면역세포화학 또는 분석법이 유용한 기술이다 18,19,20. 동시에 이러한 모든 분석에는 샘플에 존재하는 항원을 검출하기 위한 항체가 필요합니다. 항체는 비용이 많이 드는 품목이므로 항상 다음 사항에 따라 항체를 선택하는 것이 좋습니다.
예를 들어, GEO 등록 GSE161533는 ESCC에서 차등적으로 탐색된 유전자를 연구하는 데 사용되었습니다. 분석의 대표적인 결과는 그림 3에 나와 있습니다. GEO2R은 두 그룹의 실험 대상자 간에 크게 다른 사건을 식별하는 데 유용한 화산 플롯을 생성합니다. 화산 플롯은 y축에 -log10 변형 유의성(p-값)을 표시하고 x축에 fold changes(log2 transformed fold change 포함)를 사용하여 전체 유전자 분포를 표시하며(그림 3A), 차등적으로 발현되는 유전자를 시각화하는 데 유용합니다. 강조된 유전자는 0.05의 기본 adj. p-value cut-off에서 유의하게 다르게 발현됩니다(파란색 = 하향 조절, 빨간색 = 상향 조절).
평균 차이(MD) 그림은 로그2 폴드 변동 대 를 표시합니다. 평균 Log2 발현 값이며 차등적으로 발현되는 유전자를 시각화하는 데 유용합니다. MD-plot에서 log2 가 fold로 변환된 유전자는 y축에서 변화하고 x축에서 평균값 발현을 기록합니다(그림 3B). 강조 표시된 유전자는 0.05의 기본 adj. p-value cutoff(파란색 = 하향 조절, 빨간색 = 상향 조절됨)에서 유의하게 다르게 발현됩니다. 화산 도표는 한 번에 두 가지 처리의 정보만 표시한다는 점에서 MA 도표와 동일한 문제에 직면합니다21.
또한 UMAP(Uniform Manifold Approximation and Projection)22 를 사용하여 ESCC와 정상 샘플 간의 관련성을 평가했습니다(그림 3C). 대부분의 샘플이 해당 범주에 속했지만 정상 샘플에서 두 개의 ESCC 샘플이 발견되었습니다.
GEO2R은 데이터 세트의 발현 밀도를 효과적으로 보여주는 2D 대화형 발현 밀도 플롯(그림 3D)을 제시했습니다. 이 플롯은 DEG에 정규화가 필요한지 여부를 확인하는 데 유용합니다. 이 플롯에서 y축은 밀도를 나타내고 x축은 ESCC(녹색)와 보통(보라색) 모두에 대한 강도를 나타냅니다.
ESCC 및 정규분포를 포함한 여러 샘플에 걸친 값의 분포가 상자 그림에 표시되었습니다. 이러한 분포는 샘플이 실제로 미분 발현 분석에 적합한지 여부에 대한 힌트를 제공합니다. 중앙값 중심 값은 데이터가 정규화되고 교차 비교됨을 명확하게 나타냅니다(그림 3E).
식별된 유전자는 p < 0.05 및 fold-change 기준에 따라 필터링됩니다. 변경되지 않은 유전자(<2.0->0.50 사이의 접힘 변화)는 분석에서 제거되었습니다. 더욱이, 이전에 발표된 연구와 비교했을 때, 발견된 일반적인 유전자는 514개에 불과하지만, 얻어진 유전자의 고유 수는 1193개이다. GEO2R을 사용하여 고유한 유전자를 식별하면 중복을 줄이는 데 도움이 될 뿐만 아니라 개요서를 풍부하게 하는 데 도움이 될 수 있다는 점에 유의하는 것이 중요합니다.
DEG의 일부 목록은 표 1에 언급되어 있으며, DEG의 전체 목록은 보충 파일 1에 나와 있습니다. 상향 조절된 유전자 중 일부는 MMP1 8,23,24, MMP1223,25, SPP1 8,26, POSTN9 및 VCAN 8,27과 같은 세포외 기질에 속합니다. 표 1에 열거된 다른 유전자 중에는 CMPK2, AURKA28,29, CHEK127 및 CDK130이 상향 조절되고 EMP127, PTK631,32, GPX327, DPT33, FHL134,35 및 CRNN 8,36이 포함됩니다 정상 상피에 비해 ESCC에서 하향 조절됩니다. POSTN(페리오스틴)은 ESCC에서 상향 조절되었으며 식도 선암의 경우에도 보고되었습니다. ESCC에 대한 이전 연구에서는 POSTN 단백질 발현이 기질 영역뿐만 아니라 종양 세포에서도 관찰되었다고 보고했는데, 이는 종양-미세환경 9 사이에 상호 작용이 있음을 시사합니다. 페리오스틴은 주로 중간엽 세포에서 분비되는 단백질로, 조골세포의 조절, 접착 및 분화뿐만 아니라 상처 복구에 중요한 역할을 합니다. 또한 페리오스틴은 배아위망상공회의소(ESCC)를 포함한 다양한 암에서 종양 진행 및 전이와 관련이 있습니다. 연구에 따르면 페리오스틴은 암 및 종양 혈관 신생에서 상피-중간엽 전이(EMT)에 관여하여 종양의 세포 이동, 운동성, 접착 및 전이성 세포 성장을 촉진합니다. 식도의 전암성 상태인 바렛 식도(Barrett's esophagus)에서는 정상 식도 조직과 비교하여 페리오스틴(periostin)을 암호화하는 유전자인 POSTN의 상당한 상향 조절이 있습니다37. 식도의 염증성 질환인 호산구성 식도염에서는 페리오스틴 mRNA와 단백질 발현 수준이 정상 식도 상피에 비해 상향 조절됩니다. 마찬가지로, ESCC에서 POSTN은 유전자 발현 분석에서 11배 상향 조절되는 것으로 밝혀졌습니다9. 이러한 결과는 POSTN이 ESCC 및 기타 암에 대한 잠재적인 바이오마커 역할을 할 수 있음을 시사합니다. 또한, 뼈 전이가 있는 유방암 환자에서 혈청 POSTN 수치가 증가한 것으로 보고되었으며, 이는 POSTN이 ESCC 환자의 혈청에서 잠재적인 전이성 바이오마커로 추가 조사될 수 있음을 반영합니다. 전반적으로 POSTN은 종양 진행에 중요한 역할을 하는 것으로 보이며 암 진단, 예후 및 치료에 대한 잠재적인 임상적 영향을 미칠 수 있습니다.
개별 염색체에 대한 DEG의 염색체 분포는 유전자의 최대 수가 염색체 1-6 및 X에서 발생했음을 보여줍니다(그림 4). ShinyGO 기반 경로 분석은 DEG 분석 시 여러 가지 중요한 경로가 나타나는 것을 보여주었습니다. 그 중 일부는 IL-17 신호 경로, 단백질 소화 및 흡수, ECM-수용체 상호 작용, TNF 신호 경로, 톨 유사 수용체 신호 경로, 케모카인 신호 경로, 사이토카인-사이토카인 수용체 상호 작용, 알코올 간 질환, 암의 microRNA, 암의 전사 조절 장애, 세포 주기 및 ESCC의 NONO 유사 수용체 신호 경로입니다. 또한 DEG의 GO 항 강화는 g: Profiler 분석을 사용하여 수행되었습니다. 분자 기능(GO: MF), 세포 구성 요소(GO: CC) 및 생물학적 과정(GO: BP)에 대한 다양한 GO 용어가 강화되었습니다(그림 5). 이러한 GO-용어 목록은 표 2에 제공되어 있습니다.

그림 1: GEO2R 프로그램을 사용하여 유전자 발현 옴니버스에서 사용할 수 있는 식도 편평 세포 암종에 대한 연구 처리를 위한 개략도 .상향 조절된 유전자(DEG) 또는 차등 조절 분자(DEM)의 식별과 관련된 여러 단계가 스키마에 표시되었으며, 상향 조절된 경우 폴드 변화 >2.0배 및 p < 0.05, 하향 조절된 경우 <0.5 및 p-값<0.05를 기반으로 하는 DEG에 대한 선택 기준을 포함합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 2: 공개적으로 사용 가능한 다른 리소스를 사용하여 사용할 수 있는 식도 편평 세포 암종에서 차등적으로 조절되는 유전자에 대한 추가 정보를 찾기 위한 개략도 . 또한 정보 DEG는 임상 환경에서 추가 검증 및 평가를 위해 DEG를 선택해야 하는지 결정하는 데 중요합니다. 별칭 추출, 공식 유전자 기호, 염색체 위치/유전자 위치, OMIM, 도메인/모티프, 단백질의 분비 특성 및 단백질 수준에서 검증에 적합한 항체의 가용성과 같은 정보는 다양한 온라인 리소스에서 얻을 수 있습니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 3: ESCC와 정상 간의 DEG 식별을 위해 GEO2R 프로그램을 사용한 GEO 등록 GSE161533 사용한 연구 분포. GEO2R 프로그램은 (A) y축에서 -log10 변환된 유의성(p-값)으로 유전자 분포를 나타내는 화산 플롯, x축에서 fold changes(log2 변환된 fold change 포함), (B) 차등적으로 발현된 유전자를 시각화하기 위해 log2 fold change 대 average log2 발현 값을 표시하는 MD-plot plot, (C) UMAP(Uniform Manifold Approximation and Projection)은 샘플의 유형에 따른 분리를 보여주고, (D) 발현 밀도 플롯은 미분 발현 분석 전에 데이터의 정규화를 확인할 때 보완하며, (E) 데이터의 정규화가 상호 비교 가능함을 나타내기 위해 샘플 전체의 중앙값 중심 값을 보여주는 상자 플롯. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 4: ShinyGO 농축 도구를 사용한 다양한 염색체 자리의 DEG 분포. (A) 현재 연구 와 이전에 발표된 연구를 비교하기 위해 벤 다이어그램을 생성하여 고유한 유전자를 식별했습니다. (B) 게놈의 다른 염색체에 대한 DEG의 분포. (C) ShinyGO 기반 농축 분석을 사용한 DEG에 대한 경로 농축. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 5: g: Profiler를 사용하여 표적 유전자의 GO 용어 농축을 설명하기 위한 맨해튼 플롯. 차등적으로 발현된 유전자는 g: Profiler로 분석하고 GO 용어로 농축(MF: molecular function; BP : 생물학적 과정; CC: 세포 구성 요소) 및 Reactome 경로(REAC), WiKi-Pathways(WP), 전사 인자(TF) 및 microRNA 표적 염기(MIRNA)에 걸친 KEGG 경로는 맨해튼 플롯에 그래픽으로 표시되었으며, 여기서 x축은 범주별로 색칠된 GO 기능 용어입니다. 각 색상 점은 GO 항을 나타냅니다. y축은 조정된 -log10p-값을 보여줍니다. ESCC에 대해 통계적으로 유의한 GO 항은 x축에 표시됩니다. MF : 분자 기능; BP: 생물학적 과정; CC: 세포 구성 요소; 미르나: 마이크로RNA; HP: 인간 표현형(Human Phenotype). 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
표 1: ESCC에서 차등적으로 발현된 유전자의 일부 목록. 이 표를 다운로드하려면 여기를 클릭하십시오.
표 2: g: Profiler를 사용한 ESCC의 GO-term 강화. 이 표를 다운로드하려면 여기를 클릭하십시오.
보충 파일 1: ESCC에서 차등적으로 발현된 유전자의 전체 목록. 이 파일을 다운로드하려면 여기를 클릭하십시오.
암 생물학에 고처리량 OMICS 기술이 도입된 이후 데이터 생성 속도가 크게 증가했습니다. 이는 연구자, 특히 컴퓨터에 익숙하지 않은 연구자들에게 도전이 됩니다. 이를 극복하기 위해 수년에 걸쳐 생물정보학자들은 체계적인 방식으로 데이터를 제공하기 위해 데이터베이스를 개발한다는 아이디어를 내놓았습니다. 이는 연구자들, 특히 기술에 관심이 없는 연구자들로부터 긍정적인 반응을 이끌어냈습니다. 더욱이, 문헌 여기저기에 흩어져 있는 오믹스 데이터는 누구에게도 쓸모가 없습니다. 따라서 이를 적절하게 활용하기 위해서는 특별한 관심사를 가진 연구자들이 데이터에 액세스할 수 있는 공통 플랫폼이 항상 필요했습니다. ONCOMINE38, ESCC ATLAS39, 췌장암 데이터베이스(PCD)40 및 DDEC41을 포함하여 다양한 암에 대한 많은 데이터베이스가 있습니다.
차등 발현 유전자(DEG)의 개념은 RNA 염기서열 분석 데이터 분석에서 비롯되었으며, 여기서 두 가지 이상의 조건(예: 암 대 정상 또는 치료 대 대조군)에 걸쳐 발현 수준에 상당한 변화가 있는 유전자를 식별합니다. DEG를 결정하기 위해 여러 도구가 개발되었으며, 이는 원시 RNA-seq 판독값의 컴퓨터 분석 또는 프로브와 암 대 정상 그룹의 표적 염기서열 사이에 생성된 강도 비율의 컴퓨터 분석에서 평가된 유전자의 정량화를 기반으로 통계적 테스트를 수행합니다. 이러한 도구는 각 유전자에 대한 발현 수준 및 쌍별 차이 크기와 관련된 정보를 제공합니다. 차등 유전자 발현(DGE) 분석은 유기체의 표현형 차이에 기여하는 유전적 메커니즘을 이해하는 데 유용합니다. DGE 분석은 종양 기원 검출 및/또는 마이크로바이옴 분석을 포함한 다양한 생물학적 과정을 연구하는 데 적용되었습니다. DEG를 확인함으로써 이 분석은 ESCC 종양 형성과 관련된 이러한 생물학적 과정에 기여하는 기본 유전적 요인에 대한 통찰력을 제공할 수 있습니다21.
GEO2R 도구 방법은 공개적으로 사용 가능하며 문헌에서 사용할 수 있는 대부분의 연구가 다른 알고리즘을 사용하여 분석되어 데이터 분석에서 큰 차이를 초래했기 때문에 가장 선호되는 방법입니다. 따라서 이러한 차이점을 피하기 위해 이 사용자 친화적인 플랫폼은 무료이며 사용하기 쉽기 때문에 사용되었습니다. 이를 통해 '암 대 정상' 또는 '치료 대 무치료'와 같은 상태를 비교할 수 있습니다.
이 경우, ESCC는 인도와 중국에서 위장관(GI)에서 발생하는 신종 암이기 때문에 선택되었습니다. GEO2R을 사용하여 ESCC와 ESCC 간의 DEG를 식별하기 위해 분석하기 위해 GEO 등록 GSE161533 선택합니다. 보통. 이 연구는 이전에 화학요법 또는 방사선요법 치료를 받은 적이 있는 ESCC 환자를 포함하지 않았기 때문에 선택되었다. 모든 분석을 위해 가능한 경우 쌍을 이루는 샘플(ESCC 및 동일한 환자의 인접 정상)을 사용하는 것이 좋습니다. 이는 ESCC와 동일한 환자의 정상 조직의 게놈은 동일한 유전적 배경에서 비롯되고 조직이 동일한 환경에 있기 때문에 매우 유사할 것으로 예상되기 때문입니다. 쌍을 이루는 표본을 사용하면 ESCC와 유전적 배경이 다른 다른 환자의 정상 조직을 비교할 경우 발생할 수 있는 분석의 편향을 방지하는 데 도움이 됩니다. 쌍을 이루는 샘플을 사용하면 동일한 환자 내에서 ESCC와 정상 조직 간의 유전자 발현 차이를 보다 정확하게 식별할 수 있으며, 이는 결과의 특이성을 개선하는 데 도움이 될 수 있습니다. 이 접근법은 유전자 발현 연구에서 개인의 변동성을 제어하고 분석력을 향상시키기 위해 자주 사용됩니다.
연구에 참여한 피험자로부터 모든 샘플 데이터를 취합하여 GEO2R 플랫폼을 사용하여 유전자 발현 데이터를 분석했습니다. 먼저 암 샘플을 할당한 다음 정상 샘플을 할당했습니다. 이러한 샘플을 할당한 후 GEO2R 데이터베이스에서 사용할 수 있는 기본 매개변수를 사용하여 암 또는 치료 샘플과 정상 또는 대조 샘플을 식별했습니다. 암 샘플과 정상 샘플을 구별하기 위해 상향 조절된 유전자에 대해 0.05 미만의 조정된 p-값(adj. P Val) 임계값과 >2.0의 접힘 변화 임계값을 설정하고, 하향 조절된 유전자에 대해 0.05 미만의 조정된 p-값(adj. P Val) 임계값과 <0.5의 접힘 변경 임계값을 설정했습니다. 이러한 역치는 암과 정상 간에 다르게 발현된 유전자를 식별하기 위해 유전자 발현 연구에서 일반적으로 사용되었습니다. 유의성에 대한 임계값의 선택은 차등적으로 발현된 것으로 확인된 유전자의 수와 정체성에 영향을 미칠 수 있다는 점에 유의하는 것이 중요합니다. 또한 확인된 유전자의 생물학적 관련성을 신중하게 평가하고 결과를 확인하기 위해 추가 검증 연구를 수행하는 것이 중요합니다.
문헌에서는 특히 마이크로어레이 및 단백질체학 연구에서 상향 조절된 유전자의 경우 최소 2배, 하향 조절된 유전자의 경우 <0.5배 이상의 변화가 있는 유전자만 보고하는 경향이 있습니다42. 이전 연구에서는 하향 조절된 유전자에 대해 >1.5배의 접힘 변화와 <0.67배의 변화로 간주되었지만, 지난 10년 동안의 문헌 경향에 따르면 폴드 값이 낮은 후보 물질에 대해 검증 실험을 수행할 때 mRNA와 단백질 수준 데이터 사이에 상관관계가 약하거나 발견되지 않기 때문에 더 높은 접힘 변화가 선호되는 것으로 나타났습니다45. 더 높은 폴드 체인을 선택하는 데에는 어두운 면이 있습니다: 때때로 질병이나 암과 생물학적으로 관련이 있는 일부 분자를 놓치지만, DEG/DEM 목록을 만드는 데 선호되는 컷오프로 인해 생략된다는 것입니다. 더욱이, 문헌은 DEG가 특히 과소 발현된 분자보다 상향 조절되거나 과발현된 분자를 선호한다는 보고에 편향되어 있습니다. 더욱이, 분자의 발현이 동일한 암이나 질병에 대한 것인지 여부에 관계없이 여러 연구에서 동일한 상향 조절 또는 과발현 패턴을 따르는 경우 과학자들 사이에서 선호되는 접근 방식입니다. 또한, 여러 질병에서 동일한 패턴의 과발현이 관찰되고 문헌에 보고되면 과학계에서 다시 널리 받아들여집니다.
더욱이, 질병의 유사성은 비교를 위해 마이크로어레이 데이터 또는 문헌이 사용되는지 여부에 달려 있습니다. 마지막으로, 문헌에서 차등 발현 크기에 대한 느슨하게 정의된 설명은 마이크로어레이 폴드 변화 데이터46와의 제한된 상관관계만 나타냅니다.
또한 개요서는 NCBI Entrez gene47, HGNC48, OMIM49, HPRD50,51, Ensemble52, KEGG53, WikiPathways54, GO55, miRBase56 및 DGV57과 같은 데이터베이스에서 추가 정보를 제공할 수 있습니다. GEO2R을 사용하는 동안 UMAP을 평가하면 샘플이 어떻게 관련되어 있는지 알 수 있습니다. 현재 분석에서 두 개의 ESCC 샘플이 정규 샘플로 채워지며, 이는 샘플링 오류가 있거나 ESCC 샘플이 정규 샘플 그룹에 나타날 만큼 충분히 이질적임을 시사합니다.
GEO2R 도구는 사용자 친화적이고 쉽게 액세스 할 수 있지만 몇 가지 제한 사항이 있습니다. GEO2R은 PCA 플롯 및 히트 맵을 생성하거나 품질 관리 후 샘플을 필터링하는 기능이 없습니다. 동일한 시리즈 내의 샘플 비교를 위해 단일 벤 다이어그램만 제공합니다. GEO2R은 시리즈 매트릭스 파일로 제한되어 시리즈 간 비교를 할 수 없습니다. 또한 GEO2R은 마이크로어레이 데이터만 분석하며 시료 정정상성 또는 교차 비교에 대한 품질 관리 기능이 없습니다. GEO2R은 검색 결과를 무제한으로 허용하지 않으며 데이터 세트 내에서 주어진 쌍별 비교에 대해 상위 250개의 유전자만 표시합니다. 또한 강력한 통계 분석을 위해 샘플 반복이 충분하지 않은 데이터 세트를 분석합니다. GEO2R은 로그 폴드 변경으로 데이터를 제공하며, 이를 위해서는 r을 사용하거나 엑셀 시트에서 폴드 변경으로 변환해야 했습니다. 또한 상향 조절 및 하향 조절 유전자를 나타내려면 다른 소프트웨어나 온라인 도구를 사용하여 히트맵 58,59,60을 만들어야 합니다.
요약하면, 이 기사에는 간단한 파이프라인이 제공되며, 이 파이프라인은 약간의 수정으로 모든 종류의 악성 종양에 대한 개요를 만드는 데 사용할 수 있습니다. 개요서는 예후 또는 진단을 위한 사용을 위해 임상 환경에서 검증을 위한 후보 분자를 제공함으로써 특히 바이오마커 발견을 위해 생물 의학 과학자를 지원하기 위해 시간이 필요합니다.
저자는 공개할 내용이 없습니다.
MKK는 과학기술부 과학공학연구위원회(SERB) 및 인도 뉴델리 정부 인도의학연구위원회(ICMR)로부터 각각 TARE 펠로우십(보조금 # TAR/2018/2018/001054 2020/NCD-III) 교외 보조금(보조금 # 5/13/55/2020/NCD-III)을 받았습니다.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| NCBI-PUBMED | NCBI | 섹션 1을 참조합니다. 문헌 검색에 필요 | |
| 인터넷 시설과 웹 브라우저가 있는 노트북/맥북 또는 개인용 컴퓨터. | |||
| g:프로파일러 | ELIXIR 인프라 | https://biit.cs.ut.ee/gprofiler/gost | 섹션 4.10 참조. GO:MF, GO:BP 및 GO:CC 유 |
| 전자 발현 옴니버스 | NCBI | https://www.ncbi.nlm.nih.gov/geo/ | 섹션 3.1 참조. 마이크로어레이 연구 데이터베이스 |
| GEO2R | NCBI | 검색에 필요https://www.ncbi.nlm.nih.gov/geo/geo2r/ | 섹션 3.2 참조. GEO2R 도구를 사용하여 데이터를 분석하는 데 필요 |
| https://www.google.com | 1.1 참조. 문헌 검색에 필요 | ||
| HGNC | HGNC는 인간 게놈 기구(HUGO)의 위원회입니다 | https://www.genenames.org | DEGs 의 공식 유전자 기호를 알아야 하는 섹션 6.1을 참조합니다. |
| HPRD | 생물정보학 연구소, 방글루루 | http://hprd.org | 단백질 구조에 대한 정보를 위해 필요한 섹션 5.1을 참조합니다 |
| OMIM& | nbsp; 존스 홉킨스 대학교, 볼티모어 http://www.omim.org/entry | 특정 유전자의 OMIM ID를 아는 데 필요한 섹션 8.1 참조 / DEG | |
| Pangloss 프로그램 | Chris Seidel이 개발 | http://www.pangloss.com/seidel/Protocols/venn.cgi | 섹션 4.9 참조. 벤 다이어그램 생성에 필요 |
| 서던 캘리포니아 | 대학의 PANTHER Thomas 연구실http://www.pantherdb.org/geneListAnalysis.do | 섹션 4.10을 참조합니다. GO:MF, GO:BP 및 GO:CC | |
| ShinyGO | 사우스다코타 주립대학교 | http://bioinformatics.sdstate.edu/go | 섹션 4.10을 참조합니다. 염색체에 DEG 할당에 필요 |