December 10th, 2012
우리 베이지안 변경 포인트 (BCP)이 알고리즘은 숨겨진 마르코프 모델을 통해 모델링 변화 포인트의 최신 발전을 토대로와 염색질 immunoprecipitation 시퀀싱 (ChIPseq) 데이터 분석에 적용됩니다. BCP는 광범위하고 작은 반점이있는 두 데이터 유형에서 잘 수행하지만, 정확하게 확산 히스톤 농축의 강력한 재현 섬을 식별하는 탁월한.
다음 실험의 전반적인 목표는 염색질 면역침전 염기서열분석 데이터에서 매핑된 판독 위치의 밀도를 활용하여 게놈 전체의 사후 평균 판독 밀도를 추정하는 것입니다. 이것은 전처리를 통해 달성됩니다. 매핑된 ChIP-seq는 200개의 염기쌍 비중첩 빈(base-pair non-overlapping bin) 내에 속하는 동일한 수의 판독으로 차단된 밀도 프로파일을 읽습니다.
동일한 밀도를 가진 모든 인접 빈은 두 번째 단계로서 더 큰 블록으로 병합되며, 각 블록의 사후 평균 밀도는 정방향 및 역방향 필터가 있는 베이지안 모델을 사용하여 모든 주변 블록의 컨텍스트 내에서 반복적으로 계산됩니다. 여기서 블록의 읽기 횟수는 알파 및 베타 매개변수가 있는 감마 사전 분포를 취하는 세타 매개변수가 있는 푸아송 분포로 모델링됩니다. 다음으로, 각 블록의 사후 평균 밀도 추정치는 입력 제어 배경 밀도에 대해 90번째 분위수를 초과하는지 여부를 기반으로 유의성을 평가하여 최종 농축 게놈 세그먼트를 생성하고, 원시 염기서열 판독에서 사후 평균 판독 밀도 추정치까지의 진행을 설명하는 결과를 얻습니다. 마지막으로 BCP 분석 중 ChIP-seq 데이터에 대한 섬을 강화했습니다.
또한 결과는 BCP가 경쟁사 도구 서버보다 성능이 우수하다는 것을 보여줍니다. CER과 같은 기존 방법에 비해 이 기술의 주요 장점은 BCP가 숨겨진 마커 모델에서 가장 최근의 A 발전을 사용했기 때문에 이전의 휴리스틱 방법보다 칩시 데이터 분석의 뉘앙스를 더 잘 특성화한다는 것입니다. 이 방법은 게놈 전체 농축 패턴을 특성화하는 방식으로 히스토 변형의 역할과 같은 후성유전체학 분야의 주요 질문에 도움이 될 수 있습니다.
이 환자 방법은 ChIP-seq 데이터 분석에 대한 통찰력을 제공할 수 있지만, 기본 프레임워크는 bis Sufi 염기서열분석 데이터에서 차등 메틸화된 영역, RNA-Seq의 새로운 전사 유전자좌, 복제 수 변이 또는 임의의 수의 마이크로어레이 타일링 데이터 식별과 같은 다른 차세대 염기서열분석 데이터 분석에도 적용될 수 있습니다. 이 방법의 시각적 시연은 방법론을 명확하게 이해하는 데 중요하며 이점이 있습니다. 이론적 이점은 소프트웨어 내에 숨겨져 있습니다.
여기에 설명된 모든 절차 단계는 이 비디오에서 다운로드할 수 있는 BCP 소프트웨어 패키지의 단일 실행 파일로 패키지되었습니다. 소프트웨어를 실행하기 위해 프로그램에서 실행하는 단계가 설명되어 있습니다. 세 개의 매개 변수가 필요합니다.
칩 샘플의 고유하게 매핑된 읽기와 입력 제어 읽기를 위한 유사한 파일, BCP 분석을 위한 입력 파일을 준비하기 위한 출력 파일 이름을 포함하는 파일입니다. 먼저, 염기서열분석 실행에서 생성된 짧은 판독을 선호하는 짧은 판독 정렬 소프트웨어를 사용하여 적절한 참조 게놈에 정렬합니다. 매핑된 위치는 6열 브라우저 확장 가능한 데이터 또는 BED 형식으로 변환되어야 하며, 매핑된 염색체 시작 위치, 끝 위치, 읽기 이름, 점수 및 가닥을 나타내는 매핑된 읽기당 탭으로 구분된 줄로 변환해야 합니다.
칩 및 입력 맵 위치를 미리 결정된 프래그먼트 길이로 확장합니다. 예를 들어, DNA의 효소 분해 또는 초음파 처리 중에 표적으로 하는 단편 크기는 일반적으로 약 200개의 염기쌍입니다. 그런 다음 조각 개수가 인접한 bin에서 집계됩니다.
기본적으로 bin 크기는 200개의 염기 쌍의 예상 프래그먼트 길이로 설정됩니다. 동일한 recounts를 가진 bin 집합에서 가능한 모든 변경 지점은 가장 바깥쪽 경계에 속할 가능성이 큽니다. 따라서 동일한 읽기 횟수를 가진 두 Bin 사이의 내부 경계에서 변경 지점이 발생할 가능성은 거의 없습니다.
따라서 bin당 동일한 reads를 가진 인접한 bin을 단일 블록으로 그룹화합니다. 입력 파일을 준비한 후 화면 아래쪽에 표시된 명령을 입력하기만 하면 BCP 추정을 호출합니다. 각 블록의 판독 밀도는 알파 및 베타 매개변수가 있는 감마 분포와 모든 블록에서 변화점이 발생할 사전 확률이 혼합된 후 평균 매개변수 theta가 있는 푸아송 분포로 모델링됩니다.
P의 경계를 조절하면 각 블록이 이러한 방식으로 무한 상태의 숨겨진 마르코프 모델 또는 HMM을 효과적으로 렌더링할 수 있습니다. 하이퍼 파라미터 alpha, beta, P는 최대사후우도를 사용하여 추정됩니다. 베이 추정치는 HMS에서 자주 사용되는 보다 전통적이지만 시간이 많이 걸리는 전방 및 후방 필터인 sub T가 사후 평균 세타 모자 sub T를 추정하기 위해 보다 계산적으로 효율적인 경계 복잡성 혼합 근사치로 대체되는 이유를 감안할 때 각 블록 세타 sub T에 대해 명시적으로 계산됩니다. 따라서 동일한 세타 모자 sub T가 있는 블록은 업데이트된 경계 좌표와 함께 추가로 차단되어야 합니다.
BCP는 블록당 입력 읽기 수를 백그라운드 속도로 사용하고 보강을 결정합니다. 블록의 칩 위치 평균 밀도가 일부 유의성 임계값을 초과하는지 여부를 기반으로 하는 간단한 가설 테스트를 사용합니다. 90번째 분위수는 기본 임계값이며 대부분의 경우에 적합합니다.
그런 다음 BCP는 농축을 초과하는 인접한 사후 평균 밀도 블록을 단일 영역으로 병합하고 병합된 좌표를 브라우저에 보고합니다. 확장 가능한 데이터 형식 BCP는 히스톤 변형 데이터에서 광범위하게 농축되는 영역을 식별하는 데 탁월합니다. 여기. BCP 결과는 H three K 36 trimethylation을 연구하는 이 실험실의 작업에 앞서 강력한 성능을 입증한 기존 도구인 cser의 결과와 비교되며, 이는 cer보다 BCP에서 훨씬 더 큰 섬 크기의 경향을 보여주었습니다.
더 큰 섬은 H 3 K 36 트리메틸화 농축의 넓은 확산 섬에 대한 기존의 기대에 더 부합합니다. 더 큰 고립섬만으로는 정확성을 나타내지 않습니다. 그러므로, H three K 27 트리메틸화 섬과 활발하게 전사된 유전자체의 알려진 연관성 및 H three K 27 트리메틸화 섬과의 상호 배타성은 H3 K 27과의 중첩 증가를 희생하지 않고 유전자체를 더 잘 포착하는 더 큰 인접 섬이라고 불리는 CER BCP와 비교하여 BCP 및 CER의 성능을 평가하는 데 사용되었습니다. 트리메틸화 제도.
BCP는 두 개의 복제 데이터 세트에서 BCP Island 호출의 재현성을 평가하는 동시에 억제된 전사 또는 H three K 27 TRIMETHYLATION 억제 마크가 있는 유전자 간 공간 유전자와의 위양성 겹침 정도를 증가시키지 않고 유전자체에 밀접하게 정렬된 경계를 가진 H three K 36 Trimethylation Islands에 의한 활성 유전자의 높은 중복을 유지합니다. BCP는 경쟁 알고리즘에서 리드 커버리지 깊이에 대한 의존도가 높지 않은 것으로 관찰되었으며, BCPS의 견고성 및 재현성에 대한 추가 증거는 추가적인 뚜렷한 영역을 조사하여 제공되었으며, 감소된 커버리지 깊이에도 불구하고 일관된 섬 경계를 보여주었습니다. BCP의 다양성을 충분히 입증하기 위해, 반점 마크 H 3 K 27 아세틸 화, H 3 K 9 아세틸 화 및 H 3 K 4 트리메틸 화 및 H 3 K 27 트리메틸 화 및 H 3 K 36 트리메틸화 이외에 반점 마크 H 3 K 9 트리메틸화를 포함한 광범위한 히스톤 변형 데이터를 얻었다. 이러한 데이터 세트는 BCP 및 cser 모두에 대한 기본 매개 변수 설정을 사용하여 분석되었습니다.
중앙에는 전사 시작 부위에 예상대로 떨어지는 활성 전사를 표시하는 PX DN 유전자에서 H 3 K 36 트리메틸화 농축이 있습니다 추가 반점 활성 마크 H 3 K 27 아세틸화, H 3 K 9 아세틸화 및 H 3 K 4 트리메틸화. PXDN의 바로 하류에는 H 3 K 27 트리메틸화 농축으로 표시된 억압 된 유전자 간 공간이 있으며, 반대쪽 측면에는 H 3 K 27 TRIMETHYLATION 억제 유전자가 있습니다. 한 걸음 더 나아갑니다.
H 3 K 27 트리메틸화 억제보다 덜 일시적인 의미에서 SN TG 2 및 MYT 1 L의 침묵을 나타내는 것으로 보이는 H 3 K 9 트리메틸화 농축의 존재로 표시된 우리의 침묵 염색질. 이 영역은 히스톤 변형의 ChIPseek에서 발생하는 대부분의 현상을 포함합니다. BCP의 동적 특성이 반점 아세틸화와 H 3 K 4 트리메틸화 마크를 모두 식별하는 동시에 H 3 K 27 트리메틸화 및 H 3 K 9 트리메틸화 억제의 큰 인접 섬과 H 3 K 36 트리메틸화 활성 전사를 구별하는 방법을 보여줍니다.
이 알고리즘은 판독 횟수와 게놈 징후 결과에 따라 약 30분 정도 수행할 수 있습니다. 이 절차를 따르는 다른 방법에서 종종 필요한 중요한 최적화. BBCP를 사용하여 다양한 다른 히손 변형과 DNA 결합 전사 인자를 포함하여 염색질 면역침전의 다양한 표적 단백질을 연구하여 후성유전체 메커니즘 및 유전자 조절에 대한 추가 질문에 답할 수 있습니다.
이 비디오를 시청한 후에는 칩시 데이터 분석에서 확산 히손 마크가 도달하는 영역을 식별하기 위해 BCP를 사용하는 방법을 잘 이해하게 될 것입니다.
View the full transcript and gain access to thousands of scientific videos
본 연구는 염색질 면역침강 시퀀싱(ChIP-seq) 데이터 분석을 강화하는 베이지안 변화점(BCP) 알고리즘을 제시합니다. 숨겨진 마르코프 모델을 활용하여 BCP는 광범위하고 점상 데이터 유형 모두에서 히스톤 집적 영역을 효과적으로 식별합니다.
The Bayesian Change Point (BCP) algorithm provides a unified, parameter-light approach to identifying enriched genomic regions across diverse ChIP-seq data types, from punctate transcription factor binding to diffuse histone modification islands. By reducing reliance on heuristic thresholds and model switching, BCP enhances reproducibility and cross-lab comparability in epigenomic target validation. This supports mechanistic de-risking in early discovery by delivering statistically grounded, quantitative read density profiles that inform target confidence and pathway analysis.
The BCP algorithm fits into the discovery continuum from raw sequencing data to biological insight, supporting hypothesis-driven target validation, reproducible epigenomic profiling, and data integration across early screening and preclinical validation stages.