2025년 11월 4일
이 보고서는 시계열 실험에서 얻은 대규모 데이터 세트를 분석하기 위해 오픈 소스 소프트웨어 RStudio의 R 스크립트를 사용하는 방법을 설명합니다.
우리는 식물이 병원체로부터 어떻게 방어하는지에 대한 분자적 기초를 이해하고, 궁극적으로 이 지식을 활용해 식물 건강과 작물 수확량을 향상시키고자 합니다. 생물학적 분야에서는 대규모 데이터셋을 비교적 쉽게 생성할 수 있지만, 이렇게 큰 데이터셋을 적시에 분석하는 것은 어려울 수 있습니다. 시작하자면, 씨앗을 위쪽에 구멍 세 개가 뚫린 마이크로 원심분리관에 넣고 벨 자르 안에 넣으세요.
그런 다음 36% 염산을 3밀리리터, 100밀리리터의 가정용 표백제를 배출 후드 안의 비이커에 넣어 표백제 증기를 생성합니다. 비커를 벨 자에 넣고 화학 훈기 후드에 3시간 동안 두세요. 멸균 후, 멸균 유리 파스퇴르 피펫을 사용해 씨앗을 0.5% 자당과 0.8% 오저가 포함된 무라시게와 스쿠그 배지 플레이트에 층류 캐비닛 안에 판판 부착합니다.
플레이트와 밀봉된 무라시게와 스쿠그 플레이트를 섭씨 4도 환경에 이틀간 놓은 후, 12시간 빛과 12시간 암 주기로 설정된 조직 배양실로 옮깁니다. 그 후 묘목을 96웰 플레이트로 옮기며, 각 웰에 180마이크로리터의 분석 매체가 포함되도록 합니다. 플레이트를 투명 필름으로 덮고, 웰당 두 개의 구멍을 뚫어 통기하세요.
플레이트를 12시간 조명과 12시간 암흑 주기 아래 하루, 이어서 하루 24시간 지속적인 빛 아래에 두세요. 각 웰에 처리제나 모의 용액을 추가하세요. 그 후 방출 필터 렌즈 게인을 3,600으로 설정하고 측정 간격 시간을 1초로 설정한 상태에서 일정한 빛 조건에서 발광 측정값을 기록하고 데이터 수집을 시작합니다.
발광 기록이 끝나면 96웰 플레이트의 사진을 찍어 묘목 성장 과정을 기록하세요. 발광 분석법의 데이터 곡선을 관찰하여 처리 일관성을 확인하고, 원시 발광 데이터를 판 리더기의 데이터 분석 소프트웨어의 저장 기능을 사용해 하위 R 분석용 CSV 파일로 저장하세요. RStudio 소프트웨어와 필요한 알고리즘 패키지를 설치한 후, 입력 파일이 저장된 작업 디렉터리를 선택하세요. 이 디렉터리는 결과 저장 폴더 역할도 합니다.
그 다음, 올바른 형식의 CSV 입력 파일을 선택하세요. 상단 행에는 시간점이 포함되고, 첫 번째 열에는 96웰 플레이트의 개별 샘플 위치가 표시되어 있는지 확인하세요. 샘플과 처리를 96웰 플레이트 배치에 따라 명명하며, 설계에 최대 12번의 처리를 위한 8번의 복제 또는 최대 8번의 처리를 위한 12번의 복제를 포함하도록 해야 합니다.
행이나 열이 비어 있다면, Empty1, Empty2 등과 같은 이름을 처리 라벨 목록에 할당합니다. 그 다음, 챔버에서 빛이 시작된 시간을 기준으로 루시퍼라제 분석의 상대적 시작 시간을 지정합니다. 사용자 입력 II 섹션을 특정 분석 요구에 맞게 수정하세요.
발광 곡선과 유전자형 및 처리 전반에 걸친 기간, 위상, 진폭 비교를 위한 그래프 생성을 포함합니다. Tukey의 정직 유의차 검정과 함께 ANOVA 검정을 사용하여 주기, 위상, 진폭을 기준으로 처리를 비교하세요. 분석 결과물에 대조군 처리를 선택하거나 대조군 필드를 비워 모든 처리를 쌍별로 비교하세요.
선택적으로, 분석 결과 파일에 번호를 매기면 참고와 정리가 더 쉬워집니다. 이제 치료 기간, 위상, 진폭을 기준으로 t-검정을 사용해 비교하세요. t-검정을 쌍별 비교로 할지 선택하고, 그렇다면 데이터가 쌍으로 이루어져 있는지 명시하세요.
데이터셋 내 시간점을 반올림할지 선택하세요. 시간 값이 몇 분 차이만 있다면, 분석을 진행하기 전에 가장 가까운 시간으로 반올림하세요. 이제 플레이트 리더가 데이터를 내보내는 방식을 바탕으로 웰 식별 입력 형식을 설정하세요.
A1, A2, A3 등으로 우물을 나열하는 표준 형식과 A1, B1, C1 등으로 유정을 나열하는 대체 형식 중에서 선택하세요. 그 후 RStudio 콘솔 오른쪽 상단에 있는 소스 버튼을 클릭하여 루시퍼레이스 데이터 분석을 실행하세요. 각 유전자형 및 처리의 평균된 주기, 위상, 진폭 통계를 요약한 문서와 하위 폴더가 포함된 지정된 출력 폴더에서 분석 결과를 확인하세요.
생검 천공을 사용해 25일 된 식물의 네 번째에서 일곱 번째 잎에서 4밀리미터 직경의 잎 원반을 절단했습니다. 잎 원반을 털이 있는 면이 위를 향한 채 96웰 플레이트 안에 100마이크로리터의 멸균된 물에 띄웁니다. 96웰 플레이트를 깨끗한 알루미늄 호일로 덮고, 밝고 어두운 성장실 안에 하룻밤 동안 넣으세요.
그 다음 플레이트를 제거하고 멸균수를 100마이크로리터의 루미놀 용액으로 교체하세요. 즉시 40분에서 60분 동안 매분 발광 기록을 시작하세요. 필요한 RStudio 패키지를 다운로드한 후, 작업 디렉터리를 선택하세요.
입력 파일을 선택하여 올바른 형식의 CSV 파일인지 확인하세요. 맨 위 행에는 시계열 데이터가 포함되어야 하며, 첫 번째 열에는 96웰 플레이트의 샘플 위치를 포함해야 합니다. 앞서 설명한 플레이트 배치에 따라 샘플과 처리의 이름을 붙이세요.
빈 우물은 명시적으로 Empty1, Empty2 등으로 라벨링하세요. Tukey의 정직한 유의차이를 이용한 ANOVA 검정을 사용하여 처리 간 총 발광 합을 비교하세요. 두 번의 치료에서 나온 데이터를 비교할 때는 양측 t-검정을 사용하세요.
형광 곡선과 처리마다 총 발광 합을 보여주는 막대 플롯을 포함한 그래픽 출력물을 생성합니다. 평균의 표준편차 또는 표준오차를 그래프 막대에 더합니다. 플레이트 리더가 출력 웰 식별자를 어떻게 출력하는지에 따라 입력 읽기 형식을 조정하세요.
A1, A2, A3 기준 표준 목록 또는 A1, B1 기준 수직 목록 중에서 선택 C1.To 분석을 실행하고 RStudio 콘솔 오른쪽 상단에 있는 소스 버튼을 클릭하세요. 생성된 폴더에서 결과를 확인할 수 있으며, 이 폴더에는 전체 분석을 요약한 여러 문서와 하위 폴더가 포함되어 있습니다. 루시페라제 분석은 CCA1 루시페라제 리포터를 발현하는 1개의 형질전환 계통과 GRP7 루시페라제 리포터를 발현하는 7개의 독립적으로 형질전환된 형질전환 계통을 사용하여 수행되었습니다.
이 식물들의 발광 흔적은 168시간 동안 측정되었습니다. R 방법을 사용하여, CCA1 루시퍼라제 리포터의 계산된 시계 매개변수는 묘목당 초당 3,000 상대 발광 단위, 주기는 23.5시간, 위상 3.5시간으로 산출되었습니다. 모든 pGRP7 루시퍼레이스 계통은 유사한 주기와 위상 값을 보였으나 진폭은 다양했습니다.
pGRP7 루시퍼레이스의 주기는 24.2시간이며, 상은 12시간입니다. R 분석을 추가로 검증하기 위해, 동일한 데이터셋을 생체 데이터 분석을 위한 무료 온라인 플랫폼인 BioDare2를 사용해 재분석했으며, 유사한 결과가 나왔습니다. Per2dLuc 리포터를 표현한 U2 OS 세포로 생성된 생체 데이터를 R 방법으로 재분석하였습니다.
대조군은 184.8 상대 발광 단위의 진폭을 보였으며, 주기는 23.3시간, 위상은 2.8시간이었습니다. CRY2의 녹다운은 PSMD4와 PSMD7에 영향을 주지 않았으며, 생체 기준, 진폭, 위상, 주기에 유의미한 영향을 미쳤습니다. 이 결과들은 발표된 결과와 일치했다.
우리 연구에 따르면 일주기 시계는 병원체에 대한 계획된 방어에 중요하다는 것을 밝혀냈습니다. 우리는 여기서 설명한 프로토콜을 일상적으로 사용하여 시계 및 방어 분석 모두에서 대규모 시계열 데이터셋을 분석해 왔습니다. RStudio에서 R 스크립트를 사용하는 프로토콜은 대규모 시계열 데이터를 다루는 연구자들에게 사용자 친화적이고 편리한 도구를 제공합니다.
저희 프로토콜은 사용하기 쉽고 여러 통계 옵션이 있어서 R 지식이나 프로그래밍 경험이 없는 초보자도 사용할 수 있습니다.
전체 스크립트를 보고 수천 개의 과학 동영상에 액세스하세요
본 논문은 RStudio 내에서 R 스크립트를 사용하여 대규모 시계열 데이터셋을 분석하기 위한 사용자 친화적인 프로토콜을 제시합니다. 이 방법은 프로그래밍 경험이 적은 연구자들을 위해 설계되었으며, 특히 96-웰 플레이트 형식으로 수행된 서카디언 리듬(circadian clock) 및 활성산소종(reactive oxygen species) 버스트 분석 데이터에 적합합니다. 본 프로토콜은 데이터 입력, 통계 분석 및 출력 결과 정리를 간소화하여 복잡한 생물학적 데이터셋의 효율적이고 재현 가능한 분석을 가능하게 합니다.
대규모 시계열 데이터 세트는 발견 단계의 연구에서 점점 더 핵심적인 역할을 하고 있지만, 그 복잡성과 데이터 양으로 인해 분석 과정에서 병목 현상이 발생하는 경우가 많습니다. 이 R 기반 워크플로우는 고처리량 생물학적 분석의 신속하고 재현 가능하며 정량적인 분석을 가능하게 하여, 강력한 타겟 검증과 메커니즘적 리스크 감소를 지원합니다. 또한, 기술적 장벽을 낮춤으로써 다기능 팀이 실행 가능한 인사이트를 도출하고 포트폴리오 의사결정을 가속화할 수 있도록 돕습니다.
이 R 기반 분석 방법은 초기 발견 단계부터 리드 화합물 발굴 및 전임상 연구까지 원활하게 통합되며, 특히 시계열 및 고처리량 플레이트 기반 분석에 유용합니다.