4 listopada 2025
Raport opisuje metodę wykorzystującą skrypt R w otwartym oprogramowaniu RStudio do analizy dużych zbiorów danych uzyskanych z eksperymentów z szeregami czasowymi.
Naszym celem jest zrozumienie molekularnych podstaw stojących u podstaw obrony roślin przed patogenami, a ostatecznie wykorzystanie tej wiedzy do poprawy zdrowia roślin i plonów. Duże zbiory danych można stosunkowo łatwo generować w dziedzinie biologicznej, jednak analiza takich dużych zbiorów danych w odpowiednim czasie może być wyzwaniem. Na początek włóż nasiona do rurki mikrowirówki z trzema otworami na górze i umieść ją w słoiku dzwonowym.
Następnie wygeneruj parę wybielacza, dodając trzy mililitry kwasu solnego 36% do 100 mililitrów wybielacza domowego w zlewce wewnątrz okapu. Włóż zlewkę do słoika i odstaw ją w okapu chemicznym na trzy godziny. Po sterylizacji, używając sterylnej szklanej pipety Pasteura, nałóż nasiona na średnie płytki Murashige i Skoog zawierające 0,5% sacharozy i 0,8% świdra wewnątrz laminarnej szafki.
Umieść płytki Murashige i Skoog w środowisku o temperaturze czterech stopni Celsjusza na dwa dni, po czym przeniesiono je do komory do hodowli tkanek ustawionej na 12-godzinny cykl światła i 12-godzinny cykl ciemności. Następnie przenieś siewki na płytkę z 96 dołkami, upewniając się, że każda dołek zawiera 180 mikrolitrów podłoża do testowania. Przykryj płytę przezroczystą folią i nakłuj dwa otwory na dołek dla napowietrzania.
Umieść płyty przez jeden dzień pod 12-godzinnym światłem i 12-godzinnym cyklem ciemności, a następnie jeden dzień pod 24-godzinnym stałym światłem. Dodaj zabiegi lub próbne roztwory do każdego odwiertu. Następnie rejestruj odczyty luminescencji przy stałym świetle z wzmocnieniem soczewki filtra emisji ustawionym na 3 600 i czasem interwału pomiaru na jedną sekundę i rozpocznij akwizycję danych.
Na końcu nagrania luminescencji zrób zdjęcie płyty z 96 dołkami, aby udokumentować wzrost siewek. Obserwuj krzywe danych z testu luminescencji, aby potwierdzić spójność obróbki, a surowe dane luminescencji zapisz jako plik CSV do dalszej analizy R, korzystając z funkcji zapisu jako w oprogramowaniu do analizy danych czytnika płyt. Po zainstalowaniu oprogramowania RStudio i wymaganych pakietów algorytmicznych wybierz katalog roboczy, w którym przechowywany jest plik wejściowy, który będzie również służył jako folder wyjściowy z wynikami.
Następnie wybierz poprawnie sformatowany plik wejściowy CSV. Upewnij się, że górny wiersz zawiera punkty czasowe, a pierwsza kolumna przedstawia poszczególne pozycje próbek na płycie 96-dołkowej. Nazw próbki i zabiegi zgodnie z układem płytek z 96 dołkami, zapewniając, że projekt zawiera albo osiem replik na leczenie z maksymalnie 12 zabiegami, albo 12 replikacji na zabieg z maksymalnie ośmioma zabiegami.
Jeśli jakiekolwiek wiersze lub kolumny są puste, przypisz nazwy takie jak Empty1, Empty2 i tak dalej do listy etykiet leczenia. Następnie wskaż względny czas rozpoczęcia testu lucyferazowego na podstawie czasu pojawienia się światła w komorze. Zmodyfikuj sekcję User Input II, aby odpowiadała konkretnym potrzebom analitycznym.
Uwzględnić generowanie wykresów dla krzywych luminescencji oraz dla porównań okresowych, fazowych i amplitudowych między genotypami i zabiegami. Użyj testu ANOVA z testem szczerych różnic znaczących Tukeya, aby porównać metody leczenia na podstawie okresu, fazy i amplitudy. Wybierz zabieg kontrolny dla wyników analizy lub pozostaw pole kontrolne puste, aby porównać wszystkie zabiegi parą.
Opcjonalnie ponumeruj pliki wyjściowe analizy dla łatwiejszego odniesienia i organizacji. Teraz użyj testu T, aby porównać metody leczenia na podstawie okresu, fazy i amplitudy. Zdecyduj, czy test t powinien być przeprowadzony jako porównanie parowe, a jeśli tak, określ, czy dane są sparowane.
Zdecyduj, czy zaokrąglić punkty czasowe w zbiorze danych. Jeśli wartości czasowe różnią się tylko o kilka minut, zaokrągli je do najbliższej godziny przed rozpoczęciem analizy. Teraz ustaw format wejściowy do identyfikacji studni w zależności od tego, jak czytnik płyt eksportuje dane.
Wybierz między standardowym formatem, w którym studnie są wymienione jako A1, A2, A3 i tak dalej, lub alternatywnym formatem, gdzie studnie są wymienione jako A1, B1, C1 itd. Następnie uruchom analizę danych luciferazy, klikając przycisk Źródło znajdujący się w prawym górnym rogu konsoli RStudio. Zobacz wyniki analizy w wyznaczonym folderze wyjściowym, który zawiera dokumenty i podfoldery podsumowujące średnie statystyki okresu, fazy i amplitudy dla każdego genotypu i leczenia.
Za pomocą nakłucia biopsji wyciął krążki liściowe o średnicy czterech milimetrów od czwartego do siódmego liścia roślin mających 25 dni. Unieś dyski liściowe z owłosioną stroną skierowaną do góry w 100 mikrolitrach sterylnej wody wewnątrz płyty z 96 dołkami. Przykryj płytkę z 96 dołkami czystą folią aluminiową i umieść ją na noc w komorze wzrostu światła i ciemności.
Następnie zdejmij płytkę i zamień sterylną wodę na 100 mikrolitrów roztworu luminolu. Natychmiast zacznij rejestrować luminescencję co minutę przez 40 do 60 minut. Po pobraniu wymaganych pakietów RStudio wybierz katalog roboczy.
Wybierz plik wejściowy, upewniając się, że jest to poprawnie sformatowany plik CSV. Górny wiersz powinien zawierać dane o szeregach czasowych, a pierwsza kolumna powinna zawierać pozycje próbki na płycie z 96 dołkami. Nazwij próbki i zabiegi zgodnie z wcześniejszym układem płyt.
Oznacz puste studnie wyraźnie jako Empty1, Empty2 i tak dalej. Użyj testu ANOVA z uczciwą znaczącą różnicą Tukeya, aby porównać całkowite liczby luminescencji między leczeniami. Stosuj dwustronny test T, porównując dane tylko z dwóch zabiegów jednocześnie.
Generuj graficzne wyniki, w tym krzywe fluorescencyjne oraz wykres słupkowy pokazujący sumę całkowitej luminescencji między zabiegami. Dodaj do wykresu odchylenia standardowego lub błędu standardowego średniej. Dostosuj format odczytu wejściowego w zależności od tego, jak czytnik płyt generuje identyfikatory studni.
Wybierz między standardową listą A1, A2, A3 a pionową listą A1, B1, C1.To przejdź analizę, kliknij przycisk Źródło znajdujący się w prawym górnym rogu konsoli RStudio. Zobacz wynik w wygenerowanym folderze, który zawiera wiele dokumentów i podfolderów podsumowujących pełną analizę. Test lucyferazowy wykonano przy użyciu jednej linii transgenicznej wyrażającej raport lucyferazy CCA1 oraz siedmiu niezależnie transformowanych linii transgenicznych wyrażających raport GRP7 lucyferazy.
Ślady luminescencji tych roślin mierzono w ciągu 168 godzin. Metodą R obliczono parametry zegara dla reportera lucyferazy CCA1 z amplitudą 3 000 względnych jednostek luminescencji na sekundę na siewkę, okresem 23,5 godziny i fazą 3,5 godziny. Wszystkie linie lucyferazy pGRP7 wykazywały podobne wartości okresu i fazy, ale różniły się amplitudową.
Okres działania lucyferazy pGRP7 wynosi 24,2 godziny, natomiast faza 12 godzin. Aby dodatkowo zweryfikować analizę R, ten sam zbiór danych został ponownie przeanalizowany za pomocą BioDare2, bezpłatnej platformy online do analizy danych okołodobowych osiem, i uzyskano podobne wyniki. Dane okołodobowe wygenerowane za pomocą komórek U2 OS wyrażających raport Per2dLuc zostały ponownie przeanalizowane metodą R.
Grupa kontrolna wykazała amplitudę 184,8 jednostek względnej luminescencji, okres 23,3 godziny i fazę 2,8 godziny. Obniżenie poziomu CRY2, ale nie PSMD4 i PSMD7, znacząco wpłynęło na parametry okołodobowe, amplitudę, fazę i okres. Wyniki te były zgodne z opublikowanymi wynikami.
Nasze badania wykazały, że zegar okołodobowy jest ważny dla planowanej obrony przed patogenami. Rutynowo stosowaliśmy opisany tutaj protokół do analizy dużych zbiorów szeregów czasowych zarówno z testów zegarowych, jak i obronnych. Nasz protokół wykorzystujący skrypty R w RStudio zapewnia przyjazne i wygodne narzędzie dla badaczy pracujących z danymi z dużych szeregów czasowych.
Nasz protokół jest łatwy w użyciu, oferuje wiele opcji statystycznych i pozwala na korzystanie z niego także początkującemu, który nie ma wcześniejszej wiedzy o R ani doświadczenia programistycznego.
Wyświetl pełny transkrypt i uzyskaj dostęp do tysięcy filmów naukowych
Niniejszy artykuł przedstawia przystępny protokół analizy wielkoskalowych zbiorów danych szeregów czasowych przy użyciu skryptu R w środowisku RStudio. Metoda została opracowana dla badaczy z minimalnym doświadczeniem w programowaniu i jest szczególnie odpowiednia dla danych pochodzących z testów zegara okołodobowego oraz wyrzutu reaktywnych form tlenu przeprowadzanych w formatach płytek 96-dołkowych. Protokół usprawnia wprowadzanie danych, analizę statystyczną i organizację wyników, co ułatwia efektywną i powtarzalną analizę złożonych biologicznych zbiorów danych.
Zestawy danych szeregów czasowych w dużej skali stają się coraz bardziej kluczowe w badaniach na etapie odkrywania, jednak ich analiza często tworzy wąskie gardła ze względu na złożoność i objętość danych. Ten oparty na języku R przepływ pracy umożliwia szybką, powtarzalną i ilościową analizę wysokoprzepustowych testów biologicznych, wspierając rzetelną walidację celów oraz ograniczanie ryzyka mechanistycznego. Poprzez obniżenie barier technicznych, pozwala on zespołom interdyscyplinarnym na generowanie praktycznych wniosków i przyspieszenie podejmowania decyzji dotyczących portfela projektów.
Ta metoda analizy oparta na języku R integruje się płynnie z procesami początkowego odkrywania, poprzez identyfikację związków wiodących i badania przedkliniczne, szczególnie w przypadku szeregów czasowych oraz wysokoprzepustowych testów płytkowych.