Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł metodologiczny

Protokół obliczeniowy do ilościowego określenia przesunięć transkryptomowych związanych z artezunatem w tkankach mózgu eksperymentalnej malaria mózgowa z wykorzystaniem DESeq2

75 wyświetleń

DOI:

10.3791/70870

31 lipca 2026

* These authors contributed equally

W tym artykule

Podsumowanie

Doświadczalna malaria mózgowa (ECM) powoduje neuroognisko i dysfunkcję bariery krew–mózg. Korzystając z GSE162535, ten możliwy do powtórzenia przepływ pracy RNA-seq oparty na R porównuje mózg kontrolny (CB), ECM (MB) oraz leczony artezunatem (AB), przeprowadzając analizy QC, PCA i DESeq2. Identyfikuje zmiany transkrypcyjne wywołane ECM i ocenia modulacje ścieżek zapalnych i neuronaczyniowych przez artezunat.

Streszczenie

Sekwencjonowanie RNA (RNA-seq) jest szeroko stosowane do definiowania programów transkrypcyjnych związanych z chorobami, ale wymagane są spójne, kompleksowe przepływy pracy, aby zapewnić wykonalne porównania między grupami eksperymentalnymi i ułatwić biologicznie interpretowalne wyniki. Przedstawiono tu kompletny protokół analizy RNA-seq do oceny zmian transkryptomicznych w mózgu w eksperymentalnym malarii mózgowej (ECM) i po leczeniu artezunatem, przy użyciu publicznego zbioru danych GSE162535. Przepływ pracy analizuje trzy grupy—mózg kontrolny (CB), mózg ECM (MB) i mózg ECM po leczeniu artezunatem (AB)—począwszy od macierzy HTSeq-count. Po zaimportowaniu i sformatowaniu surowych liczb, protokół konstruuje zestaw danych DESeq2 z CB jako poziomem referencyjnym, filtrowuje geny o niskiej liczbie, a następnie przeprowadza kontrolę jakości przy użyciu wizualizacji wielkości biblioteki, analizy głównych składowych i klasteryzacji odległości między próbkami. Następnie obliczana jest różnicowa ekspresja dla trzech głównych kontrastów (MB vs CB, AB vs MB, AB vs CB), z zastosowaniem ściągania log2 fold-change dla stabilnej estymacji wielkości efektu. Protokół eksportuje pełne i istotne tabele różnicowej ekspresji, generuje wykresy wulkanu i wykresy MA oraz produkuje heatmapy najbardziej zmiennych genów i najwyżej sklasyfikowanych różnicowych genów ekspresyjnych dla każdego kontrastu. Aby wspierać interpretację mechanistyczną, przepływ pracy obejmuje ukierunkowane wyciąganie markerów immunologicznych (np. cytokiny, chemiokiny, markery aktywacji mikrogleju, geny BBB/endotelialne) oraz przeprowadza analizy wzbogacania Gene Ontology i KEGG dla istotnie regulowanych w górę i w dół zestawów genów. Ten protokół zapewnia powtarzalny szablon do charakteryzacji neuroinflamatorzych programów transkrypcyjnych związanych z ECM i do ilościowego określania modulacyjnego wpływu artezunatem na te signature.

Wprowadzenie

Cerebralna malaria (CM) jest zabójczym powikłaniem neurologicznym zakażenia Plasmodium falciparum i nadal jest głównym czynnikiem przyczyniającym się do śmiertelności z powodu malarii, mimo postępów w zarządzaniu przypadkami. CM charakteryzuje się ostrą encefalopatią, dysfunkcją mikrokrążenia, aktywacją endotelialną i uszkodzeniem bariery kręgowo-mózgowej (BBB), z poniższą neuroinflamacją, która może prowadzić do śpiączki, a wśród ocalałych, do trwałych neuropoznawczych skutków wtórnych1. Patogeneza CM jest wieloczynnikowa i obejmuje reakcje zapalne żywiciela, współdziałające z czynnikami pochodzenia pasożyta i żywiciela na poziomie neuronaczyniowym, co sprawia, że trudno jest wywnioskować mechanizmy przyczynowe jedynie na podstawie klinicznych punktów końcowych1.

Modele doświadczalnej choroby mózgowej (ECM), w szczególności zakażenie Plasmodium berghei ANKA u myszy C57BL/6, dostarczają łatwego w obsłudze otoczenia do badania immunopatologii specyficznej dla mózgu, uszkodzenia BBB i sygnalizacji neurozapalnej w kontrolowanym środowisku2,3. Modele te zostały wykorzystane do odwzorowania reakcji komórkowych i molekularnych w różnych fazach choroby oraz do testowania uzupełniających interwencji in vivo2,3. Jednakże, patobiologia ECM jest złożona i bardzo dynamiczna, a ukierunkowane testy mogą pominąć zsynchronizowane zmiany na poziomie ścieżek, które występują w wielu programach immunologicznych i neuronaczyniowych.

Artesunian jest zalecaną pierwszoliniową terapią dożylną w przypadku ciężkiej malarii i wykazał znaczącą korzyść w przeżywalności w porównaniu z chininę w kluczowych bazach dowodów4. Chociaż szybkie usuwanie pasożytów jest kluczowym elementem skuteczności artezunianu, wyniki neurologiczne prawdopodobnie odzwierciedlają zarówno redukcję pasożytów, jak i wtórne modulacje dróg zapalnych i neuronaczyniowych1,4. Zrozumienie, jak leczenie artemisininią kształtuje programy transkrypcyjne mózgu podczas ECM, może zatem dostarczyć mechanizmatycznych wglądów uzupełniających dane dotyczące skuteczności klinicznej i może identyfikować kandydatów do ścieżek dla uzupełniających strategii neuroprotekcyjnych.

Sekwencjonowanie RNA (RNA-seq) umożliwia bezstronne, genomowe przefiltrowanie reakcji transkrypcyjnych w stanach chorobowych i leczniczych, wspierając analizę różnic w ekspresji i dalszą interpretację funkcjonalną. Publiczne repozytoria, takie jak NCBI Gene Expression Omnibus (GEO), dostarczają skuratorek zestawów danych, które nadają się do powtarzalnej ponownej analizy, w tym GSE162535, który zawiera sekwencjonowanie RNA mózgu ze sterowanych mózgów (CB), mózgów ECM (MB) i leczonych artezunianem mózgów ECM (AB)5. Aby wspierać powtarzalne odkrycia z takich zestawów danych, wymagane są solidne statystyczne ramy do analizy różnic w ekspresji opartej na liczbie, a narzędzia wzbogacające są potrzebne do interpretacji zmian na poziomie genów w terminach ścieżek i procesów biologicznych.

Niniejsze badanie przedstawia powtarzalny, kompleksowy proces analizy RNA-seq dla tkanki mózgowej w grupach kontrolnych (CB), doświadczalnej choroby mózgowej (MB) i leczonych artezunianem (AB). Nowość tego artykułu polega na znormalizowanym przepływie opartym na DESeq2, włączającym wcześniej zdefiniowane biologicznie istotne kontrasty (MB vs CB, AB vs MB i AB vs CB), rygorystyczne wyniki kontroli jakości (ocena wielkości biblioteki, analiza głównych składowych i mapy cieplne odległości próbek) oraz zintegrowaną interpretację poniżej za pomocą Ontologii Genów (GO) i wzbogacenia ścieżek KEGG przy użyciu clusterProfiler6,7. Dodatkowo, przepływ wdraża strukturalną interpretację opartą na panelu odporności, umożliwiając systematyczną charakterystykę transkrypcyjnych reakcji neurozapalnych, immunologicznych i neuronaczyniowych. Łącząc rygor statystyczny, przejrzystość i gotowe do publikacji wyniki, protokół ten zapewnia solidną i ponownie używalną ramę do analizy dysregulacji transkryptomu związanego z ECM i oceny modulacyjnej leczenia w preklinicznych badaniach nad malarią.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

To badanie wykorzystało publicznie dostępne dane RNA-seq i nie obejmowało żadnych nowych eksperymentów na ludziach lub zwierzętach. Dlatego nie była wymagana zgoda etyczna ani pisemna zgoda na udział w badaniu (Tabela Materiałów).

1. Przygotuj środowisko komputerowe i strukturę folderów

  1. Skonfiguruj sprzęt i system operacyjny
    1. Użyj stacji roboczej lub laptopa z co najmniej 8 GB pamięci RAM (zalecane 16 GB) i ≥10 GB wolnej przestrzeni na dysku do pobierania i zapisywania wyników.
    2. Użyj systemu Windows, macOS lub Linux z uprawnieniami do instalowania pakietów R i zapisywania plików w katalogu roboczym.
  2. Zainstaluj wymagane oprogramowanie
    1. Zainstaluj R (wersja 4.2 lub nowsza). Zainstaluj RStudio Desktop (zalecane) do interaktywnego działania przepływu pracy i zarządzania katalogiem projektu.
  3. Utwórz katalog projektu i foldery wyjściowe
    1. Utwórz nowy folder do analizy (np. GSE162535_RNAseq_DESeq2). Ustaw ten folder jako katalog roboczy R.
    2. Utwórz foldery wyjściowe dokładnie w następujący sposób:
      1. Utwórz results/. Utwórz results/fig/. Utwórz results/tables/.
  4. Zainstaluj wymagane pakiety R
    1. Zainstaluj pakiety CRAN: tidyverse, pheatmap i RColorBrewer. Zainstaluj pakiety Bioconductor: DESeq2, apeglm (opcjonalnie), clusterProfiler i org.Mm.eg.db.
    2. Zaladuj wymagane pakiety na początku skryptu: DESeq2, tidyverse, pheatmap, RColorBrewer, clusterProfiler, org.Mm.eg.db i ggplot2. Ustaw nasiona dla powtarzalności, wykonując set.seed(123).
  5. Zastosuj zabezpieczenia dotyczące integralności i prywatności danych
    1. Przechowywaj pobrane pliki tylko w katalogu projektu. Ogranicz dostęp do katalogu projektu, jeśli środowisko zawiera wrażliwe lub embargowane dane. Rejestruj wersje oprogramowania, eksportując sessionInfo() do results/sessionInfo.txt na końcu przepływu pracy.
      UWAGA: Ten protokół przeprowadza analizę in silico publicznych danych RNA-seq i nie obejmuje obsługi biologicznych próbek.

2. Uzyskaj macierz zliczeń RNA-seq i zdefiniuj grupy eksperymentalne

  1. Pobierz pliki zestawu GEO dla GSE162535
    1. Pobierz plik zliczeń HTSeq dla GSE162535 z GEO i zapisz go w katalogu projektu jako GSE162535_All.HTSeq.counts.txt.gz. Zweryfikuj integralność pliku, potwierdzając, że plik otwiera się bez błędów za pomocą gzfile() i read.delim().
  2. Załaduj zliczenia HTSeq do R
    1. Zaimportuj skompresowaną tabelę zliczeń za pomocą read.delim(gzfile(...), header = TRUE, check.names = FALSE, quote = "", comment.char = ""). Sprawdź zaimportowany obiekt za pomocą str(), head() i colnames(), aby potwierdzić, że:
      1. Pierwsza kolumna zawiera identyfikatory genów (np. AccID). Pozostałe kolumny zawierają zliczenia na poziomie próbek.
  3. Ustandaryzuj typy danych i rozwiąż zduplikowane identyfikatory genów
    1. Zdefiniuj kolumny próbek jako wszystkie kolumny z wyjątkiem kolumny identyfikatora genu (AccID). Przekonwertuj wszystkie kolumny próbek na liczby całkowite. Skumuluj zduplikowane identyfikatory genów poprzez zsumowaniu zliczeń w wierszach o takich samych AccID.
    2. Przekonwertuj skumulowaną tabelę na standardową ramkę danych. Ustaw nazwy wierszy na identyfikator genu i usuń kolumnę identyfikatora z macierzy zliczeń.
  4. Weryfikuj strukturę macierzy zliczeń
    1. Potwierdź, że macierz zliczeń ma 12 kolumn próbek. Potwierdź, że nazwy kolumn próbek są zgodne z formatem AB_1..AB_4, CB_1..CB_4 i MB_1.MB_4.
    2. Zatrzymaj wykonanie, jeśli macierz zliczeń nie ma 12 kolumn.
  5. Utwórz i zweryfikuj metadane próbek
    1. Utwórz tabelę metadan próbek (colData) zawierającą następujące kolumny:
      1. próbka: unikalne identyfikatory próbek odpowiadające nazwom kolumn macierzy zliczeń. grupa: warunek biologiczny przypisany do każdej próbki.
    2. Pobierz odpowiednie adnotacje próbek dla zestawu danych GSE162535 z Gene Expression Omnibus (GEO).
    3. Weryfikuj tożsamość każdej próbki za pomocą informacji o akcesji GEO i pól adnotacji próbek opisujących warunek eksperymentalny. Przemapuj każdy identyfikator próbki w macierzy zliczeń na jego zweryfikowaną adnotację GEO.
    4. Przypisz każdą zweryfikowaną próbkę do jednej z następujących grup: mózg kontrolny (CB), mózg z eksperymentalną malarią mózgu (MB) lub mózg z eksperymentalną malarią mózgu leczony artezunatem (AB).
    5. Uporządkuj tabelę metadan, aby kolejność próbek odpowiadała kolejności kolumn w macierzy zliczeń.
    6. Porównaj identyfik

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Ocena jakości danych i globalna struktura transkryptomiczna

Dane RNA-seq z 12 próbek mózgu (CB, MB, AB; n = 4 na grupę) przetworzono zgodnie ze zstandaryzowanym schematem analizy. Po odfiltrowaniu genów o niskiej liczbie odczytów (≥10 całkowitych odczytów), zbiór danych zachowano do dalszych analiz. Analiza głównych składowych (PCA) dla odczytów przekształconych metodą rlog wykazała rozdzielenie próbek według grup eksperymentalnych, przy czym powtórzenia grupowały się spójnie ...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Niniejsze badanie przedstawia powtarzalny, oparty na DESeq2 przepływ pracy do analizy danych bulk RNA-seq w ramach wstępnie zdefiniowanych kontrastów biologicznych. Protokół integruje standaryzowane przetwarzanie wstępne, zweryfikowanie przypisania metadanych, normalizację, testowanie różnicowej ekspresji oraz uporządkowane wyniki po analizie, umożliwiając konsekwentne i przejrzyste generowanie wyników transkryptomu. Poprzez jasne zdefiniowanie kroków analitycznych i parametrów, przepływ pracy został zaprojektowany w cel...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

  Autorzy nie mają żadnych spornych interesów.

Podziękowania

Autorzy nie mają żadnych uznań.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
clusterProfiler (R package)BioconductorRRID:SCR_016884Funkcjonalna analiza wzbogacania (ścieżki GO i KEGG)
DESeq2 (R package)BioconductorRRID:SCR_015687Analiza różnicowej ekspresji danych RNA-seq opartych na liczbie
ggplot2 (R package)CRANRRID:SCR_014601Wizualizacja wykresów PCA, wykresów wulkanicznych i rysunków podsumowujących
GitHub (opcjonalnie)GitHub Inc.RRID:SCR_002630Kontrola wersji i udostępnianie reproduktywalnych skryptów
HTSeq-count zestaw danych RNA-seq (GSE162535)NCBI Gene Expression Omnibus (GEO)RRID:SCR_005012Macierz liczb RNA-seq używana jako wejście do analizy
matrixStats (R package)CRANRRID:SCR_016361Efektywne obliczanie statystyk wierszy/kolumn (np. wariancja)
openxlsx (R package)CRANRRID:SCR_019215Eksport tabel wyników do formatu Excel
System operacyjnyMicrosoft / Apple / LinuxN/AObsługa Windows 10+, macOS lub Linux
org.Mm.eg.db (R package)BioconductorRRID:SCR_002815Baza danych do analizy genów myszy dla mapowania identyfikatorów genów
Odtwarzacz PDFKażdyN/AWyświetlanie wynikowych rysunków (PCA, heatmaps, wykresy wulkaniczne)
Komputer osobisty lub stacja roboczaKażdyN/AZalecane minimum 16 GB pamięci RAM dla analizy RNA-seq
pheatmap (R package)CRANRRID:SCR_016418Wizualizacja heatmap ekspresji genów i klasteryzacji
R Statistical Software (wersja ≥ 4.2)R Foundation for Statistical ComputingRRID:SCR_001905Główne środowisko obliczeniowe dla całej analizy RNA-seq
RColorBrewer (R package)CRANRRID:SCR_015742Palety kolorów dla heatmap i wykresów
RStudio DesktopPosit SoftwareRRID:SCR_000432Zintegrowane środowisko programistyczne (IDE) dla skryptowania i reproduktywalności
Plik metadanych próbki (format CSV)Wygenerowane / adnotacje GEON/AKuratorskie adnotacje próbek łączące próbki z grupami CB, MB i AB
stringr (R package)CRANRRID:SCR_019195Przetwarzanie ciągów dla wizualizacji i formatowania wzbogacania
tibble (R package)CRANRRID:SCR_019186Obsługa ramek danych i uporządkowane struktury danych
tidyverse (pakiet R)CRANRRID:SCR_019186Manipulacja danymi, transformacja i wizualizacja

Bibliografia

  1. Storm J, Craig AG. Pathogenesis of cerebral malaria—inflammation and cytoadherence. Front Cell Infect Microbiol. 2014;4:100.
  2. Hinduja S, Kunieda M. Modelling of ECM and EDM processes. CIRP Annals. 2013 Jan 1;62(2):775–97.
  3. Soares SMA, Gualberto ACM, da Costa AC, Gonçalves DA, Gameiro J. A high-fat diet protects C57BL/6 mice from Plasmodium berghei ANKA infection in an experimental malaria study. Front Trop Dis. 2023;4:1188902.
  4. Manzoni G, Try R, Guintran JO, Christiansen-Jucht C, Jacoby E, Sovannaroth S, Zhang Z, Banouvong V, Shortus MS, Reyburn R, Chanthavisouk C. Progress towards malaria elimination in the Greater Mekong Subregion: perspectives from the World Health Organization. Malaria Journal. 2024 Mar 1;23(1):64.
  5. Wang Q, Tang Y, Pan Z, Yuan Y, Zou Y, Zhang H, et al. RNA-seq-based transcriptome analysis of the anti-inflammatory effect of artesunate in early treatment of a mouse cerebral malaria model. Mol Omics. 2022;18(8):716–30.
  6. Love MI, Huber W, Anders S. Moderated estimation of fold change and dispersion for RNA-seq data with DESeq2. Genome Biol. 2014;15(12):550.
  7. Anders S, Huber W. Differential expression analysis for sequence count data. Genome Biol. 2010;11(10):R106.
  8. Robinson MD, McCarthy DJ, Smyth GK. edgeR: a Bioconductor package for differential expression analysis of digital gene expression data. bioinformatics. 2010 Jan 1;26(1):139-40.
  9. McCarthy DJ, Chen Y, Smyth GK. Differential expression analysis of multifactor RNA-Seq experiments with respect to biological variation. Nucleic Acids Res. 2012;40(10):4288–97.
  10. Conesa A, Madrigal P, Tarazona S, Gomez-Cabrero D, Cervera A, McPherson A, et al. A survey of best practices for RNA-seq data analysis. Genome Biol. 2016;17:13.
  11. Yu G, Wang LG, Han Y, He QY. clusterProfiler: an R package for comparing biological themes among gene clusters. OMICS. 2012;16(5):284–7.
  12. Hänzelmann S, Castelo R, Guinney J. GSVA: gene set variation analysis for microarray and RNA-seq data. BMC Bioinformatics. 2013 Jan 16;14(1):7.
  13. Shen-Orr SS, Gaujoux R. Computational deconvolution: extracting cell type–specific information from heterogeneous samples. Curr Opin Immunol. 2013;25(5):571–8.
  14. Subramanian A, Tamayo P, Mootha VK, Mukherjee S, Ebert BL, Gillette MA, et al. Gene set enrichment analysis: a knowledge-based approach for interpreting genome-wide expression profiles. Proc Natl Acad Sci U S A. 2005;102(43):15545–50.
  15. Stark R, Grzelak M, Hadfield J. RNA sequencing: the teenage years. Nat Rev Genet. 2019;20(11):631–56.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

Immunologia i zakażenianumer 233numer 233wartość pustanumermasowe sekwencjonowanie RNAanaliza transkryptomicznaneurostan zapalnyleczenie artezunatemróżnicowa ekspresja genówprofilowanie szlaków immunologicznych

Ten artykuł został opublikowany

Film wkrótce dostępny