Method Article

Bazy danych do efektywnego zarządzania średniej wielkości, wielowymiarowymi danymi o niskiej prędkości w inżynierii tkankowej

DOI:

10.3791/60038

November 22nd, 2019

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wielu badaczy generuje dane "średniej wielkości", o niskiej prędkości i wielowymiarowe, które mogą być efektywniej zarządzane za pomocą baz danych niż arkuszy kalkulacyjnych. W tym miejscu przedstawiono koncepcyjny przegląd baz danych, w tym wizualizację danych wielowymiarowych, łączenie tabel w strukturach relacyjnych baz danych, mapowanie półautomatycznych potoków danych i używanie bazy danych do wyjaśniania znaczenia danych.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nauka opiera się na coraz bardziej złożonych zestawach danych dla postępu, ale powszechne metody zarządzania danymi, takie jak programy do arkuszy kalkulacyjnych, są nieodpowiednie dla rosnącej skali i złożoności tych informacji. Chociaż systemy zarządzania bazami danych mają potencjał, aby rozwiązać te problemy, nie są one powszechnie wykorzystywane poza dziedzinami biznesu i informatyki. Jednak wiele laboratoriów badawczych już teraz generuje "średniej wielkości", wielowymiarowe dane o niskiej prędkości, które mogłyby odnieść znaczne korzyści z wdrożenia podobnych systemów. W tym artykule przedstawiamy przegląd koncepcyjny wyjaśniający, jak działają bazy danych i jakie korzyści zapewniają w zastosowaniach inżynierii tkankowej. Dane dotyczące strukturalnych fibroblastów od osób z mutacją laminy A/C wykorzystano do zilustrowania przykładów w określonym kontekście eksperymentalnym. Przykłady obejmują wizualizację danych wielowymiarowych, łączenie tabel w strukturze relacyjnej bazy danych, mapowanie półautomatycznego potoku danych w celu konwertowania nieprzetworzonych danych na ustrukturyzowane formaty oraz wyjaśnianie podstawowej składni zapytania. Wyniki analizy danych wykorzystano do stworzenia wykresów o różnym układzie i wykazano znaczenie w organizacji komórek w wyrównanych środowiskach między pozytywną kontrolą progerii Hutchinsona-Gilforda, dobrze znaną laminopatią, a wszystkimi innymi grupami eksperymentalnymi. W porównaniu z arkuszami kalkulacyjnymi, metody baz danych były niezwykle efektywne czasowo, proste w użyciu po skonfigurowaniu, pozwalały na natychmiastowy dostęp do oryginalnych lokalizacji plików i zwiększały rygor danych. W odpowiedzi na nacisk National Institutes of Health (NIH) na rygor eksperymentalny, jest prawdopodobne, że wiele dziedzin naukowych ostatecznie przyjmie bazy danych jako powszechną praktykę ze względu na ich silną zdolność do skutecznego organizowania złożonych danych.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W erze, w której postęp naukowy jest silnie napędzany przez technologię, przetwarzanie dużych ilości danych stało się integralnym aspektem badań we wszystkich dyscyplinach. Pojawienie się nowych dziedzin, takich jak biologia obliczeniowa i genomika, podkreśla, jak ważne stało się proaktywne wykorzystanie technologii. Tendencje te z pewnością będą kontynuowane ze względu na prawo Moore'a i stały postęp wynikający z postępu technologicznego1,2. Jedną z konsekwencji jest jednak rosnąca ilość generowanych danych, które przekraczają możliwości dotychczas opłacalnych metod organizacji. Chociaż większość laboratoriów akademickich dysponuje wystarczającymi zasobami obliczeniowymi do obsługi złożonych zestawów danych, wielu grupom brakuje wiedzy technicznej niezbędnej do konstruowania niestandardowych systemów dostosowanych do potrzeb deweloperskich3. Posiadanie umiejętności zarządzania takimi zestawami danych i ich aktualizowania ma kluczowe znaczenie dla wydajnego przepływu pracy i wydajności. Wypełnienie luki między danymi a wiedzą specjalistyczną jest ważne dla efektywnej obsługi, ponownego aktualizowania i analizowania szerokiego spektrum danych wieloaspektowych.

Skalowalność jest istotnym czynnikiem przy obsłudze dużych zbiorów danych. Na przykład Big Data to kwitnący obszar badań, który polega na ujawnianiu nowych spostrzeżeń z przetwarzania danych charakteryzujących się ogromnymi ilościami, dużą heterogenicznością i wysokimi wskaźnikami generowania, takimi jak audio i wideo4,5. Korzystanie ze zautomatyzowanych metod organizacji i analizy jest obowiązkowe w tym polu, aby odpowiednio obsługiwać potoki danych. Wiele terminów technicznych używanych w danych big data nie jest jednak jasno zdefiniowanych i może być mylących; Na przykład dane "o dużej prędkości" są często powiązane z milionami nowych wpisów dziennie, podczas gdy dane "o niskiej prędkości" mogą obejmować tylko setki wpisów dziennie, na przykład w laboratorium akademickim. Chociaż istnieje wiele ekscytujących odkryć, które nie zostały jeszcze odkryte przy użyciu dużych zbiorów danych, większość laboratoriów akademickich nie wymaga zakresu, mocy i złożoności takich metod do rozwiązywania własnych problemów naukowych5. Chociaż nie ulega wątpliwości, że dane naukowe stają się z czasem coraz bardziej złożone6, wielu naukowców nadal korzysta z metod organizacji, które nie spełniają już ich rosnących potrzeb w zakresie danych. Na przykład wygodne programy do obsługi arkuszy kalkulacyjnych są często używane do organizowania danych naukowych, ale kosztem tego, że są nieskalowalne, podatne na błędy i nieefektywne czasowo na dłuższą metę7,8. Z drugiej strony, bazy danych są skutecznym rozwiązaniem tego problemu, ponieważ są skalowalne, stosunkowo tanie i łatwe w użyciu w obsłudze zróżnicowanych zestawów danych trwających projektów.

Bezpośrednie problemy, które pojawiają się podczas rozważania schematów organizacji danych, to koszty, dostępność i czas zainwestowany w szkolenie i użytkowanie. Często używane w środowisku biznesowym programy baz danych są bardziej ekonomiczne, ponieważ są albo stosunkowo niedrogie, albo bezpłatne, niż fundusze wymagane do wspierania korzystania z systemów dużych zbiorów danych. W rzeczywistości istnieje wiele zarówno dostępnych na rynku, jak i otwartych programów do tworzenia i utrzymywania baz danych, takich jak Oracle Database, MySQL i Microsoft (MS) Access9. Wielu badaczy byłoby również zachęconych do dowiedzenia się, że kilka pakietów akademickich MS Office jest dostarczanych z MS Access, co jeszcze bardziej minimalizuje koszty. Co więcej, prawie wszyscy programiści udostępniają obszerną dokumentację online i istnieje mnóstwo bezpłatnych zasobów online, takich jak Codecademy, W3Schools i SQLBolt, które pomagają badaczom zrozumieć i wykorzystać strukturalny język zapytań (SQL)10,11,12. Jak w przypadku każdego języka programowania, opanowanie nauki korzystania z baz danych i kodu za pomocą SQL wymaga czasu, ale dzięki dużym dostępnym zasobom proces ten jest prosty i wart zainwestowanego wysiłku.

Bazy danych mogą być potężnymi narzędziami zwiększającymi dostępność danych i łatwość ich agregacji, ale ważne jest, aby rozpoznać, które dane najbardziej skorzystałyby na większej kontroli nad organizacją. Wielowymiarowość odnosi się do liczby warunków, według których można pogrupować pomiar, a bazy danych są najbardziej wydajne w przypadku zarządzania wieloma różnymi warunkami13. I odwrotnie, informacje o niskiej wymiarowości są najłatwiejsze do obsługi za pomocą programu do obsługi arkuszy kalkulacyjnych; Na przykład zestaw danych zawierający lata i wartość dla każdego roku ma tylko jedno możliwe grupowanie (pomiary względem lat). Dane wielowymiarowe, takie jak dane z warunków klinicznych, wymagałyby dużego stopnia ręcznej organizacji w celu skutecznego utrzymania, co jest żmudnym i podatnym na błędy procesem wykraczającym poza zakres programów arkuszy kalkulacyjnych13. Nierelacyjne bazy danych (NoSQL) również spełniają różne role, przede wszystkim w aplikacjach, w których dane nie są dobrze zorganizowane w wiersze i kolumny14. Oprócz tego, że są często open source, te schematy organizacyjne obejmują skojarzenia graficzne, dane szeregów czasowych lub dane oparte na dokumentach. NoSQL wyróżnia się skalowalnością lepiej niż SQL, ale nie może tworzyć złożonych zapytań, więc relacyjne bazy danych są lepsze w sytuacjach, które wymagają spójności, standaryzacji i rzadkich zmian danych na dużą skalę15. Bazy danych najlepiej radzą sobie z efektywnym grupowaniem i aktualizacją danych w szeroki wachlarz zgodności, często potrzebnych w środowisku naukowym13,16.

Głównym celem tej pracy jest zatem poinformowanie społeczności naukowej o potencjale baz danych jako skalowalnych systemów zarządzania danymi dla "średniej wielkości", niskiej prędkości danych, a także dostarczenie ogólnego szablonu z wykorzystaniem konkretnych przykładów eksperymentów z liniami komórkowymi pozyskiwanymi przez pacjentów. Inne podobne zastosowania obejmują dane geoprzestrzenne koryt rzek, kwestionariusze z podłużnych badań klinicznych oraz warunki wzrostu drobnoustrojów w podłożach wzrostowych17,18,19. W tej pracy przedstawiono typowe zagadnienia i użyteczność konstruowania bazy danych w połączeniu z potokiem danych niezbędnym do konwersji surowych danych na ustrukturyzowane formaty. Podstawy interfejsów bazodanowych i kodowania baz danych w języku SQL są podane i zilustrowane przykładami, aby umożliwić innym zdobycie wiedzy mającej zastosowanie do budowania podstawowych frameworków. Wreszcie, przykładowy zestaw danych eksperymentalnych pokazuje, jak łatwo i skutecznie można projektować bazy danych do agregowania danych wieloaspektowych na różne sposoby. Informacje te zawierają kontekst, komentarz i szablony, które pomagają innym naukowcom na drodze do wdrożenia baz danych na potrzeby ich własnych eksperymentów.

W celu stworzenia skalowalnej bazy danych w laboratorium badawczym, dane z eksperymentów z użyciem ludzkich komórek fibroblastów zostały zebrane w ciągu ostatnich trzech lat. Głównym celem tego protokołu jest raportowanie organizacji oprogramowania komputerowego, aby umożliwić użytkownikowi agregowanie, aktualizowanie i zarządzanie danymi w sposób możliwie najbardziej efektywny kosztowo i czasowo, ale odpowiednie metody eksperymentalne są również dostarczane dla kontekstu.

Konfiguracja eksperymentalna
Eksperymentalny protokół przygotowania próbek został opisany wcześniej20,21, i jest krótko przedstawiony tutaj. Konstrukty przygotowano poprzez wirowanie prostokątnych szklanych szkiełek nakrywkowych mieszaniną polidimetylosiloksanu (PDMS) i utwardzacza w proporcji 10:1, a następnie nałożenie 0,05 mg/ml fibronektyny w liniach niezorganizowanych (izotropowych) lub 20 μm z mikrowzorami (liniami) w odstępach 5 μm. Komórki fibroblastów wysiewano w pasażu 7 (lub pasażu 16 w przypadku kontroli pozytywnych) na szkiełkach nakrywkowych w optymalnej gęstości i pozostawiono do wzrostu na 48 godzin, przy czym pożywkę zmieniano po 24 godzinach. Komórki następnie utrwalono za pomocą 4% roztworu paraformaldehydu (PFA) i 0,0005% niejonowego środka powierzchniowo czynnego, a następnie szkiełka nakrywkowe wybarwiono immunologicznie pod kątem jąder komórkowych (4',6'-diaminodino-2-fenyloodol [DAPI]), aktyny (falloidyna Alexa Fluor 488) i fibronektyny (poliklonalna królicza anty-ludzka fibronektyna). Zastosowano wtórne barwienie fibronektyny przy użyciu kozich przeciwciał anty-króliczych IgG (Alexa Fluor 750 kozioł anty-królik), a środek konserwujący został umieszczony na wszystkich szkiełkach nakrywkowych, aby zapobiec blaknięciu fluorescencji. Lakier do paznokci został użyty do uszczelnienia szkiełek nakrywkowych na szkiełkach mikroskopowych, a następnie pozostawiony do wyschnięcia na 24 godziny.

Obrazy fluorescencji uzyskano zgodnie z wcześniejszym opisem20 przy użyciu 40-krotnego obiektywu immersyjnego w oleju sprzężonego z kamerą z cyfrowym urządzeniem sprzężonym z ładunkiem (CCD) zamontowanym na odwróconym mikroskopie z napędem. Dziesięć losowo wybranych pól widzenia zostało zobrazowanych dla każdego szkiełka nakrywkowego w 40-krotnym powiększeniu, co odpowiada rozdzielczości 6,22 piksela/μm. Do ilościowego określenia różnych zmiennych z obrazów opisujących jądra, włókna aktyny i fibronektynę wykorzystano specjalnie napisane kody; Odpowiednie wartości, a także parametry organizacji i geometrii zostały automatycznie zapisane w plikach danych.

Linie komórkowe
Bardziej obszerną dokumentację na temat wszystkich linii komórkowych z próbkami danych można znaleźć we wcześniejszych publikacjach20. Krótko mówiąc, zbieranie danych zostało zatwierdzone, a świadoma zgoda została przeprowadzona zgodnie z UC Irvine Institutional Review Board (IRB # 2014-1253). Ludzkie komórki fibroblastów pobrano z trzech rodzin o różnych wariantach mutacji genu laminy A/C (LMNA): heterozygotyczna mutacja w miejscu splicingu LMNA (c.357-2A>G)22 (rodzina A); Mutacja nonsensowna LMNA (c.736 C>T, pQ246X) w eksonie 423 (rodzina B); oraz mutacja typu missense LMNA (c.1003C>T, pR335W) w eksonie 624 (rodzina C). Komórki fibroblastów pobrano również od innych osób w każdej rodzinie jako powiązane kontrole ujemne mutacji, określane jako "kontrole", a inne zakupiono jako niepowiązane kontrole ujemne mutacji, określane jako "dawcy". Jako kontrolę pozytywną, komórki fibroblastów od osoby z progerią Hutchinsona-Gliforda (HGPS) zostały zakupione i wyhodowane z biopsji skóry pobranej od 8-letniej pacjentki z HGPS posiadającej mutację punktową LMNA G608G25. W sumie przebadano fibroblasty od 22 osób i wykorzystano je jako dane w tej pracy.

Typy danych
Dane dotyczące fibroblastów należały do jednej z dwóch kategorii: zmienne jąder komórkowych (tj. procent jąder dysmorficznych, obszar jąder, mimośród jąder)20 lub zmienne strukturalne wynikające z parametru kolejności orientacyjnej (OOP)21,26,27 (tj. aktyna OOP, fibronektyna OOP, jądra OOP). Parametr ten jest równy maksymalnej wartości własnej tensora średniego rzędu wszystkich wektorów orientacji i jest szczegółowo zdefiniowany w poprzednich publikacjach26,28. Wartości te są agregowane w różne możliwe konformacje, takie jak wartości w stosunku do wieku, płci, statusu choroby, obecności pewnych objawów itp. Przykłady wykorzystania tych zmiennych można znaleźć w sekcji wyników.

Przykładowe kody i pliki
Przykładowe kody i inne pliki oparte na powyższych danych można pobrać wraz z tym artykułem, a ich nazwy i typy podsumowano w Tabeli 1.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

UWAGA: Zobacz Tabelę Materiałów, aby zapoznać się z wersjami oprogramowania używanymi w tym protokole.

1. Oceń, czy dane skorzystałyby na schemacie organizacji bazy danych

  1. Pobierz przykładowe kody i bazy danych (patrz Uzupełniające pliki kodowania, które podsumowano w Tabeli 1).
  2. Użyj Rysunek 1, aby ocenić, czy interesujący nas zestaw danych jest "wielowymiarowy".
    UWAGA: Rysunek 1 to graficzna reprezentacja wielowymiarowej bazy danych dostarczonej dla przykładowego zestawu danych.
  3. Jeśli dane mogą być wizualizowane w "wielowymiarowej" formie, takiej jak w przykładzie, i jeśli możliwość powiązania określonego wyniku eksperymentu z dowolnym z wymiarów (tj. warunków) pozwoliłaby na większy naukowy wgląd w dostępne dane, przystąp do konstruowania relacyjnej bazy danych.

2. Uporządkuj strukturę bazy danych

UWAGA: Relacyjne bazy danych przechowują informacje w formie tabel. Tabele są zorganizowane w schemacie wierszy i kolumn, podobnie jak arkusze kalkulacyjne, i mogą być używane do łączenia informacji identyfikujących w bazie danych.

  1. Uporządkuj pliki danych tak, aby miały dobrze przemyślane, unikalne nazwy. Dobre praktyki dotyczące konwencji nazewnictwa plików i struktur folder-podfoldery, jeśli są dobrze wykonane, pozwalają na szeroką skalowalność bazy danych bez uszczerbku dla czytelności ręcznego uzyskiwania dostępu do plików. Jednym z takich przykładów jest dodawanie plików dat w spójnym formacie, takim jak "20XX-YY-ZZ" i nazywanie podfolderów zgodnie z metadanymi.
  2. Podczas projektowania struktury bazy danych należy rysować relacje między polami w różnych tabelach. W związku z tym wielowymiarowość jest obsługiwana przez powiązanie ze sobą różnych pól (tj. kolumn w tabelach) w poszczególnych tabelach.
  3. Utwórz dokumentację readme opisującą bazę danych i relacje, które zostały utworzone w kroku 2.2. Po połączeniu wpisu między różnymi tabelami wszystkie skojarzone informacje są powiązane z tym wpisem i mogą być używane do wywoływania złożonych zapytań w celu filtrowania do żądanych informacji.
    UWAGA: Dokumenty Readme są powszechnym rozwiązaniem służącym do dostarczania informacji uzupełniających i informacji strukturalnych bazy danych o projekcie bez dodawania niejednolitych danych do struktury.
  4. Wykonując kroki 2.1−2.3, ustanów wynik końcowy podobny do tego przykładu, w którym różne cechy osobników (Rysunek 2A) są powiązane z powiązanymi danymi eksperymentalnymi tych osób (Rysunek 2B). To samo zostało zrobione poprzez powiązanie kolumn typów wzorców (Rysunek 2C) i typów danych (Rysunek 2D) z pasującymi wpisami w głównej tabeli wartości danych w celu wyjaśnienia różnych skrótów (Rysunek 2B).
  5. Określ wszystkie niezbędne i jedynie pomocne punkty danych, które należy zarejestrować w celu zbierania danych z dużej odległości.
    UWAGA: Kluczową zaletą korzystania z baz danych w porównaniu z programami do obsługi arkuszy kalkulacyjnych, jak wspomniano wcześniej, jest skalowalność: dodatkowe punkty danych można trywialnie dodać w dowolnym momencie, a obliczenia, takie jak średnie, są natychmiast aktualizowane w celu odzwierciedlenia nowo dodanych punktów danych.
    1. Zidentyfikuj informacje niezbędne do utworzenia odrębnych punktów danych przed rozpoczęciem. Pozostaw surowe dane nietknięte, zamiast modyfikować je lub zapisywać, aby ponowna analiza była możliwa i dostępna.
      UWAGA: Dla podanego przykładu (Rysunek 2), "Desygnator" odpowiadający osobie, "Typ wzoru", "Szkiełko nakrywkowe #" i "Typ zmiennej" były kluczowymi polami dla odrębności powiązanej wartości.
    2. W razie potrzeby dodaj inne, pomocne, nieistotne informacje, takie jak "Całkowita liczba # szkiełek nakrywkowych", aby wskazać liczbę przeprowadzonych powtórzeń i pomóc określić, czy w tym przykładzie brakuje punktów danych.

3. Konfiguracja i organizacja rurociągu

  1. Zidentyfikuj wszystkie różne eksperymenty i metody analizy danych, które mogą prowadzić do zbierania danych, wraz z normalnymi praktykami przechowywania danych dla każdego typu danych. Pracuj z oprogramowaniem do kontroli wersji typu open source, takim jak GitHub, aby zapewnić niezbędną spójność i kontrolę wersji, jednocześnie minimalizując obciążenie użytkowników.
  2. Jeśli to możliwe, utwórz procedurę spójnego nazewnictwa i przechowywania danych, aby umożliwić zautomatyzowany potok.
    UWAGA: W tym przykładzie wszystkie dane wyjściowe miały spójne nazwy, dzięki czemu utworzenie potoku danych, który szukał określonych atrybutów, było proste po wybraniu plików. Jeśli spójne nazewnictwo nie jest możliwe, tabele w bazie danych będą musiały zostać wypełnione ręcznie, co nie jest zalecane.
  3. Użyj dowolnego wygodnego języka programowania, aby wygenerować nowe wpisy danych dla bazy danych.
    1. Utwórz małe tabele "pomocnicze" (pliki #8−#10 w Tabeli 1) w oddzielnych plikach, które mogą kierować automatycznym wyborem danych. Pliki te służą jako szablon możliwości, w ramach których potok może działać, i są łatwe do edycji.
    2. Aby wygenerować nowe wpisy danych dla potoku danych (Rysunek 3D), zaprogramuj kod (LocationPointer.m, plik #1 w Tabeli 1) tak, aby używał tabel pomocniczych jako danych wejściowych do wyboru przez użytkownika (pliki #8−#10 w Tabeli 1).
    3. W tym miejscu utwórz nowy arkusz kalkulacyjny z lokalizacjami plików, łącząc nowe wpisy z poprzednimi wpisami (Rysunek 3E). Utwórz kod, aby zautomatyzować ten krok, jak pokazano w LocationPointerCompile.m (plik #2 w tabeli 1).
    4. Następnie sprawdź, czy w tym scalonym arkuszu kalkulacyjnym nie ma duplikatów, które powinny zostać automatycznie usunięte. Utwórz kod, aby zautomatyzować ten krok, jak pokazano w LocationPointer_Remove_Duplicates.m (plik #3 w tabeli 1).
    5. Dodatkowo sprawdź arkusz kalkulacyjny pod kątem błędów i powiadom użytkownika o ich przyczynie i lokalizacji (Rysunek 3F). Utwórz kod, aby zautomatyzować ten krok, jak pokazano w BadPointerCheck.m (plik #4 w tabeli 1). Alternatywnie napisz kod, który sprawdzi skompilowaną bazę danych i zidentyfikuje duplikaty w jednym kroku, jak pokazano w LocationPointer_Check.m (plik #5 w Tabeli 1).
    6. Utwórz kod, który pozwoli użytkownikowi ręcznie usunąć uszkodzone punkty bez utraty integralności bazy danych, jak pokazano w Manual_Pointer_Removal.m (plik #6 w tabeli 1).
    7. Następnie użyj lokalizacji plików, aby wygenerować arkusz kalkulacyjny wartości danych (Rysunek 3G, plik #12 w Tabeli 1), a także utworzyć najbardziej aktualną listę wpisów, do których można uzyskać dostęp w celu zidentyfikowania lokalizacji plików lub scalenia z przyszłymi wpisami (Rysunek 3H). Utwórz kod, aby zautomatyzować ten krok, jak pokazano w Database_Generate.m (plik #7 w tabeli 1).
  4. Dokładnie sprawdź, czy potok zwiększa rygor eksperymentalny, sprawdzając, czy nie ma dołączenia rygorystycznych konwencji nazewnictwa, zautomatyzowanych kodów zestawów plików i automatycznych kontroli błędów, jak opisano wcześniej.

4. Tworzenie bazy danych i zapytań

UWAGA: Jeśli tabele przechowują informacje w bazach danych, to zapytania są żądaniami do bazy danych o informacje podane według określonych kryteriów. Istnieją dwie metody tworzenia bazy danych: zaczynając od pustego dokumentu lub zaczynając od istniejących plików. Rysunek 4 przedstawia przykładowe zapytanie wykorzystujące składnię SQL, które zostało zaprojektowane do uruchomienia przy użyciu relacji bazy danych pokazanych w Rysunek 2.

  1. Metoda 1: Zaczynanie od zera w tworzeniu bazy danych i zapytań
    1. Utwórz pusty dokument bazy danych.
    2. Załaduj tabele pomocnicze (pliki #8−#10 w tabeli 1), wybierając pozycję Dane zewnętrzne | Import plików tekstowych | Wybierz Plik (pliki #8−#10) | Rozdzielany | Pierwszy wiersz zawiera nagłówki, przecinek | Pozostaw domyślne | Wybierz mój własny klucz podstawowy (desygnator dla pliku linii komórkowych #8, nazwa zmiennej dla pliku typów danych #9, nazwa wzorca dla pliku typu wzorca #10) | Pozostaw domyślne | Koniec.
    3. Załaduj tabelę wartości danych (plik #12 w tabeli 1), wybierając pozycję Dane zewnętrzne | Import plików tekstowych | Wybierz Plik (plik #12) | Rozdzielany | Pierwszy wiersz zawiera nagłówki, przecinek | Pozostaw domyślne | Zezwalaj na dostęp Dodawanie klucza podstawowego | Importuj do tabeli: DataValues | Koniec.
    4. Utwórz relacje, wybierając pozycję Narzędzia bazy danych | Relacje | Przeciągnij wszystkie tabele na tablicę | Edytowanie relacji | Utwórz nowy | Dopasowywanie pól DataValue do oznaczeń tabel pomocniczych | Typ złącza 3.
    5. Wybierz pozycję Utwórz | Projekt zapytania.
    6. Zaznacz lub przeciągnij wszystkie odpowiednie tabele do górnego okna. W tym przykładzie "Linie komórkowe", "Wartości danych", "Typy danych" i "Typ wzorca". Relacje powinny być automatycznie konfigurowane na podstawie poprzedniego projektu relacji.
    7. Wypełnij kolumny zapytania, aby uzyskać żądane wyniki, na przykład:
      1. Kliknij Pokaż | Sumy.
      2. Wypełnij pierwszą kolumnę (Tabela: WartościDanych, Pole: Zmienna danych, Suma: Grupuj według, Kryteria: "Act_OOP"), drugą kolumnę (Tabela: WartościDanych, Pole: Zmienna wzorcowa, Suma: Grupuj według, Kryteria: "Linie") i trzecią kolumnę (Tabela: Cell_Lines, Pole: Desygnator, Suma: Grupuj według, Sortuj: rosnąco).
      3. Wypełnij czwartą kolumnę (Tabela: WartościDane, Pole: Parametr, Suma: Ave), piątą kolumnę (Tabela: WartościDane, Pole: Parametr, Suma: Odchylenie odchylenia) i szóstą kolumnę (Tabela: WartościDanych, Pole: Parametr, Suma: Liczba).
    8. Uruchom zapytanie.
  2. Alternatywnie możesz użyć podanej przykładowej bazy danych jako podstawy dla przykładów. Otwórz plik bazy danych Database_Queries.accdb (plik #13 w tabeli 1), który został pobrany wcześniej. Użyj go jako szablonu, zastępując istniejące tabele interesującymi Cię danymi.

5. Przenieś tabele wyników do oprogramowania statystycznego w celu analizy istotności

  1. W przypadku tych przykładowych danych eksperymentalnych należy użyć jednokierunkowej analizy wariancji (ANOVA) przy użyciu testu Tukeya do średnich porównań między różnymi warunkami.
    UWAGA: Wartości p < 0,05 uznano za istotne statystycznie.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wielowymiarowość danych
W kontekście przedstawionego tutaj przykładowego zestawu danych, badani, opisani w sekcji Metody, zostali podzieleni na grupy osób z trzech rodzin z mutacją LMNA powodującą chorobę serca ("Pacjenci"), powiązanych kontroli ujemnych niezwiązanych z mutacją ("Kontrole"), niepowiązanych kontroli ujemnych niezwiązanych z mutacją ("Dawcy") oraz osoby z zespołem progerii Hutchinsona-Gilforda (HGPS) jako kontrolę pozytywną20. Wyniki z grupy kontrolnej ...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Techniczna dyskusja na temat protokołu
Pierwszym krokiem przy rozważaniu wykorzystania baz danych jest ocena, czy dane skorzystałyby na takiej organizacji.

Kolejnym niezbędnym krokiem jest stworzenie zautomatyzowanego kodu, który poprosi użytkownika o minimalne dane wejściowe i wygeneruje strukturę danych tabeli. W tym przykładzie użytkownik wprowadził kategorię typu danych (jądra komórkowe lub pomiary strukturalne), oznaczenie tematu linii komórkowych oraz liczbę wybiera...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do ujawnienia.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ta praca jest wspierana przez Narodowy Instytut Serca, Płuc i Krwi w Narodowym Instytucie Zdrowia, grant numer R01 HL129008. Autorzy szczególnie dziękują członkom rodziny z mutacją genu LMNA za udział w badaniu. Chcielibyśmy również podziękować Lindzie McCarthy za jej pomoc w hodowli komórek i utrzymaniu przestrzeni laboratoryjnych, Nasamowi Chokrowi za jej udział w obrazowaniu komórek i analizie danych jądrowych oraz Michaelowi A. Grosbergowi za jego trafne porady dotyczące konfiguracji naszej początkowej bazy danych Microsoft Access, a także za odpowiedzi na inne pytania techniczne.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
4',6'-diaminodino-2-fenylonolol (DAPI)Life Technologies, Karlowe Wary, Kalifornia
Alexa Fluor 488 PhalloidinLife Technologies, Carlsbad, Kalifornia
Alexa Fluor 750 kozia anty-królikLife Technologies, Carlsbad, Kalifornia
cyfrowa kamera CCD ORCAR2 C10600-10BHamamatsu Photonics, Prefektura Shizuoka, Japonia
fibronektynaCorning, Corning, Nowy Jork
Odwrócony mikroskop zmotoryzowany IX-83Olympus America, Center Valley, PA
Matlab R2018bMathworks, Natick, MA
MS AccessMicrosoft, Redmond, WA
paraformaldehyd (PFA)Fisher Scientific Company, Hanover Park, IL
poliklonalna królik anty-ludzka fibronektynaSigma Aldrich Inc., Saint Louis, MO
polidimetylosiloksan (PDMS)Ellsworth Adhesives, Germantown, WI
Prolong Gold AntifadeLife Technologies, Carlsbad, CA
prostokątne szklane szkiełka nakrywkoweFisher Scientific Company, Hanover Park, IL
Triton-XSigma Aldrich Inc. , Saint Louis, MO

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Cavin, R. K., Lugli, P., Zhirnov, V. V. Science and engineering beyond Moore's law. Proceedings of the IEEE. 100, Special Centennial Issue 1720-1749 (2012).
  2. Mast, F. D., Ratushny, A. V., Aitchison, J. D. Systems cell biology. The Journal of Cell Biology. 206 (6), 695-706 (2014).
  3. Barone, L., Williams, J., Micklos, D. Unmet needs for analyzing biological big data: A survey of 704 NSF principal investigators. PLoS Computational Biology. 13 (10), 1005755(2017).
  4. Gandomi, A., Haider, M. Beyond the hype: Big data concepts, methods, and analytics. International Journal of Information Management. 35 (2), 137-144 (2015).
  5. Siddiqa, A., et al. A survey of big data management: Taxonomy and state-of-the-art. Journal of Network and Computer Applications. 71, 151-166 (2016).
  6. Anderson, C. The End of Theory: The Data Deluge Makes the Scientific Method Obsolete. Wired Magazine. , (2008).
  7. Broman, K. W., Woo, K. H. Data Organization in Spreadsheets. The American Statistician. 72 (1), 2-10 (2018).
  8. Lee, H., et al. How I do it: a practical database management system to assist clinical research teams with data collection, organization, and reporting. Academic Radiology. 22 (4), 527-533 (2015).
  9. Bassil, Y. A comparative study on the performance of the Top DBMS systems. Journal of Computer Science & Research. 1 (1), 20-31 (2012).
  10. Learn SQL - Codeacademy. , Available from: https://www.codecademy.com/learn/learn-sql (2018).
  11. SQL Tutorial - w3schools.com. , Available from: https://www.w3schools.com/sql (2018).
  12. Introduction to SQL - SQLBolt. , Available from: https://sqlbolt.com (2018).
  13. Pedersen, T. B., Jensen, C. S. Multidimensional database technology. Computer. 34 (12), 40-46 (2001).
  14. Győrödi, C., Gyorodi, R., Sotoc, R. A Comparative Study of Relational and Non-Relational Database Models in a Web- Based Application. International Journal of Advanced Computer Science and Applications. 6 (11), 78-83 (2015).
  15. Nayak, A., Poriya, A., Poojary, D. Type of NOSQL databases and its comparison with relational databases. International Journal of Applied Information Systems. 5 (4), 16-19 (2013).
  16. Lei, C., Feng, D., Wei, C., Ai-xin, Z., Zhen-hu, C. The application of multidimensional data analysis in the EIA database of electric industry. Procedia Environmental Sciences. 10, 1210-1215 (2011).
  17. Soranno, P. A., et al. Building a multi-scaled geospatial temporal ecology database from disparate data sources: fostering open science and data reuse. GigaScience. 4, 28(2015).
  18. Edwards, P. Questionnaires in clinical trials: guidelines for optimal design and administration. Trials. 11, 2(2010).
  19. Richards, M. A., et al. MediaDB: A Database of Microbial Growth Conditions in Defined Media. PLoS ONE. 9 (8), 103548(2014).
  20. Core, J. Q., et al. Age of heart disease presentation and dysmorphic nuclei in patients with LMNA mutations. PLoS ONE. 12 (11), 0188256(2017).
  21. Drew, N. K., Johnsen, N. E., Core, J. Q., Grosberg, A. Multiscale Characterization of Engineered Cardiac Tissue Architecture. Journal of Biomechanical Engineering. 138 (11), 111003(2016).
  22. Zaragoza, M. V., et al. Exome Sequencing Identifies a Novel LMNA Splice-Site Mutation and Multigenic Heterozygosity of Potential Modifiers in a Family with Sick Sinus Syndrome, Dilated Cardiomyopathy, and Sudden Cardiac Death. PLoS ONE. 11 (5), 0155421(2016).
  23. Zaragoza, M., Nguyen, C., Widyastuti, H., McCarthy, L., Grosberg, A. Dupuytren's and Ledderhose Diseases in a Family with LMNA-Related Cardiomyopathy and a Novel Variant in the ASTE1 Gene. Cells. 6 (4), 40(2017).
  24. Zaragoza, M. V., Hakim, S. A., Hoang, V., Elliott, A. M. Heart-hand syndrome IV: a second family with LMNA-related cardiomyopathy and brachydactyly. Clinical Genetics. 91 (3), 499-500 (2017).
  25. Eriksson, M., et al. Recurrent de novo point mutations in lamin A cause Hutchinson-Gilford progeria syndrome. Nature. 423 (6937), 293-298 (2003).
  26. Drew, N. K., Eagleson, M. A., Baldo, D. B., Parker, K. K., Grosberg, A. Metrics for Assessing Cytoskeletal Orientational Correlations and Consistency. PLoS Computational Biology. 11 (4), 1004190(2015).
  27. Hamley, I. W. Introduction to Soft Matter: Synthetic and Biological Self-Assembling Materials. , John Wiley & Sons. Hoboken, NJ. (2013).
  28. Grosberg, A., Alford, P. W., McCain, M. L., Parker, K. K. Ensembles of engineered cardiac tissues for physiological and pharmacological study: Heart on a chip. Lab Chip. 11 (24), 4165-4173 (2011).
  29. Hey, T., Trefethen, A. The Data Deluge: An e-Science Perspective. Grid Computing: Making the Global Infrastructure a Reality. Berman, F., Fox, G., Hey, A. J. G. , John Wiley & Sons. Hoboken, NJ. Ch. 36 (2003).
  30. Wardle, M., Sadler, M. How to set up a clinical database. Practical Neurology. 16 (1), 70-74 (2016).
  31. Kerr, W. T., Lau, E. P., Owens, G. E., Trefler, A. The future of medical diagnostics: large digitized databases. The Yale Journal of Biology and Medicine. 85 (3), 363(2012).
  32. Laulederkind, S. J., et al. The Rat Genome Database curation tool suite: a set of optimized software tools enabling efficient acquisition, organization, and presentation of biological data. Database. 2011, (2011).
  33. Harris, P. A., et al. Research electronic data capture (REDCap)--a metadata-driven methodology and workflow process for providing translational research informatics support. Journal of Biomedical Informatics. 42 (2), 377-381 (2009).
  34. Panko, R. R. What we know about spreadsheet errors. Journal of Organizational and End User Computing (JOEUC). 10 (2), 15-21 (1998).
  35. Ziemann, M., Eren, Y., El-Osta, A. Gene name errors are widespread in the scientific literature. Genome Biology. 17 (1), 177(2016).
  36. Enhancing Reproducibility through Rigor and Transparency. NIH. , Available from: https://grants.nih.gov/reproducibility/index.htm (2018).
  37. Hofseth, L. J. Getting rigorous with scientific rigor. Carcinogenesis. 39 (1), 21-25 (2017).
  38. SQL Training and Tutorials - Lynda.com. , Available from: https://www.lynda.com/SQL-training-tutorials/446-0.html (2018).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Database ManagementMultidimensional DataTissue EngineeringRelational DatabaseData PipelineQuery DesignFile NamingVersion ControlData VisualizationStatistical Analysis

Related Articles