$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
W erze, w której postęp naukowy jest silnie napędzany przez technologię, przetwarzanie dużych ilości danych stało się integralnym aspektem badań we wszystkich dyscyplinach. Pojawienie się nowych dziedzin, takich jak biologia obliczeniowa i genomika, podkreśla, jak ważne stało się proaktywne wykorzystanie technologii. Tendencje te z pewnością będą kontynuowane ze względu na prawo Moore'a i stały postęp wynikający z postępu technologicznego1,2. Jedną z konsekwencji jest jednak rosnąca ilość generowanych danych, które przekraczają możliwości dotychczas opłacalnych metod organizacji. Chociaż większość laboratoriów akademickich dysponuje wystarczającymi zasobami obliczeniowymi do obsługi złożonych zestawów danych, wielu grupom brakuje wiedzy technicznej niezbędnej do konstruowania niestandardowych systemów dostosowanych do potrzeb deweloperskich3. Posiadanie umiejętności zarządzania takimi zestawami danych i ich aktualizowania ma kluczowe znaczenie dla wydajnego przepływu pracy i wydajności. Wypełnienie luki między danymi a wiedzą specjalistyczną jest ważne dla efektywnej obsługi, ponownego aktualizowania i analizowania szerokiego spektrum danych wieloaspektowych.
Skalowalność jest istotnym czynnikiem przy obsłudze dużych zbiorów danych. Na przykład Big Data to kwitnący obszar badań, który polega na ujawnianiu nowych spostrzeżeń z przetwarzania danych charakteryzujących się ogromnymi ilościami, dużą heterogenicznością i wysokimi wskaźnikami generowania, takimi jak audio i wideo4,5. Korzystanie ze zautomatyzowanych metod organizacji i analizy jest obowiązkowe w tym polu, aby odpowiednio obsługiwać potoki danych. Wiele terminów technicznych używanych w danych big data nie jest jednak jasno zdefiniowanych i może być mylących; Na przykład dane "o dużej prędkości" są często powiązane z milionami nowych wpisów dziennie, podczas gdy dane "o niskiej prędkości" mogą obejmować tylko setki wpisów dziennie, na przykład w laboratorium akademickim. Chociaż istnieje wiele ekscytujących odkryć, które nie zostały jeszcze odkryte przy użyciu dużych zbiorów danych, większość laboratoriów akademickich nie wymaga zakresu, mocy i złożoności takich metod do rozwiązywania własnych problemów naukowych5. Chociaż nie ulega wątpliwości, że dane naukowe stają się z czasem coraz bardziej złożone6, wielu naukowców nadal korzysta z metod organizacji, które nie spełniają już ich rosnących potrzeb w zakresie danych. Na przykład wygodne programy do obsługi arkuszy kalkulacyjnych są często używane do organizowania danych naukowych, ale kosztem tego, że są nieskalowalne, podatne na błędy i nieefektywne czasowo na dłuższą metę7,8. Z drugiej strony, bazy danych są skutecznym rozwiązaniem tego problemu, ponieważ są skalowalne, stosunkowo tanie i łatwe w użyciu w obsłudze zróżnicowanych zestawów danych trwających projektów.
Bezpośrednie problemy, które pojawiają się podczas rozważania schematów organizacji danych, to koszty, dostępność i czas zainwestowany w szkolenie i użytkowanie. Często używane w środowisku biznesowym programy baz danych są bardziej ekonomiczne, ponieważ są albo stosunkowo niedrogie, albo bezpłatne, niż fundusze wymagane do wspierania korzystania z systemów dużych zbiorów danych. W rzeczywistości istnieje wiele zarówno dostępnych na rynku, jak i otwartych programów do tworzenia i utrzymywania baz danych, takich jak Oracle Database, MySQL i Microsoft (MS) Access9. Wielu badaczy byłoby również zachęconych do dowiedzenia się, że kilka pakietów akademickich MS Office jest dostarczanych z MS Access, co jeszcze bardziej minimalizuje koszty. Co więcej, prawie wszyscy programiści udostępniają obszerną dokumentację online i istnieje mnóstwo bezpłatnych zasobów online, takich jak Codecademy, W3Schools i SQLBolt, które pomagają badaczom zrozumieć i wykorzystać strukturalny język zapytań (SQL)10,11,12. Jak w przypadku każdego języka programowania, opanowanie nauki korzystania z baz danych i kodu za pomocą SQL wymaga czasu, ale dzięki dużym dostępnym zasobom proces ten jest prosty i wart zainwestowanego wysiłku.
Bazy danych mogą być potężnymi narzędziami zwiększającymi dostępność danych i łatwość ich agregacji, ale ważne jest, aby rozpoznać, które dane najbardziej skorzystałyby na większej kontroli nad organizacją. Wielowymiarowość odnosi się do liczby warunków, według których można pogrupować pomiar, a bazy danych są najbardziej wydajne w przypadku zarządzania wieloma różnymi warunkami13. I odwrotnie, informacje o niskiej wymiarowości są najłatwiejsze do obsługi za pomocą programu do obsługi arkuszy kalkulacyjnych; Na przykład zestaw danych zawierający lata i wartość dla każdego roku ma tylko jedno możliwe grupowanie (pomiary względem lat). Dane wielowymiarowe, takie jak dane z warunków klinicznych, wymagałyby dużego stopnia ręcznej organizacji w celu skutecznego utrzymania, co jest żmudnym i podatnym na błędy procesem wykraczającym poza zakres programów arkuszy kalkulacyjnych13. Nierelacyjne bazy danych (NoSQL) również spełniają różne role, przede wszystkim w aplikacjach, w których dane nie są dobrze zorganizowane w wiersze i kolumny14. Oprócz tego, że są często open source, te schematy organizacyjne obejmują skojarzenia graficzne, dane szeregów czasowych lub dane oparte na dokumentach. NoSQL wyróżnia się skalowalnością lepiej niż SQL, ale nie może tworzyć złożonych zapytań, więc relacyjne bazy danych są lepsze w sytuacjach, które wymagają spójności, standaryzacji i rzadkich zmian danych na dużą skalę15. Bazy danych najlepiej radzą sobie z efektywnym grupowaniem i aktualizacją danych w szeroki wachlarz zgodności, często potrzebnych w środowisku naukowym13,16.
Głównym celem tej pracy jest zatem poinformowanie społeczności naukowej o potencjale baz danych jako skalowalnych systemów zarządzania danymi dla "średniej wielkości", niskiej prędkości danych, a także dostarczenie ogólnego szablonu z wykorzystaniem konkretnych przykładów eksperymentów z liniami komórkowymi pozyskiwanymi przez pacjentów. Inne podobne zastosowania obejmują dane geoprzestrzenne koryt rzek, kwestionariusze z podłużnych badań klinicznych oraz warunki wzrostu drobnoustrojów w podłożach wzrostowych17,18,19. W tej pracy przedstawiono typowe zagadnienia i użyteczność konstruowania bazy danych w połączeniu z potokiem danych niezbędnym do konwersji surowych danych na ustrukturyzowane formaty. Podstawy interfejsów bazodanowych i kodowania baz danych w języku SQL są podane i zilustrowane przykładami, aby umożliwić innym zdobycie wiedzy mającej zastosowanie do budowania podstawowych frameworków. Wreszcie, przykładowy zestaw danych eksperymentalnych pokazuje, jak łatwo i skutecznie można projektować bazy danych do agregowania danych wieloaspektowych na różne sposoby. Informacje te zawierają kontekst, komentarz i szablony, które pomagają innym naukowcom na drodze do wdrożenia baz danych na potrzeby ich własnych eksperymentów.
W celu stworzenia skalowalnej bazy danych w laboratorium badawczym, dane z eksperymentów z użyciem ludzkich komórek fibroblastów zostały zebrane w ciągu ostatnich trzech lat. Głównym celem tego protokołu jest raportowanie organizacji oprogramowania komputerowego, aby umożliwić użytkownikowi agregowanie, aktualizowanie i zarządzanie danymi w sposób możliwie najbardziej efektywny kosztowo i czasowo, ale odpowiednie metody eksperymentalne są również dostarczane dla kontekstu.
Konfiguracja eksperymentalna
Eksperymentalny protokół przygotowania próbek został opisany wcześniej20,21, i jest krótko przedstawiony tutaj. Konstrukty przygotowano poprzez wirowanie prostokątnych szklanych szkiełek nakrywkowych mieszaniną polidimetylosiloksanu (PDMS) i utwardzacza w proporcji 10:1, a następnie nałożenie 0,05 mg/ml fibronektyny w liniach niezorganizowanych (izotropowych) lub 20 μm z mikrowzorami (liniami) w odstępach 5 μm. Komórki fibroblastów wysiewano w pasażu 7 (lub pasażu 16 w przypadku kontroli pozytywnych) na szkiełkach nakrywkowych w optymalnej gęstości i pozostawiono do wzrostu na 48 godzin, przy czym pożywkę zmieniano po 24 godzinach. Komórki następnie utrwalono za pomocą 4% roztworu paraformaldehydu (PFA) i 0,0005% niejonowego środka powierzchniowo czynnego, a następnie szkiełka nakrywkowe wybarwiono immunologicznie pod kątem jąder komórkowych (4',6'-diaminodino-2-fenyloodol [DAPI]), aktyny (falloidyna Alexa Fluor 488) i fibronektyny (poliklonalna królicza anty-ludzka fibronektyna). Zastosowano wtórne barwienie fibronektyny przy użyciu kozich przeciwciał anty-króliczych IgG (Alexa Fluor 750 kozioł anty-królik), a środek konserwujący został umieszczony na wszystkich szkiełkach nakrywkowych, aby zapobiec blaknięciu fluorescencji. Lakier do paznokci został użyty do uszczelnienia szkiełek nakrywkowych na szkiełkach mikroskopowych, a następnie pozostawiony do wyschnięcia na 24 godziny.
Obrazy fluorescencji uzyskano zgodnie z wcześniejszym opisem20 przy użyciu 40-krotnego obiektywu immersyjnego w oleju sprzężonego z kamerą z cyfrowym urządzeniem sprzężonym z ładunkiem (CCD) zamontowanym na odwróconym mikroskopie z napędem. Dziesięć losowo wybranych pól widzenia zostało zobrazowanych dla każdego szkiełka nakrywkowego w 40-krotnym powiększeniu, co odpowiada rozdzielczości 6,22 piksela/μm. Do ilościowego określenia różnych zmiennych z obrazów opisujących jądra, włókna aktyny i fibronektynę wykorzystano specjalnie napisane kody; Odpowiednie wartości, a także parametry organizacji i geometrii zostały automatycznie zapisane w plikach danych.
Linie komórkowe
Bardziej obszerną dokumentację na temat wszystkich linii komórkowych z próbkami danych można znaleźć we wcześniejszych publikacjach20. Krótko mówiąc, zbieranie danych zostało zatwierdzone, a świadoma zgoda została przeprowadzona zgodnie z UC Irvine Institutional Review Board (IRB # 2014-1253). Ludzkie komórki fibroblastów pobrano z trzech rodzin o różnych wariantach mutacji genu laminy A/C (LMNA): heterozygotyczna mutacja w miejscu splicingu LMNA (c.357-2A>G)22 (rodzina A); Mutacja nonsensowna LMNA (c.736 C>T, pQ246X) w eksonie 423 (rodzina B); oraz mutacja typu missense LMNA (c.1003C>T, pR335W) w eksonie 624 (rodzina C). Komórki fibroblastów pobrano również od innych osób w każdej rodzinie jako powiązane kontrole ujemne mutacji, określane jako "kontrole", a inne zakupiono jako niepowiązane kontrole ujemne mutacji, określane jako "dawcy". Jako kontrolę pozytywną, komórki fibroblastów od osoby z progerią Hutchinsona-Gliforda (HGPS) zostały zakupione i wyhodowane z biopsji skóry pobranej od 8-letniej pacjentki z HGPS posiadającej mutację punktową LMNA G608G25. W sumie przebadano fibroblasty od 22 osób i wykorzystano je jako dane w tej pracy.
Typy danych
Dane dotyczące fibroblastów należały do jednej z dwóch kategorii: zmienne jąder komórkowych (tj. procent jąder dysmorficznych, obszar jąder, mimośród jąder)20 lub zmienne strukturalne wynikające z parametru kolejności orientacyjnej (OOP)21,26,27 (tj. aktyna OOP, fibronektyna OOP, jądra OOP). Parametr ten jest równy maksymalnej wartości własnej tensora średniego rzędu wszystkich wektorów orientacji i jest szczegółowo zdefiniowany w poprzednich publikacjach26,28. Wartości te są agregowane w różne możliwe konformacje, takie jak wartości w stosunku do wieku, płci, statusu choroby, obecności pewnych objawów itp. Przykłady wykorzystania tych zmiennych można znaleźć w sekcji wyników.
Przykładowe kody i pliki
Przykładowe kody i inne pliki oparte na powyższych danych można pobrać wraz z tym artykułem, a ich nazwy i typy podsumowano w Tabeli 1.