$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
בעידן שבו ההתקדמות המדעית מונעת במידה רבה על ידי הטכנולוגיה, הטיפול בכמויות גדולות של נתונים הפך להיבט אינטגרלי של מחקר בכל התחומים. הופעתה של שדות חדשים כגון ביולוגיה חישובית ו גנומיקה מדגיש עד כמה קריטי ניצול יזום של הטכנולוגיה הפכה. מגמות אלו ממשיכות להמשיך בעקבות חוק מור והתקדמות יציבה שצברה מקדמה טכנולוגית1,2. עם זאת, תוצאה אחת היא הכמויות העולות של נתונים שנוצרו, החורגים מהיכולות של שיטות ארגון שהיו קיימות בעבר. למרות שרוב המעבדות האקדמיות מספקות מספיק משאבים חישוביים לטיפול בערכות נתונים מורכבות, לקבוצות רבות אין מומחיות טכנית הנחוצה לבניית מערכות מותאמות אישית המתאימות לפיתוח צרכים3. לאחר שהכישורים לנהל ולעדכן ערכות נתונים כאלה נותרת קריטית עבור זרימת עבודה ופלט יעילים. גישור הפער בין הנתונים והמומחיות חשוב לטיפול יעיל, לעדכון מחדש ולניתוח ספקטרום רחב של מידע רב-תחומי.
מדרגיות היא שיקול מהותי בעת טיפול בערכות נתונים גדולות. נתונים גדולים, למשל, הוא אזור פורח של מחקר הכרוך בחשיפת תובנות חדשות מעיבוד נתונים המאופיינת בנפחים ענקיים, טרוגניות גדולים ושיעורי הדור הגבוה, כגון שמע ווידאו4,5. שימוש בשיטות אוטומטיות של ארגון וניתוח הוא חובה עבור שדה זה כדי לטפל כראוי בפריטי ים של נתונים. מונחים טכניים רבים בהם נעשה שימוש בנתונים גדולים אינם מוגדרים בבירור, אך עשויים להיות מבלבלים; למשל, נתוני "מהירות גבוהה" משויכים לעתים קרובות למיליוני ערכים חדשים ביום, ואילו נתוני "מהירות נמוכה" עשויים להיות רק מאות ערכים ביום, כגון במסגרת מעבדה אקדמית. אמנם יש ממצאים מרגשים רבים עדיין להתגלות באמצעות נתונים גדולים, רוב המעבדות האקדמיות אינן דורשות את היקף, כוח, ומורכבות של שיטות כאלה לטיפול שאלות מדעיות שלהם5. למרות שאין ספק שהנתונים המדעיים מורכבים יותר ויותר עם זמן6, מדענים רבים ממשיכים להשתמש בשיטות של ארגון שכבר אינן עונות על צורכי הנתונים המתרחבים שלהם. לדוגמה, תוכניות גיליון אלקטרוני נוחות משמשות לעתים קרובות לארגון נתונים מדעיים, אך בעלות של חוסר מדרגי, שגיאה ומועדים לא יעילים בטווח הארוך7,8. לעומת זאת, מסדי נתונים הם פתרון אפקטיבי לבעיה כאשר הם מדרגיים, זולים יחסית וקלים לשימוש בטיפול בערכות נתונים מגוונות של פרויקטים שוטפים.
חששות מיידיים העולות כאשר שוקלים סכימות של ארגון נתונים הם עלות, נגישות והשקעה בזמן להדרכה ושימוש. בשימוש תכוף בהגדרות עסקיות, תוכניות מסדי נתונים כלכליים יותר, הן זולות או חופשיות יחסית, מאשר המימון הנדרש לתמיכה בשימוש במערכות נתונים גדולות. למעשה, מגוון של תוכנות מסחריות זמינות וקוד פתוח קיימות ליצירה ולתחזוקה של מסדי נתונים, כגון Oracle Database, MySQL ו-Microsoft (MS) Access9. חוקרים רבים גם יהיה לעודד ללמוד כי כמה חבילות אקדמיות MS Office לבוא עם MS Access כללה, עוד למזער שיקולים עלות. יתר על כן, כמעט כל המפתחים לספק תיעוד נרחב באופן מקוון ויש שפע של משאבים מקוונים חינם כגון Codecademy, W3Schools, ו SQLBolt ורג כדי לעזור לחוקרים להבין ולנצל שפת שאילתות מובנית (SQL)10,11,12. כמו כל שפת תכנות, ללמוד כיצד להשתמש במסדי נתונים וקוד באמצעות SQL לוקח זמן להתמחות, אבל עם משאבים מספיק זמין התהליך הוא פשוט ושווה את המאמץ השקיע.
מסדי נתונים יכולים להיות כלים רבי-עוצמה להגברת נגישות הנתונים ולנוחות הצבירה, אך חשוב להבחין אילו נתונים ייהנו ביותר משליטה גדולה יותר בארגון. ריבוי ממדי מתייחס למספר התנאים שניתן לקבץ מידה כנגד, ומסדי נתונים חזקים ביותר בעת ניהול מצבים רבים ושונים13. לעומת זאת, מידע עם ממדי ממדי נמוך הוא הפשוט ביותר לטפל באמצעות תוכנית גיליון אלקטרוני; לדוגמה, ערכת נתונים המכילה שנים וערך עבור כל שנה כוללת רק קיבוץ אפשרי אחד (מדידות נגד שנים). נתונים מימדים גבוהים כגון מתוך הגדרות קליניות ידרוש מידה גדולה של ארגון ידני כדי לשמור ביעילות, תהליך מייגע ונוטה לשגיאות מעבר להיקף של תוכניות הגיליון13. מסדי נתונים שאינם יחסיים (NoSQL) ממלאים גם מגוון תפקידים, בעיקר ביישומים שבהם הנתונים אינם מאורגנים היטב לשורות ולעמודות14. בנוסף להיותו קוד פתוח לעתים קרובות, סכימות ארגוניות אלה כוללות שיוכים גרפיים, נתוני סדרות זמן או נתונים מבוססי מסמך. NoSQL מצטיין במדרגיות טובה יותר מ-SQL, אך אינו יכול ליצור שאילתות מורכבות, כך שמסדי נתונים יחסיים טובים יותר במצבים המחייבים עקביות, סטנדרטיזציה ושינויי נתונים נדירים בקנה מידה גדול15. מסדי נתונים הם הטובים ביותר לקיבוץ ביעילות ולעדכון מחדש של נתונים למערך הגדול של התצורות הדרושות לעתים קרובות בהגדרות מדעיות13,16.
הכוונה העיקרית של עבודה זו, לכן, היא ליידע את הקהילה המדעית על הפוטנציאל של מסדי נתונים כמערכות ניהול מידע מדרגי עבור "בגודל בינוני", נתוני מהירות נמוכה, כמו גם לספק תבנית כללית באמצעות דוגמאות ספציפיות של המטופל ניסויים בשורת התאים. יישומים דומים אחרים כוללים נתונים גאו-מרחביים של מיטות נהר, שאלונים ממחקרים קליניים לאורך, ומצבי גדילה מחיידקים בצמיחה מדיה17,18,19. עבודה זו מדגיש שיקולים נפוצים עבור ושירות של בניית מסד נתונים בשילוב עם צינור הנתונים הדרוש כדי להמיר נתונים גולמיים לפורמטים מובנים. היסודות של ממשקי מסד נתונים וקידוד עבור מסדי נתונים ב-SQL מסופקים ומומחשים עם דוגמאות כדי לאפשר לאחרים להשיג את הידע הרלוונטי לבניית מסגרות בסיסיות. לבסוף, ערכת נתונים ניסיונית לדוגמה ממחישה כיצד בקלות וביעילות מסדי נתונים יכולים להיות מיועדים לצבור נתונים מגוונים במגוון דרכים. מידע זה מספק הקשר, פרשנות ותבניות לסיוע למדענים עמיתים בדרך ליישום מסדי נתונים לצרכים הניסיוניים שלהם.
לצורך יצירת מסד נתונים מדרגי בהגדרת מעבדה מחקר, נתונים מניסויים שימוש בתאי פיברובסט של האדם נאסף בשלוש השנים האחרונות. המוקד העיקרי של פרוטוקול זה הוא לדווח על ארגון תוכנות המחשב כדי לאפשר למשתמש לצבור, לעדכן ולנהל נתונים באופן החסכוני ביותר ובזמן האפשרי, אך השיטות הנסיוניות הרלוונטיות מסופקות גם עבור הקשר.
התקנה ניסויית
הפרוטוקול הניסיוני להכנת דגימות כבר תואר בעבר20,21, והוא מוצג בקצרה כאן. בנייה הוכנו על ידי ציפוי מלבני זכוכית מלבנית שמיכות עם תערובת 10:1 של polydiמתיל siloxane (pdms) וריפוי סוכן, ולאחר מכן החלת 0.05 mg/mL fibronectin, ב מאורגנת (isotropic) או 20 יקרומטר קווים עם 5 יקרומטר הפער מיקרותבנית מיקרו הסדרים (קווים). תאים פיברולסט הופרה במעבר 7 (או מעבר 16 עבור בקרות חיוביות) על שמיכות בצפיפויות האופטימלי ושמאלה כדי לגדול עבור 48 h עם מדיה שונה לאחר 24 שעות. התאים תוקנו לאחר מכן באמצעות 4% פאראפורמלדהיד (כדור בכורה) ו-0.0005% nonionic חומרים, ואחריו כיסוי להיות חיסוני תאים גרעיני (4 ', 6 '-diaminodino-2-פניינילינדול [dapi]), אקטין (אלקסה fluor 488 phalloidin), ו fibronectin (הארנב polycloncal נגד האדם fibronectin). כתם משני עבור fibronectin באמצעות עז נגד ארנב IgG נוגדנים (אלקסה Fluor 750 עז נגד ארנבת) הוחל ושימור סוכן הותקן על כל הכיסויים כדי למנוע פלורסנט נמוגה. לק מסמר שימש כדי לאטום שמיכות על שקופיות מיקרוסקופ ואז עזב להתייבש עבור 24 שעות.
תמונות פלואורסצנטית הושגו כמתואר בעבר20 באמצעות שומן 40x היעד טבילה בשילוב עם חיוב דיגיטלי מצמידים המכשיר (CCD) מצלמה רכוב על מיקרוסקופ ממונע הפוך. עשרה שדות שנבחרו באקראי לתצוגה היו תמונות עבור כל coverslip בהגדלה 40x, המתאים לרזולוציה 6.22 פיקסלים/μm. קודים כתובים מותאמים אישית שימשו לכמת משתנים שונים מן התמונות המתארות את הגרעין, הסיבים אקטין, ו fibronectin; ערכים תואמים, כמו גם פרמטרים של ארגון וגיאומטריה, נשמרו באופן אוטומטי בקבצי נתונים.
קווי תאים
ניתן למצוא מסמכים מקיפים יותר על כל הנתונים לדוגמה של שורות התא בפרסומים קודמים20. כדי לתאר בקצרה, איסוף הנתונים אושר ומידע הסכמה בוצעה בהתאם ללוח הסקירה המוסדי של אוניברסיטת קליפורניה (IRB 2014-1253). התאים האנושיים בתאי הפיצוץ נאספו משלוש משפחות של וריאציות שונות של lamin A/C (lmna) גן מוטציה: Heterozygous lmna אחונה -מוטציה באתר (כ. 357-2a > G)22 (משפחה A); Lmna שטויות מוטציה (c. 736 c > T, pQ246X) ב אקסון 423 (משפחה ב'); ו- lmna missense מוטציה (c. 1003c > T, pR335W) ב אקסון 624 (משפחה c). תאים פיברולסט נאספו גם מאנשים אחרים בכל משפחה כמו בקרות מוטציה שלילית הקשורים, המכונה "פקדים", ואחרים נרכשו כמו בקרות מוטציה שלילית שאינם קשורים, המכונה "תורמים". בתור שליטה חיובית, תאים פיברובלסט מאדם עם האצ-gliford פרוגריה (hgps) נרכשו וגדלו מתוך ביופסיה של העור נלקח מחולה בת 8 בת עם hgps בעל מוטציה G608G point lmna 25. בסך הכל, פיברוהפיצוצים מ -22 אנשים נבדקו ושימשו נתונים בעבודה זו.
סוגי נתונים
מידע פיברובלסט נפל לאחת משתי קטגוריות: משתני גרעין סלולאריים (כלומר, אחוז הגרעינים המבוריים, שטח הגרעינים, אקסצנטריות הגרעינים)20 או משתנים מבניים הנובעים מפרמטר הסדר הoriקטיבי (לדוגמה)21,26,27 (כלומר, אקטין-הופ, פילברון-הופ). פרמטר זה שווה לערך המרבי המירבי של סדר המשמעות של טנסור של כל וקטורי הכיוון, והוא מוגדר בפירוט בפרסומים הקודמים26,28. ערכים אלה מצטברים למגוון של קונמציות אפשריות, כגון ערכים נגד גיל, מין, מצב מחלה, נוכחות של תסמינים מסוימים, וכו '. דוגמאות לאופן השימוש במשתנים אלה ניתן למצוא בסעיף התוצאות.
קודים לדוגמה וקבצים
ניתן להוריד את הקודים לדוגמה וקבצים אחרים המבוססים על הנתונים לעיל, והשמות והסוגים שלהם מסוכמים בטבלה 1.