משבר הנתונים הצומח ב-Modern Neuroscience

Neuroscience נכנס עידן של נתונים חסרי תקדים.אחד גבוה ברזולוציה גבוהה הדמיה מגנטית אדמדנס מגנטית (fMRI) יכול לייצר כמה ג'יגה-ביאטים של נתונים, בעוד הדמיה סידן והקלטות אלקטרופיזיולוגיה גבוהה לדחוף באופן שגרתי לתוך טווח terabyte לניסוי. פרויקט הקישור האנושי לבדו יצר מעל 60 tbytes של נתונים, ו- BRAIN הוא דחף קבוע כדי לתקן את רמות אחסון אלה, לא יכול להיות קבוע, פשוט על גבי רשתות אחסון עצמאיות, לא יכול להיות קבוע, 000.

הבנת סולם הנתונים הניאל

כדי להעריך מדוע מחשוב ענן הוא הכרחי, עליך להבין תחילה את הממדים של אתגר הנתונים.נתוני נילי משתרע על מספר רב של שיטות, כל אחד מייצר זרמים נפרדים אך מסיביים באותה מידה:

  • (FLT:0) סטריקטל ופונקציונלי MRIFLT:1: כרכים ברזולוציה גבוהה 3D, לעתים קרובות עם סדרות זמניות, לייצר נתונים במאות ג'יגהביטים עבור נושא אחד.
  • (FLT:0) Electrophysiology (ECoG, EEG, MEG)IRFLT:1: הקלטות מרובות ערוצים בשיעורי דגימה של 1 kHz או גבוה יותר לייצר סדרות זמן רצופות המצטברות במהירות, במיוחד במחקרים על השתלים כרוניים.
  • (FLT:0)Calcium and Stress הדמיהFLT:1: הקלטה אופטית של אלפי נוירונים בשיעורי וידאו מניבה טרה-בייט לניסוי, במיוחד עם מיקרוסקופי צילום שני.
  • (FLT:0)ConnectomicsFLT:1: שחזורים מיקרוסקופיים אלקטרון של מעגלים עצביים ברזולוציה ננומטר מייצרים פטהוואטים לכל מ"ק של רקמת המוח.
  • (FLT:0) single-cell תמלילים ו- אפיגנומיקים 1FLT: פרופיל מולקולרי של נוירונים בודדים מוסיף שכבות של נתונים גנטיים ופרוטמיים שיש לשלב עם מדידות מבניות ופונקציונליות.

האתגר אינו רק אחסון.ניתוח צינורות עבור סוגי נתונים אלה הם אינטנסיביים חישוביים: ספייקון, רישום תמונה, פתולוגיה, ולמידה של ניהול מודל עמוק הביקוש HPC-דרג משאבים.שרתים מעבדה מסורתיים הם המומים, המוביל לימים או שבועות של עיבוד זמן ועידוד חקירה.

מגבלות על תשתיות On-Premises

מעבדות עצביות רבות מסתמכות היסטורית על שרתים מקומיים, יצירות, או אשכולות מוסדיים.בעוד אלה שירתו היטב למחקרים קטנים יותר, הם מציגים מגבלות בסיסיות כאשר הם מתמודדים עם נתונים עצביים בקנה מידה מודרני:

  • (FLT:0)Fixed CapacityFLT:1: תקציבים של חומרה הם סופיים, וקניית אחסון נוסף או צמתים חדים כרוך במחזורי רכש ארוכים.
  • (ב) ל-[[1924]]: "[[1924]]]]"[[1924]]]]]], [[1924]]]]]]]], [[1924]]]]]], [[1924]]]]]]]]]]]]]], [[1924]]]]]]]], [[1924]]]]]]]]]], [[1924]]]]]]]]]], [[1924]]
  • (FLT:0) חיכוך החלפה משותף (FLT:1): שיתוף נתונים על פני מוסדות בדרך כלל דורש דחף קשיח פיזי או פרוטוקולי העברת קבצים איטיים (למשל, FTP), מעכב פרויקטים רב-אתריים.
  • (FLT:0) הרחבת ההרחבה של מעלה: צוות IT חייב לנהל כשלים חומרה, עדכוני תוכנה, אסטרטגיות גיבוי ותיקונים אבטחה - להסיט את הזמן ממחקר.
  • (FLT:0) תקרת איכות חיים 1: אפילו מעבדה ממומנת היטב לא יכולה להתאים את הסקאלה הגמישות של ספק ענן גדול, במיוחד עבור עומסי עבודה כגון הכשרת מודלים גדולים ברשת עצבית על נתוני הדמיה במוח.

מגבלות אלה דחפו את מדעי המוח לפתרונות מבוססי ענן, שבהם ניתן לספק משאבים על הביקוש, בקנה מידה עולמי, ושילמו רק כאשר משתמשים בהם.

מימון מחשוב ענן עבור נתונים ניאליים

מחשוב ענן מתייחס לאספקת משאבי מחשוב - כולל אחסון, כוח עיבוד, מסדי נתונים, רשתות ותוכנה - מעל האינטרנט על בסיס תשלום-כפי שאתה-go. ספקים מרכזיים כוללים אמזון שירותי אינטרנט (AWS), Microsoft ו-Google Cloud Platform (GCP) עבור נתונים עצביים, ההיצע העיקרי הם:

  • (ב) אחסון (למשל, אמזון S3, Azure Blob Storage, Google Cloud Storage)FLT:1: אחסון בר-קיימא, קנה-מידה מאוד עבור נתונים גולמיים, תוצאות ביניים, ופלטים סופיים.ניתן לקשור נתונים מחיבור חם (גישה בלתי-צפונית) לקור (archival) למזער עלויות.
  • (FLT:0)Compute מקרים (למשל, EC2, Azure VMs, GCE)FLT:1: מכונות וירטואליות עם CPU, GPU, וזיכרון. GPU מקרים (למשל, NVIDIA A100, V100) הן קריטיות ללמידה עמוקה ועיבוד תמונות.
  • (בדוגמא, AWS ParallelCluster, Azure CycleCloud, Google Cloud HPC Toolkit) ReveFLT:1: קובצי חומרים למשימות עיבוד מקבילות כמו ספייקט, רישום כל המוח, או סימולציה של ה-Computer.
  • (FLT:0) מחשוב ללא שירות (למשל, AWS Lambda, Azure Functions) , Azure Functions) , Azure Functions): העברת קוד מונחה על ידי אירועים עבור משימות עיבוד קלות, כגון גרימת צינורות ניתוח כאשר נתונים חדשים מועלים.
  • (בלטינית:0) תזמורת (Kubernetes, Docker on cloud)FeloLT:1: Enables reproducible, Mobiles that can be share over Labss.
  • (FLT:0) מסדי נתונים ואגמים נתונים (למשל, AWS Redshift, Google BigQuery, Amazon Athena)veFLT:1: עבור שאילתת מטא-נתונים, ניתוח סטטיסטי, שילוב סוגי נתונים הטרוגניים.

פלטפורמות ענן ספציפיות של Neuroscience, כגון NeuroCAAS (Cloud Automated Analysis Service), יישומי המוח Imaging Data Structure (BIDS) בענן, ותשתיות הענן של פרויקט המוח האנושי, בונים על יסודות אלה כדי לספק סביבות ניתוח מסובכות.

פורמטים של נתונים והתאמה

ניהול נתונים עצביים מבוסס ענן מבוסס על פורמטים סטנדרטיים.מסגרת המידע של Neuroscience (NIF), ה-International Neuroinformatics Coordinating Facility (INCF), ויוזמות קהילתיות פיתחו פורמטים כמו:

  • (FLT:0)NWB (Neurodata Without Borders)FLT:1: פורמט נתונים מאוחד עבור נתוני נוירופיזיולוגיה ברמה התאית, כולל הקלטות חוץ סלולריות, פיזיולוגיה אופטית ואופטוגניות. קבצי NWB יכולים להיות מאוחסנים ישירות בחנויות ענן ולקרוא על ידי כלי ניתוח פועל בענן.
  • (FLT:0 BIDS (Brain Imaging Data Structure)Build) ReveFLT:1: תקן ארגוני עבור MRI, MEG, EEG, ונתונים הדמיה אחרים. BIDS נתונים הם מבנים מנהליים עם מוסכמות שמות מוגדרות; הם מועברים בקלות ועובדים על פלטפורמות ענן באמצעות מיכלי ענן מאומתים של BIDS-app.
  • (FLT:0)OME-TIFF ו- זררפאלו 1 (ZerpherFoverph: for microscopy and הדמיה, פורמטים אלה שפורצים, ענן-אופטימיים מאפשרים קריאה במקביל של תת-תחומים, המאפשרים ניתוח מבוזר מבלי להוריד את כל הנתונים.

אימוץ סטנדרטים אלה מבטיח כי זרימת עבודה שפותחה על פלטפורמה ענן אחד ניתן לשכפל על השני, קידום יעילות ומדע שיתופי.

יישומים אמיתיים ומקריות

אחסון וקשת בקנה מידה

המכון למדעי המוח (FLT:0) כללן למדע המוח 1 (FLT:1) משווק נתונים בקנה מידה זעירים ממצפה המוח של העכבר ופרויקטים אחרים ב-AWS. באמצעות אמזון S3 עם מדיניות מחזור חיים, הם באופן אוטומטי להעביר נתונים ישנים יותר לארכיון הקרחון עמוק, צמצום עלויות האחסון על ידי יותר מ 80% בהשוואה לספריות קלטות מוקדמות.

בדומה לכך, פרויקט Connectome ProjectFLT:1 , חילק במקור נתונים באמצעות כונן קשיח ו- FTP. שותפות מאוחרת יותר עם AWS עשתה את כל הנתונים הזמינים ב-S3, ומאפשרת לחוקרים ברחבי העולם לספין את EC2 מקרים ולהפעלה ניתוחים ללא הורדות מקומיות.

מחשוב גבוה ל Spike מיון ועיבוד תמונה

Spike מיון - זיהוי זמני ירי של נוירונים בודדים מהקלטות חוץ סלולריות גולמיות - הוא עומס עבודה קלאסי HPC כלי כמו קילסטר, הר Sort, וקרקס סיור ליהנות מהאצה GPU ועיבוד מקבילים.ספקי ענן מציעים מקרים GPU (למשל, AWS p4d מקרים עם 8 GPUs) שיכולה למיין בדיקה של 384 ערוצים נוירופקסלים בהקלטות, במקום להשהות עשרות שעות של עיבוד.

ה-FLT:0) המעבדה הבינלאומית למוח (International Brain LaboratoryFLT) 1, קונסורציום של 21 מעבדות ברחבי העולם, משתמש צינורות מבוססי ענן לניתוח סטנדרטי של נתונים התנהגותיים ונוירונים מעכברים.כל מעבדה מעלה נתונים גולמיים למרכז S3 דלי; זרמי עבודה אוטומטיים (באמצעות AWS Batch ו-Steps) preמעבדים, סוג, ו- Quality-check הנתונים, ומייצרת NWBS לאחר מכן קבצים משותפים לכל אחד כדי לשמור על פני ארכיטקטור.

שיתוף נתונים משותף וניתוח פדרated

פלטפורמות ענן מאפשרות מודלים חדשים של שיתוף פעולה.FLT:0Brain Initiative Cell Census Network (BICCN)FLT:1 יצרו פורטל נתונים מבוסס ענן על Google Cloud שבו החוקרים יכולים לשאילתת תמליל יחיד, אפיגנטי, והנתונים מרחביים על פני מינים.משתמשים יכולים לשגר מחברות Jupyter עם נתונים מוגזמים, לנתח עם ספריות בנויות, ולשתף תוצאות ללא העברת נתונים זה בדגם זה.

מגמה חשובה נוספת היא (FLT:0) למידה מחוספסת 1 (איור 1:2), שבה מודלים של למידת מכונה מאומן על פני מוסדות מרובים ללא ריכוז נתונים גולמיים (אשר עשויים להיות בעלי פרטיות או הגבלות רגולטוריות) לדוגמה, ה-FLT:2NeuroFederatedFLT 3: 3 משתמשים בתזמורת מבוססת ענן כדי להכשיר מודלים מבוזרים על נתונים הדמיה תוך שמירה על כל מודל מקומי (עדיין) של ניהול נתונים משותפים, תוך שמירה על נתונים.

הדמיה של פעילות רבת-המדעית

(הדמיון אינטראקטיבי של נתונים לפעילות עצבית הוא אתגר מרתיעה.שירותי הדמיה מבוססי ענן כמו FLT:0NeuroglancerFLT:1 (התפתח על ידי גוגל וקהילת Connectomics) ו- (FLT:2WebKnososFLT 3LT) המאפשרים רק תחזיות ותוצאות פלח של אחסון בענן ישירות לדפדפן.

עבור אלקטרופיזיולוגיה, פלטפורמת ה-FLT:0.CloudBrainveFLT:1 מספקת הדמיה מבוססת אינטרנט של רכבות ספייק, אותות LFP ונתונים מאוחסנים התנהגות בקובץ NWB, כולם מוגשים מחנויות אובייקט בענן.זה מאפשר למשתפי פעולה מרחוק כדי לבדוק נתונים ללא צורך להתקין תוכנה מיוחדת.

יתרונות של ניהול נתונים מבוסס ענן

מחשוב ענן ניכויים יכולת ההוצאה הון.מעבדה יכולה לאחסן קטבים של נתונים ללא מערך דיסק רכישה, ויכולה לרוץ 1,000-core ניתוחים במשך כמה שעות ללא צורך אשכול. גמישות זו היא בעלת ערך במיוחד עבור Neuroscience כי דור נתונים לעתים קרובות קורה בהתפרצויות (למשל, שבוע של הקלטה אינטנסיבית בקו רוחב או מפגש הדמיה עם טכניקה חדשה).

עלויות-אווירה ותשלום-אתה-לך

בעוד שעלויות ענן יכולות להיות ⁇ אם לא מנוהלות בקפידה, מודל השכר-as-Go לעתים קרובות מוכיח יותר כלכלית עבור מעבדות מחקר מאשר תשתיות מסורתיות. A לאחרונה FLT:0study in NeuroinformaticsFLT:1 לעומת העלות הכוללת של בעלות על גודל בינוני של מערכת העצבים (20 TB אחסון, 100 ליבות CPU, 2 GPUs) מעל חמש שנים ענן היה יותר זול יותר, 000 מקרים של תחזוקה נמוכה יותר, 000.

שיתוף פעולה גלובלי וחדשנות

(הופנה מהדף מהדורות עבודה מבוססות ענן ניתן לשתף באופן מהותי: חוקר יכול לארוז ניתוח כמכל (Docker/Singularity) עם כל התלויים, לאחסן אותו במרשם, ולספק קישור לכל משתפי פעולה (או ביקורת) יכול להפעיל את אותו מיכל על תשתית ענן, לשחזר את אותם תוצאות הפעלה של קוד תכנות מחדש של כדור הארץ: 1.Freatives: LT2F) על ידי קוד תכנות ענן.

אבטחה מוגברת וביטוח

נתונים עצביים אנושיים, במיוחד כאשר קשורים לרשומות קליניות או למידע גנטי, נושאים סיכונים לפרטיות.ספקי ענן משקיעים באבטחה רבה: הצפנה במנוחה ובמעבר, זהות וניהול גישה (IAM), או ניהול בקרת ביקורת, והסמכת תאימות (HIPAA, GDPR, בתי חולים מחקר FISMA) יכולים לאחסן מידע בריאות מוגן (PHI) במקרים ענן העומדים בדרישות HIPAA, דבר מאתגר להשיג עם שרתי אינטרנט מקומיים.

כיצד לבחור את הגישה הנכונה לענן

אין ארכיטקטורת ענן אחת מתאימה לכל פרויקטי הנתונים העצביים.שיקולי המפתח כוללים:

  • (FLT:0Data size and Accessulates) ותבניות גישה ל- 1:1: אם נתונים נגישים לעתים קרובות, אחסון אינטראקטיבי (למשל, AWS EBS, Google Persistent Disk) עשויים להיות נחוצים; אם רק לעתים רחוקות, להשתמש ליד קו או אחסון בארכיון.
  • (FLT:0) דרישות חישוביות FLT:1: עבור למידה עמוקה GPU-intensive, עדיפות ספקים עם זמינות GPU חזקה וכבדות נמוכה לאחסון מקומי.
  • (FLT:0) Software EcosystemFLT:1: כמה פלטפורמות יש סביבות Neuroscience שנבנו מראש (למשל, NeuroPype של AWS, קולואב של גוגל למוחות) נחשב לזמינות של יישומים מקוטבים (אפליקציות של BIDS, NWB להמיר).
  • (FLT:0)Budget and Billing ControlsFLT:1: קביעת אזהרות תקציב, השתמש במקרים של מקום / מועדים לעבודה לא ביקורתית, ומנף את מחשבוני העלות כדי להעריך את ההוצאות החודשיות.
  • (FLT:0) מדיניות Institutional PolicyveFLT:1: בדוק עם מחלקות IT ומשפטיות של המוסד שלך לגבי תושבות נתונים, בקרות יצוא, דרישות תאימות לפני הגירה נתונים לענן ציבורי.

(הופנה מהדף [[1924]]]]]] [[1924]]]]]] [[1924]]]]]]]]]] [[1924]]]]]]]]]] [[1924]]]]]]]]]]]]]]]]]]]] [[1924]]]]]]]]]]]]]]]]]]]], [[1924]]]]]]]]]]]]]] ו[[1924]]]]]]]]]]]]

כיוונים עתידיים: Edge Computing, AI ו- Quantum

צוק מידע אמיתי-Time Neural Data

מאות אלפי חולים עם מכשירים הקלטה עצבית מושתלים (למשל, ממריצים מוח עמוק, מערך אלקטרו-קוגרפיים) לייצר זרמים רצופים של אותות תת-דורל.העברת כל הנתונים הגולמיים האלה לענן לניתוח הוא בלתי-מעשי עקב רוחב פס ושקיפות של חוקרים - עיבוד נתונים על מכשיר או שער ליד המקור - יהפכו ליותר ויותר חשוב של Clouds-Perfectification Analysis for cloud-pic Analysis to cloud-pic, but the אדג'tected Laboratory-Definance, but , אפילו ל-Outcasting Data on a cloud-Definance. Edge.

בינה מלאכותית ושילוב Machine Learning

[פלטפורמות ענן] הן הבית הטבעי לאימון רשתות עצביות עמוקות על נתונים עצביים מסיביים.מודלים מאומנים מראש עבור מגזר תאים, ספיגת עיבוד, וניתן לערוך מעקב התנהגותי על ממשקי API, המאפשרים למדענים ליישם ניתוח המדינה-של האמנות ללא מומחיות בלמידה של מערכות ההפעלה, כמו למשל:0 Amazon SageMakerph 1LT:1 ו-LTF:2reas: Google Verextrated Power for acreative Data for Machines for Machines to runed Security, and Education for a Complete-of-of-of-of-of-Falated Security, and Software, and Cloud for Machines:

פלטפורמות ענן-נוורו-מדעיות של העתיד

אנו נעים לעבר חזון שבו כל משאבי המידע העיקריים של מדעי המוח הם ענן-native.The FLT:0BRAIN Initiative Data ArchivesFLT:1 (למשל, הארכיון המנוכל לשילוב נתונים של Neurophysiology, DANDI) כבר בנוי על AWS ו-Google Cloud, המציע נתונים סטנדרטיים של NWB ו-BIDSs נגישים באמצעות גירסאות עתידיות.

  • (ב) [ה]: [ה], [ה], [ה], [ה], [ה],] [ה], [ה], [ה],]]], [ה], [ה], [ה], [ה], [ה],], [ה], [ה]], [התורהר] [ה'] [ה'] [ה'], [ה'] [ה'] [ה'] [ה'] [ה'] [ה'[ה']'[ה'[ה'] [ה'[ה']']']'[ה']']']'[ה']'], [ה']']']'[ה']'[ה']']']']']']']'[ה'[ה'], [ה'[ה']'], [ה']']'[ה']']']'[ה'[ה']']']'[ה']']']'[ה'[ה'[ה'[ה'[
  • (FLT:0) Data Proofance MonitorFLT:1: Blockchain או רשומות מוכחות באופן קריפטוגרפי כדי להבטיח שכל שלב עיבוד הוא ביקורתי.
  • (FLT:0 Interactive pinsFLT:1): שאילתה בזמן אמת של נתונים בקנה מידה זעיר באמצעות מסדי נתונים בעמודה (למשל, BigQuery, Redshift) לענות על שאלות כמו "איזה נוירונים ב ⁇ הראייה הראשית מגיבה לתחריטים אנכיים?"

תפקיד פוטנציאלי של מחשוב קוונטי

למרות עדיין בחיתוליו, מחשוב קוונטי עשוי בסופו של דבר להתמודד עם בעיות במדעי המוח כי הם בלתי-מעוררים למחשבים קלאסיים - כגון הדמיה של הדינמיקה הקוונטית של ערוצי יון או אופטימיזציה של שחזורים בקנה מידה גדול של חיבורים של צינורות ענן כבר מציעים סימולטורים קוונטיים (למשל, אמזון Braket, Azure Quantum) כי החוקרים יכולים להשתמש כדי להתנסות עם אלגוריתמים בקנה מידה קטן.

צעדים מעשיים עבור חוקרים נעים אל הענן

  1. (FLT:0)Start with aפיילוט ProjectFLT:1: בחר מצגת נתונים מובנת היטב וצנרת ניתוח יחיד. השתמש בשכבה חופשית של ספק ענן או לקבל זיכויים (מענקים מחקר מציעים).
  2. (ב) ,0) לקדם את זרימת העבודה שלך: השתמש ב Docker או Singularity כדי לארוז את הקוד שלך, התלויות והסביבה.
  3. (FLT:0) פורמטי נתונים סטנדרטיים של נתונים מותאמים ל-NWB או BIDS מוקדם בצנרת.זה יפשט שיתוף ושימוש בכלים קהילתיים.
  4. (FLT:0) צריכת החשמל כקוד (IaC) אנדרל 1: כלים כמו Terraform או AWS CloudFormation מגדירים את משאבי הענן שלך (דליים מטורפים, VMs, רשת) כקוד מבוקר גרסאות, המאפשר שכפול קל ושיקום אסון.
  5. (FLT:0) מוניטור עולה בשקידה 1: קביעת תקציבים, השתמש בחוקרים עלות לוחות נתונים, וקביעת מדיניות כדי לסגור את המשאבים של הדל (למשל, באמצעות לוח זמנים של AWS Instance).
  6. (FLT:0Engage with the Community FigFLT:1: פלטפורמה כמו Neurostars (עבור NWB /BIDS), הבלוג INCF, ופורומים ספק ענן למדעי החיים יכולים לספק ייעוץ יקר ערך ממשתמשי ענן אחרים במדעי המוח.

רוב ספקי הענן הקדישו למחקר, ל-Google:0.Research and Academic ProgramseurFLT:1 (AWS Clouds for Research, Azure for Research, Google Cloud Research Credits) המספקים אשראי חינם משמעותי לחוקרים מוסמכים.

מסקנה

התפקיד של מחשוב ענן בטיפול בנתוני עצביים בקנה מידה גדול התפתח מנוחות להכרחי.כפי ש- Neuroscience דוחף לעבר נתונים מפורטים ורב-ממדיים יותר ממיליארדים של נוירונים על פני מינים, היכולת לאחסן, לעבד ולנתח נתונים על הביקוש מבלי להיות מופץ על ידי חומרה מקומית יגדיר את קצב הגילוי.