Table of Contents
הקדמה: הקונפורמציה של Computation and Chemistry
החיזוי של תוצאות תגובה ביוכימיות עמד ארוך כאחד המשימות הדורשות ביותר במדעי החיים באופן מסורתי, כימאים וביולוגים שנתמכו על הניסויים-וטרור, חישובים תרמודינמיים, וניתוק מי מכניסטי כדי לנחש כיצד קבוצה מסוימת של מגיבים יהפוך.תהליך זה, בעוד יסוד, איטי, יקר, ולעתים קרובות אינו מצליח לתפוס את המורכבות המלאה של מערכות ביולוגיות לחיזוי פנימי (בעשור) למידה מרחוק, החל משיטות למידה מרחוק, למידה מרחוק, למידה מרחוק, משיטות למידה מרחוק, היא למידה מרחוק, למידה מרחוק, היא למידה מרחוק, היא למידה מרחוק, היא בעלת ראיות למידה מרחוק, באופן ישיר, כלומר, למידה מרחוק, באופן ישיר, היא למידה מרחוק, משיטות למידה מרחוק, שיטות למידה מרחוק, למידה מרחוק, איטיות, איטיות.
שינוי זה אינו רק שיפור מצטבר. AI מאפשר למדענים לעבור נתונים מסיביים ורעשים של תגובות ידועות, להפיק דפוסים חזקים סטטיסטית, ולהכלל במרחבים כימיים חדשים לחלוטין.ההשלכות של גילוי סמים, הנדסה מטבולית, עיצוב אנזימים, והבנה בסיסית של מכונות מולקולריות של החיים.זה הרחיב את המאמר חוקר את מצב הבינה המלאכותית בחיזוי תוצאות ביוכימיות, המפרט את הטכניקות, פריצות דרך, מגבלות עתידיות, ומגבלות מהירות של השדה הזה.
המורכבות של תגובות ביוכימיות
תגובות ביוכימיות הן המנוע של החיים.הם הופכים חומרים מזינים לאנרגיה, משכפלים חומר גנטי, ומדיה תקשורת סלולרית.אבל לחזות תוצאותיהם הרבה יותר קשה מאשר לחזות תגובות אורגניות טיפוסיות בפלאסט.
- (FLT:0) פסיכואנליזה דינמית: 10.10.1 תגובות ביוכימיות הן מקטישות על ידי אנזימים, אשר כופים מגבלות סטריאו-אלקטרוניקה קפדניות ולעתים קרובות לעקוב אחר מנגנונים רב-שלביים מעורבים ביניים.
- (FLT:0) רגישות סביבתית: תוצאות תגובה 1:1 תלוי pH, טמפרטורה, זמינות מספקת, ואת המיליאו המקומי - ניתן לעתים רחוקות נלכדים בנתוני אימון.
- (FLT:0) הסתברות גבוהה: ⁇ 1 (Enzymes) יכול לעתים קרובות לקבל מספר רב של substrates, המוביל מסלולים ומוצרים צדדיים מסבך חיזוי.
- (FLT:0) משוב רגולטורי: FLT:1 במערכות חיים, מסלולי תגובה מוסדרים באופן דינמי על ידי שינויים allostery, לאחר translational, וביטוי גנים, ביצוע מודלים חיזוי סטטי לא מספיק.
- (FLT:0) Data Sparsities: FLT:1 בעוד מסדי נתונים כמו אנציקלופדיה קיוטו של ג'ינס וגנומים (KEG) ומסד הנתונים של אנזים ברנדה מכילים אלפי תגובות, הם מתאמצים על ידי המרחב הכימי של תת-סטרים אפשריים ותנאים.
אתגרים אלה הגבילו היסטורית את הכדאיות של שיטות כימיה חישוביות, כגון מכניקת הקוונטים או דינמיקות מולקולריות, איטיות מדי עבור חיזוי גבוה באמצעות חישוב.AI מציעה גישה שונה: במקום לפשט כל אטום, הוא לומד את הכללים הסטטיסטיים השולטים תגובתיות מהנתונים שנצפו.
בינה מלאכותית: מ- Pattern Recognition to Reaction
בבסיסו, AI החל על חיזוי תגובה ניסיונות ללמוד מיפוי ממתמריצים (וזרזים אופציונליים, תנאים) למוצרים.זהו בעיית למידה מבוקרת, אך ייצוג מבנים מולקולריים מציג מכשולים ייחודיים.עבודה מוקדמת בשימוש במערכות מומחים מבוססות חוק, אך גישות מודרניות מסתמכות על מודלים של למידת מכונות המסוגלות לטפל בנתונים מהובנים גרף.
ייצוג של Molecules
למודל לחיזוי תגובות, עליו להבין תחילה את המולקולות.הייצוגים המשותפים כוללים:
- (FLT:0)SMILES: 1FLT:1 איור ליניארי מבוסס טקסט, בעוד פשוט, SMILES אינו קנטוןיניסטי ויכול להיות הזמנה רגישה לסימון רשתות עצביות חוזרות (RNs) והופכים מוחלים בהצלחה על SMI עבור חיזוי תגובה.
- (FLT:0) גרפים מולקולריים: FLT:1 Atoms כמו צמתים ואיגרות חוב כמו הקצוות. Graph רשתות עצביות (GNNs) באופן טבעי ללכוד את הקישוריות והגאומטריה של מולקולות.עבור חיזוי תגובה, את התגובה ואת המוצר יכול להיות מיוצג כמו גרף דו-פרטתי או גרף ניגודי של מיפוי אטום.
- (FLT:0) טביעות אצבע ופסלים: גרף 1 (למשל, Morgan טביעות אצבע) עדיין בשימוש ביער אקראי או במודלים SVM עבור נתונים קטנים יותר, אבל למידה עמוקה בדרך כלל מחלחלת אותם על קורפוס גדול.
טכניקות בינה מלאכותית חשובות בחיזוי תגובה
משפחות רבות של אלגוריתמים הוצבו, כל אחת מהן עם נקודות הכוח והחולשות שלה.
רשתות גרפיות (GemNs)
[ג] GNNs התפתחה כאדריכלות הדומיננטית של חיזוי רכוש מולקולרי ותגובה.הם פועלים על ידי עדכון מצגות אטום מבוסס על הסביבה הכימית המקומית שלהם.עבור חיזוי, GNN יכול ללמוד לזהות אילו אג"ח פורצות וצורה. יישום לא ניתן לעדכון כולל את תגובות Weisfeiler-Lehman ורשתות עצביות (MPNLTs אלה להשיג מודלים של המדינה-of-of-the דיוקים הראות נתונים של USF1.
מודלים של Transformer
במקור התפתח לעיבוד שפה טבעית, ההופכים מתייחסים למחרוזת SMILES כרצףים.מנגנון הכוונות העצמי מאפשר לדגם ללכוד תלות ארוכת טווח בין אטומים.אדריכלות הרובוטריקרית:0(Schקירר et al., 2019)FLT:1 השיג ביצועים יוצאי דופן על חיזוי ורטינזה, תוך התייחסות למשימה כבעיה רצף-לפרקטים כמו גרפים ו- גרפים.
מכונות וקטור וזרמים אקראיים
לפני למידה עמוקה הפכה דומיננטית, SVMs ויערות אקראיות היו מעשי העבודה של חיזוי תגובה, במיוחד עבור נתונים קטנים יותר, מחוספסים.הם מסתמכים על תכונות מעוצבות מומחה כגון ציוני פעילות אטום, פרמטרים סטרקטיים, ו descriptors אלקטרוניים. בעוד פחות גמישים מאשר רשתות עצביות, הם מציעים פירוש טוב יותר ונשארים שימושיים עבור משימות ממוקדות, כגון חיזוי אנזימים ספציפיים עבור תת-ת צר להגדיר.
Reinforcement Learning for Retrosynthesis
רנסינתזה - הבעיה של לשבור מולקולה מטרה למקורות פשוטים יותר - היא יישום מפתח של AI ביוכימיה. סוכני למידה כוח לחקור עץ של ניתוק תגובה אפשרי, מונחה על ידי אות פרס כי מעניש צעדים לא סבירים או יקר.
היתרונות של AI ב- Biochemical Reaction
היתרונות של פריסת AI עבור חיזוי תגובה להאריך מעבר להישגים קלים.הם משחזרים את כל צינור המחקר.
- האצה חד-משמעית:0(FLT:1) מודל מאומן יחיד יכול להעריך מיליוני תגובות היפותטי בשניות, משימה שתנקוט צבא של סטודנטים לתואר שני כדי להשלים.
- (FLT:0) הפחתה:0) צמצום: על ידי סינון כימאים מתים לפני שהם מגיעים למעבדה, AI מפחית בזבוז חוזר וזמן כלי.ב פרמצבטי R&D, שבו סיסינתזה כושלת אחת יכולה לעלות עשרות אלפי דולרים, זה הופך להיות טרנספורמטיבי.
- (FLT:0)iscovery of non-obious Paths:FLT ( 1:1 AI) יכול להציע תגובות המפרות את האינטואיציה האנושית - כגון שינויים ביו-קטליטיים בפתרונות שאינם מסוכנים או פרומיסזויים אנזים-קישוד C-H הפעלה - אשר הובילו לחידוש מסלולים סינתטיים.
- (FLT:0) אינטגרציה עם ניסויים בעלי ביצועים גבוהים:FLT 1:1 פלטפורמות סינתזה אוטומטיות ניתן בשילוב עם מודלים של חיזוי AI לסגור את הלולאה: המודל מציע תגובות, הרובוט מבצע אותם, ואת התוצאות להאכיל בחזרה לתוך אימון מודל.
- (FLT:0) ,Biological Pathallucidation: ⁇ 1) ב metabolomics, AI יכול לחזות אילו אנזים אחראי על טרנספורמציה נצפתה, עוזר למפות מסלולים מטבוליים לא ידועים.זה חשוב במיוחד בגילוי מוצר טבעי והבנה של חילוף החומרים של סמים.
- (FLT:0) תרופות מותאמות אישית: FLT:1 על ידי חיזוי כיצד הגרסאות הגנטיות של הפרט לשנות פעילות האנזים ובכך חילוף החומרים של תרופות, AI יכול להנחות התאמות ולהקטין תגובות שליליות.
מקורות נתונים ואתגרי איכות
מודלים של בינה מלאכותית הם רק טובים כמו הנתונים שהם מאומן עליהם.המקורות העיקריים של נתוני תגובה ביוכימית כוללים:
- (FLT:0)Literature כרייה:FLT:1hil מיצוי אוטומטי ממאמרים מניב נתונים גדולים אך רועשים.מסד הנתונים של USPTO, למשל, מכיל מעל 3 מיליון תגובות שמקורן בפטנטים, אך מיפוי אטום (אשר אטומים במפה מגיבים לאטומים במוצרים) לעתים קרובות חסר או לא נכון.
- (FLT:0) מאגרי מידע משופרים: FLT:1 KEGG, רנה ו ברנדנדה מספקים תגובות באיכות גבוהה, נבדקות באופן ידני, במיוחד עבור מסלולים מטבוליים.עם זאת, גודלם מוגבל (עשרות אלפי תגובות) בהשוואה למיליוני התגובות הקנייניות של חברות התרופות.
- (FLT:0) מחברת מעבדה אלקטרונית (ELNs): חברות פרטיות 1:1 לייצר כמויות עצומות של נתונים ניסיוניים, אך נתונים אלה לעתים רחוקות משותפים בפומבי, מה שמוביל לפירוק אשר מעכב את הכללת המודל.
- (FLT:0) ניסויים בתפוקה גבוהה: FLT:1cios כמו מערכת ברקלי AutoLab יכול לייצר אלפי תוצאות תגובה בשבוע, מתן נתונים איכותיים ללמידה פעילה.
(הדברים האיכותיים של הנתונים מכים את השדה. Missing atomמיפוי, תיאורים סטריאוכימיה לא עקביים, ומשימות מוצר שגויות יכולות להציג הטיה שיטתית, יתר על כן, הפצת הנתונים היא skeeded במידה רבה: תגובות נפוצות (למשל, היווצרות קשר amide) הן ייצוגיות באופן ישיר, בעוד שינויים נדירים אך מעניינים (למשל, halogenation סינתטי) הן ספות (למשל, כגון: גרף) של נתונים (pemgum) מכילים נתונים (p) חומרים כימיים.
מודל אינטר-חשיבות: בעיית הקופסא השחורה
ביקורת חוזרת על מודלים למידה עמוקה היא האופי שלה.כימאי שמקבל חיזוי מרשת עצבית לעתים קרובות לא יכול להבין מדוע המודל חושב שקשר מסוים ישבור.חוסר פרשנות זה מחסום משמעותי לאימוץ בסביבות מוסדרות כגון אישור תרופות.
- (FLT:0) מפות קשב: מודלים של Transformer מייצרים משקל תשומת לב שניתן לדמיין כדי להראות אילו אטומים המודל התמקד בעת ביצוע חיזוי.במקרים מסוימים, מפות אלה תואמות אתרים תגובתיים ידועים, מתן תואר של תובנה מכניסטית.
- (FLT:0) תבניות פעולה: מודלים היברידיים 1FLT משלבים ספריית תבנית נלמדת עם מערכת דירוג עצבית, המאפשרת לדגם לייצר כלל תגובה אנושי (למשל, "SN2 החלפת בפחמן ספירה 3").
- (FLT:0) הסברים כלכלנים: FLT:1 בהפרעה לגרף המולקולרי והתבוננות בשינויים בחיזוי, ניתן להסיק מהם קבוצות פונקציונליות המשפיעות ביותר.
- (FLT:0) אי-וודאות של הקוונטים: FLT:1 שיטות Ensembling ורשתות עצביות Bayesian יכולים לספק מרווחי ביטחון עבור תחזיות, הטלת תפוקה של אבטחה נמוכה עבור אימות ניסיוני.
למרות ההתקדמות, אין תקן מקובל נרחב לפירושים קיים בחיזוי תגובה.השדה מתקדם לעבר "AI ראוי" שבו תחזיות מלווה בהסברים, מצבי כישלונות מאופיין, ומודלים מאומתים על נתונים מחוץ לתפוצה.
מגבלות נוכחיות ובעיות פתוחות
ההתלהבות של AI בחיזוי תגובה צריכה להיות ממוסחת על ידי הכרה במגבלות שלה:
- (FLT:0) הכללה מוקלטת למאכלים חדשים: אנדרל 1 (Moderalph:1) מודלים שהוכשרו על סוגי תגובה ידועים נכשלים לעתים קרובות כאשר מוצגים עם שינויים חדשים באמת, כגון אלה מעורבים מצבים חמצון יוצאי דופן או אנזימים לא קנון.
- (FLT:0) תוספת התלות: 1 מודלים רבים מתעלמים מתנאי התגובה (מבודד, טמפרטורה, זרז) שילוב של משתנים אלה כקלטים נוספים נשאר אתגר פעיל, שכן הנתונים הזמינים הם דליקים ולעיתים קרובות לא שלמים.
- (FLT:0) רגישות של רשתות עצביות גרפיות:FreaLT:1 ואילו גנונים הם חזקים, הם הופכים יקרים חישוביים עבור מולקולות גדולות או כאשר יש צורך בסימולציה של צעדים רבים על מסלולים רב-שלביים נותר נדיר.
- (FLT:0) ההקשר הביולוגי: FLT:1 בתא חי, תגובה אינה מתרחשת בבידוד.תחרות במסלולים, תקשורים ותקנה מטבולית כולם משפיעים על התוצאה האמיתית.מודלים של AI מתעלמים במידה רבה מההקשר הזה, צמצום הכוח הנבאי שלהם ב vivo.
- (FLT:0) דליפת נתונים: ⁇ FLT:1 בשל האופי הציבורי של נתונים רבים של הכשרה, יש סיכון כי מודלים מוערכים על תגובות שהם ראו במהלך אימון.
כיוונים עתידיים: איפה השדה מופקד?
כמה מגמות מרגשות נועדו לדחוף את הגבולות של מה AI יכול להשיג בחיזוי תגובה ביוכימי.
שילוב עם כימיה קוונטית
במקום להתייחס ל-AI כתחליף למכניקת הקוונטים, החוקרים מתמזגים הן את שתי הגישות.מודלים ההיברידיים משתמשים בחישובים סמי-אמפיריים זולים כדי לתאר את ההפצה האלקטרונית ולאחר מכן מזינים את התכונות הללו לרשת עצבית (למשל, למידה עמוקה עם החיזוי המילטון) זה יכול ללכוד את הג'יו-סטריאו-אלקטרוניקה כי מודלים טהורים המונעים על ידי נתונים, במיוחד לתגובות עם נתיבי אנרגיה קטנים בין המסלולים בין-ה.
Multi-Task Learning and Foundation Models
בהשראת מודלים גדולים בשפה, קהילת AI הכימית מפתחת "מודלים של גילוי" שהוכשרו על נתונים כימיים מסיביים - כולל מיליוני מיתרים SMILES, תכונות מולקולריות, ותגובות - שניתן לתקן היטב עבור משימות ספציפיות.דוגמאות כוללות מול אלברט, צ'מה, ויציאתו האחרונה שוחררה:0GHub for Molecules: Openion DatabaseFLTs אלה, Un show in a kind.
מחקר Active Learning and Closed-Loop Experimentation
במקום להתאמן פעם על סט נתונים סטטי, מערכות למידה אקטיבית שוב ושוב את המודל לתחזיות לא ברורות, ולאחר מכן לבצע ניסויים כדי ליצור נתונים חדשים.זה חזק במיוחד כאשר בשילוב עם פלטפורמות סינתזה אוטומטיות.הלאה של עיצוב - איפור -test-analyze מואצת באופן דרמטי סטארטאפים כמו Zymergen ו-Genkgo Bioworks בנו את הפלטפורמה כולה סביב מחזור זה עבור הנדסה מטבולית.
חיזוי Stereochemical Outcomes
Stereoכימיה היא קריטית במולקולות סמים, אך מודלים רבים של בינה מלאכותית נאבקים לחזות אינטואיציה, דיסלקטיביות, או את ההשפעה של זרזים צ'רליים.התעוררות ייצוגים גרפים המקודמים שלוש ממדים (למשל, באמצעות הדור התואם של RDKit) ותשומת לב למרכזי צ'יר מתחילים לטפל פער זה.
שילוב עם מערכות ביולוגיה
המטרה הסופית היא לחזות תוצאות תגובה לא רק בשחפת מבחן, אלא בהקשר של תא חי.זה דורש מודלים חיזוי תגובה חיזוי עם מודלים מטבוליים בקנה מידה גנום (GEMs) שדמיינו התפלגות פלוקס. AI יכול לזהות אילו זוגות אנזימים כפופים כנראה להיות רלוונטי מבחינה פיזיולוגית, צמצום המימד של GEMs ומאפשר מודלים מטבוליים לדיוק.
מסקנה
אינטליגנציה מלאכותית עברה מסקרנות לכלי הליבה בחיזוי תוצאות התגובה הביוכימית.באמצעות רשתות גרפיטי, מהפךים ולמידה חיזוק, החוקרים יכולים כעת לחזות את המוצרים של שינויים נזומטיים וסינטטיים עם דיוק יוצא דופן, מאיץ גילוי סמים, ביולוגיה סינתטית, והבנה שלנו של חילוף החומרים.אבל השדה נשאר בעידן שלו.
בעוד שמודלים של בינה מלאכותית הופכים חזקים יותר וזמין יותר, הם לא יחליפו את הכימאי או הביולוגי, אלא במקום זאת יגדילו את היצירתיות שלהם, משחררים אותם מניסוי שגרתי וטרור ומאפשרים להתמקד בבעיות הקשות והתגמוליות ביותר.הסינרגיה בין אינטואיציה אנושית לידע מכונה תגדיר את העידן הבא של מחקר ביוכימי - עידן שבו צופה תוצאה של תגובה הופכת לשגרה כחיפוש אחר תרכובת ידועה, אך הרבה יותר חזקה.