Giriş: Computation ve Chemistry

Biyokimyasal tepki sonuçlarının tahmini, en entelektüel olarak hayattaki görevlerin biri olarak uzun zamandır durdu. Geleneksel olarak, kimyagerler ve biyologlar, deneysel deneme ve terörizm, termodinamik hesaplamalar ve mekaniksel olarak, tepki verenlerin nasıl dönüştüreceğini tahmin etmeye başladı.Bu işlem, temel olarak, biyolojik sistemlerin tam karmaşıklığına doğrudan bakmadan, doğru yola çıkarak, doğru yola çıkarak, deneysel öğrenme modellerini doğrudan öğrenmelerine yardımcı oldu.

Bu değişim sadece artımlı bir gelişme değildir. AI, bilim adamlarının bilinen tepkilerin büyük, gürültülü veri kümeleri aracılığıyla sift'e, istatistiksel olarak sağlam desenler çıkartıp bu hızla gelişen alanın yeni kimyasal uzayları ile genelleştirilmesine olanak sağlar.

Biyokimyasal Reaksiyonlarının Kompleksi

Biyokimyasal reaksiyonlar yaşamın motorudur. Bu karmaşıklığa neden olan çeşitli faktörlere katkıda bulunurlar: Genetik materyali ve medyate hücresel iletişim. Ancak sonuçları tahmin etmek, bir flask'daki tipik organik reaksiyonları tahmin etmekten çok daha zordur.

  • [FONT:0)Enzymatik kediiz:[Dönetici:[Döneticileri) Çoğu biyokimyasal reaksiyonlar enzimler tarafından kategorize edilir ve bu da genellikle geçici aralar içeren çok aşamalı mekanizmaları takip eder.
  • [FONT:0)Environmental duyarlılığı: Reaksiyon sonuçları pH, sıcaklık, kofay edilebilirlik ve yerel hücresel milieu - nadiren eğitim veri setlerinde yakalanır.
  • [FONT:0)Substrate promiscuity:) Enzymes genellikle birden çok substratı kabul edebilir, tahmin eden yol ve yan ürünleri ele geçirebilir.
  • [FONT:0)Yönergesel geri bildirim:[Dönergesel sistemlerde, reaksiyon yolları tümostery, post-translational değişiklikler ve gen ekspresi ile dinamik olarak düzenlenir ve statik tahmin modellerini yetersiz hale getirir.
  • [FONT:0]Data sparsity:[[Dönetici:[Dönetici:0)[Dönetici:0)Data sparsity:[[Dönetici:[Dönetici: 0) The Kyoto Encyclopedia of Genes and Genomes (KEGGGGGG) ve Brenda enzim veritabanı binlerce tepki içeriyor, mümkün substratlar ve koşullar kimyasal alan tarafından cüceler.

Bu zorluklar tarihsel olarak, her atomu basitleştirmek yerine, gözlemlenen verilerden reaktiviteyi yöneten istatistiksel kuralları öğrenir.

Yapay Zeka: Desenden Reaksiyon Prediction

Onun özünde, AI, tepki verenlerden (ve opsiyonel olarak katalizörler, koşullar) ürüne bir haritalama öğrenme girişimlerine başvurdu, ancak moleküler yapıların temsili eşsiz engeller ortaya çıkardı. Erken çalışma, kural tabanlı uzman sistemler, ancak modern yaklaşımlar grafik yapılandırılmış verileri kullanabilme yeteneğine sahip makine öğrenme modellerine güveniyor.

Molecules'in Yeniden Tanımlanması

Tepkileri tahmin etmek için bir model için, ilk önce molekülleri anlamalıdır. Ortak temsiller şunları içerir:

  • [FONT=0]SMILES dizeleri:[Dönetici: Bir metin bazlı lineer notasyon için bir metin bazlı doğrusal değildir. Basit olsa da, SMILES kanonik değildir ve token sipariş için hassas olabilir. Recurrent sinir ağları (RNNs) ve transformatörler SMILES'e karşı yapılan reaksiyon tahminleri için başarıyla uygulanır.
  • [FONT:0)Molecular grafikler:[Dönler:[Dönler: 0 3) Atomlar, düğümler ve bağlar olarak kenarlar olarak gösterilir. Graph sinir ağları (GNNs) doğal olarak moleküllerin bağlantılarını ve geometrisini yakalar. reaksiyon tahminleri için, reaksiyon grafiği veya ürün bir biyopartite grafiği veya atom haritalamaları kontrastlı bir grafik olarak temsil edilebilir.
  • [FONT=0]Fingerprints ve tanımlayıcılar: Geleneksel sabit uzunlukta özellik vektörleri (örneğin, Morgan parmak izleri) daha küçük veri setleri için rastgele orman veya SVM modellerinde kullanılır, ancak derin öğrenme genellikle onları büyük bir fiziksel olarak ifade eder.

Reaksiyon Prediction'daki Anahtar AI Teknikleri

Çeşitli algoritmaların aileleri, her biri güçlü ve zayıf yönleriyle dağıtıldı.

Graph Neural Networks (GNNs)

GNNs, moleküler mülkiyet ve tepki tahminleri için baskın mimari olarak ortaya çıktı.Süresel olarak yerel kimyasal çevrelerine dayanan atom temsillerini güncellediler.Rektöresel uygulamalar, Weisfeiler-Lehman ağı ve mesajı-passing sinir ağları (MPNNs) gibi ölçümlemeler için bir GNN'ler, USPTO (Birleşik Devletler ve Marka Ofisi) tepkileri ile belirlenen ölçümler konusunda üst düzeye çıkarabiliyor.

Transformer Model modelleri

Doğal dil işleme için geliştirilmiş olarak, transformatörler SMILES dizelerini diziler olarak tedavi eder.Kendi kendine özgü mekanizma, atomlar arasındaki uzun vadeli bağımlılıkları yakalamaya olanak sağlar.Ana Sayfalar ve Reaksiyoneller bu fikri eklediler.[Dönetici seviye kodlamalar ve retrosynthesis, görevi bir dizi-to-son çeviri problemi olarak tedavi eder.

Vector Machines ve Random Forests

Derin öğrenme baskın hale gelmeden önce, SVM ve rastgele ormanlar, özellikle daha küçük, incelenen veri setleri için tepki tahmin etmek için tepki tahminleri konusunda yararlıydılar. Atom reaktivite puanları, steric parametreler ve elektronik tanımlayıcılar gibi uzman tasarlanmış özelliklere güveniyorlar.

Retrosynthesis için öğrenme

Retrosynthesis – hedef molekülü basit öncülere kırma sorunu – Biyokimyada AI'nın temel bir uygulamasıdır.Finansal öğrenme ajanları, olası bir reaksiyon ağacının, pahalı veya pahalı adımların yol açtığı bir ödül sinyali tarafından yönlendirilmektedir. ”ENGT:0A 2020 Doğa kağıdı).

Biyokimyasal Reaksiyonunda AI'nın Avantajları

Artırılmış AI'yı reaksiyon tahminine dağıtmanın faydaları basit hız kazanımlar ötesine uzatıyor. Tüm araştırma borusunu yeniden şekillendiriyorlar.

  • [FONT:0]Massive Hız:[Dönetici:[Dönetici:0) Tek bir eğitimli model saniyede milyonlarca varsayımsal tepkiyi değerlendirebilir, mezun öğrenci yıllarını tamamlamak için bir görev.
  • [FONT:0]Cost azaltımı:[D)[Döneticileri laboratuara ulaşmadan önce, AI yeniden adlandırılmış atık ve enstrüman süresini azaltır.In farmasötik R&D, tek başarısız bir sentez on binlerce dolara mal olabilir, bu dönüştürücüdür.
  • [FONT:0]Discovery of non-obvious roadways:[Dönemli olmayan yollara karşı) Agresif dönüşümler – insan sezgilerini ihlal eden tepkiler önerebilir - biyocatalytic dönüşümler gibi - non-aqueous staz veya promiscuous enzim-catalyzed C-H aktivasyon - yeni sentetik rotalara yollara yol açabilir.
  • [FONT:0) Yüksek seviyeli deney ile ilgili olarak: Otomatik sentez platformları, AI tahmin modellerini döngüye kapatmak için birkaç kişi olabilir: model tepkileri önerir, robot onları gerçekleştirir ve sonuçlar modelleme eğitimine geri verir.
  • [FONT:0)Biyolojik yol elucidasyon:[Dönetici: 0 3) Metabolomics’de AI, enzimin gözlemlenen bir dönüşümden sorumlu olduğunu tahmin edebilir, bilinmeyen metabolik yol yollarını haritalamaya yardımcı olur. Bu özellikle doğal ürün keşfi ve anlayışta değerlidir.
  • [FONT:0)Kişiselleştirilmiş tıp:[Dönetici:[Dönetici:0) Bir bireyin genetik varyantlarının enzim aktivitesini nasıl değiştirir ve bu nedenle ilaç metabolizmasını yönlendirerek, AI doz ayarlamalarını ve olumsuz tepkileri azaltabilir.

Data Sources and Quality Challenges

AI modelleri sadece üzerinde eğitdikleri veriler kadar iyidir. Biyokimyasal tepki verileri için birincil kaynaklar şunları içerir:

  • [FONT:0]Literature madenciliği:[Dönetici:[Döneticileri): Uygulamada atomların çoğu zaman eksik veya yanlış olduğu için otomatik ekstraksiyon.
  • [FONT:0]Curated databases:[Döneticiler: [Döneticiler: [Döneticiler: 0,4] KEGGG, Rhea ve Brenda özellikle metabolik yol yolları için yüksek kaliteli, manuel olarak gözden geçirilmiş tepkiler veriyor. Ancak, büyüklüğü ( binlerce tepki) farmasötik şirketler tarafından yapılan milyonlarca özel tepkiyle karşılaştırıldığında sınırlı (en az sayıdaki tepki).
  • [FONT:0)Electronic laboratuvar notları (ELN): [Dönetici şirketler çok sayıda deneysel veri üretir, ancak bu veriler nadiren halka açık bir şekilde paylaşılır, hampers modeli genelleştirmenin bir parçası haline gelir.
  • [FONT:0) Yüksek Lisans deneyleri: [Dönetici: Berkeley AutoLab sistemi gibi platformlar haftada binlerce tepki elde edebilir, aktif öğrenme için yüksek kaliteli maçlanmış veriler sağlar.

Veri kalitesi sorunları alanı rahatsız eder. Eksik atom haritalama, tutarsız stereokimya açıklamaları ve hatalı ürün atamaları sistematik bir önyargı tanıtabilir. Ayrıca, veri dağılımı ağır ölçüde skewed: ortak tepkiler (örneğin, SMILES enumerasyon, grafik perturbasyon) ve sentetik veriler (örneğin, kuantum hesaplamaları) doğrudan bu verileri içerir.

Model Yorumability: The Black Box Problem

Derin öğrenme modellerinin tekrarlanması, opaklığıdır. Bir sinir ağından tahmin alan bir kimyager genellikle modelin belirli bir bağın neden kırılacağını anlayamaz. Bu yorumlama eksikliği, uyuşturucu onayı gibi düzenlenmiş ortamlarda kabul edilmesi için önemli bir engeldir. Birkaç strateji bunu ele almak için geliştirilmektedir:

  • [FONT:0)Attention haritaları:[Dönetici:[Döneticiler: 0) Transformer modelleri, atomların bir tahmin yaparken odaklandığını göstermek için dikkat ağırlıkları üretebilir. Bazı durumlarda, bu haritalar bilinen reaktif sitelerle uyumlu, mekaniksel bir anlayışla uyumlu hale getirir.
  • [FONT=0)Reaction şablonları: Hybrid modeller, öğrenilmiş bir şablon kütüphanesini bir sinir sıralama sistemi ile birleştirir, modelin insan hazırlanabilir bir reaksiyon kuralı (örneğin, “SN2 alt kurumda yer alır).
  • [FONT:0]Kırsal açıklamalar: [Dönetici grafiğine inmek ve tahminde değişiklikler izlemek, fonksiyonel grupların en etkili olduğu bir araştırma alanıdır.
  • [FONT:0)Uncertainty niceification: Ensembling yöntemleri ve Bayesian sinir ağları tahminler için güven aralıkları sağlayabilir, düşük güven çıktılarını deneysel doğrulama için.

İlerlemeye rağmen, yorumlanabilirlik için yaygın olarak kabul edilen standart hiçbir şey reaksiyon tahmininde mevcut değildir. Alan, tahminlerin eşlik ettiği “güvenli AI”ya doğru ilerliyor ve modeller dış dağıtım verileri üzerinde doğrulanıyor.

Mevcut Sınırlar ve Açık Sorunlar

ALP'nin tepki tahmininde coşku, sınırlamalarının kabul edilmesiyle üşümelidir:

  • [FONT:0] Yeni kimyagerlere genelleştirme: Bilinen tepki türlerinde eğitilmiş modeller, alışılmadık iyonik devletler veya non-canonical enzimler içerenler gibi gerçekten yeni dönüşümlerle sunulanlarda başarısız olur.
  • [[Düzg:0)Kondisyon bağımlılığı:[Dönetici:[Dönetici: 0) Birçok model reaksiyon koşullarını görmezden gelir (solvent, sıcaklık, katalizör). Bu değişkenleri ek girişler olarak aktif bir meydan okuma kalır, mevcut veriler sparse ve genellikle eksik.
  • [FONT:0] Grafik sinir ağları için erişilebilirlik:) GNNs güçlü olsa da, büyük moleküller için sayısal olarak pahalı hale gelir veya birçok tepki adımlarının çok yönlü yol yolları üzerinde eğitim nadir kalır.
  • [FONT:0]Biyolojik bağlam:[Dönetici:[Dönetici:0) Yaşam hücresinde, bir reaksiyon izolasyonda gerçekleşmiyor. Yetki yol yolları, substrat kanallama ve metabolik düzenlemeler tüm gerçek sonuçları etkiler.Mevcut AI modelleri büyük ölçüde bu bağlamı görmezden geliyor, tahmin edilebilir gücünü azaltır.
  • [FONT:0)Data sızıntı:[Dönetici:[Dönetici] Birçok eğitim veri setlerinin kamu doğası nedeniyle, eğitim sırasında gördükleri tepkilerle değerlendirilen bir risk vardır. Bakımcı geçiş ve yapılan test setleri her zaman zorunlu değildir.

Future: Alan nerede Başlanır?

Çeşitli heyecan verici eğilimler, AI'nın biyokimyasal tepki tahmininde neler elde edebileceğini zorlamak için hazırlanmaktadır.

Kuantum Kimyası ile Bütünleşme

AI'yı kuantum mekanikleri için bir yedek olarak tedavi etmek yerine, araştırmacılar her iki yaklaşımı da güçlendiriyorlar. Hybrid modeller elektron dağıtımını tanımlamak ve sonra bu özellikleri bir sinir ağına (örneğin, Hamilton'ın tahminine göre) beslemek için düşük maliyetli yarı-empical hesaplamalar kullanıyor.Bu, özellikle yol yolları arasındaki küçük enerji farklılıklarıyla ilgili olarak regio- ve stereoselectivity yakalayabilir.

Multi-Task Öğrenme ve Temel Modeller

Büyük dil modellerine ilham vererek, kimyasal AI topluluğu, MolBERT, ChemBERTa ve son zamanlarda yayınlanan “saçlar” ın geliştirilmesini teşvik etti - milyonlarca SMILES dizeleri, moleküler özellikler ve reaksiyonlar dahil - bu, sıfır atış reaksiyon tahmini için söz konusu olabilir, özellikle de MolBERT, ChemBERTa ve son zamanlarda yayınlanan bildiriler için doğrudan bir eğitim gerekli değildir.

Aktif Öğrenme ve Kapalı Deneyleme

Bir kez statik veri kümesi üzerinde bir kez eğitim yerine, aktif öğrenme sistemleri, belirsiz tahminler için modeli defalarca sorgular, sonra yeni veriler üretmek için deneyler yapar. Bu özellikle otomatik sentez platformları ile birleştirildiğinde güçlüdür. Tasarım döngüsü – makyaj-test-analyze hızla hızlanır. Zymergen ve G Bioworks gibi startuplar tüm platformlarını metabolik mühendislik için inşa etmişlerdir.

Stereokimyasal Çıktıları

Stereokimya ilaç moleküllerinde kritiktir, ancak mevcut birçok AI modeli enantioselectivity, diastereoselectivity veya chiral katalizörlerin etkisi üç boyutlu koordinatlar (örneğin RDKit’in uygun nesli kullanarak) ve chiral merkezlerinin değerlendirilmesi bu boşluğu ele almaya başlayabilir.Influence'in moleküler dinamikleri ile birleşimi, üç boyutlu koordinatları ileri düzeye çıkaran grafiklerle bir yol sağlayabilir.

Sistem biyolojisi ile entegrasyon

Nihai hedef sadece bir test tüpünde değil, canlı bir hücre bağlamında tepki tahmin modellerini (GEMs) ile eşlemeli metabolik modeller (GEMs) ile simülasyona olanak sağlar. AI, hangi enzim-substrate çiftlerinin fizyolojik olarak alakalı olduğunu tanımlanabilir, GEMs boyutunu azaltır ve hassas tıp için kişiselleştirilmiş metabolik modelleme sağlar.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Yapay zeka, biyokimyasal tepki sonuçları tahmininde temel bir araç için bir meraktan geçti. Grafik sinir ağları, dönüştürücüler ve takviye öğrenme sayesinde araştırmacılar şimdiye kadar enzymatik ve sentetik dönüşümlerin ürünlerini olağanüstü doğrulukla hızlandırdı, uyuşturucu keşfi, sentetik biyoloji ve metabolizma anlayışıyla sürdürüyorlar. Ancak alan ergenlikte kalır.

AI modelleri daha sağlam ve erişilebilir hale geldiğinde, kimyacı veya biyologı değiştirmeyecekler, ancak bunun yerine yaratıcılıklarını özgürleştirmek yerine, rutin deneme-ve-terörden serbest bırakmak ve en zor ve ödüllendirici sorunlara odaklanmaları mümkün olacaktır.İnsan sezgi ve makine öğrenimi arasındaki sinerji, bir reaksiyonun sonucunu tahmin eden bir sonraki çağı, bilinen bir bileşik olarak rutin hale gelir.