Introduction: Convergence de l'informatique et de la chimie

La prédiction des résultats des réactions biochimiques est depuis longtemps l'une des tâches les plus exigeantes intellectuellement dans les sciences de la vie. Traditionnellement, les chimistes et les biologistes se sont appuyés sur des essais expérimentaux et des calculs thermodynamiques et sur des inférences mécanistes pour deviner comment un ensemble donné de réactifs se transformerait.Ce processus, bien que fondamental, est lent, coûteux et souvent ne parvient pas à saisir toute la complexité des systèmes biologiques.

L'IA permet aux scientifiques de passer par des ensembles de données massives et bruyantes de réactions connues, d'extraire des modèles statistiquement robustes et de généraliser vers des espaces chimiques entièrement nouveaux. Les implications couvrent la découverte de médicaments, l'ingénierie métabolique, la conception enzymatique et la compréhension fondamentale de la vie des machines moléculaires.

La complexité des réactions biochimiques

Les réactions biochimiques sont le moteur de la vie. Elles transforment les nutriments en énergie, en répliquent le matériel génétique et en médiatisent la communication cellulaire. Pourtant, prédire leurs résultats est beaucoup plus difficile que prédire les réactions organiques typiques dans une fiole.

  • Catalyse enzymatique: La plupart des réactions biochimiques sont catalysées par des enzymes, qui imposent des contraintes stéréoélectroniques strictes et suivent souvent des mécanismes à plusieurs étapes impliquant des intermédiaires transitoires.
  • Sensibilité environnementale : Les résultats de la réaction dépendent du pH, de la température, de la disponibilité du cofacteur et du milieu cellulaire local, variables rarement saisies dans les ensembles de données de formation.
  • Promiscuité de substrat:[ Les enzymes peuvent souvent accepter plusieurs substrats, conduisant à des voies ramifiées et des produits secondaires qui compliquent la prédiction.
  • Feedback réglementaire : Dans les systèmes vivants, les voies de réaction sont régulées dynamiquement par des modifications allostérieuses, post-traductionnelles et l'expression génique, ce qui rend les modèles de prédiction statiques inadéquats.
  • Sparsité des données: Alors que des bases de données comme l'Encyclopédie des gènes et des génomes de Kyoto (KEGG) et la base de données des enzymes de Brenda contiennent des milliers de réactions, elles sont naines par l'espace chimique des substrats et des conditions possibles.

Ces défis ont toujours limité l'applicabilité des méthodes de chimie computationnelle, comme la mécanique quantique ou la dynamique moléculaire, qui sont trop lentes pour la prédiction à haut débit. L'IA offre une approche différente : au lieu de simuler chaque atome, elle apprend les règles statistiques qui régissent la réactivité à partir des données observées.

Intelligence artificielle: De la reconnaissance des motifs à la prédiction des réactions

L'IA a surtout été appliquée à la prévision des réactions, qui tente d'apprendre une cartographie des réactifs (et, en option, des catalyseurs, des conditions) aux produits. Il s'agit d'un problème d'apprentissage supervisé, mais la représentation des structures moléculaires introduit des obstacles uniques.

Représentation des molécules

Pour qu'un modèle puisse prédire les réactions, il doit d'abord comprendre les molécules.

  • SMILES strings:[ Une notation linéaire basée sur le texte. Bien que simple, SMILES n'est pas canonique et peut être sensible à l'ordre des jetons. Réseaux neuronaux récurrents (RNN) et transformateurs ont été appliqués avec succès à SMILES pour la prédiction de la réaction.
  • Les graphes moléculaires:[ Les atomes comme nœuds et les liaisons comme bords. Les réseaux neuronaux (RGN) des graphiques capturent naturellement la connectivité et la géométrie des molécules.
  • Les empreintes digitales et les descripteurs:[ Les vecteurs traditionnels de caractéristiques à longueur fixe (p. ex. empreintes digitales Morgan) sont encore utilisés dans les modèles aléatoires de forêt ou de SVM pour les ensembles de données plus petits, mais l'apprentissage profond les surpasse généralement sur les grands corps.

Techniques clés de l'IA dans la prévision de la réaction

Plusieurs familles d'algorithmes ont été déployées, chacune avec ses forces et ses faiblesses.

Réseaux neuronaux (RGN)

Les GNN sont apparues comme l'architecture dominante de la propriété moléculaire et de la prédiction des réactions. Ils fonctionnent par la mise à jour itérative des représentations d'atomes en fonction de leur environnement chimique local. Pour la prédiction des réactions, les GNN peuvent apprendre à identifier les liaisons qui se brisent et se forment. Parmi les implémentations notables, on peut citer le réseau Weisfeiler-Lehman et les réseaux neuronaux de transmission de messages (MPNN).

Modèles de transformateurs

Développé à l'origine pour le traitement du langage naturel, les transformateurs traitent les chaînes de SMILES comme des séquences. Le mécanisme d'auto-attention permet au modèle de capturer les dépendances à longue distance entre les atomes. L'architecture de transformation moléculaire (Schwaller et al., 2019) a obtenu des performances remarquables sur la prédiction de réaction et la rétrosynthèse, en traitant la tâche comme un problème de traduction séquence-séquence.

Supporter les machines vectorielles et les forêts aléatoires

Avant que l'apprentissage profond ne devienne dominant, les MVS et les forêts aléatoires étaient les chevaux de travail de la prédiction de la réaction, surtout pour les ensembles de données plus petits et curés. Ils reposent sur des caractéristiques conçues par des experts comme les scores de réactivité des atomes, les paramètres stériques et les descripteurs électroniques.

Renforcement de l'apprentissage pour la resynthèse

Les agents d'apprentissage du renforcement explorent un arbre de déconnections de réaction possibles, guidé par un signal de récompense qui pénalise les étapes peu probables ou coûteuses. Un document de nature 2020 a utilisé une recherche d'arbre Monte Carlo combinée à un réseau de politiques neurales pour proposer des itinéraires synthétiques pour des produits naturels complexes.Cette approche est maintenant intégrée dans les plateformes de découverte de médicaments commerciaux.

Avantages de l'IA dans la prévision des réactions biochimiques

Les avantages du déploiement de l'IA pour la prédiction des réactions dépassent les simples gains de vitesse. Ils remodelent l'ensemble du pipeline de recherche.

  • Accélération du masque:[ Un modèle formé seul peut évaluer des millions de réactions hypothétiques en secondes, une tâche qui prendrait des années à accomplir une armée d'étudiants diplômés.
  • Réduction du coût:[ En filtrant les chimies mortes avant qu'elles n'atteignent le laboratoire, l'IA réduit les pertes de réactif et le temps de l'instrument.
  • Découverte de voies non évidentes: L'IA peut suggérer des réactions qui violent l'intuition humaine – comme des transformations biocatalytiques dans des solvants non aqueux ou une activation C-H catalysée par des enzymes promisceuses – menant à de nouvelles voies synthétiques.
  • Intégration avec expérimentation à haut débit: Les plates-formes de synthèse automatisées peuvent être couplées à des modèles de prédiction de l'IA pour fermer la boucle: le modèle propose des réactions, le robot les effectue et les résultats se nourrissent de la formation du modèle.
  • Élucidation des voies biologiques :[ En métabolomique, l'IA peut prédire quelle enzyme est responsable d'une transformation observée, aidant à cartographier des voies métaboliques inconnues. Ceci est particulièrement utile dans la découverte de produits naturels et dans la compréhension du métabolisme des médicaments.
  • Médicament personnalisé:[ En prédisant comment un individu , les variantes génétiques altérent l'activité enzymatique et donc le métabolisme du médicament, l'IA peut guider les ajustements de dose et réduire les effets indésirables.

Sources de données et défis de qualité

Les modèles d'IA sont seulement aussi bons que les données sur lesquelles ils sont formés. Les principales sources de données sur les réactions biochimiques comprennent :

  • L'extraction automatique d'articles de revues produit des ensembles de données importants mais bruyants. La base de données USPTO, par exemple, contient plus de 3 millions de réactions extraites de brevets, mais la cartographie des atomes (qui sont des atomes dans les réactifs et qui sont souvent manquants ou incorrects).
  • Bases de données curés: KEGG, Rhea, et Brenda fournissent des réactions de haute qualité, manuellement revues, en particulier pour les voies métaboliques. Cependant, leur taille est limitée (tens de milliers de réactions) par rapport aux millions de réactions propriétaires détenues par les compagnies pharmaceutiques.
  • Les carnets électroniques de laboratoire (ELN): Les entreprises privées génèrent de grandes quantités de données expérimentales, mais ces données sont rarement partagées publiquement, ce qui entraîne une fragmentation qui entrave la généralisation des modèles.
  • Expériences à haut débit: Des plateformes comme le système AutoLab Berkeley peuvent produire des milliers de résultats de réaction par semaine, fournissant des données appariées de haute qualité pour l'apprentissage actif.

De plus, la distribution des données est fortement biaisée : les réactions courantes (p. ex., formation de liaisons amides) sont surreprésentées, tandis que des transformations rares mais intéressantes (p. ex., halogène enzymatique) sont éparpillées. Des techniques telles que l'augmentation des données (p. ex., dénombrement de SMILES, perturbation des graphiques) et la production de données synthétiques (p. ex., à l'aide de calculs chimiques quantiques) sont en cours d'exploration pour atténuer cette sparté. La base de données PubChem sert également de ressource massive pour l'information sur les composés, même si elle ne contient pas directement de données sur les réactions.

Modèle d'interprétation : le problème de la boîte noire

Une critique récurrente des modèles d'apprentissage profond est leur opacité. Un chimiste qui reçoit une prédiction d'un réseau neuronal ne comprend souvent pas pourquoi le modèle pense qu'un lien particulier va se rompre. Ce manque d'interprétation est un obstacle important à l'adoption dans des environnements réglementés tels que l'approbation des médicaments.

  • Les modèles de transformateurs produisent des poids d'attention qui peuvent être visualisés pour montrer les atomes sur lesquels le modèle se concentrait lorsqu'il faisait une prédiction.Dans certains cas, ces cartes s'alignent sur des sites réactifs connus, fournissant un certain aperçu mécaniste.
  • Modèles de réaction:[ Les modèles hybrides combinent une bibliothèque de modèles apprise avec un système de classement neuronal, permettant au modèle de produire une règle de réaction lisible par l'homme (p. ex., substitution de la NS2 à un carbone sp3).
  • Explications counterffactuelles:[ En perturbant le graphique moléculaire et en observant les changements dans la prédiction, on peut déduire quels groupes fonctionnels sont les plus influents.
  • Quantification d'incertitude:[ Les méthodes d'assemblage et les réseaux neuraux bayésiens peuvent fournir des intervalles de confiance pour les prédictions, en affichant des sorties peu fiables pour la vérification expérimentale.

Malgré les progrès réalisés, il n'existe pas de norme largement acceptée pour l'interprétation des prévisions de réaction. Le champ se dirige vers -----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------

Limites actuelles et problèmes ouverts

L'enthousiasme pour l'IA dans la prédiction des réactions doit être tempéré par la reconnaissance de ses limites:

  • Généralisation limitée aux nouvelles chimies: Les modèles formés sur des types de réaction connus échouent souvent lorsqu'ils sont présentés avec des transformations vraiment nouvelles, telles que celles impliquant des états d'oxydation inhabituels ou des enzymes non canoniques.
  • Dérigation des conditions:[ De nombreux modèles ignorent les conditions de réaction (solvant, température, catalyseur).Incorporer ces variables comme des entrées supplémentaires reste un défi actif, car les données disponibles sont rares et souvent incomplètes.
  • Évoluabilité des réseaux neuronaux graphes :[ Bien que les GNN soient puissants, ils deviennent coûteux pour les grosses molécules ou quand de nombreuses étapes de réaction doivent être simulées.
  • Contexte biologique: Dans une cellule vivante, une réaction ne se produit pas isolément. Les voies concurrentes, la canalisation du substrat et la régulation métabolique affectent tous le résultat réel.
  • Fausse de données: En raison de la nature publique de nombreux ensembles de données de formation, il y a un risque que les modèles soient évalués sur les réactions qu'ils ont vues au cours de l'entraînement.

Orientations futures : Où est le champ dirigé?

Plusieurs tendances stimulantes sont en passe de repousser les limites de ce que l'IA peut réaliser dans la prévision des réactions biochimiques.

Intégration avec la chimie quantique

Les modèles hybrides utilisent des calculs semi-empiriques à faible coût pour décrire la distribution des électrons, puis alimentent ces caractéristiques dans un réseau neuronal (p. ex., apprentissage profond avec prédiction de Hamilton), ce qui permet de saisir la régio- et la stéréosélectivité que les modèles purement data-drivés manquent, surtout pour les réactions avec de petites différences énergétiques entre les voies.

Modèles d'apprentissage et de fondation multitâches

Inspirée par de grands modèles de langage, la communauté chimique de l'IA développe des modèles de fondation --pré-formés sur des ensembles de données chimiques massives – y compris des millions de chaînes de SMILES, de propriétés moléculaires et de réactions – qui peuvent être affinés pour des tâches spécifiques.Par exemple, MolBERT, ChemBERTa et le récent Dithub pour les molécules : la base de données ouverte sur les réactions.

Apprentissage actif et expérimentation en boucle fermée

Plutôt que de s'entraîner une fois sur un ensemble de données statiques, les systèmes d'apprentissage actifs interrogent à plusieurs reprises le modèle pour des prédictions incertaines, puis effectuent des expériences pour générer de nouvelles données. Ceci est particulièrement puissant lorsqu'il est combiné avec des plateformes de synthèse automatisées. La boucle de conception – make – test – analyse est accélérée de façon spectaculaire.

Prévoir des résultats stéréochimiques

La stéréochimie est essentielle dans les molécules de médicaments, mais de nombreux modèles d'IA existants ont du mal à prédire l'énantioselectivité, la diastéréosélectivité ou l'influence des catalyseurs chiraux. Des représentations graphiques émergentes qui codent des coordonnées tridimensionnelles (p. ex., utilisant la génération de conformer RDKit) et l'attention aux centres chiraux commencent à combler cette lacune.

Intégration avec la biologie des systèmes

L'objectif ultime est de prédire les résultats de la réaction non seulement dans un tube d'essai, mais dans le contexte d'une cellule vivante. Il faut pour cela des modèles de prédiction de la réaction de couplage avec des modèles métaboliques à l'échelle du génome (MGE) qui simulent les distributions de flux.

Conclusion

L'intelligence artificielle est passée d'une curiosité à un outil de base dans la prédiction des résultats de la réaction biochimique. Grâce aux réseaux neuronaux graphes, aux transformateurs et à l'apprentissage du renforcement, les chercheurs peuvent maintenant prévoir les produits de transformations enzymatiques et synthétiques avec une précision remarquable, l'accélération de la découverte de médicaments, la biologie synthétique et notre compréhension du métabolisme.

À mesure que les modèles d'IA deviennent plus robustes et plus accessibles, ils ne remplaceront pas le chimiste ou le biologiste, mais ils augmenteront leur créativité, les libérant de la routine des essais et des erreurs et permettant de se concentrer sur les problèmes les plus difficiles et les plus gratifiants.