Применение машинного обучения в проектировании и оптимизации катализаторов

Машинное обучение (ML) стало преобразующим инструментом в области проектирования катализаторов, переведя парадигму от традиционных экспериментов с пробами и ошибками к открытию, основанному на данных. Используя обширные наборы данных из экспериментов и вычислений, алгоритмы ML могут прогнозировать производительность катализатора, оптимизировать условия реакции и раскрывать фундаментальные отношения структуры и активности. Эта интеграция ускоряет разработку более эффективных, селективных и долговечных катализаторов, которые имеют решающее значение для промышленных процессов, таких как синтез аммиака, нефтепереработка и улавливание углерода. По мере роста спроса на устойчивую химию подходы, основанные на ML, предлагают путь для быстрого выявления новых каталитических материалов и снижения воздействия химического производства на окружающую среду.

Введение в дизайн катализатора

Катализаторы — это материалы, ускоряющие химические реакции без потребления, позволяющие процессам протекать в более мягких условиях с более высокой селективностью. Они занимают центральное место в более чем 90% промышленных химических процессов, от производства удобрений до фармацевтического синтеза. Проектирование катализатора включает оптимизацию множества свойств, включая активность, селективность, стабильность и стоимость. Традиционно это требует обширного экспериментального скрининга и механистических исследований, часто руководствуясь эмпирическими правилами и интуицией. Сложность возникает из-за сложного взаимодействия атомных устройств, электронных состояний, поверхностных дефектов и промежуточных реакций. Современный дизайн катализатора все больше опирается на вычислительные инструменты, такие как теория функционала плотности (DFT) и микрокинетическое моделирование, но эти методы могут быть вычислительно дорогими и ограниченными в химическом пространстве, которое они могут исследовать. Машинное обучение обеспечивает дополнительный подход, который может обрабатывать высокоразмерные данные и идентифицировать шаблоны за пределами человеческой интуиции, что делает его мощным ускорителем для открытия.

Роль машинного обучения в развитии катализаторов

Модели машинного обучения обучаются на наборах данных, которые объединяют экспериментальные результаты, вычислительные вычисления и химические дескрипторы. Эти модели учатся отображать входные характеристики — такие как элементные композиции, координационные среды или энергии адсорбции — для таргетирования свойств, таких как частота оборота или энергия активации. После обучения модель может предсказать производительность тысяч катализаторов-кандидатов за секунды, эффективно отсеивая виртуальные библиотеки до того, как будет выполнен какой-либо синтез. Эта способность резко сокращает количество необходимых физических экспериментов и помогает исследователям сосредоточиться на наиболее перспективных материалах. Кроме того, ML может извлекать скрытые корреляции и предлагать новые эксперименты, которые систематически заполняют пробелы в знаниях, ускоряя итерационный цикл генерации гипотез и валидации. Интеграция ML с высокопроизводительными экспериментами (HTE) и автоматизированными лабораториями создает рабочие процессы с замкнутым циклом, которые могут автономно исследовать пространства катализаторов.

Сбор данных и разработка функций

Высококачественные данные являются основой любого успешного применения ML в катализе. Источники данных включают опубликованную литературу, общедоступные базы данных, такие как Catalysis-Hub или NREL Materials Database, запатентованные экспериментальные результаты и вычислительные репозитории. Общие функции, используемые для моделирования катализаторов, включают:

Для разработки функций требуется экспертиза домена для выбора соответствующих дескрипторов, которые коррелируют с каталитическим поведением. Последние достижения в обучении представлениям, такие как нейронные сети графов (GNN), позволяют моделям автоматически изучать функции из атомных структур, уменьшая зависимость от вручную созданных дескрипторов. Однако тщательная предварительная обработка для обработки отсутствующих данных, выбросов и согласованности единиц остается необходимой для предотвращения предвзятых прогнозов.

Используемые методы машинного обучения

Для исследования катализа были адаптированы различные алгоритмы ML, каждый из которых подходит для различных типов данных и задач прогнозирования:

Эти методы часто объединяются в гибридные рабочие процессы. Например, GNN может предсказать энергии адсорбции, которые затем подаются в кинетическую модель, в то время как активный ученик предлагает новые каталитические композиции для тестирования в лаборатории.

Ключевые модели машинного обучения для катализа

Графические нейронные сети для картирования структуры и свойств

Графические нейронные сети стали краеугольным камнем ML в проектировании катализаторов благодаря их способности обрабатывать атомные структуры напрямую. В GNN атомы представлены в виде узлов с векторами признаков и связей в виде краев. Сообщения передаются между соседними узлами для захвата локальных химических сред. Эта архитектура естественным образом подходит для прогнозирования свойств, таких как энергии формирования, зазоры полос и энергии адсорбции из кристаллических или молекулярных графов. Модели, такие как SchNet, DimeNet и MEGNet, продемонстрировали современную точность на бенчмарках данных, таких как Materials Project и OC20. Способность обобщать различные кристаллические структуры и стехиометрии делает GNN мощным инструментом для виртуального скрининга гетерогенных катализаторов.

Методы ансамбля и неопределенность количественной оценки

Методы сборки, такие как случайные леса и повышение градиента, обеспечивают надежную производительность с относительно небольшими наборами данных, что характерно для исследований катализа, где экспериментальные точки данных могут быть дорогими для генерации. Они также обеспечивают оценки важности признаков, которые помогают интерпретировать, какие дескрипторы приводят к производительности катализатора. Методы количественной оценки неопределенности, такие как отсев Монте-Карло или гауссовские процессы, дают доверительные интервалы для прогнозов. Это имеет решающее значение для управления рисками при выборе кандидатов катализатора для синтеза, поскольку это позволяет исследователям расставлять приоритеты прогнозов с высокой степенью достоверности и выводить выбросы для дальнейшего исследования.

Трансфертное обучение и многоточные модели

Трансферное обучение использует знания из больших общих наборов данных (например, расчеты DFT на тысячах материалов) для улучшения прогнозов на меньших конкретных наборах данных (например, экспериментальные данные для конкретной реакции). Этот подход снижает потребность в обширных данных обучения. Модели многоточности объединяют данные с разных уровней теории (например, дешевые эмпирические потенциалы и дорогостоящие DFT) для баланса точности и вычислительных затрат. Такие методы, как ко-кригинг или основанные на нейронных сетях многоточные рамки могут распространять информацию от прогнозов низкой точности до прогнозов высокой точности, что позволяет более эффективно исследовать пространства катализаторов.

Преимущества использования машинного обучения

Машинное обучение предлагает несколько преимуществ перед традиционными подходами в проектировании катализаторов:

Эти преимущества были продемонстрированы в нескольких областях, от электрокатализатора для расщепления воды до гетерогенного катализа для активации метана.

Исследование случаев в ML-Driven Catalyst Discovery

Прогнозирование катализаторов реакции эволюции кислорода

Одним из ярких примеров является использование ML для выявления эффективных катализаторов реакции эволюции кислорода (OER), ключевого узкого места в водном электролизе для производства водорода. Исследователи из Института им. Я. Гейровского обучили случайные лесные модели адсорбции адсорбционных энергий DFT-вычисленных реакционных промежуточных соединений по оксидам металлов. Модель предсказала сверхпотенциалы OER для тысяч композиций-кандидатов, что привело к открытию четвертичных оксидов с активностью, сопоставимой с бенчмарками драгоценных металлов. Этот подход снизил вычислительные затраты на порядок по сравнению с исчерпывающим скринингом DFT.

Оптимизация катализаторов синтеза аммиака

Синтез аммиака с помощью процесса Хабера-Боша энергоемкий и основан на катализаторах на основе железа, продвигаемых с калием и алюминием. Модели ML были разработаны для оптимизации состава промотора и распределения размеров частиц. В исследовании в вычислительных материалах npj используется ускорение градиента для прогнозирования скорости синтеза аммиака из структурных особенностей, определяя, что комбинация меньших размеров частиц и конкретных промоторов может повысить активность в мягких условиях. Эксперименты с ML-наведением достигли 30% улучшения скорости реакции по сравнению с обычными составами.

Разработка одноатомных катализаторов для снижения CO2

Одноатомные катализаторы (SAC) обеспечивают максимальную эффективность атома и настраиваемые электронные свойства. Используя графовые нейронные сети, команда из Университета Торонто отсмотрела более 200 000 конфигураций SAC на различных опорах для электрохимического снижения CO2 до метанола. Модель предсказала, что легированные азотом графеновые опоры с конкретными переходными металлами (например, Ni, Fe) продемонстрировали высокую селективность и низкую сверхпотенциальность. Последующая экспериментальная валидация подтвердила прогнозы, обеспечив жизнеспособный катализатор для использования углерода. Эта работа, опубликованная в ACS Catalysis , иллюстрирует, как ML может перемещаться по обширному пространству проектирования SACs.

Проблемы и ограничения

Несмотря на обещание, применение машинного обучения в каталитической конструкции сталкивается с несколькими препятствиями:

Решение этих проблем требует постоянных инвестиций в открытые хранилища данных, наборы эталонных данных, такие как Catalysis-Hub , и разработку объяснимых методов ИИ, адаптированных к химии.

Будущие направления и возможности

Закрытые автономные лаборатории

Одним из самых захватывающих рубежей является интеграция ML с роботизированными экспериментами и автоматизированной характеристикой. В этих «лабораториях с автоматическим управлением» модель ML предлагает катализаторные составы, робот синтезирует и тестирует их, а результаты подаются обратно для обновления модели. Этот цикл может работать непрерывно, резко ускоряя оптимизацию. Такие платформы, как система ARES в Университете Торонто и подход Chemputer, уже демонстрируют эту способность для фотокатализа и органического синтеза.

Многомасштабное моделирование и обратный дизайн

Будущие модели ML будут охватывать несколько масштабов, от электронной структуры до реакторной инженерии, обеспечивая сквозные прогнозы. Обратные методы проектирования, где модель генерирует каталитические структуры с желаемыми свойствами-мишенями (например, высокая активность для конкретной реакции), набирают тягу. Генеративные модели, такие как вариационные автокодеры (VAE) и генеративные состязательные сети (GAN), могут предлагать новые кристаллические структуры или конфигурации поверхности, которые удовлетворяют заданным ограничениям, расширяя химическое пространство за пределами существующих баз данных.

Обмен данными и федеративное обучение

Для преодоления дефицита данных в масштабах всего сообщества предпринимаются усилия по созданию больших, тщательно отобранных наборов данных. Федеративное обучение позволяет нескольким учреждениям совместно обучать модели МО без обмена их собственными данными, сохраняя конфиденциальность и извлекая выгоду из объединенных знаний. Этот подход особенно актуален для промышленного катализа, где компании могут неохотно публиковать свои данные.

Устойчивость и зеленый катализ

ML также применяется для проектирования катализаторов для устойчивых процессов, таких как фоторедукция CO2, утилизация пластика и возобновляемое химическое производство. Быстро проверяя обильные и нетоксичные материалы, ML может помочь заменить редкие или токсичные металлы (например, платину, палладий) с изобилием Земли альтернативами, согласуясь с принципами зеленой химии.

Заключение

Машинное обучение коренным образом меняет дизайн катализаторов, позволяя исследовать огромные химические пространства, уменьшая экспериментальные нагрузки и открывая новые отношения структуры-активности. От графовых нейронных сетей до автономных лабораторий эти инструменты ускоряют открытие катализаторов для энергии, окружающей среды и промышленности. Однако проблемы в качестве данных, интерпретируемости и обобщении остаются, требуя постоянного сотрудничества между экспериментаторами и вычислительными учеными. По мере созревания области интеграция ML с физическими моделями и высокопроизводительными платформами обещает предоставить специализированные катализаторы с беспрецедентной эффективностью, помогая удовлетворить глобальные потребности в устойчивом химическом производстве. Продолжение прогресса в разработке алгоритмов, инфраструктуры данных и открытой науки будет иметь важное значение для реализации полного потенциала машинного обучения в исследованиях катализа.