Подходы к проверке систем, управляемых ИИ, на предмет предвзятости и безопасности

Почему проверка систем ИИ важна сейчас больше, чем когда-либо

Искусственный интеллект больше не является лабораторным любопытством. Он обрабатывает заявки на получение кредита, рекомендует медицинские процедуры, контролирует автономные транспортные средства и модерирует онлайн-контент. Каждое из этих решений несет риск. Предвзятый алгоритм кредитования может отказать в ипотеке квалифицированным заявителям. Плохо проверенный медицинский ИИ может неправильно диагностировать состояние. Небезопасный автономный автомобиль может вызвать столкновения. Проверка - это важный процесс, который устраняет разрыв между перспективной моделью и надежным развертыванием. Без него стоимость ошибок измеряется не только в долларах, но и в справедливости, безопасности и благополучии человека.

Ставки особенно высоки, потому что системы ИИ не выходят из строя предсказуемым образом. Традиционные ошибки программного обеспечения вызывают сбои или неправильные выходы. Система ИИ может производить, казалось бы, правильные выходы для общих входов, при этом катастрофически проваливается в редких случаях. Это делает проверку гораздо более сложной. Она требует не только проверки того, что система делает то, что она должна делать, но и того, что она не делает вредных вещей в ситуациях, которые ее разработчики никогда не представляли.

Регуляторы по всему миру обращают внимание. Закон об ИИ Европейского союза & #8217 классифицирует заявки по уровню риска и предписывает оценку соответствия для систем с высоким риском. В Соединенных Штатах Национальный институт стандартов и технологий (NIST) опубликовал Рамочную программу управления рисками ИИ, которая требует постоянного тестирования и мониторинга. Организации, которые развертывают ИИ без надлежащей проверки, сталкиваются с юридической ответственностью, ущербом репутации и потерей доверия пользователей.

Основополагающие подходы к проверке

Аудит данных: поиск предубеждений в источнике

Фраза “мусор в мусоре, мусор вне ” особенно актуальна для ИИ. Данные обучения, отражающие исторические неравенства, будут учить этим неравенствам модель. Аудит данных - это первая линия защиты. Он включает в себя систематический анализ набора данных на наличие дисбалансов, недостающих групп или прокси-вариалов, которые могут привести к предвзятым решениям.

Общие методы аудита включают:

NIST’s AI Bias Resources предоставляют подробные рекомендации по методам аудита и показателям справедливости. Однако аудит не является одноразовым событием. Распределение данных смещается с течением времени, поэтому необходим постоянный мониторинг.

Тестирование и валидация: модели стресс-тестирования перед развертыванием

После того, как модель обучена, она должна быть протестирована на основе широкого спектра сценариев. Стандартная проверка на задержавшемся тестовом наборе недостаточна, поскольку она представляет собой только среднюю производительность. Тестирование на предвзятость и безопасность требует преднамеренного построения сложных входных данных.

Сценарное тестирование — мощный метод. Для модели скрининга резюме тестовые случаи могут включать кандидатов с пробелами в занятости, нетрадиционными именами или степенями из менее известных учреждений. Для самоуправляемого автомобиля сценарии включают пешеходов в темной одежде, внезапные изменения погоды и зоны строительства. Каждый тестовый случай показывает, как модель справляется с реальной сложностью.

Стресс-тестирование выталкивает модели за пределы их комфортного диапазона. Вводы систематически возмущаются: добавление шума к изображениям, перефразирование текста или изменение порядка функций. Если выход модели & #8217 резко меняется в ответ на небольшое, семантически незначительное возмущение, что указывает на хрупкость и потенциал для небезопасного поведения.

Обходное тестирование идёт ещё дальше. Отдельный алгоритм намеренно создаёт вводы, предназначенные для обмана модели. Это особенно важно для критически важных приложений. Google’s Обходный инструментарий устойчивости предоставляет инструменты для генерации таких атак и измерения устойчивости.

Валидация должна также включать оценку «человек в контуре» . Автоматизированные показатели, такие как точность или точность, не захватывают каждый режим отказа. Эксперты домена, конечные пользователи и затронутые сообщества могут идентифицировать проблемы, которые пропускают показатели. Например, чат-бот может пройти все автоматизированные тесты беглости, но все равно генерировать оскорбительные ответы на определенные входы. Человеческий обзор ловит эти случаи.

Формальная проверка: математические гарантии безопасности

Формальная проверка применяет строгие математические рассуждения, чтобы доказать, что система ИИ удовлетворяет желаемым свойствам при любых условиях. Это звучит как золотой стандарт, но он имеет значительные компромиссы.

Для простых моделей, таких как линейные классификаторы или деревья решений, формальная верификация относительно проста. Поведение модели может выражаться в виде набора ограничений, а решатель может определить, существует ли какое-либо нарушение. Для глубоких нейронных сетей проблема становится намного сложнее. Нелинейные активации и миллионы параметров создают сложную, непрозрачную границу принятия решений. Тем не менее, прогресс делается.

Такие методы, как Решители модулей удовлетворяемости (SMT) и смешанные целые линейные программы (MILP) , были адаптированы к рассуждениям о нейронных сетях. Исследователи успешно проверили свойства, такие как “ для всех входов в этом диапазоне классификация выходов не изменится” или “ сеть никогда не назначит высокий показатель достоверности состязательному примеру.”

AlphaBeta-CROWN фреймворк является одним из ведущих формальных инструментов проверки для нейронных сетей. Он может обрабатывать сети с десятками тысяч нейронов, хотя масштабирование до моделей производственного размера остается сложной задачей. Формальная проверка в настоящее время наиболее практична для небольших локальных моделей или для проверки конкретных свойств более крупных моделей.

Объяснение и интерпретируемость: открытие черного ящика

Проверка легче, когда вы понимаете, как модель достигает своих решений. Методы объяснимости направлены на то, чтобы сделать внутреннюю логику систем ИИ прозрачной для рецензентов. Это не доказывает непосредственно безопасность, но позволяет аудиторам человека выявлять ошибочные рассуждения.

Пост-хок метод объяснения

Эти методы приблизительно соответствуют тому, что делает модель черного ящика после факта. Популярные методы включают:

Эти методы не идеальны. Различные методы объяснения могут не соглашаться, и их можно обмануть состязательными входами. Однако они служат ценным диагностическим инструментом во время проверки. Если модель помечает заявку на кредит как высокий риск, и SHAP показывает, что основным драйвером является ZIP-код заявителя & #8217, то это красный флаг для искажения прокси.

Искусственно интерпретируемые модели

Альтернативный подход заключается в том, чтобы полностью избежать черных ящиков с помощью моделей, которые по своей сути интерпретируемы. Деревья решений, редкие линейные модели и обобщенные аддитивные модели (GAM) могут быть поняты непосредственно людьми. Для многих приложений с высокими ставками, таких как кредитный рейтинг или прогноз рецидивизма, эти более простые модели могут достичь конкурентной точности, предлагая полную прозрачность.

Выбор между сложной моделью черного ящика с пост-срочными объяснениями и интерпретируемой моделью по своей сути предполагает фундаментальный компромисс. Когда безопасность и справедливость имеют первостепенное значение, многие регуляторы и практики склоняются к более простым, доказуемо проверяемым моделям.

Новые технологии и режущая кромка

Алгоритмы, осознающие справедливость

Вместо того, чтобы задним числом проверять на предвзятость, новые алгоритмы встраивают ограничения справедливости непосредственно в процесс обучения. Эти алгоритмы оптимизируют точность, одновременно наказывая неравенство между защищенными группами. Подходы включают:

Каждый подход имеет слепые пятна. Предварительная обработка может снизить общую точность, поскольку она изменяет распределение данных. В процессе обработки требуется выбрать, какое определение справедливости оптимизировать, что само по себе является решением, нагруженным ценностью. После обработки может скрываться лежащая в основе модель смещения, которая может появиться при сдвиге распределения. Комплексный подход проверки использует все три.

Соперническая проверка

Опираясь на состязательное тестирование, верификацию можно превратить в непрерывную игру. Одна система (противник) пытается найти входы, которые приводят к сбою целевой модели. Затем целевая модель обновляется, чтобы противостоять этим сбоям, и начинается новый раунд атак. Этот процесс, иногда называемый обучением противника в петле, оказался эффективным в повышении надежности.

Проблема в том, что противники ограничены своими собственными вычислительными ресурсами. Определенный злоумышленник в реальном мире может найти уязвимости, которые имитированный противник пропустил. Поэтому проверка с использованием враждебных методов должна рассматриваться как повышение планки безопасности, а не гарантия совершенства.

Проблемы и ограничения в проверке ИИ

Проблема определения

Чтобы убедиться, что система ИИ справедлива или безопасна, нам сначала нужно четкое определение того, что такое справедливость и безопасность. К сожалению, эти понятия глубоко контекстуальны. Справедливость может быть интерпретирована как равенство возможностей, демографический паритет или индивидуальная справедливость, и эти определения могут конфликтовать друг с другом. Модель, которая достигает демографического паритета, может нарушать равенство возможностей, и наоборот.

Безопасность также неоднозначна. Является ли автономное транспортное средство “безопасным” если оно никогда не вызывает столкновения, или только если оно вызывает меньше столкновений, чем водитель-человек? Как мы взвешиваем тяжесть различных видов вреда? Методы проверки могут проверять только свойства, которые были точно указаны. Если спецификация неверна, результат проверки бессмыслен.

Масштабируемость и стоимость

Формальная проверка глубоких нейронных сетей остается вычислительно дорогостоящей. Инструментам, которые работают для моделей с 10 000 нейронов, могут потребоваться дни или недели, чтобы запустить на моделях со 100 миллионами параметров. Даже более простые методы, такие как комплексное тестирование сценариев, требуют огромных вычислительных бюджетов и человеческого надзора.

Для стартапов и небольших компаний стоимость тщательной проверки может быть непомерно высокой. Это создает несоответствие: более крупные организации с большим количеством ресурсов могут позволить себе более безопасный ИИ, потенциально увеличивая разрыв между хорошо проверенными системами и недопроверенными, которые все еще находят свой путь в производство.

Проблема черного лебедя

Проверка по своей сути является обратной. Она проверяет систему на соответствие известным режимам отказа и определенным спецификациям. Она не может предвидеть совершенно новые типы отказов, возникающие из поведения системы & # 8217 в дикой природе. Система ИИ может быть тщательно протестирована на всех известных сценариях смещения, но все же разрабатывать новые предубеждения при развертывании в другом культурном контексте.

Это означает, что проверка не является одноразовой сертификацией. Это должен быть непрерывный процесс мониторинга, переоценки и обновления. Системы, которые проверяются при развертывании, могут выходить из-под контроля, когда они учатся на новых данных или когда меняется окружающая среда.

Регуляторный и стандартный ландшафт

Правительства и органы по стандартизации переходят к кодификации требований к проверке. Закон ЕС об искусственном интеллекте предписывает, чтобы системы ИИ с высоким риском проходили оценку соответствия, которая включает аудиты на предвзятость, документацию и человеческий надзор. Закон явно требует проверки на справедливость и безопасность с штрафами за несоблюдение.

В Соединенном Королевстве Центр этики данных и инноваций опубликовал руководящие принципы по алгоритмической прозрачности. В Китае Министерство науки и технологий выпустило руководящие принципы по рассмотрению этики для ИИ, которые включают требования к справедливости. Международные стандарты, такие как ISO/IEC 42001 (системы управления ИИ) и IEEE’s 7001-2021 (Прозрачность автономных систем) обеспечивают рамки для организаций для структурирования их усилий по проверке.

Эти правила и стандарты имеют общие принципы: прозрачность, подотчетность, документация и постоянный мониторинг. Они также признают, что проверка не является универсальной деятельностью. Требуемая строгость зависит от уровня риска применения.

Практические рекомендации для организаций

Ни один метод проверки не является достаточным сам по себе. Надежная программа сочетает в себе несколько методов в слоях:

  1. Начать рано. Проверка не должна быть запоздалой мыслью. Включите аудит данных и проверку на честность с начала проекта.
  2. Определите сценарии риска. С заинтересованными сторонами перечислите режимы сбоев в худшем случае для вашей системы ИИ. Используйте эти сценарии для разработки тестов.
  3. Создайте разнообразные наборы тестов. Обеспечить, чтобы данные тестов охватывали недопредставленные группы, краевые случаи и состязательные входы. Привлекайте экспертов домена и затронутые сообщества.
  4. Используйте как автоматизированную, так и человеческую оценку. Автоматизированные метрики улавливают статистические аномалии; рецензенты улавливают контекстно-зависимые сбои.
  5. Внедрить непрерывный мониторинг. Развернуть панели приборов, которые отслеживают метрики смещения, точность в подгруппах и дрейф производительности с течением времени.
  6. Документируйте все. Ведите учет деятельности по проверке, результатов и исправлений. Это необходимо для соблюдения нормативных требований и для создания институциональных знаний.
  7. Будьте готовы к повторению. Проверка выявит проблемы. Относитесь к каждому нахождению как к возможности улучшить систему и ее тестирование.

Дорога впереди

Проверка ИИ — быстро развивающаяся область. Исследования в области формальной проверки делают прогресс в направлении масштабирования до более крупных моделей. Такие методы, как механистическая интерпретируемость, направлены на реверс-инжиниринг внутренних вычислений нейронных сетей, предлагая более глубокое понимание их поведения. Федеративные подходы позволяют нескольким организациям делиться результатами проверки, не раскрывая запатентованные модели.

В то же время разработка генеративного ИИ и моделей большого языка вносит новые вызовы. Эти модели имеют почти бесконечное пространство входа и могут производить непредсказуемые выходы. Проверка их на безопасность и предвзятость требует новых методов, выходящих за рамки методов классификации. Исследователи изучают такие методы, как красная команда, конституционный ИИ и фильтрация выходов, но они все еще незрелые.

Конечная цель состоит не в том, чтобы устранить все риски, а в том, чтобы сделать системы ИИ прозрачными, подотчетными и согласованными с человеческими ценностями. Проверка является важным инструментом для этой миссии. Это практика, которая требует смирения, строгости и готовности признать, что ни одна система не является идеальной. Каждая проверенная система ИИ является шагом к будущему, где технологии будут служить людям справедливо и безопасно.