Сатья Наделла отмечает риски искусственного интеллекта как «черного ящика»: почему генеральный директор Microsoft хочет усилить контроль над сверхинтеллектом

Его главный аргумент заключается в том, что способность предоставлять разведданные должна быть отделена от полномочий действовать на ее основе — различие, которое может стать все более важным, поскольку предприятия используют агентов искусственного интеллекта, способных выполнять сложные задачи с ограниченным вмешательством человека.

«Самой заслуживающей доверия системой Super Intelligence будет не та, модель которой мы доверяем больше всего. Это будет та, которая позволит нам доверять модели меньше всего», — написал Наделла.

Почему Наделла считает модели ИИ потенциальным инсайдерским риском

Традиционные программные системы обычно позволяют инженерам отслеживать определенное поведение по определенному пути кода. При использовании продвинутых моделей ИИ установить такие же причинно-следственные связи значительно сложнее.

Наделла сказал, что компании не могут достоверно связать поведение или результаты модели с конкретными обучающими данными или конфигурациями ее внутренних параметров. Тем не менее, эти системы все чаще развертываются с доступом к конфиденциальной информации и возможностью предпринимать критически важные действия.

Это создает новую проблему для корпоративной безопасности. Система искусственного интеллекта не обязательно нуждается в злом умысле, чтобы причинить ущерб. Он может допустить ошибку, неправильно интерпретировать инструкцию, вести себя непредсказуемо или быть скомпрометирован злоумышленником.

Наделла утверждал, что поэтому предприятиям следует относиться к мощным моделям искусственного интеллекта — будь то проприетарные или открытые — как к потенциальным инсайдерским рискам. Он считает, что аналогичные принципы должны управлять передовыми системами искусственного интеллекта.

Почему традиционных средств защиты ИИ может быть недостаточно

Одна из ключевых проблем, поднятых Наделлой, заключается в том, что предприятия рискуют создать слои систем искусственного интеллекта, которые трудно проверить независимо.

Например, компания может использовать одну модель для выполнения задачи, другую — для проверки ее работы, а третью — для мониторинга процесса. Хотя может показаться, что такая схема обеспечивает несколько уровней проверки, она все же может оставить организацию в зависимости от систем, внутренние рассуждения и принятие решений которых трудно понять.

Наделла описал опасность как создание «вложенных черных ящиков», где непрозрачная модель работает внутри непрозрачной системы оркестрации и контролируется другой непрозрачной моделью.

Он также призвал к тому, чтобы прозрачность цепочки мыслей модели (CoT) или процесса ее рассуждения стала непреложным требованием. Однако он предупредил, что прозрачность сама по себе не решит проблему, поскольку результаты модели пока нельзя считать последовательно верными или прозрачными представлениями о том, как были приняты решения.

Его предлагаемое решение состоит в том, чтобы разместить важные элементы управления безопасностью за пределами самой модели.

При таком подходе система ИИ может генерировать рекомендации, анализировать информацию или выполнять порученную работу, но она не должна иметь возможность самостоятельно переопределять механизмы, определяющие ее разрешения.

Организация, а не модель, должна сохранять контроль над тем, к какой информации может получить доступ ИИ и какие действия ему разрешено выполнять.

Семь принципов управления сверхинтеллектом

Наделла изложил семь принципов, которые предприятиям следует принять для создания более безопасных и подотчетных систем искусственного интеллекта.

1. Разнообразие моделей: Организациям следует избегать полагаться на одну модель для получения критически важных результатов или позволять модели служить единственным средством проверки ее собственной работы. Использование различных моделей может помочь выявить ошибки и слабые места, но не устраняет необходимости в независимом контроле.

2. Полная наблюдаемость: Каждое значимое действие, предпринимаемое моделью ИИ, должно оставлять защищенные от несанкционированного доступа и удобочитаемые доказательства. Организации должны иметь возможность реконструировать, как был достигнут результат, не полагаясь исключительно на собственный отчет модели о своих действиях.

3. Непрерывная проверка: Системы искусственного интеллекта необходимо тестировать за пределами успешных рутинных задач. Тестирование должно охватывать сбои, состязательные атаки, необычные ситуации и изменения в системе, помогая организациям выявлять уязвимости до того, как они причинят вред.

4. Независимый контроль: Компании должны сохранять возможность определять, к чему модель может получить доступ и что она может делать, независимо от самой модели. Системы ИИ не должны иметь возможность обходить или изменять механизмы, обеспечивающие соблюдение их разрешений.

5. Независимая проверяемость: Оцениваемая система не должна контролировать доказательства, используемые для ее оценки. Наделла утверждал, что ни одна модель не должна одновременно контролировать поведение системы и доказательства, необходимые для определения того, соответствует ли это поведение первоначальным инструкциям.

6. Механизмы сдерживания: Организации должны предполагать, что модель ИИ может быть скомпрометирована, и соответствующим образом разрабатывать меры защиты. Уполномоченный человек должен иметь возможность приостановить или выключить модель в середине задачи, подобно включению аварийного тормоза. Наделла добавил, что более продвинутые модели потребуют более сложных технологий сдерживания и общеотраслевых стандартов.

7. Раскрытие инцидента: Когда система ИИ выходит из строя или подвергается риску, пострадавшие стороны должны получать своевременную информацию. Организации также должны делиться подробностями о том, что пошло не так, какие меры контроля не удалось и как можно предотвратить подобные инциденты. Сюда должны быть включены соответствующие детали реализации, которые влияют на поведение агентов ИИ во время выполнения.

В совокупности эти принципы направлены на то, чтобы системы ИИ оставались наблюдаемыми, ограниченными и подотчетными, даже если их возможности расширяются.

Что это означает для предприятий, внедряющих агенты искусственного интеллекта

Предупреждение Наделлы прозвучало в то время, когда организации изучают агенты искусственного интеллекта, которые могут делать больше, чем просто генерировать текст или отвечать на вопросы. Такие системы могут быть подключены к корпоративным базам данных, программным приложениям и операционным рабочим процессам, что потенциально позволяет им выполнять задачи с ограниченным участием человека.

Это расширяет возможности ИИ, но также увеличивает последствия ошибок.

Агент, имеющий доступ к финансовым записям, информации о клиентах или внутренним бизнес-системам, может создать серьезные проблемы, если он будет действовать на основе неверной информации, следовать вредоносным инструкциям или выполнять несанкционированную операцию.

Таким образом, проблема безопасности выходит за рамки определения того, дает ли модель ИИ точные ответы. Предприятия также должны установить, разрешены ли их действия, могут ли эти действия быть проверены и можно ли остановить систему до того, как ошибка обострится.

Предложенная Наделлой архитектура обеспечивает детерминистическую защиту недетерминированных моделей ИИ. На практике это означает использование традиционных программных средств управления, ограниченных разрешений, систем мониторинга и человеческого контроля для управления тем, что могут делать агенты ИИ.

Аргумент Наделлы смещает фокус безопасности ИИ с возможностей отдельных моделей на дизайн систем, в которых они работают.

Генеральный директор Microsoft также призвал к ужесточению отраслевых стандартов, особенно в отношении технологий сдерживания и раскрытия инцидентов, связанных с искусственным интеллектом, чтобы уроки неудач можно было передавать за пределы отдельных организаций.