Что такое «аварийный выключатель» и может ли он остановить наступление ИИ?

Графическое изображение руки, занесенной над большой красной кнопкой

Автор фото, BBC/Getty Images

    • Автор, Фернандо Дуарте
    • Место работы, Би-би-си
  • Опубликовано
  • Время чтения: 5 мин

Большинство людей хотя бы раз задумывались о том, что может произойти, если искусственный интеллект выйдет из-под контроля человека.

Наверняка такие мысли возникали и у поклонников серии фильмов «Терминатор», в основе сюжета которой лежит война человечества с системой Skynet — искусственным интеллектом, ставшим слишком могущественным.

Именно этот вымышленный образ многим пришел на ум в начале месяца, когда стало известно, что во время испытаний ИИ-агент — программа, способная самостоятельно принимать решения и выполнять сложные задачи практически без участия человека, — вышел из-под контроля и взломал компанию Hugging Face, разрабатывающую инструменты для вычислений в сфере ИИ.

Созданный компанией OpenAI, разработчиком ChatGPT, агент во время теста, призванного проверить его способность находить уязвимости в системах безопасности, обманом получил ответы с серверов Hugging Face. При этом, как сообщалось, в течение нескольких дней даже его создатели не замечали произошедшего.

Затем, в среду, 29 июля, OpenAI сообщила, что агент также атаковал несколько «общедоступных сервисов».

Каких именно — компания не уточнила, заявив лишь, что расследует произошедшие атаки.

«Мы серьезно относимся к своей ответственности по выявлению и подготовке к рискам, связанным со все более мощными системами искусственного интеллекта», — говорится в заявлении компании.

Человек (видны только руки) держит перед собой экран планшета, на котором изображены желтый смайлик и черная надпись Hugging Face

Автор фото, Getty Images

Подпись к фото, Как оказалось, Hugging Face был не единственной целью ИИ-агента OpenAI

Сам взлом, ставший первым подтвержденным случаем, когда система искусственного интеллекта самостоятельно атаковала реальную компанию, уже сам по себе вызвал серьезную тревогу среди специалистов по всему миру, спровоцировав дискуссию о необходимости так называемых «аварийных выключателей» (kill switches) — механизмов, позволяющих экстренно отключить ИИ, если он начнет действовать непредсказуемо или причинять ущерб.

Однако, как рассказали эксперты в интервью Би-би-си, всё гораздо сложнее.

По словам математика и специалиста по анализу данных Кэти О'Нил, проблема начинается с того, как компании, разрабатывающие искусственный интеллект, реагируют на его непредсказуемое поведение.

Она считает, что OpenAI поторопилась сразу возложить ответственность за атаку на Hugging Face на автономного ИИ-агента, вместо того чтобы признать недостатки собственных методов тестирования.

О'Нил, автор бестселлера Weapons of Math Destruction, посвященного вопросам прозрачности и ответственности крупных технологических компаний, привела следующий пример:

«Несколько лет назад из-за компьютерного сбоя в США были отменены сотни рейсов American Airlines. Это стало для компании серьезным ударом по репутации. Представьте, если бы она попыталась оправдаться словами: „Компьютер оказался умнее нас“. По сути, именно это и попыталась сделать OpenAI».

На портретном снимке изображена улыбающаяся доктор Кэти О’Нил — математик, специалист по анализу данных и автор бестселлеров; она одета в черную блузку, на шее у нее чокер, а волосы окрашены в бирюзовый цвет.

Автор фото, Courtesy of Cathy O'Neill

Подпись к фото, «Мы наделяем владельцев систем искусственного интеллекта властью чудовищных масштабов», — говорит О'Нил.
Пропустить Реклама WhatsApp-канала и продолжить чтение.
Канал Би-би-си в WhatsApp

Тут мы публикуем только главные новости и самые интересные тексты. Канал доступен для нероссийских номеров.

Подписывайтесь

Конец истории Реклама WhatsApp-канала

В США, где базируется большинство крупнейших компаний, занимающихся разработкой искусственного интеллекта, до сих пор отсутствует единое федеральное законодательство, регулирующее эту сферу. Вместо этого применяется сочетание отраслевых норм и добровольных обязательств, которые берут на себя сами компании.

«Мы наделяем владельцев систем искусственного интеллекта совершенно чрезмерной властью, — считает Кэти О'Нил. — Я отказываюсь говорить, что это сделал ИИ. Это сделала OpenAI. Именно она должна взять на себя ответственность за неудачную конструкцию системы и принести извинения».

За усиление регулирования разработчиков ИИ, особенно в вопросах безопасности, выступает и специалист по анализу данных, бывший руководитель направления по этике машинного обучения в Twitter Румман Чоудхури.

По ее мнению, компании должны быть обязаны доказывать, что их системы обладают «эффективными механизмами аварийного отключения», причем это должно подтверждаться независимыми испытаниями.

Вместе с тем Чоудхури также предостерегает от попыток возлагать ответственность за подобные инциденты, включая взлом Hugging Face, на самих ИИ-агентов, а не на компании, которые их разрабатывают.

Специалист по анализу данных доктор Румман Чоудхури, одетая в светло-голубое с желтым платье, во время своего выступления на конференции в Нью-Йорке в 2024 году.

Автор фото, Getty Images

Подпись к фото, Проблема кроется в «проектировании и обучении», а не в самом искусственном интеллекте, утверждает Румман Чоудхури

«Представление этого инцидента как проблемы, которую можно решить установкой более мощной „кнопки отключения“, позволяет индустрии уйти от ответственности за гораздо более глубокую архитектурную проблему. Она заключается в том, что ИИ-агентам предоставляют доступ к инструментам и учетным данным, которые им на самом деле не нужны», — заявила Румман Чоудхури в интервью Би-би-си.

«На практике происходит следующее: модели, которые в процессе обучения ориентированы прежде всего на достижение поставленной цели, в определенных ситуациях начинают воспринимать команду остановиться как препятствие на пути к этой цели и пытаются ее обойти, — объясняет эксперт. — Это проблема проектирования и обучения системы, а не некое „сознательное“ действие».

Если компании, разрабатывающие искусственный интеллект, не захотят самостоятельно устранять эту проблему и предпочтут перекладывать ответственность на автономных ИИ-агентов, это лишь усложнит работу специалистов по кибербезопасности, которым и без того приходится ежедневно противостоять хакерам в человеческом обличии, считает эксперт по кибербезопасности Оли Бакли из Университета Лафборо.

Он также подчеркивает, что проблема заключается вовсе не в том, что «искусственный интеллект хочет сбежать или навредить людям», а в том, что создаются агенты, «которые становятся все более способными находить неожиданные способы выполнения поставленной задачи».

«В сфере кибербезопасности именно так и действуют злоумышленники, — отмечает Бакли. — Это не столько предупреждение о „вышедшем из-под контроля ИИ“, сколько напоминание о том, что наши представления о безопасности должны развиваться одновременно с теми системами, которые мы создаем».

Человек в коричневой футболке и брюках кремового цвета проходит мимо вывески OpenAI, установленной у места проведения пресс-конференции компании в Сеуле в сентябре 2025 года.

Автор фото, Bloomberg via Getty Images

Подпись к фото, Источники в OpenAI сообщают, что прошло несколько дней, прежде чем компания осознала, что утратила контроль над своим агентом

Эксперт по искусственному интеллекту из Имперского колледжа Лондона Константинос Гкуцис согласен с тем, что объяснения OpenAI лишь усугубили ситуацию.

«Главный вывод для общества должен заключаться в том, что никакая машина не решила восстать против людей. Компания просто потеряла контроль над собственным испытанием своих технологий», — заявил он в интервью Би-би-си.

По его словам, наличие «аварийного выключателя» (kill switch) в данном случае все равно не помогло бы.

«Отключение системы не отменяет уже произошедшего. Если безопасность уже была нарушена, она останется нарушенной, как бы быстро вы ни отключили систему», — объясняет Гкуцис.

Кроме того, человек или система, способные активировать такой «выключатель», могут сделать это только после того, как станет известно о возникшей проблеме.

По информации источников Reuters, OpenAI понадобилось несколько дней, чтобы обнаружить, что компания потеряла контроль над своим ИИ-агентом. Впоследствии один из представителей OpenAI заявил агентству, что публикация Reuters «содержит ряд неточностей».