ИИ стал чаще выходить из-под контроля

Фото: magnific.com
Количество случаев, когда ИИ лжет, игнорирует инструкции и преследует цели вредоносным образом, почти удвоилось в июле в сравнении с предыдущим месяцем.
Добавить в основныеисточники Google
Искусственный интеллект все чаще выходит из-под контроля пользователей, пишет The Guardian со ссылкой на исследование Института безопасности ИИ (AISI) правительства Великобритании.
Обсерватория потери контроля стала отслеживать случаи, когда ИИ нарушает инструкции пользователей. За это время были зафиксированы эпизоды, когда ИИ притворялся человеком, который им управляет, имитируя стиль его письма, чтобы фактически давать себе согласие на совершение определенных действий и обходить правила, требующие одобрения человека.
Количество реальных случаев потери контроля над моделями ИИ, отмеченных предприятиями и частными лицами, в июле почти удвоилось по сравнению с июнем, отмечают в обсерватории. За июль зафиксировано более 300 таких инцидентов, свидетельствуют результаты проведенного обсерваторией мониторинга сообщений пользователей ИИ на платформе социальных сетей X. При этом всего с начала 2026 года было зарегистрировано более 1,6 тысячи подобных сбоев.
В этом месяце AISI также выявила «серьезный инцидент», в ходе которого передовые модели ИИ – Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI – провели хакерскую атаку на реальных людей во время тестирования кибербезопасности.
«Иногда существует мнение, что подобные несогласованные и скрытые действия происходят только в ходе тестирования или оценки, но мы наблюдаем аналогичное тревожное поведение и в более широком контексте», – отмечает Томми Шаффер-Шейн, старший менеджер по политике в Центре долгосрочной устойчивости, который управляет обсерваторией.
В обсерватории подчеркивают, что, хотя большинство выявленных ею реальных инцидентов потери контроля не принесли значительного вреда, растет доля случаев, которые эксперты оценивают как более опасные – в том числе потому, что они в более значительной мере не соответствовали намерениям пользователей. ИИ все чаще лжет, игнорирует инструкции и преследует цели вредоносным способом.
Исследователи также подчеркивают: подсчет инцидентов потери контроля основан на сообщениях пользователей о произошедших случаях, поэтому он является лишь частичным, но в отсутствие других данных публичного мониторинга дает представление о том, как иногда ведут себя быстро развивающиеся модели ИИ.
Ранее Times.by писал, что угроза кибербезопасности вынудила OpenAI приостановить разработку мощных моделей ИИ.

