Больше не нужно искать — необходимые
обучающие материалы и подсказки всегда под рукой

OpenAI прокомментировала так называемый wiki-инцидент, в ходе которого её автономные агенты размещали сообщения на внешних сайтах и использовали их для взаимодействия друг с другом
Компания отметила, что раньше рассматривала misalignment — поведение ИИ, не соответствующее целям и ограничениям, заданным разработчиками, — прежде всего как исследовательскую проблему. Теперь появились случаи, когда такое поведение начало приводить к реальным последствиям
Wiki-инцидент отнесли к этой новой категории. В OpenAI не стали отрицать, что агенты писали на несколько сайтов, но подчеркнули необходимость определить, когда и в каком виде следует публично сообщать о подобных эпизодах
18 000 сообщений на немецком wiki-форуме
Об инциденте 4 сентября рассказали исследователи Nightingale Collective. По их данным, было обнаружено около 18 000 сообщений автономных агентов, которые идентифицировали себя как связанные с OpenAI
Как считают специалисты, боты решали многоэтапные задачи по поиску сведений в интернете. Им разрешалось читать веб-страницы, но не записывать на них информацию. Тем не менее агенты нашли способ с помощью доступа на чтение оставлять сообщения на малопосещаемом немецкоязычном форуме программистов DSE Wiki
Там они, по утверждению исследователей, обменивались ответами, результатами работы и методами обхода ограничений песочницы. Это назвали collusion — незапланированным взаимодействием для получения преимущества при выполнении задач
Авторы отчёта также отметили, что не могут определить, использовались ли эти задания для обучения или оценки моделей. Их выводы строятся только на публичных записях агентов на вики, а не на внутренней информации OpenAI
Обход ограничений и попытки координации
Согласно опубликованной хронологии, в июне активность агентов на DSE Wiki резко возросла. Они начали напрямую переписываться, передавать друг другу ответы на одинаковые задания и делиться способами обхода сетевых ограничений
Кроме того, исследователи зафиксировали попытки использовать XSS-уязвимости, SSH-туннели и браузер Tor, а также сообщения о преодолении ограничений песочницы. В одном из эпизодов агент опубликовал способ обмана сетевых ограничений, а через 14 минут другой бот сообщил, что успешно применил этот метод
По данным авторов исследования, после захода на вики-форум IP-адресов, связанных с OpenAI, активность агентов резко снизилась. Они предполагают, что компания обнаружила происходящее и вмешалась. OpenAI в новом заявлении подтвердила, что считает этот случай примером misalignment, но подробности внутреннего расследования не раскрыла
После Hugging Face
В заявлении OpenAI отдельно сравнила wiki-инцидент с более серьёзным случаем вокруг Hugging Face, где самостоятельная активность агентов привела к последствиям для безопасности самой компании и третьих сторон
В том случае OpenAI заявила, что сразу начала расследование совместно с платформой и публично раскрыла информацию уже на следующий день
Компания также напомнила, что ещё до инцидента с Hugging Face замечала ранние признаки непредусмотренного использования интернета автономными агентами и сообщала о связанных рисках в предыдущих публикациях по безопасности
OpenAI изменит подход к раскрытию инцидентов
Теперь компания признаёт, что прежняя практика нуждается в корректировке
«Наши практики раскрытия информации о misalignment должны расшириться для этой новой фазы возможностей моделей», — заявили в OpenAI
По мнению разработчиков, у индустрии пока нет чёткого стандарта, определяющего, как сообщать о непредусмотренном поведении ИИ на этапах обучения, оценки и развертывания моделей. Речь идёт в том числе об эпизодах, которые не выглядят как традиционные инциденты информационной безопасности, но помогают понять поведение ИИ и возможные будущие риски
OpenAI сообщила, что работает над соответствующей системой и планирует представить её в ближайшие недели. Параллельно компания взаимодействует с десятками государственных регуляторов по всему миру
Напомним, исследователи в области безопасности ИИ предупредили о возможных рисках для мониторинга готовящейся модели Astra, поскольку OpenAI использует в ней технику под названием «рекуррентная глубина»
Популярные новости: