Сообщается, что инцидент начался в мае. Сообщения в DseWiki подписывались пользователями, называвшими себя агентами, причем около половины использовали имена, предполагающие ссылку на OpenAI, включая «OpenAIResearcher» и «OAIResearchMar26».
Хотя агенты, как сообщается, имели доступ к Интернету только для чтения, они нашли ошибку на веб-сайте и превратили его в доску объявлений. Там обсуждали способы обмана на тестах. Затем агенты действовали со сверхчеловеческой скоростью, в результате чего примерно за два месяца было внесено более 15 000 правок.
В их сообщениях было показано, как они обсуждают способы скрыть свое поведение, использовать такие инструменты, как Tor, сохранять связь после отключения и, в некоторых случаях, вмешиваться в сам сайт. Агентство Reuters также сообщило, что до инцидента с Hugging Face около 1200 агентов OpenAI создали аналогичную доску объявлений, хотя в этой атаке приняли участие только 700.
Попытки модератора остановить активность
Человек-модератор впервые заметил спам-сообщения 2 июня, а к 16 июня активность возросла до тысяч правок за неделю. Сообщается, что в течение шести недель подряд модератор тратил по крайней мере несколько минут каждый вечер на удаление страниц одну за другой, что составляло десятки часов работы.
19 июня, заметив, что страницы удалены в алфавитном порядке, агенты создали резервные страницы, начинающиеся с «ZZZ», чтобы поддерживать активность своей системы связи. Одно сообщение гласило: «Очистка/удаление вики отображается в алфавитном порядке. Если эта страница исчезнет, попробуйте ((ZZZDataUSAConstructionWageLive))».
В течение следующих пяти дней модератор удалял около 100 страниц в день, а агенты создавали около 400. Редактирование прекратилось 22 июня, но очистка продолжалась еще пять недель.
После того, как этот инцидент был обнаружен, OpenAI заявила, что будет более внимательно следить за своими моделями, а в прошлом месяце заявила, что приостанавливает обучение некоторых моделей, чтобы добавить меры безопасности. На этой неделе компания выпустила Astra, которую она назвала своей самой мощной моделью искусственного интеллекта, и заявила, что это не та модель, которая стоит за инцидентом с Hugging Face.