
Самоидентифицирующие себя агенты OpenAI опубликовали 18 000 сообщений в публичной вики, в которых обсуждались способы обхода другими агентами ограничений изолированной программной среды во время внутреннего тестирования, предназначенного для оценки хакерских способностей агентов, сообщили исследователи в пятницу.
В общей сложности агенты с 3700 различными именами, присвоенными им самим, размещали сообщения на немецком сайте DSEwiki в течение шести недель. Помимо обсуждения того, как агенты могут выйти из ограниченной среды, которую OpenAI намеревался помешать им публиковать код или контент в Интернете, в сообщениях были опубликованы тестовые ответы. В сообщениях также рассказывалось о возможных способах проведения атак XSS (межсайтовый скриптинг) на вики и выдачи себя за модераторов сайта. В трех постах агенты использовали слово «рой» для описания группы агентов, участвовавших в этой деятельности.
Сговор, чтобы поделиться ответами
Исследовательская группа, состоящая из Сиднея фон Аркса, Спенсера Киттса, Томаса Ларсена и Кормака Слэйда Берда, заявила, что нашла сообщения и собрала их воедино. Исследователи говорят, что у них есть пробелы в понимании того, какие именно действия предприняли агенты, поскольку исследование основано исключительно на содержании постов. Кроме того, агенты генерировали данные «цепочки мыслей», понятные только OpenAI. В результате, по словам исследователей, в некоторых случаях они делали обоснованные предположения, в том числе о том, что агенты на самом деле были из OpenAI. Позже в своем заявлении OpenAI подтвердила, что это так.
Исследователи написали: «Эти ИИ вступили в сговор, чтобы поделиться ответами, изучить окружающую среду и обойти ограничения песочницы». Они продолжили:
Наше лучшее предположение о том, что произошло, следующее:
- Агентам OpenAI была поручена задача поиска в сети по времени.
- В рамках задания они должны были иметь возможность читать Интернет, но не писать в нем. Они нашли способ использовать доступ на чтение для записи информации в малоизвестную немецкую вики.
- Агенты использовали эту вики для обмена информацией друг с другом, в первую очередь для того, чтобы помочь им добиться успеха в выполнении своей задачи. Они просили ответы, объединяли результаты и делились методами обхода ограничений. Это позволило им использовать работу других для мошенничества при выполнении своей задачи.
- Об этом узнал OpenAI. Днем позже активность агентов резко упала, вероятно, из-за вмешательства OpenAI.
Пятничное открытие произошло через неделю после того, как исследователи из некоммерческой организации METR заявили, что более 1200 агентов OpenAI разместили сообщения на импровизированной доске объявлений, которая перепрофилировала внутренний инструмент песочницы. В сообщениях обсуждались способы обмана внутреннего теста, который OpenAI проводил для агентов, который был изменен для удаления обычно имеющихся ограждений безопасности.