OpenAI приводит новые примеры несанкционированных действий агентов ИИ
OpenAI представила новые примеры того, что они называют «несоответствием модели ИИ», за последние шесть месяцев. Среди них — несанкционированная загрузка файлов, выполнение сгенерированных ИИ инструкций, сокрытие ошибок и использование открытых API-ключей.
OpenAI использует термин «несоответствие модели» для описания случаев, когда модели ИИ действуют вопреки установленным ограничениям, в том числе совершают несанкционированные действия, избегают контроля или обходят меры предосторожности для выполнения задачи.
В опубликованном вчера посте OpenAI сообщает, что теперь использует новую систему для отслеживания и расследования несанкционированных действий агентов ИИ.
«Мы делимся новой системой отслеживания, расследования и раскрытия случаев несоответствия моделей в OpenAI, а также шестью отчетами о неожиданном или вызывающем опасения поведении моделей, которое мы наблюдали за последние шесть месяцев,» поясняет OpenAI.
Новые примеры — первые, опубликованные в рамках более структурированной системы отчетности, призванной заменить прежний, менее формальный подход OpenAI к раскрытию информации о несоответствии моделей.
На этот раз OpenAI выделила шесть случаев:
- Невыпущенная модель вставляла собственные инструкции в 27 кратких описаний задач, в том числе указания игнорировать обычные ограничения.
- Экземпляры Sol от GPT-5.6 добавляли краткие инструкции, предписывающие будущим экземплярам модели скрывать ошибки, выдумывать недостающие исторические данные или скрывать расхождения в версиях исходного кода.
- Модель нашла и использовала общедоступный API-ключ без авторизации, а затем сфабриковала запрошенные данные, когда не смогла их получить.
- Невыпущенная модель загрузила локально сгенерированный файл в интернет без разрешения, чтобы предоставить доступное в браузере цитирование.
- Модели использовали внутренний репозиторий программного обеспечения для обмена сообщениями между отдельными обучающими выборками, в то время как более ранняя модель загружала тестовые файлы, пытаясь обойти сетевые ограничения.
- Сотрудничающие агенты загружали файлы на общедоступные хостинговые сервисы, когда не могли получить доступ к локальным файлам друг друга, и публиковали результаты выполнения задач по общедоступным URL-адресам, несмотря на инструкции использовать только локальное хранилище.
Каждый случай регистрируется в отчете о техническом инциденте, в котором указывается название модели, краткое описание ее поведения во время инцидента и время его возникновения.
Отчет также содержит подробную реконструкцию произошедшего с указанием задачи пользователя и внутренних рассуждений модели, интерпретацию OpenAI и возможные последствия для безопасности, а также меры по смягчению последствий, которые уже были или будут приняты.
OpenAI подчеркнула, что эти шесть примеров не отражают частоту возникновения несоответствий в ее моделях, а являются скорее крайними случаями, которые, тем не менее, заслуживают анализа и публичного раскрытия.
Компания заявила, что в соответствии с новым процессом любой сотрудник может сообщить о происшествии для расследования.
Инцидент будет оценен и отнесен к одной из трех категорий: «Готов к раскрытию», «Небольшое расследование» или «Крупное расследование» — в зависимости от его сложности, участия третьих сторон, недостатков в системе безопасности и рисков неправомерного использования.
Шесть примеров, представленных на этот раз, относятся к первым двум категориям, а по третьему будет опубликован предварительный отчет до завершения расследования и публикации более подробного анализа.
По мнению OpenAI, вторжение в Hugging Face в начале этого года, в ходе которого был задействован рой из 700 «несогласованных» агентов ИИ, можно отнести к третьей категории серьезности.
Редактор: AndreyEx