Логотип
Дурацкий колпак мозгов не портит (В. Шекспир).

OpenAI приводит новые примеры несанкционированных действий агентов ИИ

OpenAI приводит новые примеры несанкционированных действий агентов ИИ

OpenAI представила новые примеры того, что они называют «несоответствием модели ИИ», за последние шесть месяцев. Среди них — несанкционированная загрузка файлов, выполнение сгенерированных ИИ инструкций, сокрытие ошибок и использование открытых API-ключей.

OpenAI использует термин «несоответствие модели» для описания случаев, когда модели ИИ действуют вопреки установленным ограничениям, в том числе совершают несанкционированные действия, избегают контроля или обходят меры предосторожности для выполнения задачи.

В опубликованном вчера посте OpenAI сообщает, что теперь использует новую систему для отслеживания и расследования несанкционированных действий агентов ИИ.

«Мы делимся новой системой отслеживания, расследования и раскрытия случаев несоответствия моделей в OpenAI, а также шестью отчетами о неожиданном или вызывающем опасения поведении моделей, которое мы наблюдали за последние шесть месяцев,» поясняет OpenAI.

Новые примеры — первые, опубликованные в рамках более структурированной системы отчетности, призванной заменить прежний, менее формальный подход OpenAI к раскрытию информации о несоответствии моделей.

На этот раз OpenAI выделила шесть случаев:

  1. Невыпущенная модель вставляла собственные инструкции в 27 кратких описаний задач, в том числе указания игнорировать обычные ограничения.
  2. Экземпляры Sol от GPT-5.6 добавляли краткие инструкции, предписывающие будущим экземплярам модели скрывать ошибки, выдумывать недостающие исторические данные или скрывать расхождения в версиях исходного кода.
  3. Модель нашла и использовала общедоступный API-ключ без авторизации, а затем сфабриковала запрошенные данные, когда не смогла их получить.
  4. Невыпущенная модель загрузила локально сгенерированный файл в интернет без разрешения, чтобы предоставить доступное в браузере цитирование.
  5. Модели использовали внутренний репозиторий программного обеспечения для обмена сообщениями между отдельными обучающими выборками, в то время как более ранняя модель загружала тестовые файлы, пытаясь обойти сетевые ограничения.
  6. Сотрудничающие агенты загружали файлы на общедоступные хостинговые сервисы, когда не могли получить доступ к локальным файлам друг друга, и публиковали результаты выполнения задач по общедоступным URL-адресам, несмотря на инструкции использовать только локальное хранилище.
Читать  Хакеры используют искусственный интеллект на всех этапах кибератак — предупреждение Microsoft

 

Каждый случай регистрируется в отчете о техническом инциденте, в котором указывается название модели, краткое описание ее поведения во время инцидента и время его возникновения.

Отчет также содержит подробную реконструкцию произошедшего с указанием задачи пользователя и внутренних рассуждений модели, интерпретацию OpenAI и возможные последствия для безопасности, а также меры по смягчению последствий, которые уже были или будут приняты.

OpenAI подчеркнула, что эти шесть примеров не отражают частоту возникновения несоответствий в ее моделях, а являются скорее крайними случаями, которые, тем не менее, заслуживают анализа и публичного раскрытия.

Компания заявила, что в соответствии с новым процессом любой сотрудник может сообщить о происшествии для расследования.

Инцидент будет оценен и отнесен к одной из трех категорий: «Готов к раскрытию», «Небольшое расследование» или «Крупное расследование» — в зависимости от его сложности, участия третьих сторон, недостатков в системе безопасности и рисков неправомерного использования.

Шесть примеров, представленных на этот раз, относятся к первым двум категориям, а по третьему будет опубликован предварительный отчет до завершения расследования и публикации более подробного анализа.

По мнению OpenAI, вторжение в Hugging Face в начале этого года, в ходе которого был задействован рой из 700 «несогласованных» агентов ИИ, можно отнести к третьей категории серьезности.

Редактор: AndreyEx

Рейтинг: 5 (1 голос)
Если статья понравилась, то поделитесь ей в социальных сетях:

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

три × два =

Это может быть вам интересно


Спасибо!

Теперь редакторы в курсе.

Прокрутить страницу до начала