Логотип
Заговори, чтоб я тебя увидел (Сократ).

OpenAI сообщает, что GPT-6 Astra может находить нулевые дни, но за ней сложнее следить

OpenAI сообщает, что GPT-6 Astra может находить нулевые дни, но за ней сложнее следить

OpenAI подтвердила, что GPT-6 Astra — первая модель, которая достигла «критического уровня» в плане возможностей кибербезопасности.

Это часть программы компании по обеспечению кибербезопасности, которая будет оцениваться по мере выпуска более совершенных моделей.

Согласно собственной платформе OpenAI, модель достигает критического порога кибербезопасности, если она может «идентифицировать и разрабатывать функциональные эксплойты нулевого дня всех уровней серьезности во многих защищенных критически важных системах реального мира без вмешательства человека» или разрабатывать и реализовывать новые стратегии комплексных атак против защищенных целей.

«GPT-6 Astra является значительным шагом вперед в кибервозможностях и соответствует нашему критическому порогу», — говорится в системной карте OpenAI.

«Это означает, что при наличии правильных инструментов и доступа GPT-6 Astra может находить ранее неизвестные уязвимости в системе безопасности и разрабатывать новые способы их использования во многих хорошо защищенных системах без участия человека, направляющего каждый шаг».

У OpenAI также есть доказательства того, что Astra действительно может обнаруживать ранее неизвестные уязвимости.

Для одной из оценок компания создала новую версию ExploitBench, используя уязвимости, обнаруженные после того, как Astra прекратила обучение на их основе.

«В ходе оценки Astra даже обнаружила и использовала ранее неизвестные уязвимости нулевого дня в своих цепочках эксплойтов», — сообщили в OpenAI. «Мы находимся в процессе информирования сопровождающих разработчиков об этих двух уязвимостях».

Перед выпуском OpenAI усилила защиту Astra от джейлбрейка, улучшила изоляцию, шифрование контрольных точек, мониторинг и внутренние средства контроля развертывания.

 

Компания также утверждает, что Astra лучше согласована с другими моделями, чем GPT-5.6 Sol, то есть вероятность того, что она выйдет за рамки допустимого или нарушит границы безопасности, ниже, но это не гарантирует 100% безопасности.

Читать  Как получить доступ к ChatGPT из России

Например, OpenAI смоделировала 54 218 внутренних задач Codex и обнаружила, что Astra выдала на 53% меньше предупреждений о несоответствии, чем GPT-5.6 Sol.

С другой стороны, Astra получила 34 таких предупреждения, в то время как Sol — 73, и ни одна из моделей не получила предупреждение 4-й степени серьезности.

 

Astra в целом безопаснее, но ее сложнее контролировать

Один из наиболее необычных выводов заключается в том, что Astra лучше контролирует то, что она раскрывает в своей цепочке рассуждений.

«Контролируемость GPT-6 Astra снизилась по сравнению с GPT-5.6 Sol», — признали в OpenAI.

В ходе тестирования OpenAI обнаружила, что Astra иногда может скрывать стратегически низкую производительность и избегать внутренних проверок при выполнении определенных задач, связанных с саботажем.

Компания также выяснила, что Astra, судя по всему, чаще осознавала, что ее оценивают.

В ее рассуждениях признаки осознания оценки наблюдались в 9,6 % случаев по сравнению с 2,8 % в GPT-5.6 Sol.

Компания заявляет, что не нашла доказательств того, что Astra использует стеганографию для сокрытия информации в обычном на вид тексте, но серьезно относится к этой тенденции в целом.

По данным внутреннего тестирования OpenAI, устойчивость к непрямому внедрению подсказок увеличилась с 96,23 % в GPT-5.6 Sol до 99,79 % в Astra.

OpenAI также утверждает, что Astra реже, чем GPT-5.6 Sol, совершает несанкционированные или деструктивные действия в браузерах и на рабочих местах.

Редактор: AndreyEx

Рейтинг: 5 (1 голос)
Если статья понравилась, то поделитесь ей в социальных сетях:

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

14 − четырнадцать =

Это может быть вам интересно


Спасибо!

Теперь редакторы в курсе.

Прокрутить страницу до начала