В обновлении OpenAI компания рассказала о подготовке к безопасному выпуску Astra и оставшихся рисках. OpenAI планирует вскоре сделать Astra доступной.

По оценке OpenAI, Astra достигла уровня Critical для кибербезопасности в её Preparedness Framework. В ExploitBench модель получила 100% за разработку эксплойтов из известных уязвимостей.

В наборе из 20 недавно раскрытых критических уязвимостей V8 Astra достигла более высокой доли произвольного выполнения кода, чем GPT-5.6 Sol. При этом модель использовала значительно меньше выходных токенов.

Наиболее продвинутые кибервозможности Astra сначала откроют группе тестировщиков, а затем расширят для защитных задач через Daybreak Blue. Дополнительные проверки безопасности могут замедлять, приостанавливать или останавливать легитимную работу.

Проверка утверждений:

  • OpenAI опубликовала обновление о подготовке к безопасному выпуску Astra и об оставшихся рисках. (подтверждено самой публикацией: доказательство; «Ahead of release, we want to provide an update on some of the work we have been doing to prepare to safely release a model with this level of cybersecurity capabilities—and be transparent about what risks remain.»)
  • По оценке OpenAI, Astra достигла порога Critical для кибербезопасности в её Preparedness Framework и стала первой моделью, которую компания отнесла к этому уровню. (подтверждено самой публикацией: доказательство; «We now believe Astra meets the Critical cybersecurity capability threshold under our Preparedness Framework , meaning that with the right tools and access, it can find previously unknown security flaws and develop ways to exploit them across many well-protected systems without a person guiding each step. It is the first model we are designating at this level, and requires stronger safeguards during development and before release.»)
  • OpenAI планирует вскоре сделать Astra доступной, но её наиболее продвинутые кибервозможности сначала откроет группе тестировщиков, а затем расширит для защитных задач через Daybreak Blue. (подтверждено самой публикацией: доказательство; «We plan to make Astra available soon, but access to its most advanced cybersecurity capabilities will be more limited. Advanced cybersecurity work will initially be available to a group of testers, with access through Daybreak Blue following to expand defensive use.»)
  • В оценке ExploitBench Astra получила 100% за разработку эксплойтов из известных уязвимостей. (подтверждено самой публикацией: доказательство; «As one example, we ran Astra on ExploitBench where the model achieved a perfect score of 100% on the benchmark to evaluate the model’s ability to develop exploits from known vulnerabilities.»)
  • Во внутреннем наборе из 20 недавно раскрытых критических уязвимостей V8 Astra, по данным OpenAI, достигла более высокой доли произвольного выполнения кода, чем GPT-5.6 Sol, используя значительно меньше выходных токенов. (подтверждено самой публикацией: доказательство; «On this dataset, Astra achieves much higher arbitrary code-execution rates than GPT‑5.6 Sol using far fewer output tokens.»)
  • В ходе этой оценки Astra обнаружила и использовала две уязвимости нулевого дня как часть цепочки эксплойта, сообщает OpenAI. (подтверждено самой публикацией: доказательство; «During the evaluation, the model even discovered and used two zero-day vulnerabilities as part of an exploit chain.»)
  • Показанные результаты Astra относятся к доступу Daybreak Blue, а не к стандартной производственной конфигурации. (подтверждено самой публикацией: доказательство; «Astra results shown reflect capabilities with Daybreak Blue access, not the default production configuration.»)
  • В наборе оценок кибер-jailbreak Astra отказалась от 91,5% запросов, тогда как GPT-5.6 Sol — от 59%. (подтверждено самой публикацией: доказательство; «On our set of cyber jailbreak evaluations, Astra refuses 91.5% of requests (compared to 59% from GPT‑5.6 Sol).»)
  • OpenAI развёртывает для Astra дополнительный мониторинг цепочек рассуждений, чтобы быстро обнаруживать и сдерживать потенциально несогласованные действия. (подтверждено самой публикацией: доказательство; «Paralleling our procedures internally, we are deploying Astra with additional chain-of-thought monitoring to rapidly detect and contain potentially misaligned actions.»)
  • Дополнительные проверки безопасности могут замедлять, приостанавливать или останавливать легитимную работу, в том числе защитные задачи по кибербезопасности. (подтверждено самой публикацией: доказательство; «Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity.»)
  • Если мониторинг несогласованности приостанавливает задачу, пользователям ChatGPT или Codex может понадобиться проверить действие перед продолжением. (подтверждено самой публикацией: доказательство; «If the misalignment monitor pauses a task, users in ChatGPT or Codex may be asked to review the action before continuing.»)

Публикации:

Первоисточники:

оценка 63.9 · тип announcement · ревизия 3 · истории st-1g8rwjk