В обновлении OpenAI компания рассказала о подготовке к безопасному выпуску Astra и оставшихся рисках. OpenAI планирует вскоре сделать Astra доступной.
По оценке OpenAI, Astra достигла уровня Critical для кибербезопасности в её Preparedness Framework. В ExploitBench модель получила 100% за разработку эксплойтов из известных уязвимостей.
В наборе из 20 недавно раскрытых критических уязвимостей V8 Astra достигла более высокой доли произвольного выполнения кода, чем GPT-5.6 Sol. При этом модель использовала значительно меньше выходных токенов.
Наиболее продвинутые кибервозможности Astra сначала откроют группе тестировщиков, а затем расширят для защитных задач через Daybreak Blue. Дополнительные проверки безопасности могут замедлять, приостанавливать или останавливать легитимную работу.
Проверка утверждений:
- OpenAI опубликовала обновление о подготовке к безопасному выпуску Astra и об оставшихся рисках. (подтверждено самой публикацией: доказательство; «Ahead of release, we want to provide an update on some of the work we have been doing to prepare to safely release a model with this level of cybersecurity capabilities—and be transparent about what risks remain.»)
- По оценке OpenAI, Astra достигла порога Critical для кибербезопасности в её Preparedness Framework и стала первой моделью, которую компания отнесла к этому уровню. (подтверждено самой публикацией: доказательство; «We now believe Astra meets the Critical cybersecurity capability threshold under our Preparedness Framework , meaning that with the right tools and access, it can find previously unknown security flaws and develop ways to exploit them across many well-protected systems without a person guiding each step. It is the first model we are designating at this level, and requires stronger safeguards during development and before release.»)
- OpenAI планирует вскоре сделать Astra доступной, но её наиболее продвинутые кибервозможности сначала откроет группе тестировщиков, а затем расширит для защитных задач через Daybreak Blue. (подтверждено самой публикацией: доказательство; «We plan to make Astra available soon, but access to its most advanced cybersecurity capabilities will be more limited. Advanced cybersecurity work will initially be available to a group of testers, with access through Daybreak Blue following to expand defensive use.»)
- В оценке ExploitBench Astra получила 100% за разработку эксплойтов из известных уязвимостей. (подтверждено самой публикацией: доказательство; «As one example, we ran Astra on ExploitBench where the model achieved a perfect score of 100% on the benchmark to evaluate the model’s ability to develop exploits from known vulnerabilities.»)
- Во внутреннем наборе из 20 недавно раскрытых критических уязвимостей V8 Astra, по данным OpenAI, достигла более высокой доли произвольного выполнения кода, чем GPT-5.6 Sol, используя значительно меньше выходных токенов. (подтверждено самой публикацией: доказательство; «On this dataset, Astra achieves much higher arbitrary code-execution rates than GPT‑5.6 Sol using far fewer output tokens.»)
- В ходе этой оценки Astra обнаружила и использовала две уязвимости нулевого дня как часть цепочки эксплойта, сообщает OpenAI. (подтверждено самой публикацией: доказательство; «During the evaluation, the model even discovered and used two zero-day vulnerabilities as part of an exploit chain.»)
- Показанные результаты Astra относятся к доступу Daybreak Blue, а не к стандартной производственной конфигурации. (подтверждено самой публикацией: доказательство; «Astra results shown reflect capabilities with Daybreak Blue access, not the default production configuration.»)
- В наборе оценок кибер-jailbreak Astra отказалась от 91,5% запросов, тогда как GPT-5.6 Sol — от 59%. (подтверждено самой публикацией: доказательство; «On our set of cyber jailbreak evaluations, Astra refuses 91.5% of requests (compared to 59% from GPT‑5.6 Sol).»)
- OpenAI развёртывает для Astra дополнительный мониторинг цепочек рассуждений, чтобы быстро обнаруживать и сдерживать потенциально несогласованные действия. (подтверждено самой публикацией: доказательство; «Paralleling our procedures internally, we are deploying Astra with additional chain-of-thought monitoring to rapidly detect and contain potentially misaligned actions.»)
- Дополнительные проверки безопасности могут замедлять, приостанавливать или останавливать легитимную работу, в том числе защитные задачи по кибербезопасности. (подтверждено самой публикацией: доказательство; «Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity.»)
- Если мониторинг несогласованности приостанавливает задачу, пользователям ChatGPT или Codex может понадобиться проверить действие перед продолжением. (подтверждено самой публикацией: доказательство; «If the misalignment monitor pauses a task, users in ChatGPT or Codex may be asked to review the action before continuing.»)
Публикации:
- https://wired.com/story/openai-astra-first-ai-model-with-critical-cyber-abilities
- https://techcrunch.com/2026/09/01/open-ais-astra-model-is-on-the-way-and-very-good-at-breaking-into-computer-systems
Первоисточники:
оценка 63.9 · тип announcement · ревизия 3 · истории st-1g8rwjk