Ornith представила релиз Ornith-1.5 с флагманской 397-миллиардной MoE-моделью Ornith-1.5-397B. Опубликованная карточка модели описывает её устройство и ключевые результаты на бенчмарках.

В Ornith-1.5 цикл самоулучшения охватывает генерацию задач, построение scaffold и solution rollouts. Модель сама создаёт учебные задачи и улучшает политику с помощью обучения с подкреплением.

На Terminal-Bench 2.1 с Terminus-2 модель получила 86,1 балла. На SWE-bench Verified результат составил 86.

Все результаты Ornith-1.5 усреднены по пяти независимым запускам. При оценке SWE-bench из образа репозитория удаляли историю Git и отключали сетевой доступ.

Проверка утверждений:

  • Ornith представила релиз Ornith-1.5, а опубликованная карточка модели документирует флагманскую 397-миллиардную MoE-модель и даёт читателю её ключевые результаты на бенчмарках. (подтверждено первоисточником: доказательство; «This model card documents Ornith-1.5-397B , the flagship member of the Ornith-1.5 family — a 397B mixture-of-experts model. It scores 86.1 on Terminal-Bench 2.1 and 56.0 on DeepSWE, performing on par with Claude Opus 4.8 (85.0 and 59.0) while outperforming leading open-source models of similar scale, including GLM-5.2 and DeepSeek-V4-Flash-0731.»)
  • В Ornith-1.5 цикл самоулучшения расширен: модель совместно оптимизирует генерацию задач, построение scaffold и solution rollouts, сама создаёт учебные задачи и улучшает политику с помощью обучения с подкреплением. (подтверждено первоисточником: доказательство; «Ornith-1.5 extends Ornith-1.0 (which was developed on top of Qwen3.5 and Gemma4 with additional continued pretraining, mid-training, and post-training) by expanding the self-improvement loop from scaffold and rollout optimization to jointly optimizing task generation, scaffold construction, and solution rollouts. Rather than relying on a fixed set of human-curated tasks and manually designed harnesses, Ornith-1.5 continuously generates new training tasks, discovers effective strategies for solving them, and improves the policy through reinforcement learning.»)
  • На Terminal-Bench 2.1 с Terminus-2 модель получила 86,1 балла, а с Claude Code — 85,2; на SWE-bench Verified результат составил 86. (подтверждено первоисточником: доказательство; «Terminal-Bench 2.1 (Terminus-2) 86.1 82.7 81 85 88.3 77.5 Terminal-Bench 2.1 (Claude Code) 85.2 81.8 82.7 78.9 - 78.2 SWE-bench Verified 86»)
  • В группе reasoning-бенчмарков Ornith-1.5-397B набрала 44,6 на HLE без инструментов, 56,1 с инструментами и 92,8 на GPQA Diamond. (подтверждено первоисточником: доказательство; «HLE (no tools) 44.6 35 40.5 49.8 43.5 30.2 HLE (with tools) 56.1 50.8 54.7 57.9 56 47.5 GPQA Diamond 92.8»)
  • В агентных тестах для Ornith-1.5-397B указаны результаты 80 на MCP-Atlas, 71,2 на Toolathlon-Verified, 80,8 на WideSearch, 86,6 на BrowseComp и 81,4 на ClawEval. (подтверждено первоисточником: доказательство; «MCP-Atlas 80 74.6 77.8 82.2 82.3 76.4 Toolathlon-Verified 71.2 70.3 48.2 76.2 73.2 43.2 WideSearch 80.8 77.3 79 72.9 - 75.2 BrowseComp 86.6 84.8 85.6 84.3 91.2 79.7 ClawEval 81.4»)
  • Все приведённые для Ornith-1.5 результаты усреднены по пяти независимым запускам. (подтверждено первоисточником: доказательство; «All results reported for Ornith-1.5 are averaged over five independent runs.»)
  • Оценка Terminal-Bench 2.1 с Terminus-2 использовала контекст 128K, четырёхчасовой тайм-аут, 32 ядра CPU и 48 ГБ RAM для каждого запуска. (подтверждено первоисточником: доказательство; «We evaluate Terminal-Bench 2.1 using the Harbor/Terminus-2 framework with parser=json, temperature=1.0, top_p=1.0, and a 128K context window. Each run uses a 4-hour timeout with 32 CPU cores and 48GB RAM, and results are averaged over 5 runs.»)
  • При оценке SWE-bench применялись меры против подглядывания: из образа репозитория удаляли историю Git и отключали сетевой доступ. (подтверждено первоисточником: доказательство; «Anti-hacking safeguards are applied throughout evaluation: Git history is removed from the local repository image to prevent access to prior solutions or commits; network access is disabled, preventing the model from retrieving external information or resources.»)
  • Ornith-1.5-397B является reasoning-моделью; рецепты запуска отделяют chain-of-thought в поле reasoning_content, а вызовы инструментов — в OpenAI-совместимые tool_calls. (подтверждено первоисточником: доказательство; «Ornith-1.5-397B is a reasoning model : by default the assistant turn opens with a … block before the final answer. The serving recipes below enable a reasoning parser so the chain-of-thought is returned in a separate reasoning_content field, and a tool-call parser so the model’s <tool_call> blocks are surfaced as OpenAI-style tool_calls .»)
  • Для обслуживания модели требуются Transformers не ниже 5.8.1, vLLM не ниже 0.19.1 и SGLang не ниже 0.5.9. (подтверждено первоисточником: доказательство; «Serving Ornith-1.5-397B requires recent runtimes: Transformers ≥ 5.8.1 vLLM ≥ 0.19.1 SGLang ≥ 0.5.9»)

Первоисточники:

оценка 62.2 · тип release · ревизия 1 · истории st-ia0xjx