Авторы статьи предлагают on-policy expert-correction pipeline, схему, которая находит сбойный ход в собственном запуске слабой модели и просит эксперта переписать только этот ход.

На семи корпоративных агентных задачах обучение слабой модели полным траекториям эксперта после эволюции агентной обвязки снизило результат на 4–30 пунктов у Qwen3-Coder и Gemma 4. Агентная обвязка — это системная инструкция, набор инструментов, точки подключения к выполнению и обвязка управления контекстом вокруг модели.

Проверка утверждений:

  • Авторы предлагают конвейер on-policy expert-correction, который находит сбойный ход в собственном запуске слабой модели и просит эксперта переписать только этот ход. (подтверждено самой публикацией: доказательство; «We therefore develop an on-policy expert-correction pipeline, automated by a meta-level MLE agent, that localizes the failing turn in the weaker model’s own rollout and asks the expert to rewrite only that turn.»)
  • На семи корпоративных агентных задачах обучение слабой модели полным траекториям эксперта после эволюции агентной обвязки снизило результат на 4–30 пунктов у Qwen3-Coder и Gemma 4. (подтверждено самой публикацией: доказательство; «However, training the weaker model on the expert’s complete trajectories under the evolved harness backfires: performance regresses on all seven tasks by 4 to 30 points across Qwen3-Coder and Gemma 4, even though the same procedure helps under the unevolved harness.»)
  • Агентная обвязка включает системную инструкцию, набор инструментов, точки подключения к выполнению и обвязку управления контекстом вокруг модели. (подтверждено самой публикацией: доказательство; «Agent harnesses (the system prompt, tool set, execution hooks, and context-management scaffolding around a model) are a critical determinant of agentic task success.»)

Первоисточники:

оценка 62.4 · тип research · ревизия 1 · истории st-727nfl