Автори статті пропонують on-policy expert-correction pipeline, схему, яка знаходить збійний хід у власному запуску слабшої моделі й просить експерта переписати лише цей хід.

На семи корпоративних агентних задачах навчання слабшої моделі на повних траєкторіях експерта після еволюції агентної обв’язки знизило результат на 4–30 пунктів у Qwen3-Coder і Gemma 4. Агентна обв’язка — це системна інструкція, набір інструментів, точки підключення до виконання й обв’язка керування контекстом навколо моделі.

Перевірка тверджень:

  • Автори пропонують конвеєр on-policy expert-correction, який знаходить збійний хід у власному запуску слабшої моделі й просить експерта переписати лише цей хід. (підтверджено самою публікацією: доказ; «We therefore develop an on-policy expert-correction pipeline, automated by a meta-level MLE agent, that localizes the failing turn in the weaker model’s own rollout and asks the expert to rewrite only that turn.»)
  • На семи корпоративних агентних задачах навчання слабшої моделі на повних траєкторіях експерта після еволюції агентної обв’язки знизило результат на 4–30 пунктів у Qwen3-Coder і Gemma 4. (підтверджено самою публікацією: доказ; «However, training the weaker model on the expert’s complete trajectories under the evolved harness backfires: performance regresses on all seven tasks by 4 to 30 points across Qwen3-Coder and Gemma 4, even though the same procedure helps under the unevolved harness.»)
  • Агентна обв’язка містить системну інструкцію, набір інструментів, точки підключення до виконання й обв’язку керування контекстом навколо моделі. (підтверджено самою публікацією: доказ; «Agent harnesses (the system prompt, tool set, execution hooks, and context-management scaffolding around a model) are a critical determinant of agentic task success.»)

Першоджерела:

оцінка 62.4 · тип research · ревізія 1 · історії st-727nfl