Метод Growing Harness переносит повторяющиеся управляющие решения из контекста языковой модели в исполняемый код. Метод начинается с заготовки без контроллера для решения задач.

Журналы выполнения привязывают каждую ошибку к ограниченному участку кода, а оптимизатор совместно исправляет несколько ошибок. Проверка на отложенных задачах откатывает серии исправлений, которые ухудшают прежние возможности.

На BrowseComp-Plus и WebArena-Verified Growing Harness показал лучший средний результат в пяти из шести сочетаний теста и модели, а в шестом отстал на 0,7 процентного пункта.

В WebArena-Verified успешность Growing Harness составила 44,7–45,3% для моделей от 4B до 120B, тогда как Tool-Calling agent с моделью 4B достиг 6,7%. По сравнению с Tool-Calling agent Growing Harness сократил число вызовов языковой модели на 76,0–91,8% и стоимость работы модели в развёрнутом агенте на 74,4–98,6%.

Проверка утверждений:

  • Growing Harness переносит повторяющиеся управляющие решения из контекста языковой модели в исполняемый код. (подтверждено самой публикацией: доказательство; «These results show that persistent program growth can move recurring control out of model context and into low-cost code, yielding reusable specialist agents that remain effective with smaller deployment models.»)
  • Метод начинается с заготовки без контроллера для решения задач. (подтверждено самой публикацией: доказательство; «We introduce Growing Harness, a failure-guided training paradigm that learns the agent harness itself from a strategy-free scaffold that exposes fixed model and tool interfaces but encodes no task-solving controller.»)
  • Журналы выполнения привязывают каждую ошибку к ограниченному участку кода, а оптимизатор совместно исправляет несколько ошибок. (подтверждено самой публикацией: доказательство; «Function-level execution traces localize each failure to a bounded code surface, an optimizer repairs a window of failures jointly, and a success-first held-out gate rolls back repair sequences that harm prior capability.»)
  • Проверка на отложенных задачах откатывает серии исправлений, которые ухудшают прежние возможности. (подтверждено самой публикацией: доказательство; «Function-level execution traces localize each failure to a bounded code surface, an optimizer repairs a window of failures jointly, and a success-first held-out gate rolls back repair sequences that harm prior capability.»)
  • На BrowseComp-Plus и WebArena-Verified Growing Harness показал лучший средний результат в пяти из шести сочетаний теста и модели, а в шестом отстал на 0,7 процентного пункта. (подтверждено самой публикацией: доказательство; «Across BrowseComp-Plus and WebArena-Verified with three deployment models from 4B to 120B parameters, Growing Harness achieves the highest mean success in five of six benchmark-model settings and trails the best mean by 0.7 pp. in the sixth.»)
  • В WebArena-Verified успешность Growing Harness составила 44,7–45,3% для моделей от 4B до 120B, тогда как Tool-Calling agent с моделью 4B достиг 6,7%. (подтверждено самой публикацией: доказательство; «On WebArena-Verified, its success remains 44.7-45.3% across model scales, whereas Tool-Calling falls to 6.7% with the 4B model.»)
  • По сравнению с Tool-Calling agent Growing Harness сократил число вызовов языковой модели на 76,0–91,8% и стоимость работы модели в развёрнутом агенте на 74,4–98,6%. (подтверждено самой публикацией: доказательство; «Relative to a Tool-Calling agent, it reduces LLM calls by 76.0-91.8% and deployed-agent inference cost by 74.4-98.6%.»)

Первоисточники:

оценка 63,4 из 100 · тип: исследование