Growing Harness переносить повторювані рішення з керування з контексту мовної моделі у виконуваний код. Метод починається із заготовки без контролера для розв’язання завдань.
Журнали виконання пов’язують кожну помилку з обмеженою ділянкою коду, а оптимізатор спільно виправляє кілька помилок. Перевірка на відкладених завданнях скасовує серії виправлень, що погіршують попередні можливості.
На BrowseComp-Plus і WebArena-Verified Growing Harness показав найкращий середній результат у п’яти з шести поєднань тесту й моделі, а в шостому відстав на 0,7 відсоткового пункту.
У WebArena-Verified успішність Growing Harness становила 44,7–45,3% для моделей від 4B до 120B, тоді як Tool-Calling agent з моделлю 4B досяг 6,7%. Порівняно з Tool-Calling agent Growing Harness скоротив кількість викликів мовної моделі на 76,0–91,8% і вартість роботи моделі в розгорнутому агенті на 74,4–98,6%.
Перевірка тверджень:
- Growing Harness переносить повторювані рішення з керування з контексту мовної моделі у виконуваний код. (підтверджено самою публікацією: доказ; «These results show that persistent program growth can move recurring control out of model context and into low-cost code, yielding reusable specialist agents that remain effective with smaller deployment models.»)
- Метод починається із заготовки без контролера для розв’язання завдань. (підтверджено самою публікацією: доказ; «We introduce Growing Harness, a failure-guided training paradigm that learns the agent harness itself from a strategy-free scaffold that exposes fixed model and tool interfaces but encodes no task-solving controller.»)
- Журнали виконання пов’язують кожну помилку з обмеженою ділянкою коду, а оптимізатор спільно виправляє кілька помилок. (підтверджено самою публікацією: доказ; «Function-level execution traces localize each failure to a bounded code surface, an optimizer repairs a window of failures jointly, and a success-first held-out gate rolls back repair sequences that harm prior capability.»)
- Перевірка на відкладених завданнях скасовує серії виправлень, що погіршують попередні можливості. (підтверджено самою публікацією: доказ; «Function-level execution traces localize each failure to a bounded code surface, an optimizer repairs a window of failures jointly, and a success-first held-out gate rolls back repair sequences that harm prior capability.»)
- На BrowseComp-Plus і WebArena-Verified Growing Harness показав найкращий середній результат у п’яти з шести поєднань тесту й моделі, а в шостому відстав на 0,7 відсоткового пункту. (підтверджено самою публікацією: доказ; «Across BrowseComp-Plus and WebArena-Verified with three deployment models from 4B to 120B parameters, Growing Harness achieves the highest mean success in five of six benchmark-model settings and trails the best mean by 0.7 pp. in the sixth.»)
- У WebArena-Verified успішність Growing Harness становила 44,7–45,3% для моделей від 4B до 120B, тоді як Tool-Calling agent з моделлю 4B досяг 6,7%. (підтверджено самою публікацією: доказ; «On WebArena-Verified, its success remains 44.7-45.3% across model scales, whereas Tool-Calling falls to 6.7% with the 4B model.»)
- Порівняно з Tool-Calling agent Growing Harness скоротив кількість викликів мовної моделі на 76,0–91,8% і вартість роботи моделі в розгорнутому агенті на 74,4–98,6%. (підтверджено самою публікацією: доказ; «Relative to a Tool-Calling agent, it reduces LLM calls by 76.0-91.8% and deployed-agent inference cost by 74.4-98.6%.»)
Першоджерела:
оцінка 63,4 зі 100 · тип: дослідження