Growing Harness прехвърля повтарящите се решения за управление от контекста на езиковия модел в изпълним код. Методът започва със заготовка без контролер за решаване на задачи.

Дневниците на изпълнението свързват всяка грешка с ограничена област от кода, а оптимизатор поправя няколко грешки заедно. Проверка върху отделени задачи отменя поредици от поправки, които влошават предишни способности.

При BrowseComp-Plus и WebArena-Verified Growing Harness постигна най-добрия среден резултат в пет от шест комбинации между тест и модел, а в шестата изостана с 0,7 процентни пункта.

При WebArena-Verified успеваемостта на Growing Harness беше 44,7–45,3% за модели от 4B до 120B, докато Tool-Calling agent с модел 4B достигна 6,7%. Спрямо Tool-Calling agent Growing Harness намали извикванията към езиковия модел с 76,0–91,8% и цената на работата на модела във внедрения агент с 74,4–98,6%.

Проверка на твърденията:

  • Growing Harness прехвърля повтарящите се решения за управление от контекста на езиковия модел в изпълним код. (потвърдено от самата публикация: доказателство; «These results show that persistent program growth can move recurring control out of model context and into low-cost code, yielding reusable specialist agents that remain effective with smaller deployment models.»)
  • Методът започва със заготовка без контролер за решаване на задачи. (потвърдено от самата публикация: доказателство; «We introduce Growing Harness, a failure-guided training paradigm that learns the agent harness itself from a strategy-free scaffold that exposes fixed model and tool interfaces but encodes no task-solving controller.»)
  • Дневниците на изпълнението свързват всяка грешка с ограничена област от кода, а оптимизатор поправя няколко грешки заедно. (потвърдено от самата публикация: доказателство; «Function-level execution traces localize each failure to a bounded code surface, an optimizer repairs a window of failures jointly, and a success-first held-out gate rolls back repair sequences that harm prior capability.»)
  • Проверка върху отделени задачи отменя поредици от поправки, които влошават предишни способности. (потвърдено от самата публикация: доказателство; «Function-level execution traces localize each failure to a bounded code surface, an optimizer repairs a window of failures jointly, and a success-first held-out gate rolls back repair sequences that harm prior capability.»)
  • При BrowseComp-Plus и WebArena-Verified Growing Harness постигна най-добрия среден резултат в пет от шест комбинации между тест и модел, а в шестата изостана с 0,7 процентни пункта. (потвърдено от самата публикация: доказателство; «Across BrowseComp-Plus and WebArena-Verified with three deployment models from 4B to 120B parameters, Growing Harness achieves the highest mean success in five of six benchmark-model settings and trails the best mean by 0.7 pp. in the sixth.»)
  • При WebArena-Verified успеваемостта на Growing Harness беше 44,7–45,3% за модели от 4B до 120B, докато Tool-Calling agent с модел 4B достигна 6,7%. (потвърдено от самата публикация: доказателство; «On WebArena-Verified, its success remains 44.7-45.3% across model scales, whereas Tool-Calling falls to 6.7% with the 4B model.»)
  • Спрямо Tool-Calling agent Growing Harness намали извикванията към езиковия модел с 76,0–91,8% и цената на работата на модела във внедрения агент с 74,4–98,6%. (потвърдено от самата публикация: доказателство; «Relative to a Tool-Calling agent, it reduces LLM calls by 76.0-91.8% and deployed-agent inference cost by 74.4-98.6%.»)

Първоизточници:

оценка 63,4 от 100 · вид: изследване