Авторите на FIRE изучават правила по време на изпълнение: инструкции на естествен език и забрани за действия, които обвивката на агента прилага в състояния, предшестващи наблюдавани сривове. Според авторите тези правила не променят теглата на модела и потребителската заявка.

В пълния набор от 87 задачи на Terminal-Bench 2.1 делът на повторните успехи на GPT-5.6 Sol се е повишил от 64,4% на 73,6%. В рандомизиран експеримент с пет групи с реалните правила успехът е бил 61% при допустимите задачи, а без правило — 39%.

Проверка на твърденията:

  • Авторите на FIRE изучават правила по време на изпълнение: целеви инструкции на естествен език и забрани за действия, които обвивката на агента прилага в състояния, предшестващи наблюдавани сривове. (потвърдено от самата публикация: доказателство; «We study runtime policies: targeted natural-language instructions and action denials applied by the agent harness at states that preceded observed failures»)
  • Авторите пишат, че тези правила не променят теглата на модела и потребителската заявка. (потвърдено от самата публикация: доказателство; «without changing model weights or the user prompt»)
  • В пълния набор от 87 задачи на Terminal-Bench 2.1 делът на повторните успехи на GPT-5.6 Sol се е повишил от 64,4% на 73,6%. (потвърдено от самата публикация: доказателство; «Across the complete 87-task Terminal-Bench 2.1 suite, with two attempts per task, policies increase repeated success (pass^2) in all three GPT-5.6 tiers: 50.6% to 54.0% for Luna, 55.2% to 60.9% for Terra, and 64.4% to 73.6% for Sol.»)
  • В рандомизиран експеримент с пет групи с реалните правила успехът е бил 61% при допустимите задачи, а без правило — 39%. (потвърдено от самата публикация: доказателство; «To isolate the mechanism we run a randomized five-arm experiment: real policies reach 61% on eligible tasks, versus 39% without a policy»)

Първоизточници:

оценка 69,0 от 100 · вид: изследване