Авторы FIRE изучают правила времени выполнения: инструкции на естественном языке и запреты действий, которые оболочка агента применяет в ситуациях, предшествовавших уже замеченным сбоям. По словам авторов, эти правила не меняют веса модели и запрос пользователя.

На полном наборе из 87 задач Terminal-Bench 2.1 повторный успех GPT-5.6 Sol вырос с 64,4% до 73,6%. В рандомизированном эксперименте с пятью группами с реальными правилами успех был в 61% подходящих задач, без правила — в 39%.

Проверка утверждений:

  • Авторы FIRE изучают правила времени выполнения: целевые инструкции на естественном языке и запреты действий, которые оболочка агента применяет в состояниях, предшествовавших замеченным сбоям. (подтверждено самой публикацией: доказательство; «We study runtime policies: targeted natural-language instructions and action denials applied by the agent harness at states that preceded observed failures»)
  • Авторы пишут, что эти правила не меняют веса модели и запрос пользователя. (подтверждено самой публикацией: доказательство; «without changing model weights or the user prompt»)
  • На полном наборе из 87 задач Terminal-Bench 2.1 повторный успех модели GPT-5.6 Sol вырос с 64,4% до 73,6%. (подтверждено самой публикацией: доказательство; «Across the complete 87-task Terminal-Bench 2.1 suite, with two attempts per task, policies increase repeated success (pass^2) in all three GPT-5.6 tiers: 50.6% to 54.0% for Luna, 55.2% to 60.9% for Terra, and 64.4% to 73.6% for Sol.»)
  • В рандомизированном эксперименте с пятью группами с реальными правилами успех был в 61% подходящих задач, без правила — в 39%. (подтверждено самой публикацией: доказательство; «To isolate the mechanism we run a randomized five-arm experiment: real policies reach 61% on eligible tasks, versus 39% without a policy»)

Первоисточники:

оценка 69,0 из 100 · тип: исследование