Автори FIRE вивчають правила виконання: інструкції природною мовою та заборони дій, які оболонка агента застосовує у станах, що передують поміченим збоям. За словами авторів, ці правила не змінюють ваги моделі та запит користувача.

На повному наборі з 87 завдань Terminal-Bench 2.1 повторний успіх GPT-5.6 Sol зріс із 64,4% до 73,6%. У рандомізованому експерименті з п’ятьма групами з реальними правилами успіх був у 61% придатних завдань, без правила — у 39%.

Перевірка тверджень:

  • Автори FIRE вивчають правила виконання: цільові інструкції природною мовою та заборони дій, які оболонка агента застосовує у станах, що передують поміченим збоям. (підтверджено самою публікацією: доказ; «We study runtime policies: targeted natural-language instructions and action denials applied by the agent harness at states that preceded observed failures»)
  • Автори пишуть, що ці правила не змінюють ваги моделі та запит користувача. (підтверджено самою публікацією: доказ; «without changing model weights or the user prompt»)
  • На повному наборі з 87 завдань Terminal-Bench 2.1 повторний успіх GPT-5.6 Sol зріс із 64,4% до 73,6%. (підтверджено самою публікацією: доказ; «Across the complete 87-task Terminal-Bench 2.1 suite, with two attempts per task, policies increase repeated success (pass^2) in all three GPT-5.6 tiers: 50.6% to 54.0% for Luna, 55.2% to 60.9% for Terra, and 64.4% to 73.6% for Sol.»)
  • У рандомізованому експерименті з п’ятьма групами з реальними правилами успіх був у 61% придатних завдань, без правила — у 39%. (підтверджено самою публікацією: доказ; «To isolate the mechanism we run a randomized five-arm experiment: real policies reach 61% on eligible tasks, versus 39% without a policy»)

Першоджерела:

оцінка 69,0 зі 100 · тип: дослідження