Авторите представиха ExecCritic, метод за агенти, които пишат код. Той отделя създаването на тестове от поправянето на изходния код.

Един агент създава тестове, а механизъм за проверка, който спира при грешка, ги приема и фиксира. Друг агент поправя кода според резултатите от изпълнението на тестовете и не ги променя.

В SWE-bench Verified съчетанието на два допълнително обучени агента достига 72,6% решени задачи. Авторите съобщават, че това е с 11,4 процентни пункта над първоначалния резултат без тестове.

Проверка на твърденията:

  • Авторите представиха ExecCritic, метод за агенти, които пишат код. (потвърдено от самата публикация: доказателство; «We introduce ExecCritic, combining a test–verify–revise scaffold with a role-specific reinforcement learning recipe for training agents within it.»)
  • Той отделя създаването на тестове от поправянето на изходния код. (потвърдено от самата публикация: доказателство; «The scaffold separates test construction from source-code repair»)
  • Един агент създава тестове, а механизъм за проверка, който спира при грешка, ги приема и фиксира. (потвърдено от самата публикация: доказателство; «a Test agent independently generates repository-native tests, a fail-closed harness qualifies and freezes them»)
  • Друг агент поправя кода според резултатите от изпълнението на тестовете и не ги променя. (потвърдено от самата публикация: доказателство; «a Repair agent revises source code from their execution feedback without changing the tests.»)
  • В SWE-bench Verified съчетанието на два допълнително обучени агента достига 72,6% решени задачи. (потвърдено от самата публикация: доказателство; «composing the two post-trained Qwen agents reaches 72.6%»)
  • Авторите съобщават, че това е с 11,4 процентни пункта над първоначалния резултат без тестове. (потвърдено от самата публикация: доказателство; «an 11.4-point gain over the original no-test baseline»)

Първоизточници:

оценка 72.6 · тип research · ревизия 1 · истории st-zfcxb4