Авторите представиха ExecCritic, метод за агенти, които пишат код. Той отделя създаването на тестове от поправянето на изходния код.
Един агент създава тестове, а механизъм за проверка, който спира при грешка, ги приема и фиксира. Друг агент поправя кода според резултатите от изпълнението на тестовете и не ги променя.
В SWE-bench Verified съчетанието на два допълнително обучени агента достига 72,6% решени задачи. Авторите съобщават, че това е с 11,4 процентни пункта над първоначалния резултат без тестове.
Проверка на твърденията:
- Авторите представиха ExecCritic, метод за агенти, които пишат код. (потвърдено от самата публикация: доказателство; «We introduce ExecCritic, combining a test–verify–revise scaffold with a role-specific reinforcement learning recipe for training agents within it.»)
- Той отделя създаването на тестове от поправянето на изходния код. (потвърдено от самата публикация: доказателство; «The scaffold separates test construction from source-code repair»)
- Един агент създава тестове, а механизъм за проверка, който спира при грешка, ги приема и фиксира. (потвърдено от самата публикация: доказателство; «a Test agent independently generates repository-native tests, a fail-closed harness qualifies and freezes them»)
- Друг агент поправя кода според резултатите от изпълнението на тестовете и не ги променя. (потвърдено от самата публикация: доказателство; «a Repair agent revises source code from their execution feedback without changing the tests.»)
- В SWE-bench Verified съчетанието на два допълнително обучени агента достига 72,6% решени задачи. (потвърдено от самата публикация: доказателство; «composing the two post-trained Qwen agents reaches 72.6%»)
- Авторите съобщават, че това е с 11,4 процентни пункта над първоначалния резултат без тестове. (потвърдено от самата публикация: доказателство; «an 11.4-point gain over the original no-test baseline»)
Първоизточници:
оценка 72.6 · тип research · ревизия 1 · истории st-zfcxb4