Авторы представили ExecCritic, метод для агентов, которые пишут код. Он отделяет создание тестов от исправления исходного кода.
Один агент создаёт тесты, а механизм проверки, который прекращает работу при ошибке, принимает и фиксирует их. Другой агент исправляет код по результатам выполнения тестов и не меняет их.
В SWE-bench Verified сочетание двух дообученных агентов достигло 72,6% решённых задач. Авторы сообщают, что это на 11,4 процентного пункта выше исходного результата без тестов.
Проверка утверждений:
- Авторы представили ExecCritic, метод для агентов, которые пишут код. (подтверждено самой публикацией: доказательство; «We introduce ExecCritic, combining a test–verify–revise scaffold with a role-specific reinforcement learning recipe for training agents within it.»)
- Он отделяет создание тестов от исправления исходного кода. (подтверждено самой публикацией: доказательство; «The scaffold separates test construction from source-code repair»)
- Один агент создаёт тесты, а механизм проверки, который прекращает работу при ошибке, принимает и фиксирует их. (подтверждено самой публикацией: доказательство; «a Test agent independently generates repository-native tests, a fail-closed harness qualifies and freezes them»)
- Другой агент исправляет код по результатам выполнения тестов и не меняет их. (подтверждено самой публикацией: доказательство; «a Repair agent revises source code from their execution feedback without changing the tests.»)
- В SWE-bench Verified сочетание двух дообученных агентов достигло 72,6% решённых задач. (подтверждено самой публикацией: доказательство; «composing the two post-trained Qwen agents reaches 72.6%»)
- Авторы сообщают, что это на 11,4 процентного пункта выше исходного результата без тестов. (подтверждено самой публикацией: доказательство; «an 11.4-point gain over the original no-test baseline»)
Первоисточники:
оценка 72.6 · тип research · ревизия 1 · истории st-zfcxb4