Автори представили ExecCritic, метод для агентів, які пишуть код. Він відокремлює створення тестів від виправлення вихідного коду.
Один агент створює тести, а механізм перевірки, що зупиняється за помилки, приймає та фіксує їх. Інший агент виправляє код за результатами виконання тестів і не змінює їх.
У SWE-bench Verified поєднання двох донавчених агентів досягло 72,6% розв’язаних задач. Автори повідомляють, що це на 11,4 відсоткового пункту вище за початковий результат без тестів.
Перевірка тверджень:
- Автори представили ExecCritic, метод для агентів, які пишуть код. (підтверджено самою публікацією: доказ; «We introduce ExecCritic, combining a test–verify–revise scaffold with a role-specific reinforcement learning recipe for training agents within it.»)
- Він відокремлює створення тестів від виправлення вихідного коду. (підтверджено самою публікацією: доказ; «The scaffold separates test construction from source-code repair»)
- Один агент створює тести, а механізм перевірки, що зупиняється за помилки, приймає та фіксує їх. (підтверджено самою публікацією: доказ; «a Test agent independently generates repository-native tests, a fail-closed harness qualifies and freezes them»)
- Інший агент виправляє код за результатами виконання тестів і не змінює їх. (підтверджено самою публікацією: доказ; «a Repair agent revises source code from their execution feedback without changing the tests.»)
- У SWE-bench Verified поєднання двох донавчених агентів досягло 72,6% розв’язаних задач. (підтверджено самою публікацією: доказ; «composing the two post-trained Qwen agents reaches 72.6%»)
- Автори повідомляють, що це на 11,4 відсоткового пункту вище за початковий результат без тестів. (підтверджено самою публікацією: доказ; «an 11.4-point gain over the original no-test baseline»)
Першоджерела:
оцінка 72.6 · тип research · ревізія 1 · історії st-zfcxb4