Автори представили ExecCritic, метод для агентів, які пишуть код. Він відокремлює створення тестів від виправлення вихідного коду.

Один агент створює тести, а механізм перевірки, що зупиняється за помилки, приймає та фіксує їх. Інший агент виправляє код за результатами виконання тестів і не змінює їх.

У SWE-bench Verified поєднання двох донавчених агентів досягло 72,6% розв’язаних задач. Автори повідомляють, що це на 11,4 відсоткового пункту вище за початковий результат без тестів.

Перевірка тверджень:

  • Автори представили ExecCritic, метод для агентів, які пишуть код. (підтверджено самою публікацією: доказ; «We introduce ExecCritic, combining a test–verify–revise scaffold with a role-specific reinforcement learning recipe for training agents within it.»)
  • Він відокремлює створення тестів від виправлення вихідного коду. (підтверджено самою публікацією: доказ; «The scaffold separates test construction from source-code repair»)
  • Один агент створює тести, а механізм перевірки, що зупиняється за помилки, приймає та фіксує їх. (підтверджено самою публікацією: доказ; «a Test agent independently generates repository-native tests, a fail-closed harness qualifies and freezes them»)
  • Інший агент виправляє код за результатами виконання тестів і не змінює їх. (підтверджено самою публікацією: доказ; «a Repair agent revises source code from their execution feedback without changing the tests.»)
  • У SWE-bench Verified поєднання двох донавчених агентів досягло 72,6% розв’язаних задач. (підтверджено самою публікацією: доказ; «composing the two post-trained Qwen agents reaches 72.6%»)
  • Автори повідомляють, що це на 11,4 відсоткового пункту вище за початковий результат без тестів. (підтверджено самою публікацією: доказ; «an 11.4-point gain over the original no-test baseline»)

Першоджерела:

оцінка 72.6 · тип research · ревізія 1 · історії st-zfcxb4