Авторы FC-SWE, метода обучения ИИ-агентов для работы с кодом, используют неудачное исправление и результаты его проверки как подсказку для следующей попытки. Перед новой попыткой метод возвращает репозиторий к исходному состоянию.

Награда за каждую попытку зависит от результата проверки. Успех повторной попытки не приносит награды за предыдущее неудачное исправление.

Авторы испытали метод с доступом к результатам проверки на всех 500 задачах из SWE-bench Verified, набора задач по исправлению кода. По их данным, при двух попытках агент решил 52,8% задач, а при одиннадцати — 70,7%, хотя при обучении допускалось не больше двух попыток подряд.

Проверка утверждений:

  • Авторы предложили FC-SWE: метод включает повторные попытки исправления кода в обучение ИИ-агентов. (подтверждено самой публикацией: доказательство; «We introduce FC-SWE, a failure-conditioned RL framework that incorporates recovery attempts into policy training.»)
  • После неудачной проверки FC-SWE возвращает репозиторий к исходному состоянию задачи и использует неудачное исправление и результаты его проверки как контекст для следующей попытки. (подтверждено самой публикацией: доказательство; «After a patch fails verification, FC-SWE restores the repository to its original task state and uses the failed patch and verifier feedback as context for a recovery trajectory.»)
  • Каждая попытка получает награду по собственному результату проверки, поэтому успех повторной попытки не приносит награды за предыдущее неудачное исправление. (подтверждено самой публикацией: доказательство; «Trajectory-local rewards preserve each attempt’s verifier outcome, preventing recovery success from rewarding an earlier failed patch.»)
  • Авторы испытали FC-SWE на всех 500 задачах SWE-bench Verified с доступом к результатам проверки и сообщили о 52,8% решённых задач при двух попытках. (подтверждено самой публикацией: доказательство; «On all 500 SWE-bench Verified tasks under a verifier-assisted protocol, FC-SWE with Qwen3.5-4B and SWE-agent achieves 41.7% Resolved@1 and 52.8% Resolved@2, compared with 38.9% and 48.5% for GRPO.»)
  • По данным авторов, при одиннадцати попытках FC-SWE достиг 70,7% решённых задач, хотя при обучении допускалось не больше двух попыток в цепочке. (подтверждено самой публикацией: доказательство; «Although trained with at most two attempts per chain, FC-SWE reaches 70.7% Resolved@11 under an eleven-attempt test-time budget.»)

Первоисточники:

оценка 55,1 из 100 · тип: исследование