Авторы FC-SWE, метода обучения ИИ-агентов для работы с кодом, используют неудачное исправление и результаты его проверки как подсказку для следующей попытки. Перед новой попыткой метод возвращает репозиторий к исходному состоянию.
Награда за каждую попытку зависит от результата проверки. Успех повторной попытки не приносит награды за предыдущее неудачное исправление.
Авторы испытали метод с доступом к результатам проверки на всех 500 задачах из SWE-bench Verified, набора задач по исправлению кода. По их данным, при двух попытках агент решил 52,8% задач, а при одиннадцати — 70,7%, хотя при обучении допускалось не больше двух попыток подряд.
Проверка утверждений:
- Авторы предложили FC-SWE: метод включает повторные попытки исправления кода в обучение ИИ-агентов. (подтверждено самой публикацией: доказательство; «We introduce FC-SWE, a failure-conditioned RL framework that incorporates recovery attempts into policy training.»)
- После неудачной проверки FC-SWE возвращает репозиторий к исходному состоянию задачи и использует неудачное исправление и результаты его проверки как контекст для следующей попытки. (подтверждено самой публикацией: доказательство; «After a patch fails verification, FC-SWE restores the repository to its original task state and uses the failed patch and verifier feedback as context for a recovery trajectory.»)
- Каждая попытка получает награду по собственному результату проверки, поэтому успех повторной попытки не приносит награды за предыдущее неудачное исправление. (подтверждено самой публикацией: доказательство; «Trajectory-local rewards preserve each attempt’s verifier outcome, preventing recovery success from rewarding an earlier failed patch.»)
- Авторы испытали FC-SWE на всех 500 задачах SWE-bench Verified с доступом к результатам проверки и сообщили о 52,8% решённых задач при двух попытках. (подтверждено самой публикацией: доказательство; «On all 500 SWE-bench Verified tasks under a verifier-assisted protocol, FC-SWE with Qwen3.5-4B and SWE-agent achieves 41.7% Resolved@1 and 52.8% Resolved@2, compared with 38.9% and 48.5% for GRPO.»)
- По данным авторов, при одиннадцати попытках FC-SWE достиг 70,7% решённых задач, хотя при обучении допускалось не больше двух попыток в цепочке. (подтверждено самой публикацией: доказательство; «Although trained with at most two attempts per chain, FC-SWE reaches 70.7% Resolved@11 under an eleven-attempt test-time budget.»)
Первоисточники:
оценка 55,1 из 100 · тип: исследование