Авторы представили SWE-Gate — репозиторный бенчмарк для агентов программной инженерии. Он оценивает соблюдение ограничений ревью наряду с функциональной корректностью.
SWE-Gate извлекает ограничения ревью из комментариев к реальным pull request. Затем бенчмарк создаёт вокруг них репозиторные задачи по исправлению кода.
Каждая задача содержит отдельные функциональные тесты и тесты ограничений. Также в каждой задаче есть несоответствующие и эталонные патчи, поэтому можно отдельно оценивать исправление проблемы и соблюдение требований ревью.
В экспериментах 4 LLM-бэкенда работали в общей обвязке coding-агента. Из 644 исправлений, прошедших функциональные тесты, 221 не выполнило ограничения ревью.
Проверка утверждений:
- Авторы научной работы представили SWE-Gate — репозиторный бенчмарк для агентов программной инженерии, который оценивает соблюдение ограничений ревью наряду с функциональной корректностью. (подтверждено самой публикацией: доказательство; «We introduce SWE-Gate, a repository-level benchmark for software engineering agents that explicitly evaluates review constraint compliance alongside functional correctness.»)
- SWE-Gate извлекает ограничения ревью из комментариев к реальным pull request и создаёт вокруг них репозиторные задачи по исправлению кода. (подтверждено самой публикацией: доказательство; «SWE-Gate derives review constraints from real pull request review comments and synthesizes repository-level repair instances around these constraints.»)
- Каждая задача в бенчмарке содержит отдельные тесты функциональности и ограничений, а также несоответствующие и эталонные патчи, что позволяет отдельно оценивать исправление проблемы и соблюдение требований ревью. (подтверждено самой публикацией: доказательство; «Each instance provides separate functional and constraint tests, together with non-compliant and gold patches, enabling explicit separation between issue resolution capability and review constraint compliance.»)
- Набор SWE-Gate включает 303 репозиторные задачи по исправлению кода из 75 открытых Python-репозиториев разных предметных областей. (подтверждено самой публикацией: доказательство; «We construct SWE-Gate with 303 repository-level repair instances spanning 75 open-source Python repositories across diverse software domains.»)
- Эксперименты проводились с четырьмя LLM-бэкендами разного уровня возможностей в общей обвязке coding-агента. (подтверждено самой публикацией: доказательство; «Experiments with four LLM backends spanning different capability levels under a common coding-agent scaffold reveal a substantial gap between functional success and success under the complete repair specification: among 644 repairs that pass the functional tests, 221 fail to satisfy the provided review constraints.»)
- Из 644 исправлений, прошедших функциональные тесты, 221 не выполнило заданные ограничения ревью. (подтверждено самой публикацией: доказательство; «among 644 repairs that pass the functional tests, 221 fail to satisfy the provided review constraints.»)
- Авторы делают вывод, что оценка только по функциональным тестам завышает способность агентов выполнять полный набор требований репозиторных задач по исправлению кода. (подтверждено самой публикацией: доказательство; «These findings show that functional-only evaluation overestimates agents’ ability to satisfy the full requirements of repository-level repair tasks.»)
Первоисточники:
оценка 64.3 · тип research · ревизия 1 · истории st-1vvofgw