Авторите представиха SWE-Gate — бенчмарк на ниво хранилище за агенти по софтуерно инженерство. Той оценява спазването на ограниченията при преглед наред с функционалната коректност.
SWE-Gate извлича ограниченията при преглед от коментарите към реални pull request. След това бенчмаркът създава около тях задачи на ниво хранилище за поправка на код.
Всяка задача съдържа отделни функционални тестове и тестове за ограничения. Във всяка задача има и несъответстващи и еталонни пачове, така че поправянето на проблема и спазването на изискванията при преглед могат да се оценяват отделно.
В експериментите 4 LLM-бекенда работиха в обща обвивка за coding-agent. От 644 поправки, преминали функционалните тестове, 221 не изпълниха ограниченията при преглед.
Проверка на твърденията:
- Авторите на научната работа представиха SWE-Gate — бенчмарк на ниво хранилище за агенти по софтуерно инженерство, който оценява спазването на ограниченията при преглед наред с функционалната коректност. (потвърдено от самата публикация: доказателство; «We introduce SWE-Gate, a repository-level benchmark for software engineering agents that explicitly evaluates review constraint compliance alongside functional correctness.»)
- SWE-Gate извлича ограниченията при преглед от коментарите към реални pull request и създава около тях задачи на ниво хранилище за поправка на код. (потвърдено от самата публикация: доказателство; «SWE-Gate derives review constraints from real pull request review comments and synthesizes repository-level repair instances around these constraints.»)
- Всяка задача в бенчмарка съдържа отделни тестове за функционалност и ограничения, както и несъответстващи и еталонни пачове, което позволява поправянето на проблема и спазването на изискванията при преглед да се оценяват отделно. (потвърдено от самата публикация: доказателство; «Each instance provides separate functional and constraint tests, together with non-compliant and gold patches, enabling explicit separation between issue resolution capability and review constraint compliance.»)
- Наборът SWE-Gate включва 303 задачи на ниво хранилище за поправка на код от 75 отворени Python-хранилища от различни предметни области. (потвърдено от самата публикация: доказателство; «We construct SWE-Gate with 303 repository-level repair instances spanning 75 open-source Python repositories across diverse software domains.»)
- Експериментите бяха проведени с четири LLM-бекенда с различно ниво на възможности в обща обвивка за coding-agent. (потвърдено от самата публикация: доказателство; «Experiments with four LLM backends spanning different capability levels under a common coding-agent scaffold reveal a substantial gap between functional success and success under the complete repair specification: among 644 repairs that pass the functional tests, 221 fail to satisfy the provided review constraints.»)
- От 644 поправки, преминали функционалните тестове, 221 не изпълниха зададените ограничения при преглед. (потвърдено от самата публикация: доказателство; «among 644 repairs that pass the functional tests, 221 fail to satisfy the provided review constraints.»)
- Авторите заключават, че оценяването само по функционални тестове надценява способността на агентите да изпълняват пълния набор от изисквания на задачи на ниво хранилище за поправка на код. (потвърдено от самата публикация: доказателство; «These findings show that functional-only evaluation overestimates agents’ ability to satisfy the full requirements of repository-level repair tasks.»)
Първоизточници:
оценка 64.3 · тип research · ревизия 1 · истории st-1vvofgw