Автори представили SWE-Gate — репозиторний бенчмарк для агентів програмної інженерії. Він оцінює дотримання обмежень рев’ю поряд із функціональною коректністю.

SWE-Gate витягає обмеження рев’ю з коментарів до реальних pull request. Потім бенчмарк створює на їхній основі репозиторні задачі з виправлення коду.

Кожна задача містить окремі функціональні тести й тести обмежень. Також кожна задача має невідповідні та еталонні патчі, тому можна окремо оцінювати виправлення проблеми й дотримання вимог рев’ю.

В експериментах 4 LLM-бекенди працювали в спільній обв’язці coding-агента. Із 644 виправлень, що пройшли функціональні тести, 221 не виконало обмежень рев’ю.

Перевірка тверджень:

  • Автори наукової роботи представили SWE-Gate — репозиторний бенчмарк для агентів програмної інженерії, який оцінює дотримання обмежень рев’ю поряд із функціональною коректністю. (підтверджено самою публікацією: доказ; «We introduce SWE-Gate, a repository-level benchmark for software engineering agents that explicitly evaluates review constraint compliance alongside functional correctness.»)
  • SWE-Gate витягає обмеження рев’ю з коментарів до реальних pull request і створює на їхній основі репозиторні задачі з виправлення коду. (підтверджено самою публікацією: доказ; «SWE-Gate derives review constraints from real pull request review comments and synthesizes repository-level repair instances around these constraints.»)
  • Кожна задача в бенчмарку містить окремі тести функціональності й обмежень, а також невідповідні та еталонні патчі, що дає змогу окремо оцінювати виправлення проблеми й дотримання вимог рев’ю. (підтверджено самою публікацією: доказ; «Each instance provides separate functional and constraint tests, together with non-compliant and gold patches, enabling explicit separation between issue resolution capability and review constraint compliance.»)
  • Набір SWE-Gate містить 303 репозиторні задачі з виправлення коду з 75 відкритих Python-репозиторіїв із різних предметних галузей. (підтверджено самою публікацією: доказ; «We construct SWE-Gate with 303 repository-level repair instances spanning 75 open-source Python repositories across diverse software domains.»)
  • Експерименти проводили з чотирма LLM-бекендами різного рівня можливостей у спільній обв’язці coding-агента. (підтверджено самою публікацією: доказ; «Experiments with four LLM backends spanning different capability levels under a common coding-agent scaffold reveal a substantial gap between functional success and success under the complete repair specification: among 644 repairs that pass the functional tests, 221 fail to satisfy the provided review constraints.»)
  • Із 644 виправлень, що пройшли функціональні тести, 221 не виконало заданих обмежень рев’ю. (підтверджено самою публікацією: доказ; «among 644 repairs that pass the functional tests, 221 fail to satisfy the provided review constraints.»)
  • Автори доходять висновку, що оцінювання лише за функціональними тестами завищує здатність агентів виконувати повний набір вимог репозиторних задач із виправлення коду. (підтверджено самою публікацією: доказ; «These findings show that functional-only evaluation overestimates agents’ ability to satisfy the full requirements of repository-level repair tasks.»)

Першоджерела:

оцінка 64.3 · тип research · ревізія 1 · історії st-1vvofgw