AMAP-ML опубликовала публичный репозиторий LoopArena с бенчмарком и техническим описанием того, как одна модель в роли Controller управляет отдельным coding-агентом в длительных задачах разработки.
В архитектуре LoopArena Worker изменяет репозиторий, а временный Reporter формирует сводку состояния. Controller получает Evidence Packet и возвращает следующий Loop Contract, при этом изменять репозиторий может только Worker.
В Type I модель выбирает лучший контракт из четырёх проверенных исполнением кандидатов на 90 примерах. Type II охватывает управление срезом coding-задачи на 27 примерах, а Type III — полной задачей на 27 примерах.
В основной панели результатов v0.1.0 сравниваются пять Controller-моделей, а лучший показатель Type III Strict Success Rate составляет 24,69%. Type II в среднем снижает оценочную стоимость инференса на 64,4% относительно Type III и сохраняет близкий порядок моделей с корреляцией Спирмена 0,9747.
Проверка утверждений:
- AMAP-ML опубликовала публичный репозиторий LoopArena с бенчмарком и техническим описанием того, как одна модель в роли Controller управляет отдельным coding-агентом в длительных задачах разработки. (подтверждено первоисточником: доказательство; «LoopArena benchmarks how well one model can guide a separate coding agent through a long-running task.»)
- В архитектуре LoopArena Worker изменяет репозиторий, временный Reporter формирует сводку состояния, а Controller получает Evidence Packet и возвращает следующий Loop Contract; изменять репозиторий может только Worker. (подтверждено первоисточником: доказательство; «The Worker edits the repository and uses the tools available in the task environment. Whenever it finishes an assignment, a temporary, read-only Reporter summarizes the current state. The harness formats the report as an Evidence Packet for the Controller, which returns a Loop Contract with the next Worker assignment, a verification request, or a decision to stop. Only the Worker can change the repository.»)
- Бенчмарк включает три режима: Type I — выбор лучшего контракта из четырёх проверенных исполнением кандидатов на 90 примерах, Type II — управление срезом coding-задачи на 27 примерах, Type III — управление полной задачей на 27 примерах. (подтверждено первоисточником: доказательство; «Type I · Contract selection Choose the best next Loop Contract from four execution-validated candidates Frozen Evidence Packet at one control point 90 Contract Accuracy Type II · Condensed coding task Guide the Worker through one selected slice of a full coding task Standardized task-slice workspace 27 Strict Success Rate Type III · Full coding task Guide the Worker through the complete coding task Original task state 27 Strict Success Rate»)
- Наборы Type II и Type III попарно соответствуют друг другу и охватывают 11 задач SCBench и 16 задач BeyondSWE. (подтверждено первоисточником: доказательство; «Type II and Type III are paired one-to-one across 11 SCBench and 16 BeyondSWE tasks.»)
- В основной панели результатов v0.1.0 сравниваются пять Controller-моделей, а лучший показатель Type III Strict Success Rate составляет 24,69%. (подтверждено первоисточником: доказательство; «The v0.1.0 main panel compares five Controller models. The strongest Type III Strict Success Rate is 24.69% , leaving substantial headroom on full-task control.»)
- В результатах проекта Type II в среднем снижает оценочную стоимость инференса на 64,4% относительно Type III и сохраняет близкий порядок моделей: корреляция Спирмена равна 0,9747. (подтверждено первоисточником: доказательство; «Across Controllers, Type II reduces estimated inference cost by 64.4% on average while producing a similar Core-based ordering to Type III (Spearman’s ρ = 0.9747 ).»)
- Во всех прогонах Controller-моделей для Type II и Type III общими Worker и Reporter служит Qwen3.7-Plus, тогда как политики no-control и fixed-control вынесены в отдельные референсные результаты. (подтверждено первоисточником: доказательство; «All Controller-model Type II and Type III runs use Qwen3.7-Plus as the shared Worker and Reporter; no-control and fixed-control are reported separately as reference policies.»)
- Fixed-control превосходит no-control на Type II — 46,91% против 39,51%, — но на Type III обе политики получают 18,52%, поэтому выводы по сокращённым задачам предлагается сверять с полными. (подтверждено первоисточником: доказательство; «Fixed control scores 46.91% versus 39.51% for no control on Type II, but both score 18.52% on Type III. This contrast motivates checking conclusions from condensed tasks against complete-task behavior.»)
- Для Type I требуется Python 3.10 или новее, а LoopArena обращается к OpenAI-совместимому модельному endpoint. (подтверждено первоисточником: доказательство; «LoopArena requires Python 3.10 or newer. For the Type I smoke test, install the model-gateway dependency from the cloned repository root: python -m pip install -e ’ .[gateway] ’ Benchmark data live in the Git checkout rather than the Python wheel. For a non-editable install, set LOOPARENA_HOME to the cloned repository root. 2. Configure a model endpoint LoopArena uses an OpenAI-compatible model endpoint.»)
- Для Type II и Type III дополнительно нужны Git, Docker и uv для SCBench; полные внешние evaluator-бандлы, репозитории и образы контейнеров проект не распространяет, а их зафиксированные ревизии нужно получить из исходных проектов. (подтверждено первоисточником: доказательство; «Type II and Type III additionally require Git, Docker, and uv for SCBench. Install the full runtime dependencies before preparing their evaluator assets: python -m pip install -e ’ .[gateway,scbench] ’ LoopArena includes the frozen Type II starting workspaces and small preparation recipes, but does not redistribute complete upstream evaluator bundles, repositories, or container images. Download the revisions pinned in benchmarks/upstreams.toml from the original projects:»)
Первоисточники:
оценка 67.0 · тип research · ревизия 1 · истории st-z3yeko