Armature опубликовала исследование о том, как coding-агенты, программы, которые помогают писать и менять код, находят и выбирают инструменты. Компания измерила 16 893 сессии с Claude Code, Codex и Cursor.
В первой опубликованной волне авторы оставили 5 292 сессии на 51 кодовой базе из 18 отраслей. Все три агента выбрали один и тот же инструмент лишь в 42% ячеек.
Проверка утверждений:
- Armature опубликовала результаты исследования о том, как coding-агенты находят и выбирают инструменты. (подтверждено самой публикацией: доказательство; «Today we are sharing everything: aggregated results and leaderboards per category, but also every observation and even the entire traces with the user prompts, thinking traces and actual code diffs applied by the agent.»)
- Armature измерила 16 893 сессии с Claude Code, Codex и Cursor. (подтверждено самой публикацией: доказательство; «Which tools do Claude Code, Codex and Cursor choose? We measured 16,893 sessions to find out.»)
- В первой опубликованной волне авторы оставили 5 292 сессии на 51 кодовой базе из 18 отраслей. (подтверждено самой публикацией: доказательство; «Out of these 16,893 runs, we started by keeping 5,292 sessions on 51 codebases and 18 sectors that we considered valid and ready to be published.»)
- Все три агента выбрали один и тот же инструмент лишь в 42% ячеек. (подтверждено самой публикацией: доказательство; «All three agents pick the same tool in only 42% of the cells»)
Публикации:
Первоисточники:
оценка 67.5 · тип research · ревизия 1 · истории st-8u0fhc