Armature опубликовала исследование о том, как coding-агенты, программы, которые помогают писать и менять код, находят и выбирают инструменты. Компания измерила 16 893 сессии с Claude Code, Codex и Cursor.

В первой опубликованной волне авторы оставили 5 292 сессии на 51 кодовой базе из 18 отраслей. Все три агента выбрали один и тот же инструмент лишь в 42% ячеек.

Проверка утверждений:

  • Armature опубликовала результаты исследования о том, как coding-агенты находят и выбирают инструменты. (подтверждено самой публикацией: доказательство; «Today we are sharing everything: aggregated results and leaderboards per category, but also every observation and even the entire traces with the user prompts, thinking traces and actual code diffs applied by the agent.»)
  • Armature измерила 16 893 сессии с Claude Code, Codex и Cursor. (подтверждено самой публикацией: доказательство; «Which tools do Claude Code, Codex and Cursor choose? We measured 16,893 sessions to find out.»)
  • В первой опубликованной волне авторы оставили 5 292 сессии на 51 кодовой базе из 18 отраслей. (подтверждено самой публикацией: доказательство; «Out of these 16,893 runs, we started by keeping 5,292 sessions on 51 codebases and 18 sectors that we considered valid and ready to be published.»)
  • Все три агента выбрали один и тот же инструмент лишь в 42% ячеек. (подтверждено самой публикацией: доказательство; «All three agents pick the same tool in only 42% of the cells»)

Публикации:

Первоисточники:

оценка 67.5 · тип research · ревизия 1 · истории st-8u0fhc