Artificial Analysis опубликовала страницу бенчмарков coding agents. Сравнительный материал показывает производительность агентов на задачах программной инженерии, а также стоимость, расход токенов и время выполнения.
Coding Agent Index v1.4 объединяет DeepSWE, Terminal-Bench v2.1 и SWE-Atlas-QnA. Оценка каждого бенчмарка — это средний pass@1 по трём попыткам на задачу, а три компонента получают в итоговом индексе одинаковый вес.
Набор охватывает чтение и понимание репозиториев, технические Q&A, исправление кода и многошаговые терминальные сценарии. Отдельное сравнение фиксирует модель Claude Opus 4.7 и сопоставляет Cursor, Claude Code и OpenCode.
Расчёт стоимости учитывает оплату API за токены, но не отражает тарифы подписок и полную стоимость эксплуатации. Более высокий индекс не означает, что агент лучше для любого сценария.
Проверка утверждений:
- Artificial Analysis опубликовала страницу бенчмарков coding agents: это сравнительный материал о работе агентов на задачах программной инженерии, который показывает производительность, стоимость, расход токенов и время выполнения. (подтверждено первоисточником: доказательство; «We measure real-world performance of coding agents on software engineering tasks, including cost, token usage, and execution time. We compare how performance changes across agents, models, and execution settings.»)
- Наблюдение за страницей 31 августа 2026 года зафиксировало изменение состава индекса — добавление одного нового участника. (в первоисточнике не найдено: доказательство)
- Artificial Analysis Coding Agent Index v1.4 объединяет три компонента: DeepSWE на 113 задачах, Terminal-Bench v2.1 на 89 задачах и SWE-Atlas-QnA на 124 задачах. (подтверждено первоисточником: доказательство; «Composite index of 3 benchmarks: DeepSWE Software engineering tasks, 113 tasks By Datacurve Terminal-Bench v2.1 Agentic terminal use, 89 tasks By Laude Institute SWE-Atlas-QnA Technical Q&A, 124 tasks By Scale AI»)
- Оценка каждого бенчмарка — это средний pass@1 по трём попыткам на задачу, а три компонента получают в итоговом индексе одинаковый вес. (подтверждено первоисточником: доказательство; «Each benchmark score averages pass@1 across three attempts per task. The Index gives equal weight to its 3 benchmark components.»)
- Набор охватывает чтение и понимание репозиториев, технические Q&A, внесение исправлений в код и многошаговые терминальные сценарии; исход каждой задачи во всех трёх компонентах бинарный. (подтверждено первоисточником: доказательство; «Some tasks are Q&A and repository-understanding tasks that focus on reading a codebase, understanding architecture or behavior, and producing a correct technical answer. Some are implementation and bug-fix tasks that require code changes and are closer to the classic make-a-patch-that-works framing. Some are terminal workflow tasks that test whether the agent can navigate a shell-driven environment, execute tools correctly, and complete a multi-step command-line workflow. All three current benchmarks use binary task outcomes.»)
- Сравнение harness фиксирует модель Claude Opus 4.7 и сопоставляет Cursor, Claude Code и OpenCode, чтобы отделить влияние агентской оболочки от влияния модели. (подтверждено первоисточником: доказательство; «This chart holds the underlying model constant at Claude Opus 4.7 and compares how it performs across different coding-agent harnesses, including Cursor, Claude Code, and OpenCode.»)
- Раздел расхода токенов показывает средние входные, кэшированные и выходные токены на задачу; эффективность по токенам не равна стоимости, поскольку провайдеры по-разному тарифицируют категории и кэширование. (подтверждено первоисточником: доказательство; «Token usage is the average observed token consumption per task across the benchmark suite. On this page we break it out into input, cache, and output tokens. Input tokens are the tokens sent into the model, including prompts, instructions, tool context, and task context. Cache tokens are prompt tokens reused through prompt caching when the provider exposes that telemetry. Output tokens are tokens generated by the model in its response. Token usage matters because it often drives cost and can also indicate how much context an agent consumes to get work done, but token efficiency and cost are not identical because providers price token categories differently and caching can materially change the bill.»)
- Расчёт стоимости основан на оплате API за токены и учитывает обычный ввод, скидки на кэшированный ввод, отдельную запись в кэш и вывод, но не отражает тарифы подписок и полную стоимость эксплуатации. (подтверждено первоисточником: доказательство; «Where applicable, that cost model includes standard input pricing, discounted cached-input pricing, separate cache-write charges, and output pricing rather than treating all prompt tokens as if they were billed at the same uncached input rate. It is intended to show pay-per-token API cost, not consumer plan pricing or the full operational cost of deploying the system in production. Infrastructure, engineering, and supervision costs are not the focus of this metric.»)
- Метрика времени использует активное wall time агента на задачу и исключает запуск окружения, время верификатора или судьи и прочие накладные расходы harness. (подтверждено первоисточником: доказательство; «This chart uses agent wall time: how long the agent process was actively running on each task. It does not include environment startup, verifier or judge time, or other harness overhead, so it is a cleaner comparison of how long the agent itself was working.»)
- Индекс предназначен для быстрого сравнения, но его следует читать вместе с разбивкой по отдельным тестам: близкие итоговые оценки могут скрывать разные сильные стороны на репозиторных, терминальных и оцениваемых по рубрике задачах. (подтверждено первоисточником: доказательство; «It is useful for quick comparison, but it should be read alongside the per-eval breakdowns. Two agents with similar index values can still have different strengths across repository tasks, terminal workflows, and rubric-based evaluations.»)
- Более высокий индекс не означает, что агент лучше для любого сценария: выбор также зависит от задержки, стоимости, инструментов, типа задач, интеграции с IDE, доступности модели и надёжности. (подтверждено первоисточником: доказательство; «A higher index score means stronger performance across the included benchmark mix, but it does not mean the agent is best for every workflow. The index is a balance across benchmark quality, not a direct measure of your specific latency, cost, tooling, or task-type priorities. Real-world choice still depends on whether your workflow looks more like repository Q&A, patching, or terminal execution, and on practical constraints such as IDE integration, model availability, and reliability.»)
Публикации:
- ratatoskr://watch/leaderboard-artificial-analysis-coding-agents
Первоисточники:
оценка 66.3 · тип observation · ревизия 1 · истории st-obs-leaderboard-artificial-analysis-coding-agents-20260831140207