Что изменилось: Появилось сравнение Sonnet 5.5 и Opus 5.5 на задачах с кодом, проведённое автором The New Stack. Прошлый пост

Сохранённый текст сравнения обрывается на описании тестов и не содержит результатов.

The New Stack, издание для разработчиков, сравнило языковые модели Claude Sonnet 5.5 и Opus 5.5 при одинаковых запросах и максимальном уровне рассуждений. Каждый тест автор повторил пять раз для каждой модели и проверил результаты набором тестов, который модели не видели.

Anthropic, разработчик Claude, представила Sonnet 5.5 28 сентября. В сравнении были задачи на исправление ошибок в Python и написание программы, которая подбирает совместимые версии пакетов по заданной спецификации.

Автор записывал стоимость по опубликованным тарифам и время выполнения каждого прогона.

Проверка утверждений:

  • Автор The New Stack сравнил Claude Sonnet 5.5 и Opus 5.5 на задачах с кодом при одинаковых запросах и максимальном уровне рассуждений. (подтверждено самой публикацией: доказательство; «I came in unsure whether Sonnet had a real place, so I tested it against Opus 5.5, the model I’d most likely replace with it. The tests I called both models through the Anthropic API with identical prompts, adaptive thinking, and the maximum effort setting.»)
  • Автор повторил каждый тест пять раз для каждой модели и оценил результаты набором тестов, который модели не видели. (подтверждено самой публикацией: доказательство; «I ran each test five times per model to measure consistency and graded every run against a hidden test suite the models never saw.»)
  • Anthropic представила Claude Sonnet 5.5 28 сентября 2026 года. (подтверждено самой публикацией: доказательство; «Claude Sonnet 5.5 September 28, 2026 Skip intro Scroll down Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family.»)
  • В сравнении были задачи на исправление ошибок в Python и написание программы для подбора совместимых версий пакетов по заданной спецификации. (подтверждено самой публикацией: доказательство; «Agentic bug fix: The model gets a small Python order-pricing repo with four planted bugs and one flaky test, plus tools to read files, write files, and run tests. A hidden suite of 12 tests checks the fixes, and I tracked tool calls, since early testers cited by Anthropic said Sonnet 5.5 needs fewer of them. Resolver spec: The model writes a dependency resolver for a fictional package manager from a two-page spec, without running any code. A hidden suite of 120 tests grades it.»)
  • Автор записывал стоимость по опубликованным тарифам и время выполнения каждого прогона. (подтверждено самой публикацией: доказательство; «I logged tokens, cost at list price, and time for every run.»)

Публикации:

Первоисточники:

оценка 54,8 из 100 · тип: релиз