Что изменилось: Появилось сравнение Sonnet 5.5 и Opus 5.5 на задачах с кодом, проведённое автором The New Stack. Прошлый пост
Сохранённый текст сравнения обрывается на описании тестов и не содержит результатов.
The New Stack, издание для разработчиков, сравнило языковые модели Claude Sonnet 5.5 и Opus 5.5 при одинаковых запросах и максимальном уровне рассуждений. Каждый тест автор повторил пять раз для каждой модели и проверил результаты набором тестов, который модели не видели.
Anthropic, разработчик Claude, представила Sonnet 5.5 28 сентября. В сравнении были задачи на исправление ошибок в Python и написание программы, которая подбирает совместимые версии пакетов по заданной спецификации.
Автор записывал стоимость по опубликованным тарифам и время выполнения каждого прогона.
Проверка утверждений:
- Автор The New Stack сравнил Claude Sonnet 5.5 и Opus 5.5 на задачах с кодом при одинаковых запросах и максимальном уровне рассуждений. (подтверждено самой публикацией: доказательство; «I came in unsure whether Sonnet had a real place, so I tested it against Opus 5.5, the model I’d most likely replace with it. The tests I called both models through the Anthropic API with identical prompts, adaptive thinking, and the maximum effort setting.»)
- Автор повторил каждый тест пять раз для каждой модели и оценил результаты набором тестов, который модели не видели. (подтверждено самой публикацией: доказательство; «I ran each test five times per model to measure consistency and graded every run against a hidden test suite the models never saw.»)
- Anthropic представила Claude Sonnet 5.5 28 сентября 2026 года. (подтверждено самой публикацией: доказательство; «Claude Sonnet 5.5 September 28, 2026 Skip intro Scroll down Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family.»)
- В сравнении были задачи на исправление ошибок в Python и написание программы для подбора совместимых версий пакетов по заданной спецификации. (подтверждено самой публикацией: доказательство; «Agentic bug fix: The model gets a small Python order-pricing repo with four planted bugs and one flaky test, plus tools to read files, write files, and run tests. A hidden suite of 12 tests checks the fixes, and I tracked tool calls, since early testers cited by Anthropic said Sonnet 5.5 needs fewer of them. Resolver spec: The model writes a dependency resolver for a fictional package manager from a two-page spec, without running any code. A hidden suite of 120 tests grades it.»)
- Автор записывал стоимость по опубликованным тарифам и время выполнения каждого прогона. (подтверждено самой публикацией: доказательство; «I logged tokens, cost at list price, and time for every run.»)
Публикации:
- https://techcrunch.com/2026/09/28/anthropic-releases-sonnet-5-5-which-it-calls-a-significantly-cheaper-faster-work-partner
- https://thenewstack.io/claude-sonnet-55-launch
- https://thenewstack.io/claude-sonnet-cyber-safeguards
- https://simonwillison.net/2026/Sep/28/claude-sonnet-5-5
- https://latent.space/p/thariq
- https://producthunt.com/products/claude
- https://thenewstack.io/claude-sonnet-5-5-vs-opus-5-5
Первоисточники:
- https://anthropic.com/claude-sonnet-5-5
- https://www-cdn.anthropic.com/870c8f525702625d2c62fc6dd04c857e3250bec1/Claude%20Sonnet%205.5%20System%20Card.pdf
- https://support.claude.com/en/articles/17161993-why-claude-switched-models-in-your-conversation-with-sonnet-5-5
- https://www.anthropic.com/claude-sonnet-5-5
- https://vercel.com/changelog/claude-sonnet-5-5-now-available-on-ai-gateway
- https://anthropic.com/news/enterprise-frontier-safeguards
оценка 54,8 из 100 · тип: релиз