Утверждения подтверждены публикацией DevOps.com, но не первоисточниками.

DevOps.com разобрал, как обычная просьба суммировать веб-страницу привела Claude Code Auto Mode к цепочке атаки с удалённым выполнением кода. Материал показывает пределы защитных классификаторов.

Исследователь Johann Rehberger перехватил Claude Code в Auto Mode модели Opus 5 с помощью запроса на суммирование сайта. После ошибки HTTP 415 инструмент перешёл к curl и получил ZIP-архив с вредоносным struct.py, который подменял одноимённый модуль стандартной библиотеки Python.

Claude отказался запускать вложенный бинарный декодер и написал собственный скрипт. Импорт base64 загрузил подложный struct.py из рабочего каталога, что привело к удалённому выполнению кода и соединению с командным сервером.

Атака срабатывала в 60–80% запусков в разных вариантах теста. Anthropic закрыла отчёт как Informative и считает реальной границей безопасности изоляцию на уровне ОС и контроль исходящего сетевого трафика.

Проверка утверждений:

  • DevOps.com опубликовал материал типа incident, который разбирает, как обычная просьба суммировать веб-страницу привела Claude Code Auto Mode к цепочке атаки с удалённым выполнением кода, и объясняет читателю пределы защитных классификаторов. (подтверждено только публикацией-переносчиком: доказательство; «A routine webpage-summary request was enough to trigger an attack chain that ultimately achieved remote code execution through Claude Code Auto Mode.»)
  • По публикации, исследователь Johann Rehberger (wunderwuzzi, Embrace The Red) смог перехватить Claude Code в Auto Mode модели Opus 5 с помощью запроса на суммирование сайта. (подтверждено только публикацией-переносчиком: доказательство; «Security researcher Johann Rehberger, who publishes under the handle wunderwuzzi at Embrace The Red, found a way to hijack Claude Code running in Opus 5’s Auto Mode using nothing more exotic than a request to summarize a website.»)
  • В материале утверждается, что Auto Mode стал режимом Claude Code по умолчанию в середине августа и вместо запроса разрешения перед каждой командой полагается на классификатор безопасности. (подтверждено только публикацией-переносчиком: доказательство; «Auto Mode became the default way Claude Code runs in mid-August. Instead of stopping to ask permission before every command, it leans on a safety classifier to decide what’s fine to execute on its own.»)
  • Описанная цепочка началась с ошибки HTTP 415 в WebFetch: Claude перешёл к curl, получил ZIP-архив с правдоподобными метаданными и вредоносным struct.py, подменявшим одноимённый модуль стандартной библиотеки Python. (подтверждено только публикацией-переносчиком: доказательство; «Claude tried to fetch the target site using its WebFetch tool and received an HTTP 415 (Unsupported Media Type) error. So it fell back to curl instead, a reasonable move for any developer or agent. Curl pulled down a ZIP file the site presented as an archive of notebook records, complete with believable metadata. Inside sat a poisoned file named struct.py, built to shadow Python’s own standard library module of the same name.»)
  • Claude отказался запускать вложенный бинарный декодер, написал собственный скрипт, а импорт base64 привёл к загрузке подложного struct.py из рабочего каталога, удалённому выполнению кода и соединению с командным сервером. (подтверждено только публикацией-переносчиком: доказательство; «Claude did one thing right here. It refused to run a binary decoder bundled in the archive, because executing an unknown binary is an obvious risk. So it wrote its own decoder script instead. That script imported Python’s base64 module, which in turn needed struct. Python first found the attacker’s version in the local working directory and loaded it instead of the real one. That single import was enough to trigger remote code execution and open a callback to a command-and-control server.»)
  • Rehberger, согласно статье, сообщил об успешности атаки в 60–80% запусков в разных вариантах теста. (подтверждено только публикацией-переносчиком: доказательство; «Rehberger reports this worked between 60% and 80% of the time across test variants.»)
  • Публикация сопоставляет этот результат с заявленным Anthropic нулевым уровнем успешности атак в стороннем red-team-тестировании и поясняет, что оценка охватывала 72 фиксированных сценария без этой цепочки атаки. (подтверждено только публикацией-переносчиком: доказательство; «That’s a hard number to square with Anthropic’s own claim of a 0.00% attack success rate from third-party red-team testing. The gap comes down to scope: that evaluation covered 72 fixed test scenarios, and this particular attack chain wasn’t one of them.»)
  • Когда Claude обнаружил проблему и попытался устранить последствия, система разрешений Auto Mode заблокировала команду очистки. (подтверждено только публикацией-переносчиком: доказательство; «Once Claude realized something had gone wrong and tried to clean up after itself, Auto Mode’s own approval system blocked the cleanup command.»)
  • По пересказу позиции Anthropic, компания закрыла отчёт как Informative, считает Auto Mode классификатором best-effort, а реальной границей безопасности — изоляцию на уровне ОС и контроль исходящего сетевого трафика. (подтверждено только публикацией-переносчиком: доказательство; «Anthropic closed the report as “Informative” rather than treating it as a vulnerability to patch. Its position, as described in Rehberger’s writeup, is that Auto Mode is a best-effort classifier, not a security guarantee, and that determined, multi-step attack chains fall outside what it’s meant to catch. The company’s stated view is that the real boundary has to be OS-level isolation and control over network egress, not a smarter approval prompt.»)
  • Материал рекомендует запускать агентов в контейнерах или виртуальных машинах, ограничивать исходящий сетевой доступ и изолировать учётные данные. (подтверждено только публикацией-переносчиком: доказательство; «It’s sandboxing agents in containers or VMs, locking down network egress, and keeping credentials isolated from whatever the agent is running.»)

Публикации:

оценка 67.7 · тип incident · ревизия 1 · истории st-e4t0go