Йоханн Ребергер опубликовал технический разбор того, как запрос на краткое изложение сайта может перехватить Claude Code Opus 5 в Auto Mode и привести к выполнению кода.
Auto Mode заменяет запросы на одобрение человеком классификатором безопасности и с середины августа является режимом запуска Claude Code по умолчанию. В описанной цепочке Claude пишет замену декодеру и запускает её внутри распакованного из архива каталога.
Разбор объясняет механизм через затенение модулей: файл struct.py из архива подменяет стандартный модуль Python при импорте base64. В разборе приведён измеренный на малой выборке диапазон успешности атаки от 60 до 80 процентов.
Автор сопоставляет этот результат со сторонней оценкой, заказанной Anthropic: в ней для Opus 5 в Auto Mode была заявлена нулевая успешность атак с инъекцией подсказок. Автор оговаривает, что результаты получены на малых выборках и не являются универсальным измерением успешности атаки.
Проверка утверждений:
- Йоханн Ребергер опубликовал технический разбор того, как запрос на краткое изложение сайта может перехватить Claude Code Opus 5 в Auto Mode и привести к выполнению кода. (подтверждено самой публикацией: доказательство; «In this post, we explore how a simple website summary request hijacks Claude Code Opus 5 in Auto Mode and achieves code execution with 60-80% attack success rate using a small sample size.»)
- Auto Mode заменяет запросы на одобрение человеком классификатором безопасности и с середины августа является режимом запуска Claude Code по умолчанию. (подтверждено самой публикацией: доказательство; «Auto Mode replaces human approval prompts with a safety classifier. Since mid-August it is the default starting mode for Claude Code.»)
- В разборе приведён измеренный на малой выборке диапазон успешности атаки от 60 до 80 процентов. (подтверждено самой публикацией: доказательство; «In this post, we explore how a simple website summary request hijacks Claude Code Opus 5 in Auto Mode and achieves code execution with 60-80% attack success rate using a small sample size.»)
- Автор сопоставляет этот результат со сторонней оценкой, заказанной Anthropic: в ней для Opus 5 в Auto Mode была заявлена нулевая успешность атак с инъекцией подсказок. (подтверждено самой публикацией: доказательство; «This is interesting because a third-party evaluation commissioned by Anthropic showed a 0.00% prompt injection attack success rate for Opus 5 in Auto Mode.»)
- В описанной цепочке Claude пишет замену декодеру и запускает её внутри распакованного из архива каталога; автор называет это путём эксплуатации. (подтверждено самой публикацией: доказательство; «Rather than running the binary, Claude decides to write a replacement decoder instead. Ironically, that safety decision is the exploit path.»)
- Разбор объясняет механизм через затенение модулей: файл struct.py из архива подменяет стандартный модуль Python при импорте base64. (подтверждено самой публикацией: доказательство; «Python places the extracted archive directory on its module search path. The standard-library base64 module imports struct . The ZIP contains a file with exactly that name:»)
- Автор оговаривает, что результаты получены на малых выборках и не являются универсальным измерением успешности атаки. (подтверждено самой публикацией: доказательство; «These are small samples, not a universal ASR measurement.»)
- В нескольких прогонах Auto Mode отклонил команду очистки после того, как Claude попытался остановить вредоносный процесс. (подтверждено самой публикацией: доказательство; «In a few runs Claude tried to terminate the malware process once it noticed the compromise, but Auto Mode denied the cleanup command .»)
- По сообщению автора, Anthropic закрыла его сообщение как Informative и сочла описанное поведение работающим по замыслу. (подтверждено самой публикацией: доказательство; «Anthropic closed the report as Informative and that the behavior is working as designed.»)
- Саймон Уиллисон позже уточнил, что описанное не соответствует классической инъекции подсказок, а ближе к атаке через запутанную среду. (подтверждено только публикацией-переносчиком: доказательство; «this doesn’t fit the bill of a classic prompt injection attack because at no point are malicious instructions from the website accidentally followed by the LLM. They’re right: this is more of a confused environment attack where the nature of the environment that the agent is exposed to results in an exploit.»)
Публикации:
Первоисточники:
оценка 86.9 · тип incident · ревизия 2 · истории st-u4yx1m