Авторы работы представили первый систематический контролируемый анализ канала рассуждений как вектора атак с префиксом вывода. Префикс вывода — это текст в начале ответа модели, а канал рассуждений — промежуточные черновые рассуждения перед финальным ответом.

В исследовании использовали 1 800 тестов из AdvBench и атаковали Gemini 3 Flash Preview, DeepSeek V4 Flash и Claude Haiku 4.5.

Инъекция вредоносных рассуждений сама по себе была почти безуспешной: успех был близок к 0%. Та же инъекция вместе с простым префиксом вывода приводила к успеху в 99% атак на некоторых моделях.

Контекстные префиксы работали лучше статических, а уязвимость зависела от модели.

Проверка утверждений:

  • В работе представлен первый систематический контролируемый анализ канала рассуждений как вектора атак с префиксом вывода. (подтверждено самой публикацией: доказательство; «We present the first systematic, controlled study that isolates the scratchpad reasoning channel as an output-prefix attack vector»)
  • В исследовании использовали 1 800 тестов из AdvBench и атаковали Gemini 3 Flash Preview, DeepSeek V4 Flash и Claude Haiku 4.5. (подтверждено самой публикацией: доказательство; «Using a factorial design of 3 prefix types $\times$ 2 reasoning injections over $1{,}800$ test cases drawn from AdvBench, we attack three 2026-era frontier models Gemini 3 Flash Preview, DeepSeek V4 Flash, and Claude Haiku 4.5.»)
  • Инъекция вредоносных рассуждений сама по себе была почти безуспешной: успех был близок к 0%, а та же инъекция вместе с простым префиксом вывода приводила к успеху в 99% атак на некоторых моделях. (подтверждено самой публикацией: доказательство; «We find that injecting malicious reasoning alone is essentially inert ($\approx0%$ attack success), but injecting the same reasoning together with a trivial output prefix raises the attack success rate to as high as $99%$ for some models.»)
  • Контекстные префиксы работали лучше статических, а уязвимость зависела от модели. (подтверждено самой публикацией: доказательство; «For this type of attack we find that contextual prefixes work better than static prefixes; and that susceptibility is dependent on the model.»)

Первоисточники:

оценка 69,2 из 100 · тип: исследование