Controlled Decoding Attacks — исследовательский подход для обхода защитных ограничений закрытых LLM — моделей, которые выдают только сгенерированный текст. Он рассчитан на интерфейсы, где можно многократно получать варианты ответа и продолжать ответ с заданного префикса.

Подход оценивает распределение следующего токена по сгенерированным ответам и меняет его только в выбранных позициях. Авторы также проверяют черновые префиксы и оставляют те, которые не требуют вмешательства, чтобы сократить обращения к целевой модели.

На четырёх конечных точках и трёх наборах тестов метод показал наивысший средний результат в большинстве сравнений с базовыми методами.

Проверка утверждений:

  • Авторы Controlled Decoding Attacks предложили способ обходить защитные ограничения закрытых LLM через текстовые интерфейсы продолжения ответа. (подтверждено самой публикацией: доказательство; «We introduce \method{}, a framework for jailbreaking through text-only continuation interfaces that permit repeated sampling and assistant-prefix continuation.»)
  • Он рассчитан на интерфейсы, где можно многократно получать варианты ответа и продолжать ответ с заданного префикса. (подтверждено самой публикацией: доказательство; «We introduce \method{}, a framework for jailbreaking through text-only continuation interfaces that permit repeated sampling and assistant-prefix continuation.»)
  • Подход оценивает распределение следующего токена по сгенерированным ответам и меняет его только в выбранных позициях. (подтверждено самой публикацией: доказательство; «Sample-Based Distribution Reconstruction combines sampled outputs with a prior over unobserved actions to obtain a usable control signal. Risk-Gated Residual Control uses the evolving response prefix to decide when to reconstruct and modify the distribution, concentrating sampling costs at selected positions.»)
  • Авторы также проверяют черновые префиксы и оставляют те, которые не требуют вмешательства, чтобы сократить обращения к целевой модели. (подтверждено самой публикацией: доказательство; «Speculative Multi-Token Execution further amortizes target calls by verifying and accepting draft prefixes that require no intervention.»)
  • На четырёх конечных точках и трёх наборах тестов метод показал наивысший средний результат в большинстве сравнений с базовыми методами. (подтверждено самой публикацией: доказательство; «Across four target endpoints and three benchmarks, \method{} achieves the highest mean score most comparisons against baselines.»)

Первоисточники:

оценка 58,5 из 100 · тип: исследование