Исследователь Сергей Березин в посте LinkedIn сообщил, что обошёл защиту GPT-6 через день после релиза модели. В сообщении он описал обход через публичный интерфейс ChatGPT.

Березин пишет, что атака сработала в конфигурациях Light и Max. Для GPT-6 ему понадобилась более длинная модификация Task-in-Prompt (TIP) и 4 другие техники.

Березин сообщил, что передал OpenAI полный промпт, неотредактированный вывод и данные для воспроизведения приватно. Статья ACL 2025 описывает TIP как класс джейлбрейк-атак, где задачи sequence-to-sequence встраивают в промпт, чтобы косвенно генерировать запрещённые входы.

Термины:

  • Task-in-Prompt (TIP) — Класс атак обхода ограничений языковой модели. В промпт встраивают задания, чтобы косвенно получить запрещённые входы.
  • джейлбрейк-атак — Приём обхода ограничений языковой модели с помощью специально составленного запроса.

Проверка утверждений:

  • Исследователь Сергей Березин в посте LinkedIn сообщил, что обошёл защиту GPT-6 через день после релиза модели. (подтверждено первоисточником: доказательство; «🚨 One day after OpenAI released GPT-6… you’ve guessed it, I jailbroke it.»)
  • Березин утверждает, что выполнил обход через публичный интерфейс ChatGPT в течение суток. (подтверждено первоисточником: доказательство; «I bypassed it within a day, using the public ChatGPT interface.»)
  • По словам Березина, атака сработала в конфигурациях Light и Max. (подтверждено первоисточником: доказательство; «The attack worked with both Light and Max configurations.»)
  • Березин пишет, что для GPT-6 ему понадобилась более длинная модификация TIP в сочетании с четырьмя другими техниками. (подтверждено первоисточником: доказательство; «While GPT-5 fell to the minimal TIP jailbreak - one line, one lever; for GPT-6 I had to use longer modification of TIP, combined with four different techniques.»)
  • Березин сообщил, что передал OpenAI полный промпт, неотредактированный вывод и данные для воспроизведения приватно. (подтверждено первоисточником: доказательство; «I have sent OpenAI the complete prompt, unredacted output, and reproduction details privately.»)
  • Статья ACL 2025 описывает Task-in-Prompt (TIP) как класс джейлбрейк-атак, в котором задачи sequence-to-sequence встраиваются в промпт, чтобы косвенно генерировать запрещённые входы. (подтверждено первоисточником: доказательство; «Our approach embeds sequence-to-sequence tasks (e.g., cipher decoding, riddles, code execution) into the model’s prompt to indirectly generate prohibited inputs.»)
  • Авторы статьи ACL сообщают, что их техники обходили защиту шести современных языковых моделей, включая GPT-4o и LLaMA 3.2. (подтверждено первоисточником: доказательство; «We demonstrate that our techniques successfully circumvent safeguards in six state-of-the-art language models, including GPT-4o and LLaMA 3.2.»)

Публикации:

Первоисточники:

оценка 69.2 · тип rumor · ревизия 1 · истории st-76owgh