Исследователь Сергей Березин в посте LinkedIn сообщил, что обошёл защиту GPT-6 через день после релиза модели. В сообщении он описал обход через публичный интерфейс ChatGPT.
Березин пишет, что атака сработала в конфигурациях Light и Max. Для GPT-6 ему понадобилась более длинная модификация Task-in-Prompt (TIP) и 4 другие техники.
Березин сообщил, что передал OpenAI полный промпт, неотредактированный вывод и данные для воспроизведения приватно. Статья ACL 2025 описывает TIP как класс джейлбрейк-атак, где задачи sequence-to-sequence встраивают в промпт, чтобы косвенно генерировать запрещённые входы.
Термины:
- Task-in-Prompt (TIP) — Класс атак обхода ограничений языковой модели. В промпт встраивают задания, чтобы косвенно получить запрещённые входы.
- джейлбрейк-атак — Приём обхода ограничений языковой модели с помощью специально составленного запроса.
Проверка утверждений:
- Исследователь Сергей Березин в посте LinkedIn сообщил, что обошёл защиту GPT-6 через день после релиза модели. (подтверждено первоисточником: доказательство; «🚨 One day after OpenAI released GPT-6… you’ve guessed it, I jailbroke it.»)
- Березин утверждает, что выполнил обход через публичный интерфейс ChatGPT в течение суток. (подтверждено первоисточником: доказательство; «I bypassed it within a day, using the public ChatGPT interface.»)
- По словам Березина, атака сработала в конфигурациях Light и Max. (подтверждено первоисточником: доказательство; «The attack worked with both Light and Max configurations.»)
- Березин пишет, что для GPT-6 ему понадобилась более длинная модификация TIP в сочетании с четырьмя другими техниками. (подтверждено первоисточником: доказательство; «While GPT-5 fell to the minimal TIP jailbreak - one line, one lever; for GPT-6 I had to use longer modification of TIP, combined with four different techniques.»)
- Березин сообщил, что передал OpenAI полный промпт, неотредактированный вывод и данные для воспроизведения приватно. (подтверждено первоисточником: доказательство; «I have sent OpenAI the complete prompt, unredacted output, and reproduction details privately.»)
- Статья ACL 2025 описывает Task-in-Prompt (TIP) как класс джейлбрейк-атак, в котором задачи sequence-to-sequence встраиваются в промпт, чтобы косвенно генерировать запрещённые входы. (подтверждено первоисточником: доказательство; «Our approach embeds sequence-to-sequence tasks (e.g., cipher decoding, riddles, code execution) into the model’s prompt to indirectly generate prohibited inputs.»)
- Авторы статьи ACL сообщают, что их техники обходили защиту шести современных языковых моделей, включая GPT-4o и LLaMA 3.2. (подтверждено первоисточником: доказательство; «We demonstrate that our techniques successfully circumvent safeguards in six state-of-the-art language models, including GPT-4o and LLaMA 3.2.»)
Публикации:
Первоисточники:
- https://www.linkedin.com/posts/s-berezin_llm-aialignment-aisecurity-activity-7502013488412680192-IO6c
- https://aclanthology.org/2025.acl-long.334
оценка 69.2 · тип rumor · ревизия 1 · истории st-76owgh