Изследователят Сергей Березин съобщи в публикация в LinkedIn, че е заобиколил защитата на GPT-6 ден след излизането на модела. В съобщението той описва заобикаляне през публичния интерфейс на ChatGPT.
Березин пише, че атаката е сработила в конфигурациите Light и Max. За GPT-6 му е била нужна по-дълга модификация на Task-in-Prompt (TIP) и 4 други техники.
Березин съобщи, че е предал на OpenAI пълния промпт, нередактирания изход и данни за възпроизвеждане по частен път. Статията от ACL 2025 описва TIP като клас джейлбрейк атаки, при които задачи sequence-to-sequence се вграждат в промпт, за да генерират косвено забранени входове.
Термини:
- Task-in-Prompt (TIP) — Клас атаки за заобикаляне на ограниченията на езиков модел. В промпт се вграждат задачи, за да се получат косвено забранени входове.
- джейлбрейк атаки — Подход за заобикаляне на ограниченията на езиков модел чрез специално съставена заявка.
Проверка на твърденията:
- Изследователят Сергей Березин съобщи в публикация в LinkedIn, че е заобиколил защитата на GPT-6 ден след излизането на модела. (потвърдено от първоизточника: доказателство; «🚨 One day after OpenAI released GPT-6… you’ve guessed it, I jailbroke it.»)
- Березин твърди, че е извършил заобикалянето през публичния интерфейс на ChatGPT в рамките на денонощие. (потвърдено от първоизточника: доказателство; «I bypassed it within a day, using the public ChatGPT interface.»)
- Според Березин атаката е сработила в конфигурациите Light и Max. (потвърдено от първоизточника: доказателство; «The attack worked with both Light and Max configurations.»)
- Березин пише, че за GPT-6 му е била нужна по-дълга модификация на TIP в съчетание с четири други техники. (потвърдено от първоизточника: доказателство; «While GPT-5 fell to the minimal TIP jailbreak - one line, one lever; for GPT-6 I had to use longer modification of TIP, combined with four different techniques.»)
- Березин съобщи, че е предал на OpenAI пълния промпт, нередактирания изход и данни за възпроизвеждане по частен път. (потвърдено от първоизточника: доказателство; «I have sent OpenAI the complete prompt, unredacted output, and reproduction details privately.»)
- Статията от ACL 2025 описва Task-in-Prompt (TIP) като клас джейлбрейк атаки, при които задачи sequence-to-sequence се вграждат в промпт, за да генерират косвено забранени входове. (потвърдено от първоизточника: доказателство; «Our approach embeds sequence-to-sequence tasks (e.g., cipher decoding, riddles, code execution) into the model’s prompt to indirectly generate prohibited inputs.»)
- Авторите на статията от ACL съобщават, че техните техники са заобиколили защитата на шест съвременни езикови модела, включително GPT-4o и LLaMA 3.2. (потвърдено от първоизточника: доказателство; «We demonstrate that our techniques successfully circumvent safeguards in six state-of-the-art language models, including GPT-4o and LLaMA 3.2.»)
Публикации:
Първоизточници:
- https://www.linkedin.com/posts/s-berezin_llm-aialignment-aisecurity-activity-7502013488412680192-IO6c
- https://aclanthology.org/2025.acl-long.334
оценка 69.2 · тип rumor · ревизия 1 · истории st-76owgh