Изследователят Сергей Березин съобщи в публикация в LinkedIn, че е заобиколил защитата на GPT-6 ден след излизането на модела. В съобщението той описва заобикаляне през публичния интерфейс на ChatGPT.

Березин пише, че атаката е сработила в конфигурациите Light и Max. За GPT-6 му е била нужна по-дълга модификация на Task-in-Prompt (TIP) и 4 други техники.

Березин съобщи, че е предал на OpenAI пълния промпт, нередактирания изход и данни за възпроизвеждане по частен път. Статията от ACL 2025 описва TIP като клас джейлбрейк атаки, при които задачи sequence-to-sequence се вграждат в промпт, за да генерират косвено забранени входове.

Термини:

  • Task-in-Prompt (TIP) — Клас атаки за заобикаляне на ограниченията на езиков модел. В промпт се вграждат задачи, за да се получат косвено забранени входове.
  • джейлбрейк атаки — Подход за заобикаляне на ограниченията на езиков модел чрез специално съставена заявка.

Проверка на твърденията:

  • Изследователят Сергей Березин съобщи в публикация в LinkedIn, че е заобиколил защитата на GPT-6 ден след излизането на модела. (потвърдено от първоизточника: доказателство; «🚨 One day after OpenAI released GPT-6… you’ve guessed it, I jailbroke it.»)
  • Березин твърди, че е извършил заобикалянето през публичния интерфейс на ChatGPT в рамките на денонощие. (потвърдено от първоизточника: доказателство; «I bypassed it within a day, using the public ChatGPT interface.»)
  • Според Березин атаката е сработила в конфигурациите Light и Max. (потвърдено от първоизточника: доказателство; «The attack worked with both Light and Max configurations.»)
  • Березин пише, че за GPT-6 му е била нужна по-дълга модификация на TIP в съчетание с четири други техники. (потвърдено от първоизточника: доказателство; «While GPT-5 fell to the minimal TIP jailbreak - one line, one lever; for GPT-6 I had to use longer modification of TIP, combined with four different techniques.»)
  • Березин съобщи, че е предал на OpenAI пълния промпт, нередактирания изход и данни за възпроизвеждане по частен път. (потвърдено от първоизточника: доказателство; «I have sent OpenAI the complete prompt, unredacted output, and reproduction details privately.»)
  • Статията от ACL 2025 описва Task-in-Prompt (TIP) като клас джейлбрейк атаки, при които задачи sequence-to-sequence се вграждат в промпт, за да генерират косвено забранени входове. (потвърдено от първоизточника: доказателство; «Our approach embeds sequence-to-sequence tasks (e.g., cipher decoding, riddles, code execution) into the model’s prompt to indirectly generate prohibited inputs.»)
  • Авторите на статията от ACL съобщават, че техните техники са заобиколили защитата на шест съвременни езикови модела, включително GPT-4o и LLaMA 3.2. (потвърдено от първоизточника: доказателство; «We demonstrate that our techniques successfully circumvent safeguards in six state-of-the-art language models, including GPT-4o and LLaMA 3.2.»)

Публикации:

Първоизточници:

оценка 69.2 · тип rumor · ревизия 1 · истории st-76owgh