Дослідник Сергій Березін у дописі LinkedIn повідомив, що обійшов захист GPT-6 через день після релізу моделі. У повідомленні він описав обхід через публічний інтерфейс ChatGPT.

Березін пише, що атака спрацювала в конфігураціях Light і Max. Для GPT-6 йому знадобилася довша модифікація Task-in-Prompt (TIP) і 4 інші техніки.

Березін повідомив, що приватно передав OpenAI повний промпт, невідредагований вивід і дані для відтворення. Стаття ACL 2025 описує TIP як клас атак джейлбрейку, де завдання sequence-to-sequence вбудовують у промпт, щоб непрямо генерувати заборонені входи.

Терміни:

  • Task-in-Prompt (TIP) — Клас атак для обходу обмежень мовної моделі. У промпт вбудовують завдання, щоб непрямо отримати заборонені входи.
  • атак джейлбрейку — Спосіб обходу обмежень мовної моделі за допомогою спеціально складеного запиту.

Перевірка тверджень:

  • Дослідник Сергій Березін у дописі LinkedIn повідомив, що обійшов захист GPT-6 через день після релізу моделі. (підтверджено першоджерелом: доказ; «🚨 One day after OpenAI released GPT-6… you’ve guessed it, I jailbroke it.»)
  • Березін стверджує, що виконав обхід через публічний інтерфейс ChatGPT протягом доби. (підтверджено першоджерелом: доказ; «I bypassed it within a day, using the public ChatGPT interface.»)
  • За словами Березіна, атака спрацювала в конфігураціях Light і Max. (підтверджено першоджерелом: доказ; «The attack worked with both Light and Max configurations.»)
  • Березін пише, що для GPT-6 йому знадобилася довша модифікація TIP у поєднанні з чотирма іншими техніками. (підтверджено першоджерелом: доказ; «While GPT-5 fell to the minimal TIP jailbreak - one line, one lever; for GPT-6 I had to use longer modification of TIP, combined with four different techniques.»)
  • Березін повідомив, що приватно передав OpenAI повний промпт, невідредагований вивід і дані для відтворення. (підтверджено першоджерелом: доказ; «I have sent OpenAI the complete prompt, unredacted output, and reproduction details privately.»)
  • Стаття ACL 2025 описує Task-in-Prompt (TIP) як клас атак джейлбрейку, у якому завдання sequence-to-sequence вбудовують у промпт, щоб непрямо генерувати заборонені входи. (підтверджено першоджерелом: доказ; «Our approach embeds sequence-to-sequence tasks (e.g., cipher decoding, riddles, code execution) into the model’s prompt to indirectly generate prohibited inputs.»)
  • Автори статті ACL повідомляють, що їхні техніки обходили захист шести сучасних мовних моделей, зокрема GPT-4o і LLaMA 3.2. (підтверджено першоджерелом: доказ; «We demonstrate that our techniques successfully circumvent safeguards in six state-of-the-art language models, including GPT-4o and LLaMA 3.2.»)

Публікації:

Першоджерела:

оцінка 69.2 · тип rumor · ревізія 1 · історії st-76owgh