Авторы исследования создали SWEADV, тестовый набор из 750 злонамеренно составленных описаний задач, построенный на 150 задачах SWE-bench Verified. Для каждой задачи авторы подготовили пять описаний, по одному для каждого типа атаки: выполнения команд, десериализации, обхода путей, отказа в обслуживании и слабого хеширования.

Авторы проверили на SWEADV агентов автоматического исправления кода mini_swe с тремя языковыми моделями: GPT-5-Mini, MiniMax-M2.5 и DeepSeek-R. В среднем вредоносные описания вызывали небезопасное поведение при успешном исправлении в 51,7% случаев.

Проверка описаний задач моделью в роли судьи достигла точности 62,3%. После исправления статический анализ и проверка моделью в роли судьи достигли средней точности 39,4% и 55,4% соответственно.

Проверка утверждений:

  • Авторы исследования создали SWEADV — тестовый набор из 750 злонамеренно составленных описаний задач, построенный на 150 задачах SWE-bench Verified. (подтверждено самой публикацией: доказательство; «First, we created SWEADV, a benchmark of 750 adversarial issue descriptions constructed from 150 repair tasks in SWE-bench Verified.»)
  • Для каждой задачи авторы подготовили пять описаний, по одному для каждого типа атаки: выполнения команд, десериализации, обхода путей, отказа в обслуживании и слабого хеширования. (подтверждено самой публикацией: доказательство; «For each repair task, we created five adversarial issue descriptions, one for each attack type: command execution, deserialization, path traversal, denial of service, and weak hashing.»)
  • Авторы проверили на SWEADV агентов автоматического исправления кода mini_swe с тремя языковыми моделями: GPT-5-Mini, MiniMax-M2.5 и DeepSeek-R. (подтверждено самой публикацией: доказательство; «Second, we evaluated mini_swe APR agents from three LLM backends on SWEADV: GPT-5-Mini, MiniMax-M2.5, and DeepSeek-R.»)
  • В среднем вредоносные описания вызывали небезопасное поведение при успешном исправлении в 51,7% случаев. (подтверждено самой публикацией: доказательство; «We found that on average, adversarial issue descriptions can induce malicious behaviors with successful repair in 51.7% of cases.»)
  • Проверка описаний задач моделью в роли судьи достигла точности 62,3%. (подтверждено самой публикацией: доказательство; «Pre-repair detection with LLM-as-judge on the adversarial issue descriptions resulted in an average detection accuracy of only 62.3%.»)
  • После исправления статический анализ и проверка моделью в роли судьи достигли средней точности 39,4% и 55,4% соответственно. (подтверждено самой публикацией: доказательство; «Post-repair detection on adversarial APR patches using static analysis tools and LLM-as-judge achieved average detection accuracies of only 39.4% and 55.4%, respectively.»)

Первоисточники:

оценка 73,7 из 100 · тип: исследование