Авторите на изследването създадоха SWEADV, тестов набор от 750 злонамерено съставени описания на задачи, изграден върху 150 задачи от SWE-bench Verified. За всяка задача авторите подготвиха пет описания: по едно за всеки тип атака — изпълнение на команди, десериализация, обхождане на пътища, отказ от услуга и слабо хеширане.

Авторите тестваха агентите за автоматична поправка на код mini_swe върху SWEADV с три езикови модела: GPT-5-Mini, MiniMax-M2.5 и DeepSeek-R. Средно злонамерените описания предизвикваха опасно поведение при успешно поправяне в 51,7% от случаите.

Проверката на описанията на задачите с езиков модел в ролята на съдия постигна точност 62,3%. След поправката статичният анализ и проверката с езиков модел в ролята на съдия постигнаха средна точност съответно 39,4% и 55,4%.

Проверка на твърденията:

  • Авторите на изследването създадоха SWEADV, тестов набор от 750 злонамерено съставени описания на задачи, изграден върху 150 задачи от SWE-bench Verified. (потвърдено от самата публикация: доказателство; «First, we created SWEADV, a benchmark of 750 adversarial issue descriptions constructed from 150 repair tasks in SWE-bench Verified.»)
  • За всяка задача авторите подготвиха пет описания: по едно за всеки тип атака — изпълнение на команди, десериализация, обхождане на пътища, отказ от услуга и слабо хеширане. (потвърдено от самата публикация: доказателство; «For each repair task, we created five adversarial issue descriptions, one for each attack type: command execution, deserialization, path traversal, denial of service, and weak hashing.»)
  • Авторите тестваха агентите за автоматична поправка на код mini_swe върху SWEADV с три езикови модела: GPT-5-Mini, MiniMax-M2.5 и DeepSeek-R. (потвърдено от самата публикация: доказателство; «Second, we evaluated mini_swe APR agents from three LLM backends on SWEADV: GPT-5-Mini, MiniMax-M2.5, and DeepSeek-R.»)
  • Средно злонамерените описания предизвикваха опасно поведение при успешно поправяне в 51,7% от случаите. (потвърдено от самата публикация: доказателство; «We found that on average, adversarial issue descriptions can induce malicious behaviors with successful repair in 51.7% of cases.»)
  • Проверката на описанията на задачите с езиков модел в ролята на съдия постигна точност 62,3%. (потвърдено от самата публикация: доказателство; «Pre-repair detection with LLM-as-judge on the adversarial issue descriptions resulted in an average detection accuracy of only 62.3%.»)
  • След поправката статичният анализ и проверката с езиков модел в ролята на съдия постигнаха средна точност съответно 39,4% и 55,4%. (потвърдено от самата публикация: доказателство; «Post-repair detection on adversarial APR patches using static analysis tools and LLM-as-judge achieved average detection accuracies of only 39.4% and 55.4%, respectively.»)

Първоизточници:

оценка 73,7 от 100 · вид: изследване