Авторите на изследването създадоха SWEADV, тестов набор от 750 злонамерено съставени описания на задачи, изграден върху 150 задачи от SWE-bench Verified. За всяка задача авторите подготвиха пет описания: по едно за всеки тип атака — изпълнение на команди, десериализация, обхождане на пътища, отказ от услуга и слабо хеширане.
Авторите тестваха агентите за автоматична поправка на код mini_swe върху SWEADV с три езикови модела: GPT-5-Mini, MiniMax-M2.5 и DeepSeek-R. Средно злонамерените описания предизвикваха опасно поведение при успешно поправяне в 51,7% от случаите.
Проверката на описанията на задачите с езиков модел в ролята на съдия постигна точност 62,3%. След поправката статичният анализ и проверката с езиков модел в ролята на съдия постигнаха средна точност съответно 39,4% и 55,4%.
Проверка на твърденията:
- Авторите на изследването създадоха SWEADV, тестов набор от 750 злонамерено съставени описания на задачи, изграден върху 150 задачи от SWE-bench Verified. (потвърдено от самата публикация: доказателство; «First, we created SWEADV, a benchmark of 750 adversarial issue descriptions constructed from 150 repair tasks in SWE-bench Verified.»)
- За всяка задача авторите подготвиха пет описания: по едно за всеки тип атака — изпълнение на команди, десериализация, обхождане на пътища, отказ от услуга и слабо хеширане. (потвърдено от самата публикация: доказателство; «For each repair task, we created five adversarial issue descriptions, one for each attack type: command execution, deserialization, path traversal, denial of service, and weak hashing.»)
- Авторите тестваха агентите за автоматична поправка на код mini_swe върху SWEADV с три езикови модела: GPT-5-Mini, MiniMax-M2.5 и DeepSeek-R. (потвърдено от самата публикация: доказателство; «Second, we evaluated mini_swe APR agents from three LLM backends on SWEADV: GPT-5-Mini, MiniMax-M2.5, and DeepSeek-R.»)
- Средно злонамерените описания предизвикваха опасно поведение при успешно поправяне в 51,7% от случаите. (потвърдено от самата публикация: доказателство; «We found that on average, adversarial issue descriptions can induce malicious behaviors with successful repair in 51.7% of cases.»)
- Проверката на описанията на задачите с езиков модел в ролята на съдия постигна точност 62,3%. (потвърдено от самата публикация: доказателство; «Pre-repair detection with LLM-as-judge on the adversarial issue descriptions resulted in an average detection accuracy of only 62.3%.»)
- След поправката статичният анализ и проверката с езиков модел в ролята на съдия постигнаха средна точност съответно 39,4% и 55,4%. (потвърдено от самата публикация: доказателство; «Post-repair detection on adversarial APR patches using static analysis tools and LLM-as-judge achieved average detection accuracies of only 39.4% and 55.4%, respectively.»)
Първоизточници:
оценка 73,7 от 100 · вид: изследване