Автори дослідження створили SWEADV, тестовий набір із 750 зловмисно сформульованих описів задач, побудований на 150 задачах SWE-bench Verified. Для кожної задачі автори підготували п’ять описів: по одному для кожного типу атаки — виконання команд, десеріалізації, обходу шляхів, відмови в обслуговуванні та слабкого хешування.
Автори перевірили на SWEADV агентів автоматичного виправлення коду mini_swe з трьома мовними моделями: GPT-5-Mini, MiniMax-M2.5 та DeepSeek-R. У середньому шкідливі описи спричиняли небезпечну поведінку за успішного виправлення у 51,7% випадків.
Перевірка описів задач мовною моделлю в ролі судді досягла точності 62,3%. Після виправлення статичний аналіз і перевірка мовною моделлю в ролі судді досягли середньої точності 39,4% та 55,4% відповідно.
Перевірка тверджень:
- Автори дослідження створили SWEADV — тестовий набір із 750 зловмисно сформульованих описів задач, побудований на 150 задачах SWE-bench Verified. (підтверджено самою публікацією: доказ; «First, we created SWEADV, a benchmark of 750 adversarial issue descriptions constructed from 150 repair tasks in SWE-bench Verified.»)
- Для кожної задачі автори підготували п’ять описів: по одному для кожного типу атаки — виконання команд, десеріалізації, обходу шляхів, відмови в обслуговуванні та слабкого хешування. (підтверджено самою публікацією: доказ; «For each repair task, we created five adversarial issue descriptions, one for each attack type: command execution, deserialization, path traversal, denial of service, and weak hashing.»)
- Автори перевірили на SWEADV агентів автоматичного виправлення коду mini_swe з трьома мовними моделями: GPT-5-Mini, MiniMax-M2.5 та DeepSeek-R. (підтверджено самою публікацією: доказ; «Second, we evaluated mini_swe APR agents from three LLM backends on SWEADV: GPT-5-Mini, MiniMax-M2.5, and DeepSeek-R.»)
- У середньому шкідливі описи спричиняли небезпечну поведінку за успішного виправлення у 51,7% випадків. (підтверджено самою публікацією: доказ; «We found that on average, adversarial issue descriptions can induce malicious behaviors with successful repair in 51.7% of cases.»)
- Перевірка описів задач мовною моделлю в ролі судді досягла точності 62,3%. (підтверджено самою публікацією: доказ; «Pre-repair detection with LLM-as-judge on the adversarial issue descriptions resulted in an average detection accuracy of only 62.3%.»)
- Після виправлення статичний аналіз і перевірка мовною моделлю в ролі судді досягли середньої точності 39,4% та 55,4% відповідно. (підтверджено самою публікацією: доказ; «Post-repair detection on adversarial APR patches using static analysis tools and LLM-as-judge achieved average detection accuracies of only 39.4% and 55.4%, respectively.»)
Першоджерела:
оцінка 73,7 зі 100 · тип: дослідження