У препринті When Models Edit Too Much Тунъяо Чжу, Вей Херн Лім і Мін-Йен Кан досліджують, як мовні моделі переписують код понад те, що потрібно для виправлення помилки. Робота показує, що якість виправлення включає мінімальність, перевірюваність під час рев’ю та вірність початковій реалізації.
Автори зібрали 400 задач BigCodeBench і внесли до еталонних рішень контрольовані спотворення AST. Так для кожної задачі отримали відомий мінімальний патч.
Навіть у GPT-5.5 високий Pass@1 поєднувався з надмірно великими змінами й доданою когнітивною складністю. Інструкція зберігати початкову реалізацію знизила середню надмірну відстань Левенштейна з 0,195 до 0,131.
Та сама інструкція знизила додану когнітивну складність на 26,6% і підвищила Pass@1 на 2,3 пункти. Автори зазначають, що ці поліпшення не пояснюються лише більшим бюджетом міркувань або більшими моделями.
Перевірка тверджень:
- На arXiv розміщено дослідницький препринт Tongyao Zhu, Wei Hern Lim і Min-Yen Kan про схильність мовних моделей переписувати код понад те, що потрібно для виправлення помилки. (підтверджено самою публікацією: доказ; «Authors: Tongyao Zhu , Wei Hern Lim , Min-Yen Kan View a PDF of the paper titled When Models Edit Too Much: On the Fidelity of Minimal Code Edits, by Tongyao Zhu and 2 other authors View PDF HTML (experimental) Abstract: Large language models (LLMs) are increasingly used to edit existing code, but correctness alone is not enough: useful repairs should also be minimal, reviewable, and faithful to the original implementation. We study over-editing, the tendency of a model to rewrite code beyond what is required to fix a bug.»)
- Автори вважають, що корисне виправлення коду моделлю має бути не лише правильним, а й мінімальним, перевірюваним під час рев’ю та вірним початковій реалізації. (підтверджено самою публікацією: доказ; «Large language models (LLMs) are increasingly used to edit existing code, but correctness alone is not enough: useful repairs should also be minimal, reviewable, and faithful to the original implementation.»)
- Для оцінки мінімальності змін автори зібрали 400 задач BigCodeBench, внесли до еталонних рішень контрольовані AST-спотворення і таким чином отримали для кожної задачі відомий мінімальний патч. (підтверджено самою публікацією: доказ; «We construct an evaluation framework from 400 BigCodeBench problems by injecting controlled AST-level corruptions into reference solutions, giving each repair task a known minimal patch.»)
- На передових LLM надмірне редагування поширене: навіть у GPT-5.5 високий Pass@1 може поєднуватися з невиправдано великими змінами та доданою когнітивною складністю. (підтверджено самою публікацією: доказ; «Across frontier LLMs, over-editing is widespread even among strong models like GPT-5.5: high Pass@1 can coexist with unnecessarily large edits and added cognitive complexity.»)
- Інструкція зберігати початкову реалізацію знизила середню надмірну відстань Левенштейна з 0,195 до 0,131, додану когнітивну складність на 26,6% і водночас підвищила Pass@1 на 2,3 пункти. (підтверджено самою публікацією: доказ; «A preservation instruction substantially reduces this behavior, lowering average excess Levenshtein distance from 0.195 to 0.131, reducing added cognitive complexity by 26.6%, and increasing Pass@1 by 2.3 points.»)
- Ці поліпшення не пояснюються просто більшим бюджетом міркувань або більшими моделями. (підтверджено самою публікацією: доказ; «However, these gains do not simply follow from a larger reasoning budget or larger models.»)
- Під час постнавчання supervised fine-tuning перенавчався на знайомі типи спотворень, тоді як reinforcement learning дав кращий компроміс між fidelity змін поза розподілом і збереженням продуктивності. (підтверджено самою публікацією: доказ; «We observe that supervised fine-tuning overfits to seen corruption patterns, whereas reinforcement learning gives the best out-of-domain edit-fidelity and performance-retention trade-off.»)
- Робота розглядає fidelity змін як окрему характеристику якості виправлення коду, яку можна вимірювати й навчати. (підтверджено самою публікацією: доказ; «These results position edit fidelity as a distinct axis of code-repair quality and show that it can be measured and learned.»)
Першоджерела:
оцінка 66.5 · тип research · ревізія 1 · історії st-1wd2cwd