В препринте When Models Edit Too Much Тунъяо Чжу, Вэй Херн Лим и Мин-Йен Кан исследуют, как языковые модели переписывают код сверх необходимого для исправления ошибки. Работа показывает, что качество исправления включает минимальность, проверяемость при ревью и верность исходной реализации.

Авторы собрали 400 задач BigCodeBench и внесли в эталонные решения контролируемые искажения AST. Так для каждой задачи получился известный минимальный патч.

Даже у GPT-5.5 высокий Pass@1 сочетался с избыточно крупными правками и добавленной когнитивной сложностью. Инструкция сохранять исходную реализацию снизила среднюю избыточную дистанцию Левенштейна с 0,195 до 0,131.

Та же инструкция снизила добавленную когнитивную сложность на 26,6% и повысила Pass@1 на 2,3 пункта. Авторы отмечают, что эти улучшения не объясняются только большим бюджетом рассуждений или более крупными моделями.

Проверка утверждений:

  • В arXiv размещён исследовательский препринт Tongyao Zhu, Wei Hern Lim и Min-Yen Kan о склонности языковых моделей переписывать код сверх необходимого для исправления ошибки. (подтверждено самой публикацией: доказательство; «Authors: Tongyao Zhu , Wei Hern Lim , Min-Yen Kan View a PDF of the paper titled When Models Edit Too Much: On the Fidelity of Minimal Code Edits, by Tongyao Zhu and 2 other authors View PDF HTML (experimental) Abstract: Large language models (LLMs) are increasingly used to edit existing code, but correctness alone is not enough: useful repairs should also be minimal, reviewable, and faithful to the original implementation. We study over-editing, the tendency of a model to rewrite code beyond what is required to fix a bug.»)
  • Авторы считают, что полезное исправление кода моделью должно быть не только корректным, но и минимальным, проверяемым при ревью и верным исходной реализации. (подтверждено самой публикацией: доказательство; «Large language models (LLMs) are increasingly used to edit existing code, but correctness alone is not enough: useful repairs should also be minimal, reviewable, and faithful to the original implementation.»)
  • Для оценки минимальности правок авторы собрали 400 задач BigCodeBench, внесли в эталонные решения контролируемые AST-искажения и тем самым получили для каждой задачи известный минимальный патч. (подтверждено самой публикацией: доказательство; «We construct an evaluation framework from 400 BigCodeBench problems by injecting controlled AST-level corruptions into reference solutions, giving each repair task a known minimal patch.»)
  • На передовых LLM избыточное редактирование распространено: даже у GPT-5.5 высокий Pass@1 может сочетаться с неоправданно крупными правками и добавленной когнитивной сложностью. (подтверждено самой публикацией: доказательство; «Across frontier LLMs, over-editing is widespread even among strong models like GPT-5.5: high Pass@1 can coexist with unnecessarily large edits and added cognitive complexity.»)
  • Инструкция сохранять исходную реализацию снизила среднюю избыточную дистанцию Левенштейна с 0,195 до 0,131, добавленную когнитивную сложность на 26,6% и одновременно повысила Pass@1 на 2,3 пункта. (подтверждено самой публикацией: доказательство; «A preservation instruction substantially reduces this behavior, lowering average excess Levenshtein distance from 0.195 to 0.131, reducing added cognitive complexity by 26.6%, and increasing Pass@1 by 2.3 points.»)
  • Эти улучшения не объясняются просто большим бюджетом рассуждений или более крупными моделями. (подтверждено самой публикацией: доказательство; «However, these gains do not simply follow from a larger reasoning budget or larger models.»)
  • При постобучении supervised fine-tuning переобучался на знакомые типы искажений, тогда как reinforcement learning дал лучший компромисс между fidelity правок вне распределения и сохранением производительности. (подтверждено самой публикацией: доказательство; «We observe that supervised fine-tuning overfits to seen corruption patterns, whereas reinforcement learning gives the best out-of-domain edit-fidelity and performance-retention trade-off.»)
  • Работа рассматривает fidelity правок как отдельную характеристику качества исправления кода, которую можно измерять и обучать. (подтверждено самой публикацией: доказательство; «These results position edit fidelity as a distinct axis of code-repair quality and show that it can be measured and learned.»)

Первоисточники:

оценка 66.5 · тип research · ревизия 1 · истории st-1wd2cwd