В препринта When Models Edit Too Much Тунъяо Чжу, Вэй Херн Лим и Мин-Йен Кан изследват как езиковите модели пренаписват код повече от необходимото за поправяне на грешка. Работата показва, че качеството на поправката включва минималност, проверимост при преглед на кода и вярност към първоначалната реализация.

Авторите събраха 400 задачи от BigCodeBench и внесоха контролирани AST изкривявания в еталонните решения. Така за всяка задача се получи известен минимален пач.

Дори при GPT-5.5 високият Pass@1 се съчетаваше с прекалено големи промени и добавена когнитивна сложност. Инструкцията за запазване на първоначалната реализация намали средното излишно разстояние на Левенщайн от 0,195 на 0,131.

Същата инструкция намали добавената когнитивна сложност с 26,6% и повиши Pass@1 с 2,3 пункта. Авторите отбелязват, че тези подобрения не се обясняват само с по-голям бюджет за разсъждение или с по-големи модели.

Проверка на твърденията:

  • В arXiv е публикуван изследователски препринт на Tongyao Zhu, Wei Hern Lim и Min-Yen Kan за склонността на езиковите модели да пренаписват код повече от необходимото за поправяне на грешка. (потвърдено от самата публикация: доказателство; «Authors: Tongyao Zhu , Wei Hern Lim , Min-Yen Kan View a PDF of the paper titled When Models Edit Too Much: On the Fidelity of Minimal Code Edits, by Tongyao Zhu and 2 other authors View PDF HTML (experimental) Abstract: Large language models (LLMs) are increasingly used to edit existing code, but correctness alone is not enough: useful repairs should also be minimal, reviewable, and faithful to the original implementation. We study over-editing, the tendency of a model to rewrite code beyond what is required to fix a bug.»)
  • Авторите смятат, че полезната поправка на код от модел трябва да бъде не само коректна, но и минимална, проверима при преглед на кода и вярна на първоначалната реализация. (потвърдено от самата публикация: доказателство; «Large language models (LLMs) are increasingly used to edit existing code, but correctness alone is not enough: useful repairs should also be minimal, reviewable, and faithful to the original implementation.»)
  • За да оценят минималността на промените, авторите събраха 400 задачи от BigCodeBench, внесоха контролирани AST изкривявания в еталонните решения и така получиха за всяка задача известен минимален пач. (потвърдено от самата публикация: доказателство; «We construct an evaluation framework from 400 BigCodeBench problems by injecting controlled AST-level corruptions into reference solutions, giving each repair task a known minimal patch.»)
  • При водещите LLM прекомерното редактиране е разпространено: дори при GPT-5.5 високият Pass@1 може да се съчетава с неоправдано големи промени и добавена когнитивна сложност. (потвърдено от самата публикация: доказателство; «Across frontier LLMs, over-editing is widespread even among strong models like GPT-5.5: high Pass@1 can coexist with unnecessarily large edits and added cognitive complexity.»)
  • Инструкцията за запазване на първоначалната реализация намали средното излишно разстояние на Левенщайн от 0,195 на 0,131, добавената когнитивна сложност с 26,6% и едновременно повиши Pass@1 с 2,3 пункта. (потвърдено от самата публикация: доказателство; «A preservation instruction substantially reduces this behavior, lowering average excess Levenshtein distance from 0.195 to 0.131, reducing added cognitive complexity by 26.6%, and increasing Pass@1 by 2.3 points.»)
  • Тези подобрения не се обясняват просто с по-голям бюджет за разсъждение или с по-големи модели. (потвърдено от самата публикация: доказателство; «However, these gains do not simply follow from a larger reasoning budget or larger models.»)
  • При дообучението контролираното фино настройване се пренастройваше към познати типове изкривявания, докато обучението с подсилване даде по-добър компромис между верността на промените извън разпределението и запазването на производителността. (потвърдено от самата публикация: доказателство; «We observe that supervised fine-tuning overfits to seen corruption patterns, whereas reinforcement learning gives the best out-of-domain edit-fidelity and performance-retention trade-off.»)
  • Работата разглежда верността на промените като отделна характеристика на качеството на поправката на код, която може да се измерва и обучава. (потвърдено от самата публикация: доказателство; «These results position edit fidelity as a distinct axis of code-repair quality and show that it can be measured and learned.»)

Първоизточници:

оценка 66.5 · тип research · ревизия 1 · истории st-1wd2cwd