Авторы исследования показали: ИИ-помощник для работы с кодом может выполнить задачу, но нарушить правила установленного навыка, набора инструкций о том, когда и как выполнять задачу. Например, из-за похожего навыка может перестать действовать запрет на работу с git.

Исследователи проверили 312 пар похожих навыков на трёх моделях в 6 368 запусках. По данным авторов, в каждом пятом запуске агент выбирал похожий навык вместо исходного, а успешность выполнения задач не снижалась.

В запусках, где агент сначала читал похожий навык, он не выполнял более трети функций, предусмотренных только исходным навыком.

Авторы предлагают проверять эти функции отдельно от выполнения задачи и показывать пользователю, какой навык применил агент.

Проверка утверждений:

  • Авторы исследования показали, что при конфликте похожих навыков ИИ-помощник для работы с кодом может выполнить задачу, но не соблюсти правила установленного навыка. (подтверждено самой публикацией: доказательство; «In a conflict, the installed skill loses core functions (e.g., a ban on touching git) because the similar skill runs instead or changes what it does. The task still passes, so benchmarks that check only task completion miss such cases.»)
  • Из-за похожего навыка может перестать действовать запрет на работу с git. (подтверждено самой публикацией: доказательство; «In a conflict, the installed skill loses core functions (e.g., a ban on touching git) because the similar skill runs instead or changes what it does.»)
  • Исследователи проверили 312 пар похожих навыков на трёх моделях в 6 368 запусках. (подтверждено самой публикацией: доказательство; «From snapshots of 20,947 repositories, we mine 822,109 candidate similar-skill pairs, have an LLM judge a stratified sample of 3,754, and run 312 confirmed pairs on three models (6,368 runs, 169,294 tool calls, 542 agent-hours).»)
  • По данным авторов, в каждом пятом запуске агент выбирал похожий навык вместо исходного, а успешность выполнения задач не снижалась. (подтверждено самой публикацией: доказательство; «Without lowering task completion, a similar skill takes one in five runs from the installed skill»)
  • В запусках, где агент сначала читал похожий навык, он не выполнял более трети функций, предусмотренных только исходным навыком. (подтверждено самой публикацией: доказательство; «runs that open the similar skill first lose over a third of the exclusive core functions that only the installed skill fulfills.»)
  • Авторы предлагают проверять функции, предусмотренные только исходным навыком, отдельно от выполнения задачи и показывать пользователю, какой навык применил агент. (подтверждено самой публикацией: доказательство; «Benchmarks should thus score exclusive core functions, and platforms should guard the first read and show which skill ran.»)

Первоисточники:

оценка 67,6 из 100 · тип: исследование