Авторы исследования проверили, сохраняются ли на новых задачах того же типа улучшения навыков ИИ-агентов (сохранённых инструкций и кода для повторного использования). Из 21 навыка, улучшившего результаты на тренировочных задачах, 5 сохранили на новых задачах весь прирост, 13 — часть, а 3 — ничего.

Авторы сравнили пять методов последовательной доработки навыков и навык, созданный за один раз, на шести наборах тестовых задач, используя одну модель, одного агента и одинаковое разделение задач на тренировочные и проверочные. По наблюдениям авторов, в навыках, плохо переносимых на новые задачи, часто жёстко задавали названия столбцов или выходные файлы либо делали исправление одного сбоя правилом для всех задач.

Авторы предложили метод, который хранит только руководство по составлению навыков и создаёт отдельный навык для каждой задачи. По их результатам, этот метод получил самые высокие оценки на всех шести наборах тестовых задач.

Проверка утверждений:

  • По результатам исследования, из 21 навыка, улучшившего результаты на тренировочных задачах, 5 сохранили на новых задачах весь прирост, 13 — часть, а 3 — ничего. (подтверждено самой публикацией: доказательство; «Of the 21 skills that improve on their training tasks, 5 keep all of that improvement on the test tasks, 13 keep part of it, and 3 keep none of it.»)
  • Авторы исследования проверили, сохраняются ли улучшения навыков ИИ-агентов на новых задачах того же типа. (подтверждено самой публикацией: доказательство; «Self-evolving skill methods keep rewriting these skills after each round of practice on training tasks, and the skill is then used on new tasks of the same kind. We ask a question: does the improvement a skill shows on its training tasks carry over to new test tasks?»)
  • Авторы сравнили пять методов последовательной доработки навыков и навык, созданный за один раз, на шести наборах тестовых задач, используя одну модель, одного агента и одинаковое разделение задач на тренировочные и проверочные. (подтверждено самой публикацией: доказательство; «We test five self-evolving methods and a one-shot skill on six benchmarks, with the same model, the same agent, and the same train/test split for every method.»)
  • По наблюдениям авторов, в навыках, плохо переносимых на новые задачи, часто жёстко задавали названия столбцов или выходные файлы либо делали исправление одного сбоя правилом для всех задач. (подтверждено самой публикацией: доказательство; «When we read the skills, the ones that carry over badly often fix details that should depend on the task, such as column names and output files, or turn a fix for one failure into a rule for every task.»)
  • Авторы предложили метод, который хранит только руководство по составлению навыков и создаёт отдельный навык для каждой задачи. (подтверждено самой публикацией: доказательство; «Based on these findings, we describe Generalizable Skill Optimization (GSO), which keeps only a guide for writing skills and writes a new skill for each task; it scores highest on all six benchmarks.»)
  • По результатам авторов, предложенный метод получил самые высокие оценки на всех шести наборах тестовых задач. (подтверждено самой публикацией: доказательство; «Based on these findings, we describe Generalizable Skill Optimization (GSO), which keeps only a guide for writing skills and writes a new skill for each task; it scores highest on all six benchmarks.»)

Первоисточники:

оценка 53,9 из 100 · тип: исследование