Авторите на статията предлагат on-policy expert-correction pipeline, схема, която намира проблемния ход в собственото изпълнение на по-слабия модел и иска от експерта да пренапише само този ход.

В седем корпоративни агентни задачи обучението на по-слаб модел с пълните траектории на експерта след еволюция на агентната обвивка намалява резултата с 4 до 30 точки при Qwen3-Coder и Gemma 4. Агентната обвивка е системната инструкция, наборът от инструменти, точките за включване в изпълнението и обвивката за управление на контекста около модела.

Проверка на твърденията:

  • Авторите предлагат конвейер on-policy expert-correction, който намира проблемния ход в собственото изпълнение на по-слабия модел и иска от експерта да пренапише само този ход. (потвърдено от самата публикация: доказателство; «We therefore develop an on-policy expert-correction pipeline, automated by a meta-level MLE agent, that localizes the failing turn in the weaker model’s own rollout and asks the expert to rewrite only that turn.»)
  • В седем корпоративни агентни задачи обучението на по-слаб модел с пълните траектории на експерта след еволюция на агентната обвивка намалява резултата с 4 до 30 точки при Qwen3-Coder и Gemma 4. (потвърдено от самата публикация: доказателство; «However, training the weaker model on the expert’s complete trajectories under the evolved harness backfires: performance regresses on all seven tasks by 4 to 30 points across Qwen3-Coder and Gemma 4, even though the same procedure helps under the unevolved harness.»)
  • Агентната обвивка включва системната инструкция, набора от инструменти, точките за включване в изпълнението и обвивката за управление на контекста около модела. (потвърдено от самата публикация: доказателство; «Agent harnesses (the system prompt, tool set, execution hooks, and context-management scaffolding around a model) are a critical determinant of agentic task success.»)

Първоизточници:

оценка 62.4 · тип research · ревизия 1 · истории st-727nfl