Авторы опубликовали на arXiv препринт «Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents», в котором представили фреймворк AutoSciRub. Это научная статья об evaluation-first фреймворке для исследовательских агентов.
Фреймворк сначала выводит исполнимую рубрику, зависящую от задачи, а затем использует её для выполнения исследования, проверки критериев и итеративной доработки. Он разбивает недостаточно определённую инструкцию на атомарные научные цели, связывает их с релевантной литературой и доступными в задаче данными и синтезирует проверяемые критерии.
Полученная рубрика делает неявные требования к экспериментам и доказательствам явными и направляет проведение экспериментов и анализов. При доработке проверка по рубрике выявляет невыполненные критерии и позволяет точечно улучшать исследовательский отчёт и подтверждающие его артефакты.
На ResearchClawBench AutoSciRub в среднем прибавил 2,08 балла в трёх конфигурациях базовых LLM при фиксированном Codex harness. На AstaBench E2E Discovery система показала среднее улучшение на 16,8 балла, не уменьшая или увеличивая число успешно выполненных задач.
Проверка утверждений:
- Авторы опубликовали на arXiv препринт научной статьи «Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents», представляющей AutoSciRub — фреймворк evaluation-first для исследовательских агентов. (подтверждено самой публикацией: доказательство; «To address the problem, we present AutoSciRub, an evaluation-first framework that induces a task-specific executable rubric before research execution, and uses it to guide execution, criterion-level verification as well as iterative revision.»)
- Фреймворк сначала выводит исполнимую, зависящую от задачи рубрику, а затем использует её для выполнения исследования, проверки критериев и итеративной доработки. (подтверждено самой публикацией: доказательство; «To address the problem, we present AutoSciRub, an evaluation-first framework that induces a task-specific executable rubric before research execution, and uses it to guide execution, criterion-level verification as well as iterative revision.»)
- AutoSciRub разбивает недостаточно определённую инструкцию на атомарные научные цели, связывает их с релевантной литературой и доступными в задаче данными и синтезирует проверяемые критерии. (подтверждено самой публикацией: доказательство; «AutoSciRub decomposes an underspecified instruction into atomic scientific goals, grounds them in relevant literature and task-visible data, and synthesizes specific, actionable, and verifiable criteria.»)
- Полученная рубрика делает неявные требования к экспериментам и доказательствам явными и направляет проведение экспериментов и анализов. (подтверждено самой публикацией: доказательство; «The resulting rubric makes implicit experimental and evidential requirements explicit, providing guidance for experiments and analyses.»)
- При доработке проверка по рубрике выявляет невыполненные критерии и позволяет точечно улучшать исследовательский отчёт и подтверждающие его артефакты. (подтверждено самой публикацией: доказательство; «During revision, rubric-guided verification identifies unmet criteria and enables targeted refinement of the research report and its supporting artifacts.»)
- На ResearchClawBench AutoSciRub в среднем прибавил 2,08 балла в трёх конфигурациях базовых LLM при фиксированном Codex harness и 2,95 балла в трёх agent harness с фиксированным DeepSeek-V4-Flash. (подтверждено самой публикацией: доказательство; «On ResearchClawBench, AutoSciRub consistently improves all tested configurations, with an average gain of 2.08 points across three backbone LLMs under the fixed Codex harness and 2.95 points across three agent harnesses using a fixed DeepSeek-V4-Flash backbone.»)
- На случайной выборке из 20 задач AstaBench E2E Discovery система показала среднее улучшение на 16,8 балла в трёх agent harness, не уменьшая или увеличивая число успешно выполненных задач. (подтверждено самой публикацией: доказательство; «On a randomly sampled 20-task subset of AstaBench E2E Discovery, AutoSciRub further achieves an average improvement of 16.8 points across three agent harnesses, while maintaining or increasing the number of successfully completed tasks.»)
Первоисточники:
оценка 63.2 · тип research · ревизия 1 · истории st-1xax1lu