Авторы представили TokenCast, систему прогнозирования расхода токенов при выполнении задач агентами на больших языковых моделях. Расход токенов при выполнении одной задачи может различаться между запусками более чем на порядок.

Метод записывает расход токенов и рост контекста для каждого сегмента выполнения, затем объединяет соседние сегменты в общую оценку. По мере выполнения TokenCast обновляет прогноз по новым данным без дополнительных обращений к большой языковой модели.

На SWE-bench Verified среднее суммарное время прогнозирования составило 32,8 мс на запуск. В 96 оценённых сочетаниях наборов задач и моделей среднее снижение абсолютной ошибки относительно лучшего из сопоставляемых методов составило 14,5%.

При офлайновом моделировании управления бюджетом TokenCast в среднем использовал на 21,3% меньше токенов, чем политика с фиксированным бюджетом при одинаковой степени завершённости запусков.

Проверка утверждений:

  • Авторы представили TokenCast — систему для прогнозирования расхода токенов при выполнении задач агентами на больших языковых моделях. (подтверждено самой публикацией: доказательство; «In this paper, we propose TokenCast»)
  • Расход токенов при выполнении одной задачи может различаться между запусками более чем на порядок. (подтверждено самой публикацией: доказательство; «When a large language model (LLM) agent executes the same task, token consumption can vary by over an order of magnitude across runs.»)
  • Метод записывает расход токенов и рост контекста для каждого сегмента выполнения, затем объединяет соседние сегменты в общую оценку. (подтверждено самой публикацией: доказательство; «TokenCast, which learns a composable cost representation for each execution segment, recording its own consumption and the context growth it introduces. Composing adjacent segments yields a cumulative estimate»)
  • По мере выполнения TokenCast обновляет прогноз по новым данным без дополнительных обращений к большой языковой модели. (подтверждено самой публикацией: доказательство; «As execution unfolds, newly observed evidence refreshes the forecast, requiring no additional LLM calls»)
  • На SWE-bench Verified среднее суммарное время прогнозирования составило 32,8 мс на запуск. (подтверждено самой публикацией: доказательство; «incurring a mean cumulative prediction time of 32.8 ms per run on SWE-bench Verified»)
  • В 96 оценённых сочетаниях наборов задач и моделей среднее снижение абсолютной ошибки относительно лучшего из сопоставляемых методов составило 14,5%. (подтверждено самой публикацией: доказательство; «Across 4 task suites and 6 agent models, TokenCast’s mean absolute error reduction against the strongest comparator averages 14.5% over 96 evaluated combinations.»)
  • При офлайновом моделировании управления бюджетом TokenCast в среднем использовал на 21,3% меньше токенов, чем политика с фиксированным бюджетом при одинаковой степени завершённости запусков. (подтверждено самой публикацией: доказательство; «In offline budget-control replay, TokenCast uses 21.3% fewer tokens on average than a fixed-budget policy at matched trace completion.»)

Первоисточники:

оценка 62,4 из 100 · тип: исследование