Майкл Офенгенден и Максим Андрющенко представили AgentTime, набор заданий для проверки ИИ-агентов, который оценивает три навыка: работать заданное время, предсказывать длительность работы и оценивать прошедшее время после завершения.
В тесте 222 задания из 18 источников, в том числе по написанию кода, работе за компьютером и автоматизированным исследованиям. В экспериментах агенты получали инструкцию работать примерно от минуты до нескольких дней.
По словам авторов, совпадение длительности запуска с заданным временем само по себе не доказывает, что агент всё это время работал над задачей. В части изученных запусков агент явно переходил в режим ожидания после того, как, судя по записи, завершил работу.
Проверка утверждений:
- Майкл Офенгенден и Максим Андрющенко представили AgentTime для проверки того, могут ли ИИ-агенты работать заданное время, предсказывать длительность работы и оценивать прошедшее время после завершения. (подтверждено самой публикацией: доказательство; «Authors: Michael Ofengenden , Maksym Andriushchenko View a PDF of the paper titled AgentTime: Can Agents Estimate and Control Their Own Runtime?, by Michael Ofengenden and Maksym Andriushchenko View PDF HTML (experimental) Abstract: An essential control of AI agents is their ability to manage runtime. This ability requires a sense of time-awareness, to predict and estimate wall-clock time and to control their own actions. Prior work has focused on time-awareness, but duration-following and control in native agent harnesses remain unexplored. We present AgentTime, a benchmark for testing whether agents can work for a requested duration, predict their runtime, and estimate elapsed time afterward.»)
- AgentTime содержит 222 задания из 18 источников, в том числе по написанию кода, работе за компьютером и автоматизированным исследованиям. (подтверждено самой публикацией: доказательство; «It comprises 222 tasks from 18 sources spanning coding, computer use, agentic work, and automated research.»)
- В экспериментах агенты получали инструкцию работать от примерно минуты до нескольких дней. (подтверждено самой публикацией: доказательство; «Duration-following experiments append a single instruction specifying how long to work, with requests ranging from about a minute to multiple days.»)
- По словам авторов, совпадение длительности запуска с заданным временем само по себе не доказывает, что агент всё это время работал над задачей. (подтверждено самой публикацией: доказательство; «However, matching the requested runtime does not, by itself, establish continued work on the task.»)
- По словам авторов, в части изученных запусков агент явно переходил в режим ожидания после того, как, судя по записи, завершил работу. (подтверждено самой публикацией: доказательство; «Among 158 reviewed Astra runs with classifiable transcripts, 14 explicitly slept after appearing to finish.»)
Первоисточники:
оценка 54,5 из 100 · тип: исследование