Maat, система контроля за работой нескольких ИИ-агентов, проверяет передачу данных между ИИ-агентами по версии правил процесса, которую авторы называют anchor. Авторы исключили языковую модель из проверки и оценки.

В шести контролируемых сценариях с 6–15 агентами и 522 запусками авторы внесли ошибки в данные и проверили Maat по семи критериям. При учёте только остановок, связанных с подтверждённой ошибкой, оценка выросла на 7,7–29,1% в пяти сценариях, а в разработке ПО не изменилась.

Ручная проверка 94 остановок при работе Maat выявила 35 ложных срабатываний, или 37%, из-за дефектов валидатора. Если считать ложные срабатывания неудачей, вариант с Maat уступил варианту без Maat в четырёх из шести сценариев.

Проверка утверждений:

  • Maat проверяет передачу данных между ИИ-агентами по версии правил процесса, которую авторы называют anchor. (подтверждено самой публикацией: доказательство; «We present Maat, a runtime governance layer that validates agent-to-agent handoffs against a versioned workflow contract, or anchor»)
  • Авторы исключили языковую модель из проверки и оценки. (подтверждено самой публикацией: доказательство; «with no language model in the validation or scoring path.»)
  • В шести контролируемых сценариях с 6–15 агентами и 522 запусками авторы внесли ошибки в данные и проверили Maat по семи критериям. (подтверждено самой публикацией: доказательство; «We evaluate it in six controlled domain workflows (6-15 agents, 522 trials) with injected data-level defects and a deterministic seven-check rubric.»)
  • При учёте только остановок, связанных с подтверждённой ошибкой, оценка выросла на 7,7–29,1% в пяти сценариях, а в разработке ПО не изменилась. (подтверждено самой публикацией: доказательство; «On paired trials where the governed run completed or halted on a finding attributable to a verified defect, the rubric score changes by +7.7% to +29.1% in five workflows and is flat in software development»)
  • Ручная проверка 94 остановок при работе Maat выявила 35 ложных срабатываний, или 37%, из-за дефектов валидатора. (подтверждено самой публикацией: доказательство; «A hand review of all 94 governed-arm halts found 35 false alarms (37%), caused by validator defects rather than model behaviour»)
  • Если считать ложные срабатывания неудачей, вариант с Maat уступил варианту без Maat в четырёх из шести сценариев. (подтверждено самой публикацией: доказательство; «counting those halts as failed work, the governed arm scores below the ungoverned arm in four of six workflows.»)

Первоисточники:

оценка 58,9 из 100 · тип: исследование