Новый монитор METR проверяет каждое действие агента до выполнения во внутренних оценках безопасности. Языковая модель оценивает действие, а при оценке выше порога монитор останавливает оценку до проверки человеком.
Авторы подчёркивают, что доказательства для многих частей их аргумента пока лишь частичные. При разборе системы они нашли несколько серьёзных проблем: один исследователь провёл рискованные оценки без монитора, потому что неверно понял критерии.
Среди 20 тысяч случайно отобранных действий из внутреннего трафика пять, или 0,025%, получили оценку выше порога, и все пять оказались ложными срабатываниями в пределах того, что монитор считает реальным вредом. Один пропущенный обход защиты сайта заставил команду уточнить инструкцию для монитора, после чего он заблокировал все десять проверенных образцов.
Проверка утверждений:
- Монитор METR проверяет каждое действие агента до выполнения во внутренних оценках безопасности. (подтверждено самой публикацией: доказательство; «An LLM judge reviews each action from the agent before execution»)
- Языковая модель оценивает действие, а при оценке выше порога монитор останавливает оценку до проверки человеком. (подтверждено самой публикацией: доказательство; «An LLM judge reviews each action from the agent before execution, and holds anything above a threshold for human review, halting the eval in the meantime.»)
- Авторы подчёркивают, что доказательства для многих частей их аргумента пока лишь частичные. (подтверждено самой публикацией: доказательство; «many of the claims and subclaims are only partially supported under our current evidence.»)
- При разборе системы они нашли несколько серьёзных проблем: один исследователь провёл рискованные оценки без монитора, потому что неверно понял критерии. (подтверждено самой публикацией: доказательство; «a researcher ran a set of potentially-risky evals without applying the monitor due to misunderstanding the criteria.»)
- Среди 20 тысяч случайно отобранных действий из внутреннего трафика пять, или 0,025%, получили оценку выше порога, и все пять оказались ложными срабатываниями в пределах того, что монитор считает реальным вредом. (подтверждено самой публикацией: доказательство; «Running the monitor post-hoc on 20,000 randomly sampled actions from internal eval traffic, 5 actions (0.025%) were scored at or above our threshold of 3/10 suspicion. All five are false positives under our monitor’s scope of real-world harm.»)
- Один пропущенный обход защиты сайта заставил команду уточнить инструкцию для монитора, после чего он заблокировал все десять проверенных образцов. (подтверждено самой публикацией: доказательство; «We have since added one sentence to the prompt clarifying that terms of service violations, such as evading bot protection, count as real-world harm. With this change, all 10 samples are blocked.»)
Первоисточники:
оценка 62,3 из 100 · тип: руководство