В репозитории usedotai/dot-reflex опубликован анонс выпуска Dot Reflex 14B — контроллера цикла выполнения другого агента. Репозиторий содержит рантайм, примеры интеграции, тесты, результаты оценки и документацию, а веса адаптера размещены на Hugging Face.
Dot Reflex 14B представляет собой rank-64 QLoRA-адаптер для Qwen3-14B-Base и не требует совпадения архитектуры рабочей модели. Он получает компактное резюме траектории агента и выбирает одно из десяти решений, включая проверку, откат, смену модели, обращение к человеку и остановку.
Контроллер принимает обычный JSON по облегчённой схеме обмена, которая не заявлена как универсальный протокол агентов. Генерация работает детерминированно, а при невалидной входной схеме или действии рантайм завершается с ненулевым кодом.
Эталонный 4-битный рантайм требует Linux и GPU NVIDIA с практическим минимумом 24 ГБ видеопамяти для одного запроса. Опубликованные оценки получены на отложенном синтетическом Agent Recovery Bench, поэтому результат 100% не доказывает перенос на независимо подготовленные или производственные сбои.
Проверка утверждений:
- В репозитории usedotai/dot-reflex опубликован анонс выпуска Dot Reflex 14B: rank-64 QLoRA-адаптера для Qwen3-14B-Base, который контролирует цикл выполнения другого агента и не требует совпадения архитектуры рабочей модели. (подтверждено первоисточником: доказательство; «The release is a rank-64 QLoRA adapter for Qwen/Qwen3-14B-Base . It can sit beside a coding or tool-using agent built on GPT, Claude, Gemini, Qwen, Llama, or another model. Dot Reflex supervises the execution loop , so the worker model does not need to share its architecture.»)
- Dot Reflex получает компактное резюме траектории агента и возвращает одно из десяти управляющих решений — от продолжения и проверки до отката, смены модели, обращения к человеку или остановки. (подтверждено первоисточником: доказательство; «Dot Reflex is an execution-recovery controller, not a replacement for the agent doing the work. It reads a compact summary of an agent trajectory and returns one of ten control decisions: continue, verify, retry differently, replan, rollback, branch, switch model, ask a human, stop successfully, or stop with failure.»)
- Контроллер принимает обычный JSON из событий агентного фреймворка, а точная входная структура описана в trajectory.schema.json; авторы прямо называют её облегчённой схемой обмена, а не универсальным протоколом агентов. (подтверждено первоисточником: доказательство; «The exact accepted structure is in trajectory.schema.json . This is a lightweight interchange schema, not a universal agent protocol. Most harnesses need a small event-to-trajectory adapter; examples are documented in INTEGRATION.md .»)
- Эталонный 4-битный рантайм требует Linux и GPU NVIDIA; практический минимум для одного запроса — 24 ГБ видеопамяти, а 40–48 ГБ дают больший запас. (подтверждено первоисточником: доказательство; «An NVIDIA GPU and Linux are required by the reference 4-bit runtime. A 24 GB GPU is the practical minimum for one request at a time; 40-48 GB gives more headroom.»)
- Репозиторий содержит рантайм, примеры интеграции, тесты, результаты оценки и документацию; примерно 1,03-ГБ адаптер размещён на Hugging Face и загружается при первом использовании вместе с закреплёнными базовыми весами Qwen3. (подтверждено первоисточником: доказательство; «This GitHub repository contains the runtime, integration examples, tests, evaluation receipts, and documentation. The adapter weights are hosted on Hugging Face and are downloaded automatically on first use. git clone https://github.com/usedotai/dot-reflex.git cd dot-reflex python3 -m venv .venv source .venv/bin/activate python3 -m pip install –upgrade pip python3 -m pip install -r requirements.txt The adapter is about 1.03 GB. The pinned Qwen3 base weights are downloaded on first use and cached by Hugging Face.»)
- Генерация сделана жадной и детерминированной, а при невалидной входной схеме или сгенерированном действии рантайм завершается с ненулевым кодом, позволяя оркестратору прекращать работу по принципу fail-closed. (подтверждено первоисточником: доказательство; «Generation is greedy and deterministic. The runtime exits non-zero if the input schema or generated action is invalid, so an orchestrator can fail closed.»)
- Dot Reflex только рекомендует управляющее действие: политика, разрешения, исполнение инструментов, механизм отката и окончательное решение об остановке остаются за управляющим фреймворком. (подтверждено первоисточником: доказательство; «Dot Reflex recommends a control. Your harness remains responsible for policy, permissions, tool execution, rollback mechanics, and the final stop decision.»)
- Обучение прошло на 6000 синтетических обучающих и 600 валидационных траекториях за одну эпоху и 375 шагов; на одном NVIDIA H200 оно заняло 1816,2 секунды, итоговые потери составили 0,11566 на обучении и 0,08640 на валидации. (подтверждено первоисточником: доказательство; «The completed run used 6,000 synthetic training trajectories and 600 synthetic validation trajectories for one epoch, totaling 375 optimizer steps. Measured trainer runtime was 1,816.2 seconds on one NVIDIA H200. Final aggregate training loss was 0.11566 and final validation loss was 0.08640.»)
- Опубликованные оценки получены на отложенном синтетическом Agent Recovery Bench, а не на SWE-bench или в производственной эксплуатации; реалистичный переносной пилот подготовлен, но запуск нейронного контроллера для него не завершён. (подтверждено первоисточником: доказательство; «Evaluation status: the published scores are from a held-out synthetic Agent Recovery Bench, not SWE-bench and not a production trial. A separate realistic transfer pilot was authored but its neural-controller run has not been completed. Do not treat the synthetic 100% result as proof of universal reliability.»)
- Результат адаптера в 100% демонстрирует соответствие распределению этого синтетического бенчмарка, но не доказывает перенос на независимо подготовленные или производственные сбои. (подтверждено первоисточником: доказательство; «The 100% adapter score demonstrates fit to this benchmark distribution. It does not establish transfer to independently authored or production failures.»)
- В выпуск не входят сборки GGUF, Ollama, MLX, CPU или вариант со слитыми весами; эталонный рантайм рассчитан на один GPU NVIDIA. (подтверждено первоисточником: доказательство; «The reference runtime is optimized for one NVIDIA GPU. No GGUF, Ollama, MLX, CPU, or merged-weight build is included in this release.»)
Первоисточники:
оценка 74.8 · тип announcement · ревизия 1 · истории st-pvuegc