Утверждения подтверждены публикацией InfoQ, но не первоисточником.
InfoQ опубликовал новостной материал об открытом движке FreeToken, который представили исследователи UC Berkeley и MIT. Из него читатель узнает, как движок запускает передовые MoE-модели на потребительском оборудовании.
Политика q* динамически делит вычисление токена между ядрами CPU и тензорными ядрами GPU с учётом текущей пропускной способности соединения. Формат весов FTW и двойная буферизация полного слоя позволяют полностью совмещать передачу весов по PCIe с вычислением активных слоёв.
Эластичный менеджер памяти во время работы перераспределяет VRAM между KV-кэшем и слотами резидентных экспертов без перезагрузки модели. Механизм semantic anchor checkpointing сохраняет промежуточные состояния внимания и рекуррентные активации на логических границах задачи, чтобы повторно использовать состояния подпоследовательностей после изменения аргументов инструментов или добавления результатов их выполнения.
По сравнению InfoQ, на эквивалентных MoE-моделях FreeToken ускоряет декодирование в 3–4 раза, а prefill — в 6–30 раз относительно Ollama и llama.cpp.
Проверка утверждений:
- InfoQ опубликовал новостной материал о представленном исследователями UC Berkeley и MIT открытом движке FreeToken; материал объясняет, как он запускает передовые MoE-модели на потребительском оборудовании. (подтверждено только публикацией-переносчиком: доказательство; «Researchers from UC Berkeley and MIT have introduced FreeToken , an open-source inference engine designed to bridge the gap between frontier Mixture-of-Experts (MoE) models and consumer-grade hardware.»)
- На потребительских системах декодирование MoE ограничивают пропускная способность PCIe в 16–64 ГБ/с и задержка оперативной памяти, а статическая выгрузка экспертов полностью останавливает вычисление при промахе кэша. (подтверждено только публикацией-переносчиком: доказательство; «On consumer hardware, however, PCIe throughput (typically 16–64 GB/s) and host RAM latency form severe decode bottlenecks. Existing edge runtimes rely on static expert offloading where inactive weights reside in system RAM and are synchronously streamed to the GPU upon activation, completely stalling execution on cache misses.»)
- Политика q* в FreeToken динамически делит вычисление токена между ядрами CPU и тензорными ядрами GPU в зависимости от текущей пропускной способности соединения. (подтверждено только публикацией-переносчиком: доказательство; «Rather than halting the GPU during cache misses, FreeToken splits token computation between CPU cores and GPU tensor cores according to real-time interconnect throughput.»)
- Формат весов FTW и двойная буферизация полного слоя позволяют полностью совмещать передачу весов по PCIe с вычислением активных слоёв. (подтверждено только публикацией-переносчиком: доказательство; «The system employs a fast weight format (FTW) alongside full-layer double buffering, allowing weight streaming over PCIe to overlap entirely with active computation layers.»)
- Эластичный менеджер памяти FreeToken во время работы перераспределяет VRAM между KV-кэшем и слотами резидентных экспертов без перезагрузки модели. (подтверждено только публикацией-переносчиком: доказательство; «An elastic memory manager also dynamically reallocates VRAM between KV cache entries and resident expert slots during runtime without triggering model reloads.»)
- Механизм semantic anchor checkpointing сохраняет промежуточные состояния внимания и рекуррентные активации на логических границах задачи, чтобы при изменении аргументов инструментов или добавлении результатов их выполнения повторно использовать состояния подпоследовательностей. (подтверждено только публикацией-переносчиком: доказательство; «FreeToken integrates semantic anchor checkpointing, caching intermediate attention states and recurrent activations at logical task boundaries. When an agent edits intermediate tool arguments or injects external execution output, FreeToken reuses existing sub-sequence states instead of invalidating the prompt cache.»)
- По приведённому в InfoQ сравнению, на эквивалентных MoE-моделях FreeToken ускоряет декодирование в 3–4 раза, а prefill — в 6–30 раз относительно Ollama и llama.cpp. (подтверждено только публикацией-переносчиком: доказательство; «FreeToken achieves 3–4x faster decode and 6–30x faster prefill on equivalent MoE models.»)
- В пересказе раздела бенчмарков статьи FreeToken запускал Qwen3.6-35B примерно на 39 токенах в секунду на ноутбуке с RTX 4060 и 8 ГБ памяти, обслуживал DeepSeek-V4-Flash на RTX 5090 и обрабатывал GLM-5.2 на одном GPU рабочей станции. (подтверждено только публикацией-переносчиком: доказательство; «According to the benchmarks section of the paper, FreeToken ran Qwen3.6-35B at ~39 tokens/sec on an 8GB RTX 4060 laptop, served DeepSeek-V4-Flash (284B) on an RTX 5090 desktop, and processed GLM-5.2 (753B) on a single workstation GPU.»)
- CLI и настольный клиент FreeToken доступны через FlashML.ai и репозиторий GitHub и поддерживают видеокарты NVIDIA RTX серий 30, 40 и 50 в Linux и Windows. (подтверждено только публикацией-переносчиком: доказательство; «The CLI and desktop client are available via FlashML.ai and the GitHub repository , supporting NVIDIA RTX 30, 40, and 50 series GPUs on Linux and Windows.»)
Публикации:
оценка 68.9 · тип research · ревизия 1 · истории st-1lyc920