Команда Pipecat выпустила открытую по весам модель PhoneLLM Alpha 1 для голосовых агентов. Карточка модели раскрывает её характеристики, результаты PhoneBench и рекомендации по развёртыванию.
PhoneLLM Alpha 1 представляет собой полнопараметрическое дообучение NVIDIA Nemotron 3 Nano 30B-A3B с гибридной Mamba-Transformer MoE-архитектурой. Модель обучена вызывать нужные инструменты в нужный момент без включённого thinking.
По собственному сравнению Pipecat, PhoneLLM работает на уровне GPT 5.6 Terra, но обходится на 94% дешевле и сокращает P95 time-to-first-token на 1300 мс. PhoneBench измеряет точность, стиль речи, задержку и стоимость работы в минуту, а его LLM-судьи откалиброваны по человеческим меткам.
Проверка утверждений:
- Команда Pipecat опубликовала карточку модели PhoneLLM Alpha 1 и сообщила о выпуске открытой по весам модели для голосовых агентов; материал даёт читателю характеристики модели, результаты PhoneBench и рекомендации по развёртыванию. (подтверждено первоисточником: доказательство; «The Pipecat team is pleased to announce the release of PhoneLLM Alpha 1 , an open-weights model for voice agent use cases.»)
- PhoneLLM Alpha 1 — полнопараметрическое дообучение NVIDIA Nemotron 3 Nano 30B-A3B, выполненное с NVIDIA NeMo; гибридная Mamba-Transformer MoE-архитектура имеет 30 млрд параметров всего и 3,5 млрд активных. (подтверждено первоисточником: доказательство; «Architecture Hybrid Mamba-Transformer mixture-of-experts; 30B total parameters, 3.5B active Training Full-parameter supervised fine-tuning with the NVIDIA NeMo framework»)
- Контекст модели составляет 262 144 токена, веса представлены в bfloat16 safetensors; рекомендуются temperature=0 и отключённый thinking, а для сервинга указаны vLLM или SGLang. (подтверждено первоисточником: доказательство; «Context length 262,144 tokens Precision bfloat16 safetensors Recommended inference settings temperature=0 , thinking disabled ( chat_template_kwargs: {“enable_thinking”: false} ) Serving vLLM or SGLang, Nemotron 3 Nano recipes; trust_remote_code=True»)
- В связке с распознаванием и синтезом речи через Pipecat модель рассчитана на входящие звонки в финансовых услугах, здравоохранении, рознице и гостиничном бизнесе, а также на типовые исходящие звонки. (подтверждено первоисточником: доказательство; «When paired with transcription and text-to-speech models through a framework like Pipecat , PhoneLLM can handle incoming calls for financial services, healthcare, retail, and hospitality customer service, and perform common outbound calling agent tasks.»)
- По собственному сравнению Pipecat, PhoneLLM показывает уровень GPT 5.6 Terra, обходясь на 94% дешевле и сокращая P95 time-to-first-token на 1300 мс. (подтверждено первоисточником: доказательство; «For example, PhoneLLM performs on par with GPT 5.6 Terra, but 94% cheaper and with 1,300ms faster P95 time-to-first-token.»)
- Модель можно запускать на собственной инфраструктуре; она выпущена под BSD-лицензией без коммерческих ограничений. (подтверждено первоисточником: доказательство; «PhoneLLM is an open model, so you can run it on your own infrastructure. The model is released under the BSD license, with no commercial restrictions.»)
- Вместе с моделью Pipecat представила PhoneBench v1 — тест пригодности LLM для телефонных агентов, который наряду с точностью и стилем речи измеряет задержку и оценивает стоимость работы в минуту. (подтверждено первоисточником: доказательство; «We are also announcing PhoneBench v1 , a benchmark which evaluates LLMs based on their suitability for phone agent use cases. In addition to accuracy and speaking style, we measure model latency and estimate per-minute runtime cost.»)
- PhoneBench оценивает ответы панелью LLM-судей относительно эталонных примеров, а самих судей калибрует по человеческим меткам. (подтверждено первоисточником: доказательство; «To handle this subjectivity, PhoneBench uses a panel of LLM judges to grade model output, comparing the actions to high-quality reference samples. The judges are calibrated against human labels to ensure accuracy.»)
- Сценарии, наборы инструментов и системные промпты PhoneBench отделены от обучающих данных PhoneLLM, чтобы проверять обобщение на ранее не встречавшиеся сценарии, отрасли, инструменты и промпты. (подтверждено первоисточником: доказательство; «The scenarios, tool lists, and system prompts in the benchmark are kept separate from the data we use to train models like PhoneLLM, so that PhoneLLM isn’t limited to the tasks it was trained on. And the benchmark verifies that the model generalizes across previously unseen scenarios, business use cases, tools lists, and prompts.»)
- PhoneLLM специально обучена вызывать нужные инструменты в нужный момент без включённого thinking. (подтверждено первоисточником: доказательство; «PhoneLLM is specifically trained to call the right tools at the right time, without the need for thinking to be enabled.»)
- Официальная NVFP4-квантизация рассчитана на NVIDIA Blackwell и сопровождается проверенным рецептом native vLLM для одной NVIDIA B200. (подтверждено первоисточником: доказательство; «It uses the same PhoneLLM Alpha 1 weights and is released with a tested native vLLM recipe for one NVIDIA B200.»)
- По среднему результату десяти прогонов PhoneBench при temperature=0 и отключённом thinking вариант NVFP4 с BF16 KV-кэшем почти совпал с BF16: 72,019090 против 72,055800, разница — минус 0,036711. (подтверждено первоисточником: доказательство; «BF16 BF16 72.055800 — NVFP4 FP8 71.512482 -0.543318 NVFP4 BF16 72.019090 -0.036711»)
Первоисточники:
оценка 70.2 · тип release · ревизия 1 · истории st-19td63h