В аккаунте samuel-vitorino на Hugging Face опубликована карточка открытой TTS-модели Sopro V2 Turbo. В ней описаны ключевые возможности модели.
Sopro V2 Turbo содержит 120 млн параметров и поддерживает английский, европейский португальский, французский и немецкий языки. Модель клонирует голос без дополнительного обучения по 5–20 секундам референсного аудио.
В потоковом режиме заявлено около 300 мс до первого аудио на CPU ноутбука. Модель запускается в браузере через ONNX, а полностью браузерная демонстрация работает без сервера.
На мобильных устройствах используется квантованная версия, поэтому качество может быть немного ниже локальной демонстрации. Смешение языков внутри одного предложения названо слабым местом модели.
Проверка утверждений:
- В аккаунте samuel-vitorino на Hugging Face опубликована карточка модели sopro-v2-turbo; это материал типа model card, который представляет открытую TTS-модель и даёт читателю описание её ключевых возможностей. (подтверждено первоисточником: доказательство; «samuel-vitorino / sopro-v2-turbo like 17 Text-to-Speech Safetensors 4 languages sopro tts voice-cloning streaming on-device License: apache-2.0 Model card Files Files and versions xet Community 1 Copy to bucket new Sopro TTS Sopro (from the Portuguese word for “breath/blow”) is a lightweight voice-cloning text-to-speech model family. This repo ships sopro-v2-turbo , a 120M-parameter open model that streams, runs comfortably on a laptop CPU or in the browser, and reaches SOTA-level intelligibility against much larger systems.»)
- Sopro V2 Turbo содержит 120 млн параметров и поддерживает английский, европейский португальский, французский и немецкий языки. (подтверждено первоисточником: доказательство; «Main features: 120M parameters English, European Portuguese, French, and German»)
- Модель выполняет zero-shot клонирование голоса по 5–20 секундам референсного аудио. (подтверждено первоисточником: доказательство; «Zero-shot voice cloning from 5-20 seconds of reference audio»)
- Для потокового режима заявлено около 300 мс до первого аудио на CPU ноутбука; приведённые показатели RTF составляют 0,24 офлайн и 0,21 в стриминге на M3 CPU, а также 0,07 на H100. (подтверждено первоисточником: доказательство; «Streaming with ~300 ms time-to-first-audio on a laptop CPU Zero-shot voice cloning from 5-20 seconds of reference audio 0.24 RTF offline / 0.21 RTF streaming on an M3 CPU, 0.07 RTF on an H100»)
- Sopro V2 Turbo запускается в браузере через ONNX; доступна полностью браузерная демонстрация без сервера. (подтверждено первоисточником: доказательство; «Runs in the browser via an ONNX runtime Local demo Run the model and open the demo with one command: uvx –from sopro soprotts serve If Sopro is already installed: soprotts serve Then navigate to http://localhost:7860 . The model downloads on first use and stays in the Hugging Face cache. Sopro selects CUDA or CPU automatically and defaults to CPU on macOS (pass –device mps explicitly to use MPS). Use soprotts serve –help for model, device, port, and CPU int8 options. Browser demo There is also a fully in-browser demo with no server involved: https://samuel-vitorino.github.io/sopro/ .»)
- Локальная демонстрация запускается одной командой, модель скачивается при первом использовании, сохраняется в кэше Hugging Face и автоматически выбирает CUDA или CPU. (подтверждено первоисточником: доказательство; «Run the model and open the demo with one command: uvx –from sopro soprotts serve If Sopro is already installed: soprotts serve Then navigate to http://localhost:7860 . The model downloads on first use and stays in the Hugging Face cache. Sopro selects CUDA or CPU automatically and defaults to CPU on macOS (pass –device mps explicitly to use MPS).»)
- На мобильных устройствах используется квантованная версия, поэтому качество может быть немного ниже локальной демонстрации, а устройства с малым объёмом памяти могут аварийно завершить работу. (подтверждено первоисточником: доказательство; «On mobile the model is quantized, so results can be slightly below the local demo, and devices with low memory may crash.»)
- В модель не добавили водяные знаки: автор считает, что в открытом конвейере инференса их легко удалить, и отдельно просит не использовать модель для имитации людей. (подтверждено первоисточником: доказательство; «We did not add watermarking: with an open-source inference pipeline it would be trivial to remove, so it would only provide a false sense of safety. Please use the model for good: do not impersonate people.»)
- Минималистичный текстовый фронтенд может неверно произносить некоторые сокращения, числа и символы, а смешение языков внутри одного предложения названо слабым местом. (подтверждено первоисточником: доказательство; «The text frontend is deliberately minimal, so some abbreviations, numbers, and symbols may not be pronounced correctly. Prefer words: 1 + 2 should be written one plus two . That said, Sopro generally reads common abbreviations like “CPU” or “TTS” fine, and you can put a language-specific normalizer in front of it. Mixed-language text is a weak spot: words from one language inside a sentence of another (an English product name in a Portuguese sentence, for example) can be mispronounced.»)
- Потоковый тракт не совпадает побитово с офлайн-трактом; для лучшего качества автор рекомендует офлайн-режим, а код обучения в ближайшее время выпускать не планирует. (подтверждено первоисточником: доказательство; «The streaming path (chunked attention and the causal vocoder) is not bit-exact with the offline path. For best quality, prefer the offline path. We are not planning to release the training code in the near future due to its complexity.»)
Первоисточники:
оценка 57.8 · тип release · ревизия 1 · истории st-1k1kc7d