Репозиторій Qwen3.8-Flash-Next-FP8 містить ваги моделі, квантизовані у FP8, і файли конфігурації донавченої моделі у форматі Hugging Face Transformers. FP8 — це формат 8-бітних чисел з рухомою комою.
Артефакти сумісні з Hugging Face Transformers, vLLM, SGLang і TokenSpeed. Квантування використовує блоки по 128, а його показники продуктивності майже збігаються з показниками вихідної моделі.
Перевірка тверджень:
- Репозиторій Qwen3.8-Flash-Next-FP8 містить ваги моделі, квантизовані у FP8, і файли конфігурації донавченої моделі у форматі Hugging Face Transformers. (підтверджено самою публікацією: доказ; «This repository contains FP8-quantized model weights and configuration files for the post-trained model in the Hugging Face Transformers format.»)
- Артефакти сумісні з Hugging Face Transformers, vLLM, SGLang і TokenSpeed. (підтверджено самою публікацією: доказ; «These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, TokenSpeed, etc.»)
- Квантування використовує блоки по 128, а його показники продуктивності майже збігаються з показниками вихідної моделі. (підтверджено самою публікацією: доказ; «The quantization method is fine-grained fp8 quantization with block size of 128, and its performance metrics are nearly identical to those of the original model.»)
Публікації:
Першоджерела:
- https://huggingface.co/Qwen/Qwen3.8-Flash-Next-FP8
- https://huggingface.co/spiritfather/Qwen3.8-Flash-Next-heretic-2-GGUF
оцінка 27,8 зі 100 · тип: реліз · оновлення 3