Репозиторій Qwen3.8-Flash-Next-FP8 містить ваги моделі, квантизовані у FP8, і файли конфігурації донавченої моделі у форматі Hugging Face Transformers. FP8 — це формат 8-бітних чисел з рухомою комою.

Артефакти сумісні з Hugging Face Transformers, vLLM, SGLang і TokenSpeed. Квантування використовує блоки по 128, а його показники продуктивності майже збігаються з показниками вихідної моделі.

Перевірка тверджень:

  • Репозиторій Qwen3.8-Flash-Next-FP8 містить ваги моделі, квантизовані у FP8, і файли конфігурації донавченої моделі у форматі Hugging Face Transformers. (підтверджено самою публікацією: доказ; «This repository contains FP8-quantized model weights and configuration files for the post-trained model in the Hugging Face Transformers format.»)
  • Артефакти сумісні з Hugging Face Transformers, vLLM, SGLang і TokenSpeed. (підтверджено самою публікацією: доказ; «These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, TokenSpeed, etc.»)
  • Квантування використовує блоки по 128, а його показники продуктивності майже збігаються з показниками вихідної моделі. (підтверджено самою публікацією: доказ; «The quantization method is fine-grained fp8 quantization with block size of 128, and its performance metrics are nearly identical to those of the original model.»)

Публікації:

Першоджерела:

оцінка 27,8 зі 100 · тип: реліз · оновлення 3