В репозитории Qwen3.8-Flash-Next-FP8 доступны FP8-квантованные веса модели, представленные с пониженной точностью, и файлы конфигурации для дообученной модели в формате Hugging Face Transformers.

Для квантования использован метод FP8 с блоками по 128 значений, а показатели производительности, по данным карточки, почти не отличаются от исходной модели. Артефакты совместимы с Hugging Face Transformers, vLLM, SGLang и TokenSpeed.

Проверка утверждений:

  • В репозитории Qwen3.8-Flash-Next-FP8 доступны FP8-квантованные веса и файлы конфигурации для дообученной модели в формате Hugging Face Transformers. (подтверждено самой публикацией: доказательство; «This repository contains FP8-quantized model weights and configuration files for the post-trained model in the Hugging Face Transformers format.»)
  • Для квантования использован метод FP8 с блоками по 128 значений, а показатели производительности почти не отличаются от исходной модели. (подтверждено самой публикацией: доказательство; «The quantization method is fine-grained fp8 quantization with block size of 128, and its performance metrics are nearly identical to those of the original model.»)
  • Артефакты совместимы с Hugging Face Transformers, vLLM, SGLang и TokenSpeed. (подтверждено самой публикацией: доказательство; «These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, TokenSpeed, etc.»)

Публикации:

Первоисточники:

оценка 17,0 из 100 · тип: релиз · обновление 4