Хранилището Qwen3.8-Flash-Next-FP8 съдържа квантизирани във FP8 тегла на модела и конфигурационни файлове за дообучения модел във формат Hugging Face Transformers. FP8 е формат с 8-битови числа с плаваща запетая.

Артефактите са съвместими с Hugging Face Transformers, vLLM, SGLang и TokenSpeed. Квантизирането използва блокове от 128, а показателите му за производителност са почти еднакви с тези на оригиналния модел.

Проверка на твърденията:

  • Хранилището Qwen3.8-Flash-Next-FP8 съдържа квантизирани във FP8 тегла на модела и конфигурационни файлове за дообучения модел във формат Hugging Face Transformers. (потвърдено от самата публикация: доказателство; «This repository contains FP8-quantized model weights and configuration files for the post-trained model in the Hugging Face Transformers format.»)
  • Артефактите са съвместими с Hugging Face Transformers, vLLM, SGLang и TokenSpeed. (потвърдено от самата публикация: доказателство; «These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, TokenSpeed, etc.»)
  • Квантизирането използва блокове от 128, а показателите му за производителност са почти еднакви с тези на оригиналния модел. (потвърдено от самата публикация: доказателство; «The quantization method is fine-grained fp8 quantization with block size of 128, and its performance metrics are nearly identical to those of the original model.»)

Публикации:

Първоизточници:

оценка 27,8 от 100 · вид: издание · актуализация 3