Agention опубликовала релиз AP-квантов Qwen3.8-Flash-Next для штатной версии llama.cpp. Карточка объясняет смешанную квантизацию и помогает выбрать сборку по объёму, VRAM и качеству.

В сборках используются разные типы квантизации для разных групп тензоров. Плотная основа с attention, GDN, hyper-connections и shared experts сохраняется в Q6_K или Q8_0, а основное сжатие приходится на MoE-экспертов.

Размеры сборок составляют от 80,72 до 112,51 ГиБ. Заявленное потребление VRAM находится в диапазоне от 53,90 до 76,75 ГиБ.

Таблица per_layer_token_embd содержит 51,2 млрд параметров и занимает около трети файла. Её перенос в RAM почти не снижает скорость и исключает таблицу из бюджета VRAM.

Проверка утверждений:

  • Agention опубликовала материал типа release с AP-квантами Qwen3.8-Flash-Next для штатной версии llama.cpp; карточка объясняет принцип смешанной квантизации и помогает выбрать сборку по объёму, VRAM и качеству. (подтверждено первоисточником: доказательство; «agentionai / Qwen3.8-Flash-Next-AP-GGUF like 10 Text Generation GGUF qwen3.8-flash-next qwen4exp imatrix conversational License: qwen-community-1.0 Model card Files Files and versions xet Community 1 Deploy Copy to bucket new Use this model Qwen3.8-Flash-Next AP GGUF Agention Precision (AP) quants of Qwen/Qwen3.8-Flash-Next : space-efficient, mainline llama.cpp compatible — standard quant types only, no fork needed.»)
  • В каждой сборке применяются разные типы квантизации для разных групп тензоров: плотная основа, включая attention, GDN, hyper-connections и shared experts, сохраняется в Q6_K/Q8_0, а основное сжатие приходится на MoE-эксперты. (подтверждено первоисточником: доказательство; «Each tier uses a different quant type per tensor group rather than one type throughout: the dense backbone (attention, GDN, hyper-connections, shared experts) is held at Q6_K / Q8_0 because it is read on every token and is far more sensitive than its size suggests, while the MoE experts — where the parameters actually are — carry the compression.»)
  • Релиз включает пять сборок размером от 80,72 до 112,51 ГиБ: заявленное потребление VRAM составляет от 53,90 до 76,75 ГиБ, а отклонение perplexity от неквантованного эталона — от +3,74% до +0,68%. (подтверждено первоисточником: доказательство; «AP-IQ3_XXS AP-IQ3_XXS/ 80.72 GiB 53.90 GiB 4.1566 +3.74% 0.0787 90.22% AP-IQ4_XS AP-IQ4_XS/ 84.24 GiB 57.42 GiB 4.1572 +3.75% — — AP-Q4_K_XL AP-Q4_K_XL/ 94.20 GiB 67.38 GiB 4.0536 +1.17% — — AP-Q5_K_M AP-Q5_K_M/ 103.57 GiB 76.75 GiB 4.0468 +1.00% 0.0204 94.95% AP-Q5_K_XL AP-Q5_K_XL/ 112.51 GiB 76.75 GiB 4.0339 +0.68% ref ref»)
  • Показатели KLD и совпадения top-1 измерены относительно AP-Q5_K_XL, а не неквантованной модели, которая не помещалась на оборудовании авторов, поэтому эти числа нельзя напрямую сравнивать с KLD из других публикаций. (подтверждено первоисточником: доказательство; «** KL-divergence and top-1 agreement are measured against AP-Q5_K_XL , not against the unquantized model (it does not fit on our hardware). They rank these tiers against each other correctly, but are not comparable to KLD figures published elsewhere.»)
  • Авторы рекомендуют AP-Q5_K_XL при достаточном объёме диска: её VRAM-потребление такое же, как у AP-Q5_K_M, дополнительные 8,94 ГиБ приходятся на более точную n-gram-таблицу в оперативной памяти, а переход на AP-Q5_K_M меняет лучший токен примерно в одном предсказании из двадцати. (подтверждено первоисточником: доказательство; «AP-Q5_K_XL unless you are short of disk. It has the same VRAM cost as AP-Q5_K_M — the extra 8.94 GiB is the higher-precision n-gram table, which lives in host RAM — and it is meaningfully better: dropping to AP-Q5_K_M changes the top token on 1 prediction in 20.»)
  • AP-Q4_K_XL позиционируется как оптимальный по стоимости вариант с отклонением примерно 1,2% от эталона при размере 94 ГиБ; AP-IQ3_XXS названа минимальной устойчивой сборкой и заменой AP-IQ4_XS с сопоставимой perplexity при экономии 3,5 ГиБ. (подтверждено первоисточником: доказательство; «AP-Q4_K_XL is the value pick, within ~1.2% of reference at 94 GiB. AP-IQ3_XXS is the smallest that still holds up, and supersedes AP-IQ4_XS (same perplexity within noise, 3.5 GiB smaller). AP-IQ4_XS is kept for anyone already depending on it.»)
  • Таблица per_layer_token_embd содержит 51,2 млрд параметров и занимает около трети файла; перенос её в RAM почти не снижает скорость и исключает её из бюджета VRAM. (подтверждено первоисточником: доказательство; «per_layer_token_embd is a 51.2 B-parameter hash-embedding table — a third of the file. It is only ever gathered from , never multiplied, so putting it in host RAM costs little speed and takes it entirely out of your VRAM budget:»)
  • На Radeon 8060S авторы измерили при выносе n-gram-таблицы 282 против 285 токенов/с на обработке промпта и 24,4 против 25,4 токена/с на генерации — несколько процентов скорости в обмен на экономию 36 ГиБ VRAM. (подтверждено первоисточником: доказательство; «Measured cost on a Radeon 8060S: prompt processing 282 vs 285 t/s and generation 24.4 vs 25.4 t/s against a smaller tier held fully on the GPU — i.e. a few percent, in exchange for 36 GiB of VRAM.»)
  • Режим mmap обязателен, если файл модели больше суммарного объёма RAM и VRAM. (подтверждено первоисточником: доказательство; «–load-mode mmap is required if the file is larger than RAM + VRAM.»)
  • Опциональный Vulkan-форк авторов ускоряет длинный контекст: в тесте AP-IQ4_XS на глубине 32768 prefill составил 194,2 против 70,6 токена/с, а генерация — 22,46 против 11,85 токена/с у штатной версии. (подтверждено первоисточником: доказательство; «AP-IQ4_XS , Radeon 8060S / Vulkan, llama-bench , q8_0 KV, identical weights on both sides: depth prefill (fork) prefill (stock) generation (fork) generation (stock) 512 315.9 245.6 25.05 26.39 2048 302.8 219.7 24.75 22.70 8192 275.1 153.0 25.07 18.67 16384 232.4 107.4 22.91 16.22 32768 194.2 70.6 22.46 11.85»)
  • По измерениям авторов, от контекста 512 до 32k скорость генерации штатной версии падает на 55%, а форка — на 10%; причины связаны с переходом индексатора sparse attention на однопоточный CPU-путь и повторным вычислением ключей сводки блоков на каждом шаге. (подтверждено первоисточником: доказательство; «Stock decays 55% in generation from 512 to 32k; the fork decays 10%. Two causes, both fixed on the fork: the sparse-attention indexer asks for a top-k larger than a single Vulkan workgroup can serve, so past ~1024 cached tokens the op silently falls back to a single-threaded CPU path once per QSA layer per token; and the indexer recomputed its block summary keys over the whole context every step instead of caching them.»)
  • Флаг –ngram-on-disk позволяет читать строки таблицы прямо из файла: для AP-Q4_K_XL заявлены 70,5 ГиБ VRAM и почти нулевое потребление оперативной памяти против примерно 23 ГиБ RAM при переносе таблицы на CPU. (подтверждено первоисточником: доказательство; «The fork also accepts –ngram-on-disk , which reads the table’s rows straight from the file instead of holding them in host RAM at all: 70.5 GiB VRAM and ~0 host for AP-Q4_K_XL , versus ~23 GiB resident with the -ot approach above.»)

Публикации:

Первоисточники:

оценка 72.3 · тип release · ревизия 1 · истории st-fueioq