Исследовательская группа Kuleshov Group опубликовала техническое руководство по устройству диффузионных языковых моделей. Читатель узнает основы современных открытых моделей на материале лекций ICLR 2026 и MLSS 2026.

В отличие от поточной генерации по одному токену диффузионная модель начинает с черновика всей последовательности и многократно его уточняет. Она позволяет менять баланс скорости и качества, исправлять ошибки и использовать двунаправленный контекст.

При обучении двунаправленный трансформер восстанавливает случайно замаскированную долю токенов. При генерации модель начинает с полностью замаскированной последовательности, заполняет пробелы и снова маскирует часть предсказаний, оставляя с каждым раундом больше открытых токенов.

Проверка утверждений:

  • Исследовательская группа Kuleshov Group опубликовала техническое руководство по устройству диффузионных языковых моделей: оно разбирает основы современных открытых моделей, включая итеративное уточнение, постобучение и генерацию переменной длины, на материале лекций ICLR 2026 и MLSS 2026. (подтверждено первоисточником: доказательство; «An introduction to diffusion language models and the research advances that underlie today’s diffusion LLMs. We describe the building blocks of recent open-source models, starting from simple masking diffusion, and including techniques for iterative refinement, post-training, and variable-length generation. Material is adapted from workshop talks and lectures at ICLR 2026 and MLSS 2026.»)
  • В руководстве по сравнению с поточной генерацией по одному токену диффузионная модель начинает с черновика всей последовательности и многократно уточняет его, позволяя менять баланс скорости и качества, исправлять ошибки и использовать двунаправленный контекст. (подтверждено первоисточником: доказательство; «Diffusion models take a different approach. Rather than producing text one token at a time, they generate the whole sequence at once, starting from an initial guess and iteratively refining it over a number of steps. This unlocks several advantages: generation can trade off speed and quality by using fewer or more steps, mistakes can be corrected along the way, and every step attends to bidirectional context.»)
  • Авторы называют 2024 год переломным моментом, когда диффузионные модели сравнялись по качеству с авторегрессионными, и приводят Mercury 2, Gemma Diffusion и Nemotron Diffusion как выпуски отраслевых лабораторий к 2026 году. (подтверждено первоисточником: доказательство; «In 2024 the field reached a turning point, as diffusion models became competitive with autoregressive models on quality. By 2026, diffusion LLMs are a reality, with releases from leading industry labs — Mercury 2 (Inception Labs) , Gemma Diffusion (Google) , and Nemotron Diffusion (NVIDIA) .»)
  • Базовый рецепт диффузионной модели состоит из прямого процесса, который постепенно портит данные шумом, и обучаемого обратного процесса, который шаг за шагом устраняет это искажение. (подтверждено первоисточником: доказательство; «This forward/reverse recipe — corrupt data with noise, then learn to reverse the corruption one step at a time — is the blueprint for every diffusion model.»)
  • Для дискретного текста авторы предлагают считать шумом маскирование токенов и утверждают, что популяризированный их группой подход лежит в основе большинства открытых диффузионных языковых моделей. (подтверждено первоисточником: доказательство; «Below we introduce one simple yet effective approach that defines noise via masking. Our group popularized this approach, and it now forms the basis of most open-source diffusion language models.»)
  • Обучение masked diffusion описано как работа двунаправленного трансформера, который восстанавливает случайно замаскированную долю токенов; это похоже на BERT со случайной долей маскирования, но получившаяся модель является генеративной. (подтверждено первоисточником: доказательство; «We train the model by taking clean sequences, masking a random fraction of their tokens, and asking a bidirectional transformer to fill in the blanks. If you know BERT, this is essentially BERT with a randomized masking rate — but unlike BERT, the resulting model is generative.»)
  • При генерации модель стартует с полностью замаскированной последовательности и повторяет два действия: заполняет все пробелы, затем снова маскирует случайную часть предсказаний, оставляя в каждом раунде больше открытых токенов. (подтверждено первоисточником: доказательство; «Once we trained the unmasking transformer, we can generate text by starting from a fully masked sequence and repeating two steps many times: 1. Infilling: Ask the model to fill in every blank in the current sequence, yielding a rough guess of the clean tokens. 2. Remasking: Randomly re-noise the infilled sequence by replacing tokens with masks, but keep a few more tokens unmasked than in the previous round.»)
  • В прямом процессе masked diffusion расписание αt задаёт вероятность того, что токен останется незамаскированным: она падает от 1 для чистой последовательности до 0 для полностью замаскированной. (подтверждено первоисточником: доказательство; «The amount of masking is governed by a schedule αt — the probability that a given token remains unmasked — which plays the role of the signal-to-noise ratio in Gaussian diffusion. It starts at 1 when t=0 (a clean sequence) and decreases to 0 when t=1 (a fully masked sequence).»)
  • Обратный процесс заменяет неизвестную чистую последовательность предсказанием модели xθ(zt), заполняет маски и сохраняет часть заполненных токенов для следующего состояния. (подтверждено первоисточником: доказательство; «We therefore train a model xθ(zt) to predict the final clean sequence given the current state zt and apply the ideal reverse process q(zs∣zt,x) using the estimate xθ(zt) in place of the real x.»)
  • Для masked diffusion целевая часть ELBO сводится к кросс-энтропии между предсказаниями unmasking-трансформера и истинными токенами — то есть к функции потерь BERT, усреднённой по разным уровням маскирования. (подтверждено первоисточником: доказательство; «In other words, it is the cross-entropy loss between the predictions of our unmasking transformer and the true tokens — this is exactly the BERT loss! Differently from BERT, this loss is averaged over all t, and hence over all possible masking rates, rather than a single fixed one.»)

Первоисточники:

оценка 68.1 · тип guide · ревизия 1 · истории st-89df14