Diffusion language models генерують текст, починаючи з шуму або масок і ітеративно уточнюючи всю послідовність, що дає змогу виправляти помилки, генерувати паралельно та керувати властивостями виходу. Основу складає masked diffusion, який можна розглядати як генеративний BERT з випадковою часткою маскування, а далі стаття описує розширення: block diffusion для змінної довжини, encoder-decoder архітектури, remasking та uniform state diffusion для ітеративного уточнення, дистиляцію для прискорення семплювання і RL пост-тренування. Сучасні відкриті моделі, як-от LLaDA, Gemma Diffusion і Nemotron Diffusion, поєднують ці техніки і досягають якості, порівнянної з autoregressive моделями, при 5-10x швидшому інференсі. Автори аргументують, що diffusion може зробити для inference-time і post-training scaling те саме, що transformer зробив для pre-training, тобто прибрати послідовне вузьке місце.
Головне питання тепер, чи вистачить diffusion-моделям даних і обчислень, щоб довести перевагу за якістю, а не лише за швидкістю.