DiffusionGemma Technical Report
DiffusionGemma fine-tunes Gemma 4 into a discrete-diffusion language model that generates roughly 1,500 tokens per second on an H100 by refining 256-token blocks in parallel. HN discusses its promising local-inference speed, implementation challenges, hardware tradeoffs, and quality gaps versus autoregressive models.