MDRSS · MARKDOWN SNAPSHOT
0.0/10

DLLM RL

We also introduce a diffusion-based value model that reduces variance and improves stability during optimization. Based on TraceRL, we derive a series of diffusion language models, TraDo, which achieve state-of-the-art performance on math and coding reasoning tasks.

#llm-engineering / card #1891★ 0◌ 0snapshot 2026-08-04