MS student
Computer Science, Peking University
01 / BIO
Computer Science, Peking University
EECS, Peking University
02 / RESEARCH
围绕扩散模型的语言、多模态生成与后训练展开。
Bi-VRL 面向多模态扩散语言模型,在“扩散时间步”和“推理步骤”两个维度进行强化学习优化,并以细粒度多模态对齐检查推理过程是否有视觉依据。
一个统一的多模态扩散基础模型:用共享的概率建模方式处理文本推理、多模态理解与文生图,并通过 UniGRPO 统一不同任务的后训练。
提出 TraceRL,把扩散模型的推理轨迹纳入强化学习后训练,并利用扩散式价值模型提升稳定性,用于数学、代码与长思维链推理。
03 / NOTES
从“逐字续写”之外,理解另一种文本生成方式。
训练时,模型看到一段被逐渐遮盖或扰乱的文本,并学习恢复原始 token。生成时则从一片噪声或大量 [MASK] 开始,经过多轮去噪得到完整答案。
自回归语言模型通常一次预测下一个 token;扩散语言模型可以在一轮中同时更新多个位置,也能回头修正早期结果。这带来并行解码与全局规划的潜力。
迭代修改适合推理、编辑与多模态统一,但如何选择去噪步数、分配每一步的训练奖励,以及高效使用缓存,仍是这个方向的重要课题。
[MASK] [MASK] models [MASK] languageDiffusion [MASK] models generate languageDiffusion language models generate language.04 / CONTACT
合作关系:Ling Yang · Ye Tian