小众架构赢麻了！通过编辑功能让100B扩散模型飙出892 tokens/秒的速度！

2026-02-11 10:10:31

量子思考者

发布在

快讯

阅读：1589

2026年2月，蚂蚁集团发布LLaDA2.1扩散语言模型，实现892 tokens/秒的峰值速度，显著超越主流自回归模型。该模型采用双模式解码策略：极速模式适合高吞吐场景，质量模式保障高精度任务。通过可纠错编辑机制，模型先并行生成草稿再全局修正，解决了扩散模型的逻辑一致性问题。此外，团队首次在100B参数规模上成功应用强化学习，大幅提升指令遵循等任务表现。开源版本包括100B和16B两种规模，后者峰值速度超1500 tokens/秒，为轻量化部署提供支持。技术报告及代码已公开。

原文链接

本文链接：https://kx.umi6.com/article/32840.html

转载请注明文章出处

可纠错编辑