【大屏时代】首页 > 3D快报内容详情

上海AI Lab与上交大抛出NCP预训练新范式,8.9B隐空间模型用一半Token追平对手

1小时前 4 大屏时代



逐词预测这个大模型时代的老套路,被上海人工智能实验室与上海交通大学人工智能学院LUMIA Lab团队撕开了一道口子。他们提出全新预训练任务下一个概念预测(NCP),并顺势推出全球首个8.9B规模的离散隐空间基座模型NCP-ArchPreview,把训练效率的账本重新算了一遍。


这组数字相当刺眼。模型基于5.73T的Dolma- 3 语料预训练,却只用掉51.3%的Token预算就追平了OLMo-3-7B的最终预训练Loss,等效收敛速度提升1. 95 倍,计算帕累托效率系统性提升1. 74 倍;到了下游任务上,综合表现领先2. 45 分,其中GSM8K数学推理一口气涨了近 6 分。也就是说,别人烧完一整箱算力才够到的位置,它半箱油就到了。


NCP-ArchPreview的骨架是一条三段式隐空间概念处理流水线。它先用乘积量化搭起一个超大的离散概念表征空间,再通过可微的下一个概念预测、因果防泄漏反馈机制和分层残差路由,实现对未来概念的显式建模——不再是盯着下一个词硬猜,而是先想清楚下一个概念长什么样。这种转向隐空间概念预测的打法,从根本上打破了逐词预测范式。


惊喜还不止于预训练。团队发现,只微调17M的隐空间参数就能超越LoRA,而且没有遗忘的老毛病;训练吞吐量上去了,显存占用也降下来。把这个概念表征注入草稿模型后,推测解码的平均接受长度提升4.17%,在代码任务上更是涨到7.59%,为推理加速开了条新路。技术报告里团队还大方分享了踩坑经验与解决方案,构建了千亿级代理指标筛选机制,并把包含全程阶段性Checkpoint、评测框架在内的全部资产一并开源。对于想要在模型微调和推理加速上找新突破口的研究者来说,这套隐空间思路无疑是一份刚出炉的路线图。



相关文章

相关标签: 上海AI Lab与上交大抛出NCP预训练新范式,8.9B隐空间模型用一半Token追平对手