完全由后训练构建的升级
DeepSeek在V4-Flash-0731上最关键的决策是它没有改动什么:即模型架构。该模型保留了与4月预览版完全相同的2840亿总参数、混合专家设计中的130亿激活参数以及100万token上下文窗口[2]。所有基准测试的提升都来自于更密集的后训练,重点集中在编码、智能体工作流和工具使用上,而非任何新的预训练过程[1]。
这些提升幅度之大,看起来仿佛是一个全新的模型类别。Terminal-Bench 2.1从72.1(前代V4-Pro预览版)跃升至82.7,NL2Repo从38.5升至54.2,Cybergym从52.7升至76.7,Toolathlon-Verified从55.9升至70.3[1]。对于那些认为前沿进展必须依赖扩大参数或算力的人来说,这是一个惊人的结果——同样的权重通过不同的再训练方式,大幅缩小了与更大更昂贵系统的差距。


