一次重训,而非重建:DeepSeek 如何在不推出新模型的情况下实现智能体能力跃升
DeepSeek-V4-Flash-0731 并非全新模型发布,而是在 2026 年 4 月发布的预览版所采用的完全相同的 2840 亿参数、130 亿激活参数 MoE 架构和 100 万 token 上下文窗口基础上进行的重新后训练 [1]。该公司自己的更新日志明确指出,架构和规模完全相同,仅后训练堆栈发生了变化 [1]。然而,此次重训带来的基准测试提升之大,堪比代际跃迁:Terminal Bench 2.1 从 61.8 提升至 82.7,而更具挑战性的智能体编码基准 DeepSWE 则从 7.3 跃升至 54.4 [2]。
OfficeChai 的分析将其精准定义为仅通过训练升级而非推出新模型 [3],BiGGo 的报道则指出其机制是通过对现有权重应用强化学习和基于蒸馏的调优,而非重新预训练 [4]。这一区别至关重要:DeepSeek 正在证明,仅通过后训练即可获得显著的智能体能力提升,而无需承担训练全新基础模型的资本成本——相比那些通过发布新架构来追逐相同提升的竞争对手,这是一种更低成本、更快速的杠杆。



