以极小部分的算力实现万亿参数
Mistral在自家欧洲数据中心使用约3800至4000块Nvidia Grace Blackwell GPU,耗时约两个月从头训练了ML4[1]。科学副总裁Pierre Stock将此描述为一种刻意追求效率的策略,称其计算量比中国竞争对手“少两到三倍”,也“显著低于”西方闭源实验室[2]。这一说法至关重要,因为它正是Mistral的核心卖点:与其在原始算力上与OpenAI或Google比拼烧钱,该公司更相信通过架构和训练技术,可以用更少的GPU预算缩小差距。这也同时构成了一种主权主张——完全在欧洲境内、使用Mistral自主控制的硬件进行训练,而不依赖外国超大规模云服务商。然而,“算力更少、效果相当”这一说法能否在完整权重发布后经得起独立基准测试的检验,仍是该公司信誉所系的关键问题。


