真正的突破并非更大,而是 Cursor 的数据
Grok 4.5 并非其前身的轻量微调——一次独立技术分析估计它运行在一个新预训练的‘V9’基础模型上,尽管 xAI 尚未正式确认这一说法。但更具决定性的输入是数据,而非模型规模。在 xAI 据报收购 Cursor(估值接近 600 亿美元)[1]后,真实的开发者会话编码数据被纳入训练,Grok 4.5 现已内置于 Cursor 的所有订阅计划中,而非作为附加集成 [2]。这种优势在原始排行榜排名中体现不多,更多体现在效率上:在 SWE Bench Pro 上,Grok 4.5 每项任务仅使用 15,954 个 token,而 Claude Opus 4.8 使用了 67,020 个 [3],这一差距更可能是由实用的、真实世界的编码轨迹而非单纯的参数数量所解释。这比‘最大模型获胜’的故事更低调,但可能更具持久性:xAI 实质上通过购买获得了训练数据优势,而没有专属 IDE 关系的竞争对手难以复制。



