架构:Inkling 实际上从 DeepSeek 借鉴了什么
Inkling 的设计公开承认借鉴了 DeepSeek V3,但称其为复制并不准确 [5]。其底层架构是一个仅解码器的 66 层 Transformer,每 MoE 层包含 256 个路由专家和 2 个共享专家,每个 token 激活 6 个路由专家 [2]。正是这种专家路由密度,使得在 9750 亿总参数下仍能实现每 token 410 亿激活参数。与以往 MoE 设计的关键区别在于其基于 sigmoid 的路由器,采用无辅助损失的负载均衡机制,即训练过程中不惩罚路由损失——这是 DeepSeek V3 首创的技术,Thinking Machines 对其进行了适配 [2]。
注意力机制采用滑动窗口与全局注意力的交错结构,比例为 5:1,在大多数序列位置上以效率换取全上下文计算能力 [2]。多模态在 token 层级融合,无需独立编码器塔:音频以 dMel 谱图形式输入,图像通过四层 hMLP 编码器转换为 40x40 像素块,直接馈入同一 token 流 [2]。训练使用混合优化器——Muon 用于大矩阵权重,Adam 用于其余所有参数——在 NVIDIA GB300 NVL72 系统上完成 [3]。结合源自成熟中国 MoE 模型的架构与美国构建的硬件基础设施,该模型在不到 9 个月内从零完成训练 [1]。


