架构押注:100 多个小模型而非一个大模型
Modulate 的技术主张基于一项特定的架构选择。Velma 的集成听觉模型(ELM)并未依赖单一大型基础模型,而是结合了 100 多个专门化的音频模型,直接从原始音频而非文本转录中分析情感、语调、意图和合成语音 [1]。该公司声称,这种集成方法的效率最高可达单一大模型方法的 1000 倍,真实阳性识别准确率高出一倍,且假阳性数量减少 7 倍——尽管需要指出的是,这些是 Modulate 自行发布的基准数据,而非来自独立研究的引用结果 [2]。新融资将专门用于扩展该架构:包括人工智能/机器学习研究、产品与工程团队扩编、开发者关系建设,以及推出新的 API 和部署选项,以便外部开发者可直接集成 Modulate 的音频模型,而不必自行构建 [1]。


