Jev 是 TypeSafe AI 推出的首个 System One 模型,这是一款前沿人工智能,采用名为 RLCD(用于校准决策的强化学习)的新方法进行训练,输出的是带有类型和校准置信度的决策,而非聊天文本,由 ChatGPT RLHF 的联合发明人 Diogo Almeida 构建。
TECH

Jev 是 TypeSafe AI 推出的首个 System One 模型,这是一款前沿人工智能,采用名为 RLCD(用于校准决策的强化学习)的新方法进行训练,输出的是带有类型和校准置信度的决策,而非聊天文本,由 ChatGPT RLHF 的联合发明人 Diogo Almeida 构建。

20+
Signals

战略概览

  • 01.
    Jev 是 TypeSafe AI 推出的首个 System One 模型——一款专为快速、结构化决策优化的前沿 AI,其输出可被软件直接消费,而非用于聊天。
  • 02.
    Jev 采用一种名为 RLCD(用于校准决策的强化学习)的新训练方法,旨在优化认知上诚实的概率,而非人类偏好的文本,这与 RLHF 和 RLVR 等大语言模型训练方法形成对比。
  • 03.
    TypeSafe 将 Jev 的价格定为每千个输入 token 0.042 美元(约每十亿 token 42 美元)——大约比典型的大语言模型每百万 token 定价低一个数量级——且不收取输出 token 的费用。
  • 04.
    TypeSafe AI 由 Diogo Almeida 创立,他此前在 OpenAI 工作,协助构建了支撑 ChatGPT 的指令跟随/RLHF 方法,并在推出 Jev 前经历了约两年的隐秘开发。

深度分析

并行决策,而非逐词生成文本

Jev 与所有主流大语言模型的根本区别在于其架构:它不是逐词生成答案,而是输出带有类型、结构化值和校准置信度分数的结果,并能并行回答多个问题,而非顺序生成,避免了传统大语言模型逐 token 生成带来的延迟 [2]。这与聊天机器人补全句子的计算模式有本质不同——它更接近分类器或路由器,而非 GPT 风格的文本生成。TypeSafe 将 Jev 定位于机器对机器的工作流,如路由、分类和欺诈检测,而非作为聊天替代品 [1]。Almeida 在其发布推文中直接承认了这一权衡:Jev 无法生成自由形式的文本,只能输出结构化决策,他将这一转变类比为 Transformer 的并行计算如何取代 RNN 的顺序处理——这是创始人自身宣传中的说法,而非独立的技术评估。

自我报告的数据与唯一独立测试的对比

TypeSafe 自身的营销声称 Jev 比对比的大语言模型快 193.6 倍、便宜 444.6 倍,并且输入价格比 Claude Fable 5.1 低 238 倍 [4]。其博客还单独声称端到端响应时间为 70–500 毫秒,据称比前沿大语言模型在同等任务上快 40–200 倍 [1]。迄今为止唯一公开的第三方测试来自 Every.to,发现差距虽小但仍显著:在一项直接对比的校对任务中,Jev 的中位响应时间为 0.35 秒,发现了 7 个故意缺陷中的 6 个,而 Claude Fable 5.1 耗时 8.83 秒,全部发现,且根据评测者的计算,Jev 的成本约为其 580 倍便宜 [2]。该评测者明确表示,在推荐生产使用前,希望进行更彻底的准确性检查 [2]。换句话说,迄今为止唯一的外部测试证实了差距确实存在且显著,但小于 TypeSafe 自身宣称的倍数,而准确性——而不仅仅是速度和成本——仍是未解之问。

Almeida 的论点:RLHF 天生倾向于过度承诺

RLCD 背后的动机直接源于 Almeida 对其参与发明的技术的批判。他认为,将模型优化为迎合人类偏好——正如 RLHF 为 ChatGPT 风格助手所做的那样——本质上会奖励听起来自信但未必准确的答案,使此类模型不适合无人监管的高风险自动化:“过度承诺是一种特性,这是设计使然。”[5]。TypeSafe 将 RLCD 定位为解决方案:一种在结构化任务上优化认知诚实、校准概率的训练方法,而非生成取悦人类评分者的文本 [1]。这一批判来自一位被公认为在 OpenAI 共同发明 RLHF 和 InstructGPT 的人 [3],因此该论点具有非同寻常的分量——它读起来不像局外人对聊天机器人的抱怨,而更像是内部人士对从一开始就嵌入该方法中的权衡的揭示。

早期、热门,但仍未验证

目前的反应是兴奋但明确持谨慎态度,且到处重复着相同的警告:这些是 TypeSafe 自己的数据,尚未在大规模上独立证实。报道尚新且稀少——这还是一则数小时内的新闻,Jev 仍处于等待名单后的早期访问阶段,因此大多数评论都是对公告本身的反应,而非实际测试。整体讨论的基调是积极的,并将核心理念——用并行结构化决策取代顺序文本生成——视为真正新颖,其可信度很大程度上源于 Almeida 在 ChatGPT 时代的资历。但怀疑也存在:一种常见的反应是观望态度,希望看到这些主张在真实项目中得到验证后再予以信任。这种组合——技术上的吸引力加上明确的未经验证主张警告——与当前更多是理念而非实绩的发布状态一致。

历史背景

Almeida 共同撰写了 InstructGPT 研究,并协助开发了 RLHF,这项技术被认为使 ChatGPT 能够遵循人类意图。
TypeSafe AI 成立后经历了约两年的隐秘开发,才公开发布其首个模型 Jev。
此前存在一种不相关的技术也缩写为 RLCD——即用于无监督对齐语言模型的“对比蒸馏强化学习”(Reinforcement Learning from Contrast Distillation),与 TypeSafe 的“用于校准决策的强化学习”(Reinforcement Learning for Calibrated Decisions)命名冲突,但两者是不同的方法。

关键关系图

关键玩家
主题

Jev 是 TypeSafe AI 推出的首个 System One 模型,这是一款前沿人工智能,采用名为 RLCD(用于校准决策的强化学习)的新方法进行训练,输出的是带有类型和校准置信度的决策,而非聊天文本,由 ChatGPT RLHF 的联合发明人 Diogo Almeida 构建。

DI

Diogo Almeida

TypeSafe AI 联合创始人/CEO;前 OpenAI 研究员,因共同发明 RLHF/InstructGPT(ChatGPT 和 GPT-4 背后的技术)而闻名;现公开批评 RLHF/聊天范式,并将 Jev 定位为面向自动化的替代方案。

TY

TypeSafe AI

初创公司,致力于构建用于机器对机器自动化的 System One 模型,而非用于对话聊天,团队成员来自 OpenAI、Google Brain、Meta/FAIR、Stripe、Airbnb、Plaid 和 Docker。

ER

Erik Gafni

TypeSafe AI 首席技术官;连续创业者,Ravel(用于 DNA 测序的多模态 AI)创始人,曾为 Invitae 和 Freenome 的早期员工。

SA

Sasha Sheng

TypeSafe AI 首席运营官;前 Meta/FAIR 研究工程师,曾从事 News Feed 和 AI 体验工作,在 NeurIPS/ECCV 发表过论文。

EV

Every.to

媒体机构,其评测者独立地将 Jev 与 Claude 进行基准测试,提供了对 TypeSafe 速度和成本主张的早期第三方验证——同时也揭示了其局限性。

事实来源

5 条引用
  1. [1] Introducing System One Models and Jev
  2. [2] Mini Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds
  3. [3] TypeSafe AI Team
  4. [4] TypeSafe AI
  5. [5] TypeSafe AI's Diogo Almeida on Why Overpromising Is by Design

来源文章

Top 1

THE SIGNAL.

Analysts

在 37 份文档上测试了 Jev,同时回答 21 个问题,耗时不到 0.7 秒,成本约四分之一美分;发现其在标记问题方面有用,但在进一步验证前尚不具备生产就绪条件。

Mike Taylor
作家,Every.to

认为基于 RLHF 的助手模型在结构上被设计为过度承诺和产生幻觉,因为它们优化的是在人类评分者面前显得正确,而真正的自动化需要以校准决策为目标。“过度承诺是一种特性。这是设计使然。”

Diogo Almeida
TypeSafe AI 联合创始人/CEO(前 OpenAI 员工)
The Crowd

After co-inventing ChatGPT, I kept asking myself: why have superhuman chat models not led to AGI? I've spent the last 2 years in stealth building a new way to train models (RLCD), and a new type of frontier AI model that we are releasing today: Jev • 20-200x faster • 40-400x

@@CompleteSkeptic25147

The gains aren't free: Jev can't generate text Comparing Jev vs LLMs side-by-side makes the trade-off clear Fun fact: replacing sequential computation with parallel is the same way Transformers leapfrogged RNNs

@@CompleteSkeptic1995

Another brilliant launch for developers: and its 20-200x faster than LLMs because it skips token-by-token generation entirely. TypeSafe AI just launched Jev, > 20-200x faster >40-400x cheaper (w/ output tokens free) > Frontier composable intelligence optimized for decisions So

@@rohanpaul_ai57

Diogo Almeida ex-OpenAI et fondateur de TypeSafe AI. lance Jev : un nouveau type de modèle conçu pour l'automatisation, annoncé comme 100 fois plus rapide et "incapable d'halluciner"

@u/DomLant4
Broadcast
Jev: The Model That Killed Chat GPT's Core Idea? RLCD Explained

Jev: The Model That Killed Chat GPT's Core Idea? RLCD Explained

TypeSafe AI Unveils Jev: Structured Decision Model

TypeSafe AI Unveils Jev: Structured Decision Model

시스템 원 모델과 Jev: 빠른 구조화된 AI 의사결정의 주장과 한계

시스템 원 모델과 Jev: 빠른 구조화된 AI 의사결정의 주장과 한계

Jev 是 TypeSafe AI 推出的首个 System One 模型,这是一款前沿人工智能,采用名为 RLCD(用于校准决策的强化学习)的新方法进行训练,输出的是带有类型和校准置信度的决策,而非聊天文本,由 ChatGPT RLHF 的联合发明人 Diogo Almeida 构建。 — AI 新闻 | Agentic Brew