Ornith-1.5:DeepReinforce的自改进开源权重模型对阵Claude Opus 4.8
TECH

Ornith-1.5:DeepReinforce的自改进开源权重模型对阵Claude Opus 4.8

26+
Signals

战略概览

  • 01.
    DeepReinforce于2026年8月发布了Ornith-1.5,这是一个开源权重模型系列,涵盖9B、35B专家混合(mixture-of-experts)和397B专家混合变体,全部采用MIT许可证。
  • 02.
    该发布围绕DeepReinforce所谓的自改进强化学习循环构建,即模型生成并评分自己的训练信号,而非完全依赖静态的人工整理数据集进行训练。
  • 03.
    DeepReinforce的旗舰397B变体在Terminal-Bench 2.1上得分为86.1,高于Claude Opus 4.8的85.0;在SWE-Bench Verified上得分为86.0,高于Opus 4.8的85.8;在WideSearch上得分为80.8,远超Opus 4.8的72.9。
  • 04.
    关于此次发布的其他报道引用了更广泛的评估套件——包括GPQA Diamond、BrowseComp和DeepSWE基准的进展——DeepReinforce指出这些是证明自改进循环在多次训练中累积提升能力的证据。
  • 05.
    同一行业报道也提到了Ornith-1.5落后的基准测试:旗舰397B在Frontier-Bench v0.1上得分为13.5,而Claude Opus 4.8为21.1。

自改进循环的实际运作机制

DeepReinforce围绕所谓的自改进强化学习循环构建了Ornith-1.5:模型不再仅基于静态人工整理的数据集进行训练,而是生成候选解决方案、自行评分,并将质量最高的样本反馈到下一轮训练中[1]。这比DeepReinforce此前为其前代模型使用的“自搭建(self-scaffolding)”标签迈出了一大步——在自搭建模式下,模型虽能编写和修改自身的工具调用代码,但奖励信号仍来自固定的人工定义评分标准[2]。这一区别对判断未来能力提升的瓶颈至关重要:在自搭建模式下,实验室的能力受限于人类标注奖励数据的速度;而在自改进模式下,模型自身的评分成为训练循环的一部分,理论上使能力提升不再依赖人类标注的节奏。

该系列包含三种规模——9B、35B专家混合和旗舰级397B专家混合——均采用MIT许可证,这一点尤为引人注目,因为此前接近前沿水平的开源权重模型更多采用研究专用或定制商业条款,限制生产用途[3]。在一个声称可与闭源前沿模型竞争的397B模型上使用MIT许可证本身就是一个重要信号:它使得DeepReinforce的所有基准声明都面临独立复现的检验,而这正是发布后几天内发生的情况。

击败Opus 4.8——取决于你信任哪个基准

DeepReinforce公布的数据在纸面上毫无争议:旗舰397B在Terminal-Bench 2.1上以86.1战胜Claude Opus 4.8的85.0,在SWE-Bench Verified上以86.0战胜Opus 4.8的85.8,在WideSearch上以80.8大幅领先Opus 4.8的72.9[1][4]。另一些行业报道还引用了更广泛的测试套件——GPQA Diamond、BrowseComp,以及DeepSWE分数从Ornith-1.0的8.0跃升至Ornith-1.5的56.0(增长48分)——DeepReinforce以此作为证据,表明自改进循环能在多轮训练中持续积累优势,而非一次性高分[3][5]

然而独立测试结果则更为复杂。一个在X平台上传播的社区基准比较项目One-Spark显示,较小的Ornith-1.5-35B变体总得分为88.7,略低于同级别Qwen3.8-27B模型的89.4——Qwen以不到一分的优势胜出。按类别拆分的结果更值得玩味:Ornith在代码生成、长上下文处理、代理式工作流和工具使用方面领先,而Qwen在安全性、鲁棒性和规划能力上占优。Reddit用户自发汇总的基准表也从另一个角度呈现了类似结论——它显示Qwen3.8-27B在Terminal-Bench 2.1、SWE-bench Pro、DeepSWE和HLE等指标上领先,而这些正是DeepReinforce用来证明其自改进成效的关键DeepSWE指标;相比之下,Ornith-1.5的35B-A3B变体仅在NL2Repo上胜出,并在GPQA Diamond上打平。这些结果并未否定DeepReinforce的数据真实性——在其选择公布的基准上确实可复现——但“击败Opus 4.8”的说法高度依赖于所选的测试套件、模型规模以及你参考的是哪一方的复现结果。

发布中的裂痕——未训练的头部与身份问题

最具体的技術問題迅速浮現:Ornith-1.5的多令牌預測(MTP)解碼頭——負責實現更快推理的組件——實際上處於未訓練狀態,導致多個量化版本出現混亂或重複輸出,直到社區自行修補為止。這一單一缺陷對實際採用的阻礙遠超任何基準爭議,因為它直接影響了最有可能真正運行這些權重而非僅閱讀新聞的用戶群體。

還有一個更隱蔽的問題是Ornith-1.5底層究竟是什麼。社區逆向工程指向其基礎為Qwen 3.5/3.6,而非從零構建的模型——據報道,模型自身的配置文件明確標註為Qwen 3.5 MoE架構——且有Reddit分析指出Ornith不可能直接微調Qwen3.8-27B,因為Qwen從未公開發布過該特定基礎檢查點(僅發布過指令微調版本)。這並不否定自改進聲稱的有效性,但重新定義了其含義:該循環可能是在一個已有能力的基礎上進行真實改進,而非從無到有構建能力,這與「從零開始自改進」相比是一個更謙遜的主張。

然而最尖銳的批評集中在基本可靠性而非來源問題上。一位Reddit用戶報告稱,將397B模型量化至Q8後,在一組困難測試中徹底崩潰失敗,而同等規模的DeepSeek V4和Qwen3.8-27B均成功恢復並完成任務。另一人描述該模型在實踐中功能失常——大量基本工具調用失敗,包括簡單的文件讀寫操作,甚至嘗試寫入受限制的系統路徑。基準爭議是一回事;而關於模型無法履行最基本代理功能的報告則是另一層級的問題,這與整個發布所宣揚的「代理式編碼優越性」形成了尷尬對比。

從自搭建到自改進——DeepReinforce為何必須讓這一說法成立

將此次發布命名為「自改進」而非沿用DeepReinforce先前對該系列的稱呼「自搭建」[1],是一次刻意的敘事升級:這區別於「模型能編輯自身工具」與「模型能自我提升」,而後者若成立,才真正威脅到閉源前沿實驗室的定價策略與護城河。

正因如此,若被發現誇大比較結果,其代價也異常高昂。DeepReinforce選擇直接與Claude Opus 4.8對標[1],而非其他開源模型,這意味著其報告數字與社區復現之間的任何差距都會被視為對Anthropic前沿地位的直接挑戰——而每一項矛盾(One-Spark的分裂結果、Reddit的DeepSWE表格、功能失常報告)都被解讀為更廣泛地反駁「開源模型可匹敵閉源」這一命題,而不僅僅針對本次發布。MIT許可證使這種審視不可避免:DeepReinforce無法控制誰來測試其聲稱或如何測試。

历史背景

DeepReinforce早期的Ornith模型基於自搭建構建——代理可編寫和修訂自身的工具調用代碼——但仍基於固定的人工定義獎勵信號進行訓練。
DeepReinforce於2026年8月發布Ornith-1.5,作為首個明確圍繞自改進而非自搭建構建的模型系列,發布了9B、35B MoE和397B MoE權重,均採用MIT許可證。

关键关系图

关键玩家
主题

Ornith-1.5:DeepReinforce的自改进开源权重模型对阵Claude Opus 4.8

DE

DeepReinforce

The model's creator and license-setter; choosing to ship all three Ornith-1.5 sizes under MIT, rather than a research-only or custom commercial license, is what makes the benchmark dispute a community-adjudicated question rather than a closed one.

AN

Anthropic (Claude Opus 4.8)

The incumbent closed frontier model that Ornith-1.5's entire benchmark narrative is built against; every headline number DeepReinforce publishes is framed as a comparison to Opus 4.8, making Anthropic's positioning the yardstick the release lives or dies by.

TH

The open-weight developer community (Hugging Face, r/LocalLLaMA)

As the party actually running the weights outside DeepReinforce's own test harness, this community is where the 'beats Opus 4.8' claim gets stress-tested - and where the untrained decode head, benchmark discrepancies, and hands-on failure reports complicating the launch have all surfaced.

事实来源

5 条引用
  1. [1] Ornith-1.5 official release page
  2. [2] Ornith-1.5: Self-Improving Open-Weight Model
  3. [3] Ornith-1.5: Self-Improving Open Source Agentic Model
  4. [4] Ornith-1.5-397B on Hugging Face
  5. [5] DeepReinforce releases open source Ornith-1.5 family of models with solid benchmarks and MIT license

来源文章

Top 5

THE SIGNAL.

Analysts

獨立測試發現Ornith-1.5-35B在DeepSWE上的得分約為Qwen3.8-27B的一半,而該基準被認為比單文件補丁基準更難操縱,與Ornith的官方數據相矛盾。

Unnamed Hacker News commenter (via explainx.ai)
獨立基準測試者

評估自改進機制在機械層面屬實,非營銷話術,但標記出未經驗證的基礎模型血統、未確認的創始人歸屬,以及模型有時聲稱自己是Claude的「身份污染」問題。他們表示:「自改進循環在機械層面是真實的,而非營銷話術。」

explainx.ai
人工智能產業分析

Ornith-1.5的基準聲稱缺乏獨立第三方驗證,反映出對遞歸式自改進敘事的普遍懷疑。他們表示:「Ornith-1.5的基準尚未獲得獨立第三方驗證。」

byteiota.com
人工智能產業分析

強調Ornith-1.5作為一款在四項基準上擊敗Claude Opus 4.8的開源發布具有里程碑意義,儘管其為開源權重模型。

Rohan Paul
人工智能評論員,X/Twitter
The Crowd

Aloha! Introducing Ornith-1.5, a family of open-source LLMs spanning 9B Dense, 35B MoE, and 397B MoE, trained with self-improving strategies. It achieves state-of-the-art performance among open-source models of comparable size and delivers performance comparable to Claude Opus [4.8]...

@@ornith_6451

One-Spark benchmark results: Qwen3.8-27B: 89.4 Ornith 1.5 35B: 88.7 Ornith wins: Code 85.8 Long context 70.6 Agentic 95.2 Tool use 82.9 Qwen wins: Safety 97.3 Robustness 100 Planning 95.5 Qwen takes the overall crown by just 0.7. All verifiable and repeatable...

@@WescheNex1q212

Ornith-1.5 is taking open-source AI to another level. Self-improving models, strong reasoning/coding performance, and releases ranging from 9B to 397B MoE all under MIT. The self-improvement loop is especially interesting.

@@this_is_tasnim75

We have Q3.8 35B at home: 3x new Ornith 1.5 released

@u/AppealSame4367455
Broadcast
Ornith 1.5 35B-A3B: Self-Improving Model Goes General-Purpose: Run Locally

Ornith 1.5 35B-A3B: Self-Improving Model Goes General-Purpose: Run Locally

Run Ornith 1.5 35B Locally: 155 Tokens/Sec on Your GPU?

Run Ornith 1.5 35B Locally: 155 Tokens/Sec on Your GPU?

Ornith 1.5 (FREE) - The AI Agent That Trains Itself & BEATS Opus 4.8 & GLM 5.2!

Ornith 1.5 (FREE) - The AI Agent That Trains Itself & BEATS Opus 4.8 & GLM 5.2!