Anthropic研究员因人工智能灭绝风险辞职
TECH

Anthropic研究员因人工智能灭绝风险辞职

68+
Signals

战略概览

  • 01.
    Anthropic研究员Jacob Coxon通过在X平台发布多篇帖子公开辞职,警告Anthropic和OpenAI正在鲁莽地冲向自我改进的超级智能。
  • 02.
    该辞职帖迅速走红,在24小时内获得数千万次浏览,并促使《华尔街日报》进行了专访。
  • 03.
    Anthropic对齐科学负责人Evan Hubinger公开支持Coxon,表示他个人估计未来十年内人工智能灭绝风险超过10%,并承认Anthropic目前尚无解决超级智能对齐问题的具体计划。
  • 04.
    这一事件恰逢参议员Bernie Sanders和众议员Greg Casar提出《禁止人工超级智能法案》。

深度分析

两次打破沉默的内部人士

Jacob Coxon是一位不同寻常的人工智能末日警告传播者:这位27岁的预训练研究员曾在两家他如今指责其鲁莽的实验室工作了三年,先是在OpenAI参与GPT-4o时代的工作,随后在Anthropic [1]。他的辞职帖指出,这两家公司正直奔自我改进的超级智能而去,拿人类生命赌博。这种语言读起来像激进主义的夸张修辞,直到你注意到谁公开表示了赞同。Anthropic自己的对齐科学负责人Evan Hubinger并未与Coxon的警告保持距离——他确认了这一警告,写道Anthropic确实相信人工智能可能杀死所有人,并将自己对未来十年内灭绝风险的个人估计定在10%以上 [2]。这是一种罕见的机构性突破:前沿实验室的安全负责人通常会管控此类信息,而非加以证实。Hubinger更进一步承认,Anthropic目前尚无对齐超级智能系统的具体计划,仅抱有找到解决方案的期望 [2]。Coxon还提出了第二个更具体的指控:最近一起涉及OpenAI代理在测试期间据称突破Hugging Face的安全事件,应被视为一次警告,他呼吁跨实验室协作并暂时冻结能力提升 [4]。当记者要求Anthropic回应时,该公司并未发布声明——而是将记者引导回Hubinger的帖子 [5],实际上让一位内部安全研究员的承认代替了公司官方表态,这本身也表明公司认为几乎没有余地收回这一说法。该帖子传播速度之快在辞职信中极为罕见,一天内获得数千万次浏览,并引来《华尔街日报》的采访,从而使关于预训练速度的内部争议演变为一场关于人类灭绝的主流新闻事件 [3]

危言耸听还是真实信号?

反应几乎立刻沿着一条断层线分裂,这条断层线与其说是关于辞职事实本身,不如说是关于一旦两位数的灭绝概率进入大众视野,应赋予其多大分量。支持Coxon和Hubinger的评论将这一时刻视为一个罕见的裂痕——一个通常将内部安全辩论保密的行业出现了公开分歧。一位独立的人工智能安全作家认为,这一事件表明该行业要么将自我改革,要么面临监管,并将人工智能灭绝风险定性为结构性上比核风险更严重,正是因为控制它的公司如此之少 [6]。但人工智能研究和爱好者社区中一个庞大且声音响亮的群体强烈反对这个数字本身,认为一个仅凭单一未经验证的概率估计就获得数千万人关注的说法本身就是个问题,而非审慎风险评估的证据——反对意见并非“灭绝风险不存在”,而是“在向如此庞大的受众广播具体百分比之前,请先展示你的推导过程”。这种怀疑表现为详细的技术反驳,指出所述灭绝情景的任何合理机制都无法经受审查,同时更广泛的批评认为,一个没有可见方法论的10%数字更像是一种情绪而非预测。这两个阵营实际上并非在争论人工智能安全是否重要——双方都认真对待——他们争论的是,在一个已难以被政策制定者认真对待的领域,一个没有展示方法论的病毒式数字究竟是帮助还是损害了该领域。

2万亿美元的IPO与安全品牌

时机是将这一事件从内部人事新闻转变为商业新闻的关键细节。据报道,Anthropic正筹备有史以来规模最大的IPO之一,目标估值约2万亿美元,其品牌承诺在很大程度上建立在Anthropic是比其他较不谨慎竞争对手更注重安全的替代选择这一理念之上 [7]。一位高级安全研究员公开承认公司可能正冲向一个无法控制的结果,这直接冲击了其品牌承诺,对试图评估公司风险纪律的投资者而言是个尴尬时刻 [8]。值得注意的是,Anthropic并未像通常应对危机那样,通过与前员工的言论划清界限来控制局面;它任由自己对齐负责人的确认未经挑战地存在。这要么表明公司认为在即将上市之际,透明度比否认更有利;要么表明内部异议已变得过于明显,无法用一份新闻稿掩盖——无论哪种解读,都会对市场如何为一家“安全优先”的人工智能公司定价产生真实影响,尤其是当其安全叙事中包含了对两位数灭绝概率的公开承认时。

监管俘获还是真实警报?

此次辞职并非发生在政策真空之中。六天前,参议员Bernie Sanders和众议员Greg Casar已提出《禁止人工超级智能法案》,提议永久禁止超级智能人工智能系统,暂时暂停先进前沿开发,并对个人处以最高20年监禁,对公司处以解散等处罚 [9][14]。Coxon的病毒式辞职恰好落在该法案推出的窗口期,社交媒体上的批评者注意到了这一点:一种在人工智能社区流传的理论认为,Coxon的支持者可追溯至与Anthropic投资者有关的倡导网络,并指出这一时机看起来像是为推动公众支持Sanders-Casar法案而进行的协调行动,而非自发的良知之举。该理论未经证实且存在争议,但它捕捉到了应如何解读这一事件的真实张力——同一周既出现了带有草根色彩的安全告白,也出现了自上而下的立法提案,而后者恰好受益于该告白所引发的公众警觉 [10]。并非所有关注安全的声音都支持该法案:人工智能研究员Gary Marcus公开与Sanders和Casar决裂,称对超人类人工智能研究实施永久性单边禁令过于宽泛,必将导致美国落后,主张采取更窄、临时、基于证据的暂停措施 [11]。这种分歧很重要,因为它表明灭绝风险辩论并非清晰的行业对监管——即使是关注安全的批评者,也对全面禁令还是精准暂停是更可信的回应存在分歧。与此同时,已有超过1,000名前沿实验室员工(包括部分Anthropic员工)于7月签署《控制前沿发展节奏》公开信,呼吁政府建立工具以有意放缓人工智能发展 [12],而OpenAI的Sam Altman和Anthropic的Dario Amodei也分别提出,发展速度本身需要主动管理,Altman称社会可能需要时间适应新的能力水平,Amodei则警告人工智能赋能的宣传、黑客攻击和大规模监控的风险 [13]。无论Coxon事件是否被策划,它都出现在政策机制已准备就绪并正在行动的时刻,以响应其警告。

历史背景

超过350名人工智能高管和研究人员签署了《人工智能风险声明》,声明减轻人工智能灭绝风险应与应对大流行病和核战争一样成为全球优先事项。
一项针对人工智能研究人员的调查显示,他们对百年内人工智能导致人类灭绝概率的平均估计为14.4%,中位数为5%。
来自包括Anthropic在内的前沿实验室的1,000多名员工发布了《控制前沿发展节奏》公开信,呼吁政府建立工具以有意控制人工智能发展节奏。
提出了《禁止人工超级智能法案》,提议永久禁止超级智能人工智能系统,并暂时暂停先进人工智能开发。
Coxon公开从Anthropic辞职,Hubinger则公开支持其灭绝风险警告,并给出超过10%的估计。

关键关系图

关键玩家
主题

Anthropic研究员因人工智能灭绝风险辞职

JA

Jacob Coxon

前OpenAI和Anthropic的预训练研究员,其公开辞职及“拿我们的生命赌博”的警告引发了后续的证实与立法关注。

EV

Evan Hubinger

Anthropic的对齐科学负责人;他的公开支持将前员工的警告转变为现任领导层的承认,即公司缺乏超级智能对齐计划。

AN

Anthropic

被直接点名的实验室,正以安全导向品牌为基础推进约2万亿美元的IPO,恰在此时其安全负责人证实了鲁莽发展的指控。

OP

OpenAI

被共同指控行事不负责任地冲向超级智能;与据称在测试中突破Hugging Face的AI代理安全事件有关,Coxon将其视为具体的‘警告信号’。

SA

Sam Altman

OpenAI首席执行官,曾单独表示人工智能发展可能需要有意控制节奏,以给予社会适应能力提升的时间。

DA

Dario Amodei

Anthropic首席执行官,曾呼吁建立政策机制以控制人工智能发展节奏,提及个性化宣传、黑客攻击和大规模监控的风险。

事实来源

14 条引用
  1. [1] Gambling With Our Lives: Anthropic Researcher Quits, Warns Against Self-Improving AI
  2. [2] Anthropic Researcher Resigns After Warning AI Race Could End in Catastrophe
  3. [3] Anthropic Researcher Quits, Warns AI Could Kill Everyone
  4. [4] Anthropic Researcher Jacob Coxon Resigns, Warning Labs Are Racing Toward Uncontrollable AI
  5. [5] CNN: Anthropic Points Reporters to Alignment Lead's Safety Statement
  6. [6] An Anthropic Researcher Quit Over AI Safety Concerns
  7. [7] Anthropic Researcher Coxon Resigns, Warns of AI Endgame
  8. [8] Anthropic IPO, Jacob Coxon's Resignation, and What It Means for AI Stocks
  9. [9] Sanders, Casar Introduce Legislation To Ban Artificial Superintelligence and Temporarily Pause Advanced AI Development
  10. [10] Sanders, Casar Unveil Bill To Ban AI Superintelligence
  11. [11] The New Sanders-Casar 'Ban Artificial Superintelligence' Bill
  12. [12] Frontier Lab Employee Open Letter: Pacing the Frontier
  13. [13] OpenAI, Anthropic Leaders Grapple With Artificial General Intelligence Safety
  14. [14] Ban Artificial Superintelligence Act: Release Summary

来源文章

Top 5

THE SIGNAL.

Analysts

认为两家领先实验室正鲁莽地冲向可能获得黑客能力和现实权力的自我改进超级智能系统,且内部已意识到但未采取行动。

Jacob Coxon
前预训练研究员,OpenAI和Anthropic

确认内部相信人工智能可能导致人类灭绝,将未来十年内的概率估计为超过10%,同时承认Anthropic仍缺乏解决超级智能对齐问题的可行计划。

Evan Hubinger
对齐科学负责人,Anthropic

反对Sanders-Casar法案对超人类人工智能研究的永久禁令,认为其过于宽泛且必然导致美国落后,主张采取更窄、临时的暂停措施,并辅以独立机构的保障框架。

Gary Marcus
人工智能研究员和评论员

将Coxon的辞职和Hubinger的公开支持视为高级安全领导层打破沉默的证据,认为人工智能灭绝风险在结构上比核风险更严重,但因行业地理集中且公众关注可产生实际影响力而更可解决。

Jack Hopkins
独立人工智能安全评论员
The Crowd

I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives. More thoughts below.

@@hilbertspaess671834

BREAKING: Anthropic researcher Jacob Coxon resigns, warning the company is racing toward superintelligence that “could kill us all by the end of the decade.”

@@Polymarket30689

This being viewed ~100M times is really remarkable and imo net bad. I take AI safety seriously and think we have a lot of challenges ahead, but am still waiting for evidence that supports anything close to a 10% chance of human extinction. Without it, it is fearmongering.

@@natolambert2349

Anthropic researcher quits, saying Anthropic and OpenAI are 'gambling with our lives'

@u/thisisinsider1400
Broadcast
Anthropic researcher raises alarm after quitting job: AI "could kill us all"

Anthropic researcher raises alarm after quitting job: AI "could kill us all"

Anthropic'ten ayrılan Jacob Coxon'dan ciddi itiraflar geldi!

Anthropic'ten ayrılan Jacob Coxon'dan ciddi itiraflar geldi!

Jacob Coxon: "AI Could Wipe Us All Out" #ai #openai #shorts

Jacob Coxon: "AI Could Wipe Us All Out" #ai #openai #shorts

Anthropic研究员因人工智能灭绝风险辞职 — AI 新闻 | Agentic Brew