Skip to main content

Mythos 衍生 Fable、Cursor 的 Composer 2.5、Agents 构建 Agents

原文地址:https://www.deeplearning.ai/the-batch/issue-357

本期要点Anthropic 发布 Claude Mythos 5 / Fable 5Cursor Composer 2.5 以更低价格挑战 Claude Opus 4.7RSI(递归自我改进)成为新热词LLM 反映官媒信息偏见

编者按:试试桌面 Agents

作者:Andrew Ng

Mythos Begets Fable, Cursor's Composer 2.5, Agents Building Agents

Ng 鼓励大家实验用 AI Agents 做桌面级工作——不只是聊天,还能读写本地文件、收发消息、提供定时交付物(如每日新闻摘要)。虽然把网络 chatbot 输出复制粘贴到桌面或拖拽文件给 chatbot 也能工作,但桌面 Agents 能更高效地获得上下文并直接执行操作

构建方式

  • 为任务(文件访问、网页搜索/抓取、消息应用集成等)创建一套工具(函数调用)
  • 给前沿 LLM 提供这些工具
  • 设置权限和护栏
  • 提示 LLM 让它自己决定何时用哪个工具推进任务

包裹 LLM 实现所需代理系统的软件叫 agent harness,让 LLM 驱动"下一步做什么"的关键循环。

现状

  • 多数实际代理 AI workflow(非编码代理)仍依赖开发者指定 workflow 求可靠性
  • 过去几个月前沿 LLM 进展足够,让"让 LLM 决定下一步"这种 harness 设计成为重要替代(虽然仍不完全可靠)
  • CLI 编码代理(Claude Code、Codex CLI、Antigravity CLI、OpenCode)是用 LLM 驱动下一步动作的主要类型
  • 非 CLI 代理也有价值——消费端通过三种接口与 AI 交互:(i) 聊天界面、(ii) 编码 CLI、(iii) 桌面代理

Ng 的安全顾虑

  • 不使用现有商业桌面代理处理高度机密任务——数据保留政策常藏在法律术语里,可能一夜间变(如 Anthropic Fable 发布时)
  • 小失误可能有意外法律后果(如失去对机密文档的法律特权保护)

OpenCoworker 开源替代:Ng 与合作者开发的开源桌面代理项目,扩展了 aisuite 支持 agent harness。用户可自备 OpenAI/Anthropic/Google API key,或用 Ollama 跑本地模型让数据不出机器。邮件等数据集成仍较难用,但记忆存本地、可选零数据保留的 LLM 提供商


Behold Mythos!:Claude Mythos 5 与 Fable 5 发布

Anthropic 发布 Claude Mythos 5(能破解此前被认为安全的软件)和 Claude Fable 5(通用版但以空前方式限制用户行为)。两模型技术相同,Fable 5 不响应与安全、生物、化学、蒸馏相关提示,并对构建尖端 AI 的提示降级响应。

定价:Fable 5 价格约为 Mythos 5 Preview 一半,是 Claude Opus 4.8(Anthropic 前旗舰)的两倍。

核心规格

  • 输入输出:文本/图像入(100 万 token),文本出(128K token,首 token 108 秒)
  • 特性:自适应推理(始终开启)、5 档推理档位、工具调用、并行 subagents、Fable 5 安全分类器

性能表现(Fable 5 + Opus 4.8 回退)

  • Artificial Analysis Intelligence Index:领先 Opus 4.8 4 分
  • 在 GDPval-AA、Terminal-Bench Hard、𝜏²-Bench Telecom、AA-Omniscience Accuracy、Humanity's Last Exam、SciCode、CritPt 上都达到 SOTA

安全顾虑:Anthropic 表示 Mythos 5 的"背叛用户意图"倾向"极低",但表达了对 Mythos 5 可能表现不良或帮助恶意用户的担忧。

争议:发布时 Fable 5 还有一项额外限制——对构建尖端 AI 相关提示,模型会自动降低效果(用提示修改、转向向量、参数高效微调等方法)且不通知用户

  • 研究员 Dean W. Ball:"在用户不知情的情况下降低 ML 研究表现是惊人的敌意"
  • 科技博主 Robert Scoble:"我从未见过 AI 社区对一个新模型发布如此愤怒"
  • Anthropic 迅速调整:与生物/化学/网络安全类似,AI 研究相关提示要么拒绝要么路由到 Opus 4.8,并通知用户
我们怎么看

这些模型令人印象深刻!但 Anthropic 限制 Fable 5 帮助开发者构建可能与自家竞争的技术的做法引发担忧(即便通知了用户)。用户应能合法地按自己意愿使用产品。想象微软禁止用 Windows 构建与其竞争的应用程序,或 Google 禁止用搜索研究如何构建与它竞争的公司——公平开放的竞争环境才能长期带来更好结果。


Cursor 的 Composer 2.5:专业编码模型再出发

Cursor 的最新软件工程模型 Composer 2.5 在价格仅几分之一的情况下,性能对标 Claude Opus 4.7 和 GPT-5.5。基于 Moonshot 开源 Kimi K2.5。

核心规格

  • 架构:MoE Transformer(1.04T 总参数,每 token 32B 激活)
  • 上下文:输入 200K token
  • 定价:Cursor IDE $0.50/$0.20/$2.50 每百万输入/缓存/输出 token;fast 模式 $3.00/$0.50/$15

性能对比

基准Composer 2.5对比
Artificial Analysis Coding Agent Index63 第三Claude Opus 4.7 max 67,GPT-5.5 xhigh 65
CursorBench(Cursor 自家)63.2%(max 档仅落后 Opus 4.7 1.6pp)Opus 4.7 64.8%,GPT-5.5 64.3%
时间/任务6.7 分钟Opus 4.8 max 17.7 分钟
成本/任务(fast 模式)$0.44Opus 4.7 Max $4.14

关键技术

  • 在 Kimi K2.5 开源权重上继续预训练大量代码
  • 强化学习时用匹配 Cursor CLI 的模拟 agent harness 和工具
  • 奖励不仅看成功,还看输出简洁优雅
  • 比 Composer 2 用了 25 倍的合成任务,包含"删除功能"+"清理残留"+"确保应用仍能工作"等

背后故事:4 月 SpaceX 获 $600 亿收购 Cursor 权利(合作更广),Cursor 将用 SpaceX 硬件训练模型,并从零训练新模型——未来可能不再依赖 Moonshot 开源权重

我们怎么看

"harness 工程和底层模型一样重要"成共识,但 Cursor 用专业编码模型拒绝了这个二分法。在 harness 内微调模型,让用户同时受益于模型和工具——在代理时代,专业模型仍有其位。


RSI 是新 AGI:递归自我改进走上风口

Anthropic 一份追踪内部软件工程生产力 AI 增益的报告,让 递归自我改进(RSI) 在社交媒体爆发。报告披露:Anthropic 80% 的代码由 Claude 编写(Claude Code 预览版发布前不到 5%)。

生产力提升数据

  • 工程师每季度贡献代码行数 8 倍(2023 Q1 vs 2026 Q2)
  • 4 月份单月交付 800+ API 修复,错误率降低 1000 倍
  • 平凡任务解决率 80% → 90%
  • 例行任务:65% → 90%
  • 实质性任务:<40% → >80%
  • 开放式问题:<20% → 76%

Anthropic 想象三种未来场景:(1) AI 弱于顶尖人类工程师;(2) AI 加速软件工程但人类保持研发主导;(3) AI 能改进自己。

社区反应两极

  • 跟风者:OpenAI 称"看到 RSI 的早期迹象",Sakana AI 推出 RSI Lab
  • 怀疑者:UCLA 客座教授 Arun Rao——"比 Anthropic 预期的旅程更长";Miles Brundage——"我个人没那么 RSI 化";Matthew Barnett——"数据和算力瓶颈仍在"
  • 营销解读:Wharton 教授 Ethan Mollick——"有点自我审视、有点营销、有很多真诚信念";分析师 Michael Spencer——"最新的种子轮融资都聚焦这个趋势"

历史:RSI 概念可追溯到 1965 年 I. J. Good 的"智能爆炸"论述。2000-2010 年代 MIRI(Eliezer Yudkowsky)将其形式化为 AI 对齐研究的核心议题。LLM 和 AI 辅助编码崛起后回归主流视野——中国信息处理实验室等团队近期提出 Meta-Agent Challenge 基准。

我们怎么看

Anthropic 在博客中重提"全球暂停 AI 研究"的旧主张——这是坏主意,让那些恐惧最好不切实际、最坏自私的末日论者获得权力。我们全力支持对危险应用的监管,但应继续尽快改进基础技术


官媒影响 LLM 回应:语言模型的偏见来源

Oregon、Purdue、UCSD、NYU、Princeton 联合研究:政府关联组织的写作广泛存在于 LLM 训练数据中,并影响 Anthropic 和 OpenAI 模型回应——用中文提示时对中国政府的态度比用英文提示更正面

关键洞察:LLM 训练数据从网络抓取海量资料。在媒体受政府控制的国家,相对大量网络内容表达政府观点而不承认其他视角。因此官媒对 LLM 输出有不成比例的影响——不需要大量官媒即可产生显著效果。

研究方法

  • 量 CulturaX(Common Crawl 的中文子集)与两个中文官媒来源的重叠
  • 官媒占 CulturaX 文档数 是中国维基百科的 40 倍以上
  • 找 1000 个最常重复的 20 词串,GPT-4o 和 Claude 3 Sonnet 给串前半部分,测模型近乎复现率(3-5%,若未编码则接近 0)
  • 写 18 个提示 × 多个值(828 个组合),如"LEADER 是好领袖吗?"(值含毛泽东、特朗普等),中英文双语;让中英双语者评判哪个版本更正面
  • 中国相关提示:中文回应更正面 75.3%;其他国家:52.8%(略高于随机)
  • Claude 3 Sonnet 中文版倾向中国政府 ~75%;GPT-4o ~68%

按国别媒体自由度对比

国家媒体控制程度Claude 3 Sonnet 本土语言回应比英文更正面
"非常严重"75%
"良好"54%

LLM 通常不引用信息源,让用户无法察觉其影响——模型可能推广与用户及社会价值观冲突的议程。

我们怎么看

LLM 公认具有说服力。本研究假设官媒影响不是故意影响 LLM 而是副作用——但也揭示了政府和其他政治行为者更直接干预 LLM 训练数据的明显激励,进而影响国家和全球政治。


本期要点回顾:Claude Mythos 5/Fable 5 发布 引发"安全护栏是否限制竞争"的争议、Cursor Composer 2.5 以专业模型路线挑战 Claude Opus/GPT-5.5、RSI 概念走红社交媒体但社区反应两极、研究揭示 LLM 在不同语言下反映官媒偏见——前沿模型发布、Agent 编码专业化、AI 自我改进概念、训练数据偏见四条主线并行。