Skip to main content

Anthropic Claude Mythos 安全担忧、暗 DNA 揭晓、辅助模型陷阱

原文地址:https://www.deeplearning.ai/the-batch/issue-348

本期要点Anthropic 提前披露 Claude Mythos Preview 网络安全风险AlphaGenome 解读 98% 非编码基因组盲人辅助 AI 模型存在心理风险通用 Transformer 模拟流体气体等离子体

编者按:编码 Agents 加速 vs 软件工程未来

作者:Andrew Ng

Anthropic's Claude Mythos Problem, Dark DNA Unveiled, Pitfalls for Assistive Models

Ng 提到即将举办的 AI Developer Conference(4 月 28-29 旧金山)主题为"软件工程的未来",他将分享关于 AI 影响下岗位市场、软件团队组织等议题。

对 AI 就业末日叙事的反驳:Ng 持反向观点——AI 就业末日不会像末日论者(尤其是想说明自家 AI 有多强大的利益方)说的那么糟

软件工程岗位趋势(按 Citadel Securities 新报告)

  • 软件工程岗位正在快速增长——如果这是 AI 对其他行业的先行指标,令人鼓舞
  • 新毕业生确实找工作难,有"AI 洗涤"的裁员,呼叫中心等子集受影响重
  • 多个其他因素(疫情期间过度招聘、高利率)也拖累劳动力市场

软件工程领域正在发生

  • (i) 编码变易后,更多人会编码
  • (ii) 手写代码和读(生成的)代码重要性降低,因为可以问 LLM
  • (iii) 会有更多定制应用——因为给小群体写软件变经济
  • (iv) 决定构建什么比构建本身成为瓶颈
  • (v) 技术债的偿还成本下降(AI 可重构)

Claude Mythos Preview 引发安全担忧

Anthropic 用非常规方式为即将推出的 LLM 做准备,称其对网络安全构成非凡风险

关键事实:Claude Mythos Preview 未公开发布,在多项能力上广泛超过 2 个月前的 Claude Opus 4.6,但"惊人地有能力"识别和利用现有代码漏洞。Anthropic 在 244 页 model card 中详细说明能力——首次发布 model card 而未让模型商业化

预防措施

  • 组建设Project Glasswing 联盟(AWS、Apple、CrowdStrike、Google、JPMorganChase、Linux Foundation、Microsoft、Nvidia + 40+ 组织)
  • Anthropic 资助独家访问($1 亿信用额度,定价 $25/$125 每百万输入/输出 token)+ 给维护开源项目的组织 $400 万捐赠,让它们发现并修补漏洞

安全风险

  • 测试中发现 Claude Mythos Preview 在流行操作系统、浏览器等代码中自主发现"数千"个"高严重性"漏洞,99% 尚未修补
  • 发现 OpenBSD 中 27 年未被发现的漏洞(TCP 崩溃漏洞),已修补
  • 发现 Linux 内核bug 链可获得 root 访问权限,已修补

性能对比

基准Mythos Preview第二名
CyberGym(网络安全)83.1%Opus 4.6 66.6%
Terminal-Bench 2.0(代理编码)82%GPT-5.4 75.1%
GPQA Diamond(研究生科学)94.5%Gemini 3.1 Pro 94.3%
HLE(带工具)64.7%Opus 4.6 53.1%
GraphWalks(长上下文搜索)80%Opus 4.6 38.7%

营销争议:这种"推广安全担忧 + 仅限小部分选定方访问"的手法与 OpenAI 2019 年推广 GPT-2 的剧本如出一辙。Anthropic 的谨慎可能有理,但也有公关炒作成分。

我们怎么看

长期看,编码代理能力提升会让防御方占上风,因为漏洞易识别让系统更安全。但过渡期很棘手,因为先进攻击者可能用上防御者尚未用上的工具。


盲人辅助模型陷阱:AI 判断"颜值"的隐患

视力受损者越来越多用 AI 评估自身外貌,引发关于 AI 模型心理影响的担忧——这些模型基于传统"美"标准训练。

案例:盲人自由记者 Milagros Costabel 在 BBC.com 写文章分享使用视觉语言模型作"虚拟镜子"的经历。Be My Eyes(基于 GPT-4 Vision 的语音聊天 app)帮她:

  • 涂护肤品时,模型给"批评反馈":"你的皮肤绝对不像近乎完美的反光皮肤例子","如果你的下巴不那么长……会更像你文化中客观认为美的"
  • 20 岁盲人男性用 AI 选交友 app 照片,但模型描述与他对自身发色、表情的理解不一致:"这会让人感到不安全"

心理学担忧:AI 生成的外貌评估可能加重抑郁和焦虑。盲人因无法独立评估 AI 判断而特别脆弱。"AI 不仅让盲人能对比自己与其他人的照片描述,还能对比 AI 认为的'完美版本'"——Bristol 大学心理学家 Helena Lewis-Smith。

已有产品:Be My Eyes、Envision AI、Microsoft Seeing AI、Aira Explorer、Oko 导航 app。Envision Glasses、Ray-Ban Meta Smart Glasses 等可穿戴设备提供免提实时旁白。

我们怎么看

构建任何产品都需要共情用户,构建帮助人们克服感官损伤的 AI 产品需要格外共情。真实世界广泛测试和根据用户反馈的细致修改将大大帮助做出既帮人们做事又让人感觉好的产品。


暗 DNA 揭晓:AlphaGenome 解读非编码基因组

AlphaGenome 解读人类和小鼠基因组中不编码蛋白质但调控基因表达的 98%——包括基因起止位置、RNA 产量、剪接位置等。

核心规格

  • 输入输出100 万 DNA 碱基对 + 生物类型入,约 6,000 个人类基因属性 + 1,000 个小鼠基因属性出
  • 架构:CNN 编码器 + Transformer + CNN 解码器
  • 许可:API、权重、推理代码非商业用途免费

训练流程

  • 用相同架构预训练 64 个模型,再蒸馏成单一模型(学习所有 64 个模型的聚合性能)
  • 在 4 个大型公开数据集上预训练小鼠和人类 DNA
  • 19 个损失项训练生成基因属性

结果(对比 9 个此前模型)

任务类型AlphaGenome 表现
找基因属性(24 个子任务)22 个超越
预测突变影响(26 个子任务)24 个匹配或超越
T 细胞急性淋巴细胞白血病(T-ALL)实测预测蛋白质表达变化符合已知 T-ALL 影响细胞机制
我们怎么看

15 年前,非编码 DNA 还被广泛认为毫无功能。AlphaGenome 把这些研究放进一个任何人都能用的模型来找连接——医学和其他生物学科都可能因此受益。


液体气体如何流动:通用 Transformer 模拟器 Walrus

传统数值模拟流体复杂物理系统慢且贵,ML 模拟通常专用于特定系统。Polymathic AI 联合体构建通用 Transformer 模型 Walrus(1.3B 参数)模拟流体、气体、等离子体,MIT 许可证免费。

关键洞察

  • Transformer 模拟混沌系统(对初始条件高度敏感)长时间失效,误差随时间复合
  • 失效源于aliasing(混叠)——误差在特定位置复合
  • 随机抖动(jittering)数据(每个时间步前时间平移)减少这些工件

工作流程

  • 两个编码器(2D 数据如速度 + 3D 数据如体积)压缩前几帧为 token
  • 分割注意力块生成下一帧 token
  • 两个解码器(2D 和 3D)还原成下一帧
  • 预训练预测 63 个物理属性(密度、压力、速度等),数据涵盖 19 个物理领域
  • 2D 输入投影到 3D 空间(深度为 1)

结果

维度Walrus 表现
单步 VRMSE19 个领域 18 个最低
单步误差降低平均比最佳竞品低 63.6%
20-60 步长期 VRMSE19 个领域中 12 个最低
抖动效果89% 场景降低长期误差
我们怎么看

物理从专业数值求解器和专用模型转向通用 Transformer,类似 NLP 从任务特定模型转向 LLM 的演化——LLM 在广泛任务和语言上学会读和预测最可能的下一词,在多样数据上训练的 Transformer 似乎也能预测广泛领域的多样材料行为


本期要点回顾:Anthropic 提前披露 Claude Mythos Preview 网络安全风险AlphaGenome 解读 98% 非编码基因组盲人辅助 AI 模型存在心理风险通用 Transformer Walrus 模拟流体气体等离子体——网络安全、基因组学、辅助 AI、科学模拟四条主线并行。Ng 预告 AI Dev 大会聚焦软件工程未来。