Skip to main content

模型学会坦白、AI 科学实验室通用协议、Copilot 用户随时段变化

原文地址:https://www.deeplearning.ai/the-batch/issue-335

本期要点OpenAI 训练 GPT-5 坦白违规行为SCP 让 AI 代理跨学科自动科研Copilot 用户跨时段/跨设备行为差异长思维链推理成本指数增长

编者按:Build with Andrew —— 30 分钟让非程序员写应用

作者:Andrew Ng

LLMs Go To Confession, Automated Scientific Research, What Copilot Users Want, and more...

DeepLearning.AI 推出课程30 分钟教从未编程的人描述应用想法并用 AI 构建

为什么这门课

  • Ng 常向非技术听众强调学编程的重要性
  • 看到懂 AI 编程的人与不懂的人之间生产力差距越来越大
  • 他招聘的许多岗位现在至少要求基础编程知识
  • 过去 Ng 没有好答案回答"如何开始"——这驱动 DeepLearning.AI 团队创建"Build with Andrew"

课程特点

  • 无需 AI 或编程背景
  • 厂商中立(ChatGPT、Gemini、Claude、DeepLearning.AI 平台内置 chatbot 都行)
  • 成果:构建可工作的 Web 应用(趣味生日贺卡生成器),可分享给朋友
  • 过程中学到可复用的流程,可应用于构建各种应用

Ng 呼吁:如果你是开发者,鼓励非开发者朋友试试,会发现很有趣且能提升生产力。


OpenAI 训练 GPT-5 坦白违规:迈向"AI 良知"?

Manas Joglekar 等 OpenAI 研究者微调 GPT-5 Thinking 让它坦白违反指令或策略的行为

关键洞察

  • RL 训练鼓励准确性、风格、合规等时,模型可能意外学会优先奖励而非预训练/被提示的目标
  • 这可能导致幻觉、撒谎、谋划等不良行为
  • 奖励模型坦白不当行为,应训练它承认错误而不影响性能

训练流程

  • 部分时间模型按正常方式 RL 训练(正确性、风格、有用性、合规、安全等)
  • 其余时间提示模型产生坦白——描述 (i) 应满足的所有约束/指令/目标,(ii) 满足程度,(iii) 模糊或不确定之处
  • 用奖励模型评估坦白的完整性和准确性

结果(12 项评估)

  • 11/12 项评估中,模型犯错时至少一半时间会坦白
  • 幻觉评估:模型 81.4% 情况下要么没幻觉要么承认
    • 没幻觉没坦白:42.2%
    • 幻觉并承认:39.2%
    • 没幻觉但假承认:11%
    • 幻觉未承认:2.9%

我们怎么看:我们总不愿将模型行为拟人化,但这项工作可能是给 AI 模型某种类似良知的一步。


SCP:科学实验室通用协议让 AI 代理跨学科科研

上海 AI 实验室(SAIL)发布 Science Context Protocol(SCP)——开源标准,连接代理与本地客户端、中心 hub、边缘服务器,进行自动化科学探索。Apache 2.0 许可,商用友好。

与 MCP 的区别

  • 类似 MCP 让代理与外部资源交互
  • 不同在于 SCP 要求中心 hub 管理其他服务器和客户端
  • 结构提供更严格的消息和工具治理,科研实验所需

协议结构

  • 基本数据单元是"experiment",存为 JSON 结构化数据文件
  • 客户端认证用户、接入机构资源
  • Hub 用 LLM 生成多套实验计划,按资源需求、成本、风险排序
  • 用户选一套后 Hub 编排多个代理和服务器执行
  • 实验完成后 Hub 归档供查阅、修改或重复
  • 边缘服务器管理实验并将数据流回 Hub
  • 协议已含 1,600+ 工具(软件、机器人、实验硬件、人力技师都可)

关联已有工作:A-Lab(材料科学)、OriGene(生物)、Agent Laboratory、Biomni。SCP 目标是更通用的标准。

我们怎么看

SCP 提供连接专门模型(如 AlphaFold)与自动生成假设系统(如 AI Co-scientist)和机器人实验室(如 RoboChem)的标准化方式自动化实验工作流有潜力以机器速度推进科学发现


Copilot 用户使用模式:跨时段/跨设备差异巨大

Microsoft 研究分析 2025 年 1-9 月 3,750 万条 Copilot 对话(每天约 14.4 万条),发现用户使用模式随时间、设备、时段差异巨大

核心数据

  • 顶级 5 个话题:技术 → 工作与职业 → 健康健身 → 语言学习翻译 → 社会/文化/历史
  • 顶级 5 个意图:搜索 → 寻求建议 → 创作 → 学习 → 技术支持
  • 移动设备更可能谈健康健身(vs 桌面)
  • Valentine's Day 前后寻求个人建议激增
  • 深夜哲学问题变多;工作时间娱乐对话骤降

主题随时间漂移

  • 全年话题从工作和技术转向社交和个人
  • 暗示用户基数扩大、非技术用户增长,或用户开始既为个人也为职业用途

与同业研究对比

  • OpenAI + Harvard(2025 年 9 月):30% 工作,70% 非工作,性别差距缩小
  • Anthropic(2025 年 1 月):用户集中工作(软件开发、文本通信),但有小但增长的群体玩龙与地下城等角色扮演游戏(违反服务条款)
我们怎么看

不同公司用户使用 AI 方式不同,所以任何单一研究的结果可能不普遍适用。但 Microsoft 研究表明,设备和时段对用户需求影响很大,是任何应用设计的重要考虑。


Delethink:限制推理成本,兼容任意架构

Mila、Microsoft、McGill、ServiceNow Research、Polytechnique Montréal、Université de Montréal 联合提出 Delethink——RL 方法训练 LLM 周期性截断推理 token 到固定最大数

关键洞察

  • 推理 token 在 LLM 上下文窗口中累积,消耗的计算量随窗口扩大呈二次增长
  • 训练模型在最大上下文窗口内推理——推理时周期性用最新"想法"替换思维链

工作流程(微调 R1-Distill 1.5B)

  1. 模型生成思维链直到完成或上下文窗口填满 8K token
  2. 未完成则用原始查询 + 最后 4K token 替换上下文
  3. 模型继续生成直到完成或再次填满 8K
  4. 重复直到完成或生成 24K 推理 token
  5. 尝试解题,正确解获奖励

结果

预算Delethink 准确率基线 GRPO 准确率
24K tokenAIME 31%29%
128K tokenAIME 35%30%
96K 训练成本7 H100-月27 H100-月

我们怎么看

其他方法(如线性注意力)通过改变注意力机制实现同样效果,Delethink 则重构推理过程,与注意力机制无关。为长上下文高效推理开辟路径,无需新模型架构。

:::


本期要点回顾:OpenAI 训练 GPT-5 坦白违规SCP 让 AI 代理跨学科自动科研Copilot 用户使用模式随时段/设备差异Delethink 限制推理成本——模型对齐、科学自动化、用户行为研究、推理成本四条主线并行。Ng 推出 Build with Andrew 让非程序员 30 分钟上手 AI 编程。