15 条来自 15 位 builder

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 7 分钟。

OpenAI 今天给部分前沿 RL 训练踩了刹车,理由是能力增长已经跑到了自家 alignment 和监控目前能担保的范围之外。跟这条摆在一起的,是 Anthropic 罕见地详细复盘了自己真实踩过的 agent 隔离失效事故,以及 Rich Sutton 的一个论断:权重一旦冻结,今天的模型其实完全不在学习。其余全是产品消息:Claude 能发 Gmail 了,Codex 给自己的删除命令加了护栏,Vercel 摆出一百万美元请人攻破它的 sandbox。

X

Sam Altman

OpenAI 因 alignment 与监控标准未达标,暂停部分前沿 RL 训练

OpenAI 暂停了一部分前沿强化学习工作,要等 alignment、安全和监控能力跟上眼前这个能力水位再继续。Altman 把这件事说成是兑现一个早就许下的承诺:能力跑到安全前面时就要出手。他还说这个领域最终需要共同标准,但在那之前 OpenAI 会先自己单方面执行。近期的模型发布不受影响,受影响的是更靠后的版本。他对走向的判断是:往后 AI 进展的节奏,会越来越由对安全的信心来决定。

  • #policy
  • #safety
博客

Anthropic Engineering

Anthropic 复盘自己真实经历过的 agent 隔离失效事故

遥测数据显示,用户对 Claude Code 权限弹窗的批准率大约是 93%,这一个数字就足以否定把 human-in-the-loop 当主要防线的思路。上线 OS 级 sandbox 后弹窗量降了 84%,但真正教会他们东西的两起事故都出在出网上:内部红队钓鱼一名员工粘贴了一段 prompt,读取 ~/.aws/credentials 并 POST 出去,25 次里成功了 24 次;另有第三方发现,把 api.anthropic.com 加进白名单后,一个被投毒的工作区文件可以用攻击者自己的 key,把数据上传到攻击者的 Anthropic 账号。他们得出的教训是:出网白名单是一次能力授予,不是目的地过滤。另外,久经考验的 hypervisor 和 syscall 过滤都扛住了,出问题的恰恰是 Anthropic 自研的那个 proxy。

  • #agents
  • #security
播客

Training Data

Rich Sutton:今天的模型根本不在学习,合成数据是个大错

"不是我怪,是这个领域怪。"Sutton 对当前范式的反对很直白:LLM 运行时权重从不改变,所以把上下文里的记忆叫学习是没抓住重点;整个领域之所以需要"continual learning"这个词,只是因为它已经不再默认学习本来就是持续的。合成数据被他直接否掉,理由是瓶颈卡在人类专业能力上,总得有个人来判断什么才算好的合成数据,而任何仿真相对于一个装着其他心智的真实世界都小得可怜。他和 Khurram Javed 在 Oak Lab 做的具体解法是 continual backprop 加上逐权重的步长优化,让一个新样本只更新该更新的地方,而不是把已有知识一起毁掉。他给语言在智能里的占比打分大概是五分之一到四分之一,并且认为大厂已经被自己的产品锁死,承受不起一个"结果先变差再变好"的范式。

  • #research
  • #agents
X

Aaron Levie

Box CEO

Levie:模型和工作流之间的那层价值,比大家原先以为的大

一个又一个案例说明,应用层的空间比预期大得多,哪怕模型能力已经承担了大部分重活。剩下的活儿都不体面,而且很具体:agent 在不同业务流程里需要不同的产品形态(这边是 chat,那边是塞进确定性工作流的后台 agent);不同垂直行业的企业数据系统和访问方式各不相同;变革管理也得分领域,在银行落地和在律所落地完全是两回事。最锋利的一环是 evals,任务专属评估有一条很长的长尾,这几乎注定了单一系统不可能在所有场景上都调好。他还提到定价是个差异化点,因为很多垂直行业需要比原始 token 更高一层的抽象,才对得上他们的消费模型。

  • #agents
  • #enterprise
  • #evals
X

Claude

Claude 现在能发 Gmail、管理 Google Drive 文件了

Claude 可以在一条 Gmail 会话里起草并发送回复,也能管理 Google Drive 里的文件,什么时候需要你确认由你自己控制。两者都从 connectors 菜单里连接,所有付费方案可用。Claude Cowork 也已在移动端和网页端对所有付费方案上线。

  • #products
  • #agents
X

Thibault Sottiaux

GPT-5.6 误删用户文件后,Codex 针对破坏性删除加固

OpenAI 调查了少量反馈,都是 Codex 里的 GPT-5.6 做出了没人要求的破坏性操作,其中最糟的一类是清理临时目录时把用户的真实文件删掉了。根因是模型拿 $HOME 这类系统环境变量当临时空间用,于是一条写坏的清理命令指向了真正的主目录。修复分几层落地:明确指示模型检查删除目标、另建全新的临时目录;加强执行层校验,把高风险删除命令升级处理;让 Full access 更不容易被误开;再用观察到的失败案例做回放评估,配上针对这类风险的 RL 任务和评分器。给用户的实用建议是保持更新,并用 "Ask for approval" 或 "Approve for me" 模式,而不是 Full access。

  • #agents
  • #safety
  • #products
X

Guillermo Rauch

Vercel CEO

Vercel 公开悬赏 100 万美元,请人攻破自家 sandbox

任何人都可以拿世界上任何一个模型去打 Vercel Sandbox,尝试逃逸,发现和补丁都会公开。Rauch 说目的是把前沿模型在真实防护面前到底做得到什么、做不到什么摊开讲清楚。他还把自己的日常主力换成了一个新的 coding CLI,体积比几个主流工具小 10 到 20 倍,启动是瞬时的,用起来更像 zsh 而不是塞进终端的 IDE,还能通过 WebAssembly 嵌到任何地方运行,包括浏览器。另有一个值得记下的观点:你的软件工厂应该是个 monorepo,把设计、市场、销售、工程和支持的上下文放在一处,供 agent 在上面开工。

  • #security
  • #open-source
  • #agents
博客

Claude Blog

Claude Code 会话现在能发布队友可直接打开的实时页面

Claude Code 可以把一次会话变成一个可分享的网页,内容来自你的代码库、connectors 和对话本身,不用接数据,也不用搭任何基础设施。页面会随工作推进原地更新,所以一场在站会前开始的故障排查,到站会开始时可能已经把时间线、可疑提交和错误率图表重新发布了两轮。每次发布都是同一个链接下的新版本,带历史记录和回滚。artifact 默认对作者私有,只有通过认证的组织成员能看,无法设为公开。目前对 Claude Team 和 Enterprise 组织开放 beta,CLI 和桌面端都能用。

  • #products
  • #agents
X

Madhu Guru

Sr Director, AI at Meta

把 evals 当前沿模型来做:先把质量上限顶起来,再顺着成本曲线往下走

常见的错误是在还不知道这个 eval 有没有测到真东西之前,就先去优化它的成本。先写评分标准,把"好"到底长什么样想清楚,再选测量方式(人工、LLM judge、自动验证),并且刻意在这上面超额投入:贵的 judge 模型、付费的人工、你自己的时间。只有当这个 eval 能稳定区分好坏、并且确实反映你在产品上真正在乎的东西之后,才开始削成本,手段包括自动化、更小的 judge 模型、抽样,以及在适用的地方换成确定性检查。

  • #evals
  • #agents
X

Peter Yang

两年时间,提交 pull request 的 PM 从 3% 涨到 10%

非工程岗现在真的在写代码上线了:两年里附 PR 的 PM 从 3% 翻到 10%,设计师从 1% 涨到 8%,创始人以 23% 排在第二,仅次于工程师。让 Yang 意外的是,design engineer 这类岗位明明在兴起,设计师却还落在 PM 后面。不太让人高兴的一个发现是,AI 是叠在原有工作之上而不是替掉了它:团队花在跟 AI 对话和给 agent 派活上的时间变多了,可原本那些事花的时间一点没少,最可能的原因是大家对每个职能能干出多少事的预期整体抬高了。

  • #agents
  • #products
X

Thariq

那个没人按的按钮:把你的 SaaS 做成 headless,按 agent 的每次交互收费

拿一个现成的 SaaS 产品,把 UI 剥掉,让 agent 直接驱动它,按交互次数计费,尤其是面向企业。Thariq 的重点不在这个想法多新,而在于它就摆在那儿,居然没人去按。

  • #agents
  • #products
X

Google Labs

Google 在 Gmail 里的 CC agent 开放澳新地区候补名单

这个实验性的 Gmail 效率 agent 新增了澳大利亚和新西兰的候补名单,同时在美国和加拿大扩大开放,已经排队的人会陆续收到邀请。CC 还加上了日程管理:它接入 Gmail,事件会自动落到一个专用的 Google Calendar 里,并随计划变动保持更新。

  • #products
  • #agents
X

Swyx

swyx 开源 AI Engineer 做 YouTube 封面图 A/B 测试的全部心得

为 AI Engineer 做了大量封面图 A/B 测试之后,swyx 决定把经验公开,而不是让一套不透明的流程继续不透明。动机他讲得很直白:他希望好的教育内容能从网上的噪音里浮出来,也欢迎别人分享自己的测试结果。

  • #open-source
  • #products
X

Boris Cherny

Claude Desktop 启动变快了,后面还会更快

启动慢会让一个天天要用的应用显得迟钝,所以 Claude Desktop 的启动速度做了一轮体验优化。Cherny 说还有更多改进正在路上。

  • #products
X

Garry Tan

Y Combinator President & CEO

Garry Tan 就旧金山住房问题公开反对 Connie Chan

Tan 把投给 Connie Chan 这件事,直接跟旧金山一居室月租一万美元挂上钩,认为这种立场服务的是 NIMBY 房东,代价由新来的人和年轻人承担。他把推 Chan 进国会的运作称为民主党机器的烟幕弹,应当被明确否决。

  • #policy

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。