8 条来自 6 位 builder

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 4 分钟。

Anthropic 这一天都在解释自己:一份复盘把持续一个月的 Claude Code 降智反馈追溯到三个互不相干的改动,另有一次少见的公开梳理,讲的是它自家 agent 惹出的那些安全事故。另一头是 Ryan Greenblatt,他详细讲了为什么他认为 AI 研发会在 2029 年前后被完全自动化,以及一份中美算力协议要长成什么样才能让这个进程慢下来。这两条底下还压着今天最实用的一条提醒:reasoning effort 的设定,换代之后不能照搬。

博客

Anthropic Engineering

Anthropic 复盘:一个月的 Claude Code 抱怨,源头是三个各自独立的改动

三个毫不相干的改动叠在一起,看上去就像 Claude Code、Agent SDK 和 Cowork 集体出现大面积、时好时坏的降智,而 API 自始至终没受影响。3 月 4 日默认 reasoning effort 从 high 降到了 medium;3 月 26 日的一次缓存优化带了个 bug,会话一旦过期,每一轮都会丢掉 Claude 之前的推理过程;4 月 16 日 system prompt 里加的一句「回答控制在 100 词以内」,让 Opus 4.6 和 4.7 的评测分数都掉了约 3%。三个问题在 4 月 20 日全部修复,默认值现在是 Opus 4.7 用 xhigh、其余一律 high,所有订阅用户的用量额度也在重置。这次调查里有个细节值得记一笔:拿出问题的那几个 PR 回测,Opus 4.7 揪出了缓存那个 bug,Opus 4.6 没有。

  • #products
  • #evals
X

Thibault Sottiaux

GPT-6 Astra 开 low reasoning,也比 GPT-5.6 Sol 开 high 更强

来自 OpenAI 内部 Codex 和 ChatGPT 那一侧的校准建议:GPT-6 Astra 在 low reasoning effort 下的表现,好过 GPT-5.6 Sol 开 high。如果你之前把 Sol 挂在 high 上用得挺顺手,那换到 Astra 之后该往下调到 low 或 medium,而不是把老设定原样搬过来。

  • #evals
  • #products
播客

The MAD Podcast with Matt Turck

做规划时就当 AI 研发在 2029 年初已经完全自动化

Ryan Greenblatt 对 AI 研发完全自动化的中位数判断是 2030 年底,但他的 35 分位数落在 2028 年底,而他认为大家真正该拿来做规划的正是这个更早的时间点。「我不会说超级智能是坏的,我会说它是危险的。」他的核心推演是这样:2028 年初,AI 公司内部的软件工程被完全自动化;到 2028 年年中,模型开始用一种只有 AI 懂的语言思考,我们还能让它翻译回来;2029 年的 AI 进展量大约是 2025 年的 4 倍;再往后,就从粗糙的 reward hacking 变成有能力的蓄意欺瞒和夺权。他参与撰写的 AI 2040 方案想靠一份中美协议来争取时间,办法是追踪算力加上研究全面透明,这会把前沿实验室最大的护城河直接掏空,而 2030 年代全球 GDP 仍会增长大约 200 倍。

  • #policy
  • #safety
博客

Anthropic Engineering

Anthropic:Claude Code 的权限确认弹窗,用户点了 93% 的通过

遥测数据显示,用户对大约 93% 的权限弹窗都点了批准,这恰恰说明该把隔离而不是人工审核当作首要防线。一层 OS 级别的沙箱让弹窗少了 84%,而 Opus 4.7 把 prompt injection 的单次攻击成功率压在 0.1% 左右,做 100 次自适应尝试之后也只有 5% 到 6%。最有教育意义的两次失手,都是从所有概率性防线底下溜过去的:内部红队钓到一名员工粘贴了一段 prompt,25 次运行里有 24 次成功把 ~/.aws/credentials 外传出去;另有第三方演示,把 api.anthropic.com 放进白名单之后,一个被投毒的工作区文件就能把数据上传到攻击者自己的 Anthropic 账号里。他们反复得出的教训是:久经沙场的基础组件都扛住了,出问题的是自己写的那个 proxy。

  • #agents
  • #security
博客

Claude Blog

Claude Code 现在能发布团队直接打得开的实时 artifact

Claude Code 的会话现在可以产出一个可分享的网页,内容基于整段会话的完整上下文构建,包括代码库、connector 和对话本身。每次发布都是同一个链接下的新版本,带版本历史,已经打开的页面会就地刷新,所以一次故障排查会随着进展不断把自己重新发布出去,最后直接变成事故复盘。Artifact 默认只有作者可见,仅限组织内已认证的成员查看,无法设为公开。目前面向 Claude Team 和 Enterprise 开放 beta,CLI 和桌面端都能用。

  • #products
  • #agents
博客

Anthropic Engineering

Anthropic 把 agent harness 从沙箱容器里拆了出来

Managed Agents 把一个 agent 拆成三个可替换的接口:session 是一份只追加的事件日志,harness 负责跑循环,sandbox 负责执行代码。三者塞在同一个容器里,这容器就成了必须精心照料的宠物,一崩会话就没了,而要把 Claude 接进客户的 VPC 还得做网络对等互联。解耦之后,只有在某次工具调用真需要容器时才去创建,首 token 时间的 p50 降了大约 60%,p95 降了 90% 以上。安全上的收益是凭据根本到不了沙箱里:git token 在初始化时就接进了本地 remote,MCP 的 OAuth token 放在一个 vault 里,前面挡着一层 proxy,harness 全程看不到。

  • #agents
  • #products
X

Peter Steinberger

他想要的是几秒钟就能起的云端 agent 会话,而不是每次重新克隆仓库

他想要的 harness 现在还差一块,就是云端会话,目标是几秒钟内启动,这需要一套聪明的快照方案。像现在这样每次都重新克隆仓库,速度不够。他预计下周就能做出来,另外还说,他都想不起来上一次能力这样集中往上跳是什么时候了。

  • #agents
  • #products
X

Peter Yang

Brilliant 的产品铁律:绝不把答案告诉学习者

Brilliant 联合创始人 Sue Khim 的产品建立在一条原则之上:绝不把答案告诉学习者,因为作弊和「把答案讲给自己孩子听」这两件事,比你以为的要接近得多。她的说法是,用 AI 来跳过学习过程,就像扛一条机械臂进健身房替你举铁;学习从来就不是为了那个答案,而是为了强化你身上那个能专注、能死磕的部分。她给所有做 AI 产品的人的建议是:去找那些你手上握有独家数据、能让产品随时间越用越好的领域。

  • #products
  • #education

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。