15 条来自 14 位 builder

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 7 分钟。

Anthropic 今天花了一整天做自我交代:一份事后复盘点名了三处各自独立的改动,正是它们造成了 Claude Code 长达一个月的抱怨,同时给所有订阅用户重置了用量额度。OpenAI 也回应了自家关于 Codex 额度的类似质疑,把矛头指向把订阅转卖成 API 的中间商,而不是什么悄悄改过的政策。在这两件事底下,面向企业的 agent 叙事正在变硬:sandbox 和 MCP server 现在都能跑在客户自己的边界之内。

博客

Anthropic Engineering

Anthropic 把一个月的 Claude Code 抱怨追溯到三处独立改动

三处互不相关的改动叠在一起,看上去就像一次全面的质量下滑。3 月 4 日,默认 reasoning effort 从 high 降到了 medium;3 月 26 日的一次缓存优化本意是清掉旧的 thinking 内容,结果变成整个会话里每一轮都清一次,Claude 因此变得健忘,还在缓存未命中上白白烧掉用量额度;4 月 16 日加进 system prompt 的一行把回复限制在 100 词以内,让 Opus 4.6 和 4.7 的 eval 成绩掉了 3%。API 自始至终没有受影响,三处问题在 v2.1.116 中全部修复,所有订阅用户的用量额度正在重置。接下来的做法是:每一次 system prompt 改动都要跑分模型的 eval 套件,逐行做消融实验,凡是可能拿智能水平做交换的改动都要先经过一段浸泡期。

  • #products
  • #evals
X

Thibault Sottiaux

OpenAI:Codex 额度没有变,是 sub2api 转卖触发了风控

OpenAI 调查了关于 Codex 用量额度表现异常的反馈,并表示自己不会在没有先跟社区沟通的情况下改动额度。它查到的是另一回事:不少受影响的用户在跑 sub2api,把订阅额度转成 API 流量再转售或分给大量用户使用,这会被反欺诈系统标记。通过官方客户端,或者 Pi、OpenCode 这类开源客户端用 ChatGPT 账号登录,都没有问题。今天同时上线的还有:ChatGPT 和 API 里 GPT-Image-2 的透明图像输出,以及可以和别人一起搭建、能分享出去的 ChatGPT Sites。

  • #policy
  • #products
博客

Claude Blog

Claude Managed Agents 现在可以在你自己的边界内执行工具

自托管 sandbox 进入公测:负责编排、上下文管理和错误恢复的 agent 循环仍然留在 Anthropic 的基础设施上,而工具执行搬到了你自己掌控的基础设施,或者 Cloudflare、Daytona、Modal、Vercel 上。代码、敏感文件和代码仓库始终不出你的网络,运行时镜像和资源规格也由你自己定,这一点对耗时长的构建或图像生成很关键。还在 research preview 阶段的 MCP tunnel,让 agent 通过单条向外的网关连接去访问内部数据库、私有 API 和工单系统,不需要任何入站防火墙规则,也不用暴露公网端点。Amplitude、Clay 和 Rogo 已经在上面开发了。

  • #agents
  • #products
X

Boris Cherny

Anthropic 要做一种数据全部留在客户手里的部署方式

Mythos 级别的模型需要额外的安全措施,而企业自己也有隐私和合规上的要求要满足。Anthropic 一直在和客户一起打磨这样一套方案:数据归客户所有、由客户掌控,Anthropic 一点都不留。今年秋天推出。

  • #policy
  • #products
X

Thariq

Claude 面向企业的新安全防护跑在客户自己的基础设施上

面向企业的 Fable 安全防护跑在你自己的基础设施上,数据存在哪里、谁能访问,控制权都留在你这边。这套东西已经和大约 100 家公司一起打磨过,计划在秋天更大范围推开。

  • #policy
  • #agents
博客

Anthropic Engineering

把 agent 的大脑和手分开,p50 首 token 时间降了 60%

Managed Agents 最早把 session、harness 和 sandbox 塞在同一个容器里,这就让容器变成了一只换不掉的宠物:它一死,会话跟着死,而调试意味着要登进一台同时还存着用户数据的机器。解法是拆成三个可以各自独立失败的接口,会话日志放在 harness 之外,于是 harness 崩了之后可以用 wake(sessionId) 重启,从最后一个事件接着往下走。容器现在只在真正需要时由一次工具调用来创建,所以那些从头到尾没碰过 sandbox 的会话不用再为启动成本买单:p50 TTFT 降了大约 60%,p95 降了超过 90%。安全上的收益是,凭据在跑 Claude 生成代码的那个 sandbox 里根本够不着,prompt injection 再也没法直接读自己所在的环境。

  • #agents
  • #products
播客

No Priors

一款能恢复真实形状视觉的视网膜植入物刚在欧洲获批

Prima 是一块植入视网膜下方的芯片,由患者眼镜上的激光投影仪驱动,为因黄斑变性失明的人绕开已经死掉的视杆和视锥细胞。它在 7 月拿到欧洲上市许可,未来几周开始销售;临床试验里的患者能填数独、做填字游戏、读书,这是此前任何设备都没做到过的。背后的观念是:大脑明摆着就是一台计算机,把它当计算机来对待,得到的效果量是几十年小分子药物研发都没能拿到的,因为“我把电极放进 M1,你大概一小时之后就能用上一台计算机”。把大脑做成键盘的产品明确不是目标,因为“如果你能拿到视觉、听觉、平衡感,再加上每秒一千比特的运动控制,你就已经走到通往矩阵的一半了”。柏拉图表征假说在这里是被拿来用的,不是拿来谈哲学的:他们能把动物的神经记录和 AI 模型的内部表征对齐。

  • #hardware
  • #research
X

Nikunj Kothari

FPV Ventures Partner

投资人非要你有野心的真实原因:错过的代价太高了

LP 们眼看着 Anthropic 以史上最快的速度从零冲到一万亿估值,SpaceX 以 1.77 万亿上市,Cursor 四年做到 600 亿,还给早期基金返了实打实的 DPI。他们的反应是把钱大把倒进超级基金,而基金一旦大到那个体量,每一张支票,哪怕是 A 轮,都必须按万亿级的结果来做承销。到了那一步,入场价格就不重要了:2 亿、3 亿、5 亿,有时候 10 亿,放在被建模的那个结果面前都是一回事。于是错过的代价远远大于投错的代价,基金再也不敢漏掉任何一个有热度的项目,剩下的交给幂律。这就是野心会主导整场 pitch 背后的算术。

  • #funding
X

Aaron Levie

Box CEO

post-training 正在变成应用型 AI 公司的成本杠杆

一旦你对某个领域理解得足够深,手上又有一批相似任务的规模量,专门为这类活儿定制一个模型就开始划算了。机制在于 post-training 里的奖励塑形:在性能相当的前提下,更偏好那些消耗更少 token 的轨迹,这“让我们能同时优化成本和质量,在成本保持稳定的情况下拿到明显的性能提升”。这套做法不是到处都成立,通用的前沿模型往往已经够用,有时候干脆是非用不可。但如果你既有很深的垂直积累,又碰上成本高到没法规模化运行,或者手上的任务类型压根没人在训练,那对于贴着企业工作流的公司来说,这就是一个很有吸引力的位置。

  • #products
  • #research
X

Madhu Guru

Meta Sr Director of AI

企业做不好 AI,是因为压根没有 eval 策略

一套 eval 是不够的。你需要一组阶梯式的 eval,铺开在成本和真实度的两端之间,并且按你自己的用例来调。爬坡型 eval 负责往前推产品边界,必须持续更新,才能不断提升质量、扩展功能。回归型 eval 负责接住爬坡过程中被弄坏的东西,冒烟测试覆盖那些绝对不能出错的基本项,比如产品身份认知,而上线前的 eval 贴着真实流量跑,控制最少,真实度最高。

  • #evals
X

Peter Yang

让一个 manager agent 用激将法逼 worker agent 交出更好的结果

Yang 的直觉是,很多 AI 输出只要加一个 manager agent 不断顶回去的循环就能变好:“你确定这已经是你能做到的最好了?”、“我觉得你还能更好,再来一次”、“再仔细看看,给我 11 分(满分 10 分)的输出”。他的 YouTube 订阅也过了 10 万,已经排上的访谈包括:今天的模型如何彻底改变了 eval、哪些 vibe coding 做出来的应用真的做成了生意,以及 ChatGPT Finance。

  • #agents
X

Aditya Agarwal

SPC General Partner

SPC 筛人最看重的特质是清晰,不是履历

清晰指的是能诚实面对、能穿透战场迷雾、能在浑水里找出一条路,Agarwal 说这是 SPC 最看重的一项特质。他举的极致例子是 Sridhar Ramaswamy,此人把 Google 广告从 10 亿做到 1000 亿,如今正带着 Snowflake 穿越 AI 转型;这期 Minus One 聊了什么时候该冒职业风险、Neeva 到底哪里出了问题,以及模型接下来会走向何方。还有一句相关的:最好的创始人都是还原论者。

  • #funding
X

Swyx

NVIDIA 花 60 亿买下的模型工厂,产出胜过 Thinky 级模型

swyx 最新一期 Latent Space 的嘉宾,正是 NVIDIA 刚花 60 亿美元收购其模型工厂的那个人。他坚持说“产出能压过 Thinky 级模型”这话不是夸张,看数字就知道。他还点出 agent skill 领域正在冒出来的一个模式:Matt Pocock 的 /wayfinder,是给 /grill-me 用的 /grill-me,专为那种你还困在战场迷雾里、得先编排一轮调研和后续几轮 grill 才知道自己不知道什么的时候而做。

  • #funding
  • #agents

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。