16 条来自 16 位 builder

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 7 分钟。

今天大家的注意力都落在 agent 干活所需要的那些底层管道上:OpenAI 在 DevDay 前的一周里一口气推了五个 Astra 相关的东西,同时罕见地把质量投诉的原因讲得很具体;Coinbase 则说清了为什么刷卡那套清算体系撑不起机器与机器之间的支付。贯穿这一切的是对「怎么衡量」的共同担忧,三位 builder 各自表达了同一个意思:benchmark 分数已经没法告诉你这个模型在你的实际工作里好不好用。也有几个人暂时放下产品话题,去纪念 9/11。

X

Thibault Sottiaux

OpenAI 一周内发了五个 Astra 产品,并点名质量下降的三个原因

Images 2.5、GPT-Live-1、一套 Agents API、Data Agent,还有面向金融行业的 ChatGPT,全都赶在 DevDay 之前落地,下周还有更多。这轮质量投诉没有被含糊带过,而是给了一份真正的复盘:为老模型写的 skills 触发得太频繁,反而挡住了模型检查自己工作的机会;一项需要主动开启的上下文管理实验,导致大约 4000 到 5000 名用户遇到提前中断、以及回复到更早那条消息的情况,现在已经关掉;另外还有一批配置有问题的引擎在拖累长尾流量,已经下线。OpenAI 还请来了 Git AI 团队的 Aidan 和 Sasha,他们那个开源工具能衡量 coding agent 对代码库到底做出了多少实际贡献,OpenAI 承诺会继续让它保持开源。

  • #products
  • #agents
播客

No Priors

agent 商业支付里有 76% 不到 30 美分,低于刷卡渠道能承载的下限

刷卡渠道大约是 30 美分固定费再加一个百分比,所以碰上 agent 真正会发生的那类交易就彻底跑不通。Brian Armstrong 的说法是:「我们不希望这些 AI 成为没有银行账户的人。」现在只要粘贴一句 prompt,Coinbase 就能给任意 agent 开一个自托管钱包,不需要 KYC,支付走 x402,这个协议由 Coinbase 孵化后捐给了 Linux Foundation,Google、Cloudflare 和 AWS 都有参与。公司内部则在追求递归式的自我改进:按仓库、按团队维护一个「大脑」,把每一次事故、每一项财务管控、每一个 AB test、每一个通过或被拒的 PR 都记进去,并强制要求人对 agent 工作的任何一次纠正都要写回这个大脑。另外还披露了几个数字:非 Bitcoin 交易已经占到 88% 的收入,预测市场上线几个月就做到 1 亿美元的年化规模,代币化股票已经在美国以外上线,是真实证券并按 1:1 托管。

  • #agents
  • #payments
X

Madhu Guru

Meta Sr Director of AI

企业 AI 的失败,往往是中央团队在替业务做,而不是和业务一起做

三种失败模式:一是 CEO 找来一位信得过的副手,副手又拉来信得过的同事,于是把一套为「十五年渐进式改良」设计的团队结构和发布流程,原封不动搬到了一件需要实验和发明的事情上。二是长期不在 evals 上投入,大多数公司甚至说不清什么才算好。三是中央 AI 团队自封为平台,做出来的工具和真正干活的人的工作流、判断完全脱节,最后换来的是勉强的采用率和零生产力提升。解法是把你最好的 AI builder 放进财务、销售和客服内部,而不是站在外面对着他们造东西。

  • #evals
  • #enterprise
X

Dan Shipper

Every CEO

Every 把三年的模型体感测试变成了每个人自己的 benchmark

benchmark 分数更高,几乎说明不了这个模型处理你真实工作的能力,所以 Every 这三年一直在做的是另一件事:每出一个新模型,就写一篇上手实测的长文评测。现在这些体感测试要量化了,Hammer 和 Nityesh 搭了一个内部平台,团队里每个人都从自己的日常工作出发,构建一套属于自己的 benchmark。

  • #evals
X

Peter Yang

软件工厂目前还跑不通,而且没人拿得出反例

除了验证和测试之外,AI 还做不到在没有人参与的情况下自我改进一个产品,或者端到端做出一个新功能。失败方式很具体:让它挂在那里跑一整夜,只要有一个假设是错的,整轮下来就全是烧掉的 token。这个公开挑战值得认真对待,因为到现在也没有人能说出哪个产品或功能是全程端到端做出来的,既没有人定义需求,也没有人检查结果。另外是一个很干净的工具分工:本地的定时任务留在 Codex,云端任务交给 Grok Bot。

  • #agents
X

Thariq

Claude Code 加入 plugin evals,让 skills 扛得住模型升级

在 plugin 目录下跑一句 `claude plugin eval init`,就能回答「换了新模型之后我的 skills 还好不好使」这个问题。更深一层的意思是,单纯的通过/失败分数已经几乎没法解读了:很多 benchmark 上的失败其实来自过于严苛的隐藏测试,有些情况下模型给出的答案反而比标准答案更合理。

  • #evals
  • #agents
X

Aaron Levie

Box CEO

Box 现在可以直接挂进 agent 的沙箱里读写文件

把 Box 挂进沙箱之后,agent 就能在自己的电脑上读写文件。背后的理由是:agent 正在接手企业里的关键工作流,它们需要人一直拥有的那些基本能力,首先就是一个真正的文件系统。

  • #agents
  • #products
X

Guillermo Rauch

Vercel CEO

Tailscale 的 model router 跑在 Vercel AI Gateway 上

AI gateway 正在变成当年的 CDN:你当然可以直连源站,但很脆弱,而自己造一套既痛苦又贵。Tailscale 的 model router 现在就以 Vercel AI Gateway 作为底层基础设施。

  • #products
X

Nikunj Kothari

FPV Ventures Partner

未来两年,VC 的业绩记录会被悄悄改写

大额退出和大幅估值提升本来就稀少,而这恰恰是募下一期基金的依据,所以成功的 VC 会为热门项目的归属权争得很凶。预测很具体:会有人的名字被从记录里抹掉,或者被「恰好」略过,因为大家都在修改历史,好把赢家算到自己头上。新晋 GP 受伤最重,业绩记录是他们面对未来 LP 时唯一拿得出手的东西。防守方式是和你的创始人保持紧密关系,他们才是真正的背景调查人。

  • #funding
X

Zara Zhang

一人公司被高估了,因为一个人做东西真的很孤独

AI 确实让一个人能做的事情多了很多,但这没说到 cofounder 真正的意义。做一件全新的事是一种极其孤独的体验,你需要有人一起头脑风暴、一起熬、一起庆祝。如果没有和另一个人把自己绑在同一根桅杆上,动力是很容易崩掉的。

  • #startups
X

Peter Steinberger

Astra 靠 computer use 在云端会话里玩起了 Doom

把 Astra 跑在 OpenClaw 上,开一个云端会话,让 CUA 去操作机器,模型就把 Doom 玩起来了。Peter Steinberger 的评价是:算不上 AGI,但大概能赢过一只苍蝇的大脑。为了跑通这件事,他给 trycua 提了个补丁,让按键在 Linux 下能稳定生效,不过他仍然认为这整体上是个靠谱的框架。

  • #agents
  • #open-source
X

Matt Turck

FirstMark Capital VC

选了 53 层而不是 104 层,一家在 9/11 里幸存下来的创业公司

TripleHop 是一家 25 人的企业搜索创业公司,做的事情大致就是今天 Glean 在做的,当时把办公室设在了北塔,因为世界贸易中心正拿优惠条件招揽年轻的 dot-com 公司。他们选了更便宜的 53 层,而没有选 104 层附近的那处空间,那里视野好得难以置信,但等电梯要等到天荒地老。8 点 46 分那一刻,办公室里只有一名员工 Kenton Beerman,他毫发无伤地脱了身;CTO 做的备份让公司在当天结束前就重新运转起来。几周前第一次去纪念馆,心里想的是,其实只差一点点:晚一个小时,低几层楼,或者换成另一处办公室。

  • #startups
X

Garry Tan

Y Combinator President & CEO

考到 1600 应该解锁一张更难的卷子,而不是让衡量就此结束

SAT 满分正好卡在这套工具不再提供任何信息的地方,所以应该有第二张更难的考试,在 1600 之上再叠一个分数。而现实是考试被取消,招生变成随机抽签,卓越也就再没办法被识别出来。

  • #policy
X

Aditya Agarwal

SPC General Partner

SPC 开启秋季系列,聊科技监管和加州的两党格局

摆在桌面上的问题是:怎么在加州鼓励真正的创新,怎么让加州变成一个两党竞争的州,以及科技应该被怎样监管。整个秋天会有决策者陆续参与,第一位是 9 月 23 日的 Steve Hilton。另外还有一段关于 9/11 的回忆:当时他正在 CMU 的 Wean Hall 7500 教室里上课听到消息,周围的人因为有一架飞机接近匹兹堡而陷入恐慌,而他希望自己那时能有 United 93 上那些乘客的勇气。

  • #policy

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。

AI构建者摘要 — 2026-09-12 · LLMRates.ai