12 条来自 12 位 builder

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 6 分钟。

今天有两场关于天花板在哪的重要争论。Jerry Tworek 和 Rohan Anil 认为瓶颈就是 transformer 本身,它一旦离开实验室就再也学不动了;而 Aaron Levie 觉得天花板在于可验证性,最难的活反而最先被自动化,恰恰因为它们能被测出对错。与此同时,Vercel 把一个内部 agent 放到了自家运营的中枢位置,还有一位投资人说,当前的融资市场跟基本面已经彻底脱钩,而且至少还得再脱钩一年。

播客

Training Data

Core Automation 创始人:瓶颈是 transformer,不是算力

Jerry Tworek 在 OpenAI 把 RL 规模化的时候,一直相信这条路能走通,他说 2025 本该是万事皆解的一年。结果 benchmark 一路往上涨,真实世界的任务却依旧一团乱麻,因为 eval 和训练数据本来就是一体两面,而两者都跟真实部署对不上。他的结论是模型必须能在 test time 学习,而这恰恰是 transformer 结构上做不到的事,所以 Core Automation 正在找一种替代架构,并把 AGI 定义为无需人类介入就能自我改进的模型。用他的话说,现在人类加 LLM 的混合体确实非常成功,但去掉人类的 LLM,就没那么行了。Rohan Anil 补了一堵很实际的墙:他们办过一场 QR kernel 竞赛,要把 cuSolver 打赢 60 倍,大概需要地球上仅有的三个人,再加十万美元的 coding agent 算力,花上四周,而没有任何前沿模型能接近解出这道题。

  • #research
  • #agents
  • #hardware
X

Guillermo Rauch

Vercel CEO

Vercel 现在把内部运营全都跑在一个自研 agent 上

Guillermo Rauch 说,Vercel 现在每天的日常工作都要经过一个叫 @v 的内部 agent,日交互量和 token 消耗都在指数级增长,能力范围横跨财务、公关、文档、市场、工程和数据分析。它为每个用户保留独立的 memory、workflow 和日程安排,也是 Eve 设计的基础。真正有意思的是路由这一层:Vercel 之前建过几十个各自独立的 agent,他把那种做法比作给每个 agent 都配一个自己的域名,于是 @v 干脆同时当 agent 和 router,底下挂 sub-agent、skill 和委派机制。至于为什么不直接接一个第三方的 Slack 集成了事,他的理由是所有权,因为如果 agent 最终等同于现代公司本身,你会希望从源码到运行时到数据再到 token 都攥在自己手里。

  • #agents
  • #products
X

Aaron Levie

Box CEO

最难的工作最先被自动化,因为它最容易验证

Aaron Levie 的说法是,数学、网络安全和写代码之所以早早被自动化,不是尽管它们难,而是因为对错可以客观测出来,这让训练拿到了更清晰的 reward signal,也让你能在规模上确认部署确实有效。而法律条款、市场活动、销售话术、预算制定,这些事没有唯一正解,取决于操盘者的风险偏好,而且往往要等模型出完结果很久之后才评得出好坏。这个推论跟纯粹的模型规模化路线正好相反:哪怕能力还在指数级增长,大部分价值仍然会在应用层被创造出来,而底层的业务流程本身也必须跟着改。他觉得我们可能需要一整套全新的方式去测量知识工作,就像软件行业早就有的那样。

  • #evals
  • #agents
X

Dan Shipper

Every CEO

Dan Shipper 拆解「主体性断裂」的三个阶段

看着模型独自完成一件过去每一步都离不开你的事,感觉近乎一种死亡,因为我们把自己等同于自己的产出,而这事儿没人征求过我们同意。Shipper 说这种反应会沿着一条可预测的弧线走:一开始你眼里只有 AI,于是你说「AI 解决了那道 Erdos 问题」;接着你注意到背后的人类脚手架,于是你说「我的工作就是给 Claude 当保姆」;最后你围绕脚手架本身重建了主体性,因为它现在看上去才是真正的活儿,于是你又开始说「这是我做的」,AI 只是不言自明的一部分。他押注的是,把这些断裂消化成玩心和好奇心的能力,决定了谁能在 AI 经济里活得好,而每一次能力跃迁都会给此前尚未被波及的人群,比如数学家,制造出新的断裂。

  • #agents
  • #culture
X

Nikunj Kothari

FPV Ventures Partner

「VC 已经基本彻底变成了 vibes capital」

Nikunj Kothari 说,早期和中期的定价现在跟基本面完全脱钩,有些公司什么都没有却融到了离谱的轮次,而看上去板上钉钉的项目反倒举步维艰。决定结局的是你在不在当红赛道上,而且他认为大多数人期待的那种回调不会来,充裕的 dry powder 加上 AI 的顺风,至少还能把这局面延长 12 到 18 个月。公开市场烧的是同一种燃料,万亿美元市值的股票会因为 vibes 和模型发布单日波动超过 5%,最近的存储和 KOSPI 就是例子,而且轮动的节奏越来越快。他的建议是,盈利能力和干净的 cap table 最终还是会赢,但创始人在碰资本市场之前,得先搞明白眼下这个漩涡是怎么回事。

  • #funding
  • #markets
X

Thariq

杰文斯悖论已经在数学界显形,需求还在涨

Thariq 认为 AI 之于数学,走的路跟当年的国际象棋一样。事情变多了,也变得更容易看懂,数学家有了更多时间在更高的抽象层上跟外行讨论它。他的结论跟「取代论」正好相反:懂数学、会用数学思考的人,需求是往上走的,不是往下。

  • #research
  • #culture
X

Peter Yang

Hermes 怎么防止自建的 skill 变成一堆垃圾

Hermes 会自己造 skill 来干活,那问题就来了:靠什么阻止这个库慢慢腐烂。Nous Research 联合创始人 karan4d 告诉 Peter Yang,答案是 Hermes Curator,一个按计划在你的 agent 内部跑的后台任务,一边清理 skill 和 memory,一边不断追问哪里是垃圾、哪里还能更高效。因为它是开源的,你可以把自己对「垃圾」的定义交给它,它会照着重写自己的清理循环。

  • #agents
  • #open-source
X

Swyx

一个 computer-use agent 跑去打客服,还把理吵赢了

Swyx 正在为一期相关播客收集 Codex 的 computer-use 高光时刻,目前最亮眼的一个是 agent 代他去客服聊天窗口,一路把问题升级以求更快解决。客服想把锅甩到他这边,结果 agent 把证据一条不落地全甩了回去。他补了一句:那些人类完全不知道自己在跟一个 bot 说话。

  • #agents
  • #products
X

Garry Tan

Y Combinator President & CEO

Garry Tan:结果才是疆域,其余都只是地图

Tan 谈精英主义的观点是,人们总把地图错当成疆域,而在市场里,疆域无非就是你有没有做出别人真正想要的东西。除此之外,他把 AI 驱动的经济增长称为眼下最好的一颗白色药丸,并且注意到,公众的惊奇感恰恰在惊奇的量开始垂直上升的那一刻消失了。

  • #culture
  • #markets
X

Ryo Lu

如果我们要告别 app,软件还剩哪部分是看得见的

Ryo Lu 把 Rdio、Mailbox 和 Apple 视为自己早年的老师,这些 app 发明的交互模式,让软件用起来更简单、更顺手。眼下那个时代正在结束,他想问的是:软件还有哪些部分会留在人眼可见的地方,以及那些部分该是什么手感。

  • #design
  • #products
X

Andrej Karpathy

Karpathy 把「鹈鹕骑自行车」测试做成了能玩、能 fork 的版本

接着 Simon Willison 关于 pelican on a bicycle 测试的最新一篇,Karpathy 把源码传了上去,现在能直接在浏览器里跑,谁都可以 fork。他顺带说了一句:留意一下,GTA Hobbiton 可能会比 GTA VI 先发。

  • #evals
  • #open-source

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。

AI构建者摘要 — 2026-08-03 · LLMRates.ai