10 条来自 10 位 builder

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 4 分钟。

两家前沿实验室同一天降价:GPT-6 Sol 和 Luna 发布,API 价格永久砍半;Opus 5.5 成了 Claude 全线产品的默认模型,速率上限比原来多撑 25%。紧接着 Vercel 放出新一轮 Next.js evals,Opus 5.5、GPT-6 Sol 和 Fable 5.1 并列 97%,难分高下。最值得一读的是 Box 的实测,他们量化了 token 变便宜到底换来了什么:同样的任务,更高的准确率,花的钱只是零头。

X

Thibault Sottiaux

GPT-6 Sol 与 Luna 发布,API 价格永久下调 50%

GPT-6 Sol 和 Luna 已经上线,OpenAI 这次把 API 价格砍半是永久性的,不是发布期的促销,这让一批原本扛不住 token 成本的场景变得可行。官方说提升是全方位的,而写作和整体手感是你最先能感觉到的地方。Plus、Pro 和 Business 账户已累积的用量也会清零重置。背后的逻辑是用能力供养效率:只有顶端有足够强的模型,你才有资格把前沿之下的一切做便宜。

  • #products
  • #pricing
X

Cat Wu

Opus 5.5 成为 Claude Code 和 Claude 应用的默认模型

Opus 5.5 现在是 Pro、Max 和 Team 用户在 Claude Code、Claude 应用以及 Cowork 里的默认模型。默认 effort 档位是 medium,官方描述是智能水平与 Fable 5.1 相当但更快,速率上限比 Opus 5 时期多撑 25%。官方给用户的建议是:别拿小任务试它,直接扔一个有野心的任务过去。

  • #products
  • #agents
X

Aaron Levie

Box CEO

Box 实测:Opus 5.5 的 token 用量比 Opus 5 少 63%

Box 拿 Opus 5.5 跑了复杂的企业知识工作,结果是 token 用量比 Opus 5 少 63%,啰嗦程度低 42%,完成速度快 30%;同时准确率在财务尽调任务上提升 39%,在云成本分析上提升 65%。在一项临床诊断任务里,模型发现两组数据的标准差相差超过 100 倍,于是重新正确地跑了一遍对比,最后发现所谓的旱季差异其实并不成立。Levie 把两家实验室同时降价解读成 agent 版的杰文斯悖论:AI 的单任务成本下降速度超过此前任何一种技术,每降一档就解锁一层新的部署场景,从扫描你全部代码找安全问题,到把每一行日志都读一遍。

  • #pricing
  • #agents
  • #enterprise
X

Guillermo Rauch

Vercel CEO

Vercel 的 Next.js evals 三方并列 97%

最新一轮 Next.js evals 里,Opus 5.5、GPT-6 Sol 和 Fable 5.1 都是 97%,Grok 4.7 以 94% 紧随其后,价格却比领先者便宜 2 到 7 倍。更大的判断是:生成变便宜之后,软件本身的定义也变了。怀念 Google Reader?那就自己生成一个部署上去,永久留着。Rauch 还认为 web 上 headless 的时机终于到了,因为现在任何一个页面都可以长成你想要的任意奇形怪状,不再有任何借口不去推进设计的边界。

  • #evals
  • #pricing
X

Boris Cherny

把 Opus 5.5 指向 Lean,换来 16 个修复竞态条件的 PR

用 Lean 对 Claude Agent SDK 做形式化验证,只花了几条简短的 prompt,产出 16 个修 bug 和竞态条件的 PR,而写这些的人其实并不熟 Lean。TLA+ 也能用,两者结合起来对付数据流、并发和状态管理这类问题尤其有效,人类 reviewer 大概率根本发现不了。另外,Opus 5.5 和 Fable 5.1 各自把 HAProxy 从 C 移植到了 Rust,两者都几乎通过了 HAProxy 的全部测试,但 Opus 5.5 用了 9.5 小时,对方是 12 小时,成本还低 51%。留下的问题是:找 bug 这件事最终会不会落到形式化验证上?

  • #coding
  • #research
X

Alex Albert

一条 prompt,用档案资料在 Blender 里重建 1906 年的 Market Street

Opus 5.5 在 3D 建模和视觉上的提升,意味着一条 prompt 就能生成一整个世界:1906 年旧金山大地震前一天下午的 Market Street,从 Ferry Building 一路到第五街,包括 Palace Hotel、Call Building 和 Lotta's Fountain。这条 prompt 禁止使用下载来的 mesh、贴图和 HDRI,要求为维多利亚式立面、孟莎屋顶、缆车和煤气灯写可复用的生成器,整个场景基于一份资料文件搭出来,来源包括 Sanborn 火险地图、Miles Brothers 当年 4 月拍的影片,以及那个年代的照片档案,每一条事实都要带上出处和置信度。

  • #coding
  • #products
X

Peter Steinberger

macOS 27 上的 ChatGPT 崩溃,根源是 libuv 里躺了 14 年的 bug

macOS 27 更新之后 ChatGPT 开始间歇性崩溃,Astra 把原因追到了一个在 libuv 里存在了大约 14 年的 bug。系统更新只是让它浮出水面,缺陷本身比大多数依赖它的代码都要老。

  • #open-source
  • #agents
X

Nikunj Kothari

FPV Ventures partner

大额融资的头条数字,默认里面大半是 SPV 的钱

现在连最顶级的投资人都在大量组 SPV,规模大到你看见一个融资头条数字时,不管公告怎么写,都可以合理假定其中相当一部分来自 SPV。再叠加上分档估值,以及那些字面意思和实际含义并不一致的收入数字,结论很直白:别再信头条了。是骡子是马得拉出来遛遛,可这匹马压根没在公开场合露过面。

  • #funding
X

Aditya Agarwal

SPC General Partner

Waymo 真正的成就是那套 eval 基础设施,不是开车本身

今天讲安全和 alignment,讨论的都是模型,但机器学习安全最早的那场辩论其实是关于自动驾驶的,而那个领域只能靠证据把问题解决掉。在 SPC 接待 Dmitri Dolgov 时,最让人印象深刻的是 Waymo 建起来的那套庞大的 eval 和测试基础设施,正是它带来的信心,才敢让 2 吨重、以每小时 30 英里穿行城市的机器人上路。第一次坐 Waymo 仍然是一种近乎宗教体验的感觉:一项真的能在真实道路上跑通的技术。完整视频随后放出。

  • #evals
  • #hardware
X

Thariq

模型变强,该换来的是原型,而不是十倍的上线功能

面对能力跃升,错误的反应是把十倍数量的功能推到生产环境。正确的做法是把多出来的余量花在理解用户、做实验、搭原型,以及弄懂那些你还不懂的东西上,这样你真正上线的东西才是能用的。放到游戏和 3D 生成上也一样:它很适合把你脑子里的游戏变成现实,但你还是得先找到一个让人玩得下去的游戏循环。

  • #products
  • #agents

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。