11 条来自 11 位 builder

AI构建者摘要

真正在做 AI 的人今天说了什么。一页读完,约 5 分钟。

今天 builder 圈里聊得最多的是速率限制和缓存命中,OpenAI 的 Codex 团队公开排查了额度为什么比预期消耗得更快。Anthropic 上线了一个安全扫描器,能在整个仓库范围内找漏洞,并把补丁一并递回来。还有一条更安静的主线贯穿其中:eval、模拟和评分体系,才是评判这些系统的真正基础设施,毕竟它们已经好到没法用一个数字打分了。

X

Thibault Sottiaux

OpenAI Codex & ChatGPT

Codex 额度消耗变快,原因是缓存命中率下滑了

这周有些 Codex 用户发现额度烧得比往常快,原因是缓存命中率变差,而不是策略调整。稳定命中缓存本来就是效率账里的关键一环,命中率一掉,额度就跟着往下走。排查还在进行中,第二天会给出进展。另外,banked reset 已在太平洋时间晚上 8 点前对所有付费的 ChatGPT Work 和 Codex 用户上线。

  • #products
  • #agents
X

Claude

Claude Security 用 Mythos 扫描 GitHub 仓库,并直接给出修复建议

把它指向一个仓库,Mythos 会跨文件追踪数据、推理各组件之间如何交互,返回的结果会标上 CWE 分类,以及置信度和严重程度评级。建议的修复可以直接在网页版 Claude Code 里打开,用的是你团队本来就在跑的模型,扫描按普通 token 用量计入现有套餐。设计上模型被挡在扫描后面:它只返回发现的问题,不提供直接访问。同期还有 Defender Advantage Fund,拿出 3500 万美元额度投向开源安全;合作伙伴把 Mythos 5 集成进第三方安全产品;Cyber Verification Program 也在扩容。

  • #security
  • #products
X

Madhu Guru

Meta Sr Director, AI

把一整套 eval 压成一个分数,会盖住你最前沿场景上的退步

平均数的暴政:一个模型在摘要上从 85 提到 89、在事实问答上从 80 提到 85,同时在复杂金融分析上从 70 掉到 63,用单一数字去看仍然是一场胜利。加权分数不是解药,它只是把一次主观判断包进了虚假的数学精度里。真正的替代方案是:一层层排好优先级的 eval,一群愿意读细节而不是张口就要抽象结论的人,以及由人来判断这套系统对用户是不是真的更好。Gemini 早期就发生过这种事,今天的团队还在重复。

  • #evals
X

Swyx

模拟人类是递归自我改进的最后一道门槛

如果你认真对待递归自我改进,也就是模型接管越来越大比例的 ML 研究和 AI 工程,那么模拟人类和人类反馈就是剩下的那个瓶颈。这个视角重新解释了 Smallville:它当年没有任何商业应用,却恰恰是 Karpathy 和 Fei-Fei Li 投资那支团队的理由。Simile 在很早的阶段就已经在 Fortune 100 客户那里跑出了 product-market fit。这段坦白说得相当直接:晚了两年才想明白,而从没这么高兴自己曾经看错。

  • #agents
  • #research
X

Aaron Levie

Box CEO

当智能便宜到不值得计费,机会就转移到扩散上

同样的任务,模型成本在降;通用能力在涨;速度更快;几乎每个领域的深度都在同时加深,这个速率在科技史上没有先例。一旦智能逼近便宜到不值得计费,价值就从生产智能转向把 AI 推进真实经济。所以对应用层的 AI 公司来说,眼下是个相当好的时点:上游的竞争和创新是顺风,不是威胁。

  • #products
  • #agents
X

Guillermo Rauch

Vercel CEO

Vercel 把 is-agentic 反复跑在自家文档上,一路刷到 100/100

拿 is-agentic 这套评估反复跑他们的文档站,补掉了不少真实存在的缺口,同时刻意花力气把评判标准维持在足够高的质量上,才对得起烧掉的那些 token。现在已经支持 Grok 和 Codex 订阅,可以在 sandbox 里即时安装。Python 团队那边也在快速推进。

  • #evals
  • #products
X

Thariq

Anthropic 内部的 ELI5 skill:用大图和少量文字把代码讲清楚

prompt 很简单:假设我对这个话题一无所知,用一个 HTML artifact 来解释,图要大、字要少。内部拿它写讲解,也拿它刨问题,常见的 prompt 包括这个模块是怎么跑的、我们当初为什么这么取舍、这次故障是什么引起的。现在可以从社区 plugin 市场装上,至于要不要转成官方 plugin,还是个开放问题。

  • #agents
  • #open-source
X

Peter Yang

Instinct 的上手体验极好,但它会索引你的邮件,而且删不掉

接 iMessages、Google Workspace 和各种 MCP 的过程顺畅得不寻常,助手也比同类更主动,MCP 一连上就立刻给出可执行的建议。卡点在数据处理:它未经许可就索引并留存邮件,也没有任何办法把这些内容从它的记录里清掉,这一天不修,就一天不能推荐。另一个限制是结构性的,所有东西都挤在同一个 thread 里,所以它适合处理零碎杂事,撑不起真正的工作。真正的主力仍然是 ChatGPT Work 和 Codex。

  • #products
  • #privacy
播客

No Priors

电脑赢了人类之后,国际象棋反而更火了

Chess.com 的起点是 2005 年一场破产拍卖上花 5.6 万美元买下的域名,当时几乎每一个投资人都说这东西不值得投;如今它有 1000 万日活、2.5 亿注册用户、两亿多美元营收,而且一路增长没为此融过一分钱。机器越过超人水平这件事,确实让棋一度变得无聊,所有人都在磨 Stockfish 认可的残局;后来 Leela 这类神经网络开始下激进又反常规的棋,反倒把人类的棋路往前推了一大截,比以前刺激得多。谈到专业能力,过程上没有捷径,只有工具上有:“把你人生中随便一天拿出来,乘以一千,那大概就是你人生的样子。”创业建议是别听创业建议:2005 年的标准打法是从 Stanford 找个技术合伙人、融资、盯着大市场,而他反着来,成了。下一个项目叫 Gambit,一个扑克站点,把国际象棋那套评分体系搬到一个通常用筹码计分的游戏里:你到底有多强,而不是你能补进多少颗 M&M 豆。

  • #products
  • #founders
X

Nikunj Kothari

Claude Code 把幼儿园的食谱网站逆向成了家里机器人的每日推送

幼儿园把每天的伙食发在一个随便什么网站上,数据毫无结构。Claude Code 通过看网络请求找到了背后的 API,发现它根本没有鉴权,摸清了返回格式,然后接进了已有的 Hermes bot。现在家里的机器人每天早上播报早餐和午餐,家人可以照着准备。这种小规模的个人自动化,仍然被严重低估。

  • #agents
  • #products

发到你的邮箱

每天一封。一键退订。

数据来源

源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。

摘要由程序自动生成。据此做判断前请先看原文。