Thibault Sottiaux
OpenAI Codex & ChatGPTCodex 额度消耗变快,原因是缓存命中率下滑了
这周有些 Codex 用户发现额度烧得比往常快,原因是缓存命中率变差,而不是策略调整。稳定命中缓存本来就是效率账里的关键一环,命中率一掉,额度就跟着往下走。排查还在进行中,第二天会给出进展。另外,banked reset 已在太平洋时间晚上 8 点前对所有付费的 ChatGPT Work 和 Codex 用户上线。
- #products
- #agents
真正在做 AI 的人今天说了什么。一页读完,约 5 分钟。
今天 builder 圈里聊得最多的是速率限制和缓存命中,OpenAI 的 Codex 团队公开排查了额度为什么比预期消耗得更快。Anthropic 上线了一个安全扫描器,能在整个仓库范围内找漏洞,并把补丁一并递回来。还有一条更安静的主线贯穿其中:eval、模拟和评分体系,才是评判这些系统的真正基础设施,毕竟它们已经好到没法用一个数字打分了。
Codex 额度消耗变快,原因是缓存命中率下滑了
这周有些 Codex 用户发现额度烧得比往常快,原因是缓存命中率变差,而不是策略调整。稳定命中缓存本来就是效率账里的关键一环,命中率一掉,额度就跟着往下走。排查还在进行中,第二天会给出进展。另外,banked reset 已在太平洋时间晚上 8 点前对所有付费的 ChatGPT Work 和 Codex 用户上线。
Claude Security 用 Mythos 扫描 GitHub 仓库,并直接给出修复建议
把它指向一个仓库,Mythos 会跨文件追踪数据、推理各组件之间如何交互,返回的结果会标上 CWE 分类,以及置信度和严重程度评级。建议的修复可以直接在网页版 Claude Code 里打开,用的是你团队本来就在跑的模型,扫描按普通 token 用量计入现有套餐。设计上模型被挡在扫描后面:它只返回发现的问题,不提供直接访问。同期还有 Defender Advantage Fund,拿出 3500 万美元额度投向开源安全;合作伙伴把 Mythos 5 集成进第三方安全产品;Cyber Verification Program 也在扩容。
模拟人类是递归自我改进的最后一道门槛
如果你认真对待递归自我改进,也就是模型接管越来越大比例的 ML 研究和 AI 工程,那么模拟人类和人类反馈就是剩下的那个瓶颈。这个视角重新解释了 Smallville:它当年没有任何商业应用,却恰恰是 Karpathy 和 Fei-Fei Li 投资那支团队的理由。Simile 在很早的阶段就已经在 Fortune 100 客户那里跑出了 product-market fit。这段坦白说得相当直接:晚了两年才想明白,而从没这么高兴自己曾经看错。
Vercel 把 is-agentic 反复跑在自家文档上,一路刷到 100/100
拿 is-agentic 这套评估反复跑他们的文档站,补掉了不少真实存在的缺口,同时刻意花力气把评判标准维持在足够高的质量上,才对得起烧掉的那些 token。现在已经支持 Grok 和 Codex 订阅,可以在 sandbox 里即时安装。Python 团队那边也在快速推进。
Anthropic 内部的 ELI5 skill:用大图和少量文字把代码讲清楚
prompt 很简单:假设我对这个话题一无所知,用一个 HTML artifact 来解释,图要大、字要少。内部拿它写讲解,也拿它刨问题,常见的 prompt 包括这个模块是怎么跑的、我们当初为什么这么取舍、这次故障是什么引起的。现在可以从社区 plugin 市场装上,至于要不要转成官方 plugin,还是个开放问题。
电脑赢了人类之后,国际象棋反而更火了
Chess.com 的起点是 2005 年一场破产拍卖上花 5.6 万美元买下的域名,当时几乎每一个投资人都说这东西不值得投;如今它有 1000 万日活、2.5 亿注册用户、两亿多美元营收,而且一路增长没为此融过一分钱。机器越过超人水平这件事,确实让棋一度变得无聊,所有人都在磨 Stockfish 认可的残局;后来 Leela 这类神经网络开始下激进又反常规的棋,反倒把人类的棋路往前推了一大截,比以前刺激得多。谈到专业能力,过程上没有捷径,只有工具上有:“把你人生中随便一天拿出来,乘以一千,那大概就是你人生的样子。”创业建议是别听创业建议:2005 年的标准打法是从 Stanford 找个技术合伙人、融资、盯着大市场,而他反着来,成了。下一个项目叫 Gambit,一个扑克站点,把国际象棋那套评分体系搬到一个通常用筹码计分的游戏里:你到底有多强,而不是你能补进多少颗 M&M 豆。
源数据来自 zarazhangrui 的开源项目 follow-builders,以 MIT 许可发布。摘要由 LLM 基于该项目的公开 feed 生成,摘要 prompt 亦改编自该项目。上面每一条都链接到原始出处。
摘要由程序自动生成。据此做判断前请先看原文。