10 則來自 10 位 builder

AI構建者摘要

真正在做 AI 的人今天說了什麼。一頁讀完,約 4 分鐘。

兩家前沿實驗室同一天降價:GPT-6 Sol 和 Luna 釋出,API 價格永久砍半;Opus 5.5 成了 Claude 全線產品的預設模型,速率上限比原來多撐 25%。緊接著 Vercel 放出新一輪 Next.js evals,Opus 5.5、GPT-6 Sol 和 Fable 5.1 並列 97%,難分高下。最值得一讀的是 Box 的實測,他們量化了 token 變便宜到底換來了什麼:同樣的任務,更高的準確率,花的錢只是零頭。

X

Thibault Sottiaux

GPT-6 Sol 與 Luna 釋出,API 價格永久下調 50%

GPT-6 Sol 和 Luna 已經上線,OpenAI 這次把 API 價格砍半是永久性的,不是釋出期的促銷,這讓一批原本扛不住 token 成本的場景變得可行。官方說提升是全方位的,而寫作和整體手感是你最先能感覺到的地方。Plus、Pro 和 Business 賬戶已累積的用量也會清零重置。背後的邏輯是用能力供養效率:只有頂端有足夠強的模型,你才有資格把前沿之下的一切做便宜。

  • #products
  • #pricing
X

Cat Wu

Opus 5.5 成為 Claude Code 和 Claude 應用的預設模型

Opus 5.5 現在是 Pro、Max 和 Team 使用者在 Claude Code、Claude 應用以及 Cowork 裡的預設模型。預設 effort 檔位是 medium,官方描述是智慧水平與 Fable 5.1 相當但更快,速率上限比 Opus 5 時期多撐 25%。官方給使用者的建議是:別拿小任務試它,直接扔一個有野心的任務過去。

  • #products
  • #agents
X

Aaron Levie

Box CEO

Box 實測:Opus 5.5 的 token 用量比 Opus 5 少 63%

Box 拿 Opus 5.5 跑了複雜的企業知識工作,結果是 token 用量比 Opus 5 少 63%,囉嗦程度低 42%,完成速度快 30%;同時準確率在財務盡調任務上提升 39%,在雲成本分析上提升 65%。在一項臨床診斷任務裡,模型發現兩組資料的標準差相差超過 100 倍,於是重新正確地跑了一遍對比,最後發現所謂的旱季差異其實並不成立。Levie 把兩家實驗室同時降價解讀成 agent 版的傑文斯悖論:AI 的單任務成本下降速度超過此前任何一種技術,每降一檔就解鎖一層新的部署場景,從掃描你全部程式碼找安全問題,到把每一行日誌都讀一遍。

  • #pricing
  • #agents
  • #enterprise
X

Guillermo Rauch

Vercel CEO

Vercel 的 Next.js evals 三方並列 97%

最新一輪 Next.js evals 裡,Opus 5.5、GPT-6 Sol 和 Fable 5.1 都是 97%,Grok 4.7 以 94% 緊隨其後,價格卻比領先者便宜 2 到 7 倍。更大的判斷是:生成變便宜之後,軟體本身的定義也變了。懷念 Google Reader?那就自己生成一個部署上去,永久留著。Rauch 還認為 web 上 headless 的時機終於到了,因為現在任何一個頁面都可以長成你想要的任意奇形怪狀,不再有任何藉口不去推進設計的邊界。

  • #evals
  • #pricing
X

Boris Cherny

把 Opus 5.5 指向 Lean,換來 16 個修復競態條件的 PR

用 Lean 對 Claude Agent SDK 做形式化驗證,只花了幾條簡短的 prompt,產出 16 個修 bug 和競態條件的 PR,而寫這些的人其實並不熟 Lean。TLA+ 也能用,兩者結合起來對付資料流、併發和狀態管理這類問題尤其有效,人類 reviewer 大機率根本發現不了。另外,Opus 5.5 和 Fable 5.1 各自把 HAProxy 從 C 移植到了 Rust,兩者都幾乎透過了 HAProxy 的全部測試,但 Opus 5.5 用了 9.5 小時,對方是 12 小時,成本還低 51%。留下的問題是:找 bug 這件事最終會不會落到形式化驗證上?

  • #coding
  • #research
X

Alex Albert

一條 prompt,用檔案資料在 Blender 裡重建 1906 年的 Market Street

Opus 5.5 在 3D 建模和視覺上的提升,意味著一條 prompt 就能生成一整個世界:1906 年舊金山大地震前一天下午的 Market Street,從 Ferry Building 一路到第五街,包括 Palace Hotel、Call Building 和 Lotta's Fountain。這條 prompt 禁止使用下載來的 mesh、貼圖和 HDRI,要求為維多利亞式立面、孟莎屋頂、纜車和煤氣燈寫可複用的生成器,整個場景基於一份資料檔案搭出來,來源包括 Sanborn 火險地圖、Miles Brothers 當年 4 月拍的影片,以及那個年代的照片檔案,每一條事實都要帶上出處和置信度。

  • #coding
  • #products
X

Peter Steinberger

macOS 27 上的 ChatGPT 崩潰,根源是 libuv 裡躺了 14 年的 bug

macOS 27 更新之後 ChatGPT 開始間歇性崩潰,Astra 把原因追到了一個在 libuv 裡存在了大約 14 年的 bug。系統更新只是讓它浮出水面,缺陷本身比大多數依賴它的程式碼都要老。

  • #open-source
  • #agents
X

Nikunj Kothari

FPV Ventures partner

大額融資的頭條數字,預設裡面大半是 SPV 的錢

現在連最頂級的投資人都在大量組 SPV,規模大到你看見一個融資頭條數字時,不管公告怎麼寫,都可以合理假定其中相當一部分來自 SPV。再疊加上分檔估值,以及那些字面意思和實際含義並不一致的收入數字,結論很直白:別再信頭條了。是騾子是馬得拉出來遛遛,可這匹馬壓根沒在公開場合露過面。

  • #funding
X

Aditya Agarwal

SPC General Partner

Waymo 真正的成就是那套 eval 基礎設施,不是開車本身

今天講安全和 alignment,討論的都是模型,但機器學習安全最早的那場辯論其實是關於自動駕駛的,而那個領域只能靠證據把問題解決掉。在 SPC 接待 Dmitri Dolgov 時,最讓人印象深刻的是 Waymo 建起來的那套龐大的 eval 和測試基礎設施,正是它帶來的信心,才敢讓 2 噸重、以每小時 30 英里穿行城市的機器人上路。第一次坐 Waymo 仍然是一種近乎宗教體驗的感覺:一項真的能在真實道路上跑通的技術。完整影片隨後放出。

  • #evals
  • #hardware
X

Thariq

模型變強,該換來的是原型,而不是十倍的上線功能

面對能力躍升,錯誤的反應是把十倍數量的功能推到生產環境。正確的做法是把多出來的餘量花在理解使用者、做實驗、搭原型,以及弄懂那些你還不懂的東西上,這樣你真正上線的東西才是能用的。放到遊戲和 3D 生成上也一樣:它很適合把你腦子裡的遊戲變成現實,但你還是得先找到一個讓人玩得下去的遊戲迴圈。

  • #products
  • #agents

寄到你的信箱

每天一封。一鍵取消訂閱。

資料來源

來源資料出自 zarazhangrui 的開源專案 follow-builders,以 MIT 授權釋出。摘要由 LLM 依該專案的公開 feed 生成,摘要 prompt 亦改編自該專案。上面每一則都連結到原始出處。

摘要由程式自動生成。據此判斷前請先看原文。