10 件10 人の builder から

AI Builders Digest

AI を実際につくっている人たちが今日話したこと。1 ページ、約 5 分。

フロンティアラボ2社が同じ日に値下げしました。GPT-6 Sol と Luna は API 価格の恒久的な 50% 引きとともに登場し、Opus 5.5 は Claude の各プロダクトでデフォルトになって、レート制限も 25% 伸びました。さらに Vercel の最新 Next.js eval では、Opus 5.5、GPT-6 Sol、Fable 5.1 が 97% で横一線。いちばん読む価値があったのは Box で、token が安くなると実際に何が買えるのかを測っています。同じタスクで、精度は上がり、支出はごく一部。

X

Thibault Sottiaux

GPT-6 Sol と Luna、API 価格の恒久 50% 引きとともに登場

GPT-6 Sol と Luna が公開され、OpenAI は API 価格を半額にしました。ローンチ時の期間限定キャンペーンではなく恒久的な値下げで、これまでの token コストでは成立しなかった類のユースケースが、どちらのモデルでも射程に入ります。改善は全方面に及ぶとされ、まず気づくのは文章と全体的な手触りだそうです。Plus、Pro、Business の各アカウントには、積み上がっていた利用枠のリセットも入ります。位置づけは、能力が効率を支えるという構図です。フロンティアより下のすべてを安くできるのは、頂点にとんでもないモデルを持っているからこそ、ということですね。

  • #products
  • #pricing
X

Cat Wu

Opus 5.5 が Claude Code と Claude アプリのデフォルトに

Opus 5.5 が、Claude Code、Claude アプリ、Cowork のいずれでも Pro / Max / Team のデフォルトになりました。デフォルトの effort 設定は medium で、知能面では Fable 5.1 と同等ながらより速いとされています。レート制限も Opus 5 のときより 25% 長く使えます。ユーザーへの呼びかけは、小さな用事ではなく野心的なタスクを渡してみてほしい、というもの。

  • #products
  • #agents
X

Aaron Levie

Box CEO

Box の計測では、Opus 5.5 の token 消費は Opus 5 より 63% 少ない

Box が複雑なエンタープライズのナレッジワークで Opus 5.5 を試したところ、Opus 5 に比べて token は 63% 減、冗長さは 42% 減、完了までの時間は 30% 短縮。精度も財務デューデリジェンスで 39%、クラウドコスト分析で 65% 向上しました。臨床診断のタスクでは、2 群の標準偏差が 100 倍以上ずれていることにモデル自身が気づき、比較をやり直したうえで、乾季の差は実際には成立しないと結論づけています。Levie は 2 社同時の値下げを、agent に適用された Jevons のパラドックスとして読んでいます。AI のタスク当たりコストは過去のどの技術よりも速く下がり、下がるたびに次の段階の使い方が解禁される。コード全体をセキュリティ観点でスキャンする、ログを 1 行残らず読ませる、といった具合です。

  • #pricing
  • #agents
  • #enterprise
X

Guillermo Rauch

Vercel CEO

Vercel の Next.js eval、97% で三者同着

最新の Next.js eval では Opus 5.5、GPT-6 Sol、Fable 5.1 がそろって 97%。Grok 4.7 が 94% で続き、しかも上位勢より 2 倍から 7 倍安い。もっと大きな主張は、生成が安くなるとソフトウェアの意味そのものが変わるということです。Google Reader が好きだった? 自分用に生成してデプロイし、ずっと持ち続ければいい。Rauch はさらに、web における headless の出番がついに来たと言います。どのページも好きなだけ気まぐれな形を取れるようになった以上、デザインのフロンティアを押し広げない理由はもう残っていない、と。

  • #evals
  • #pricing
X

Boris Cherny

Opus 5.5 を Lean に向けたら、race condition 修正の PR が 16 本

Claude Agent SDK を Lean で形式検証する作業は、短い prompt を数本投げるだけで済み、バグと race condition を直す PR が 16 本出てきました。書いたのは Lean に詳しくない人です。TLA+ でも同じことができて、両方を組み合わせるとデータフロー、並行性、状態管理あたりで、人間のレビュアーならおそらく一生気づかない類の問題に効きます。別件では、Opus 5.5 と Fable 5.1 がそれぞれ HAProxy を C から Rust に移植し、どちらも HAProxy のテストをほぼ全部通しました。ただし所要時間は Opus 5.5 が 9.5 時間で、もう一方は 12 時間。コストは 51% 安く済んでいます。残る問いは、バグ探しの行き着く先は形式検証なのか、ということ。

  • #coding
  • #research
X

Alex Albert

prompt 1 本で、1906 年の Market Street を資料から Blender に再現

Opus 5.5 の 3D モデリングと視覚能力が上がった結果、prompt 1 本で世界がまるごと出てくるようになりました。1906 年の地震の前日午後のサンフランシスコ、Market Street の Ferry Building から Fifth まで。Palace Hotel、Call Building、Lotta's Fountain も入っています。prompt はダウンロードした mesh、texture、HDRI の使用を禁じ、ヴィクトリアン様式のファサード、マンサード屋根、ケーブルカー、ガス灯については再利用可能なジェネレータを書かせています。素材となる資料ファイルは Sanborn の火災保険地図、その年の 4 月に Miles Brothers が撮ったフィルム、当時の写真アーカイブから組み立てたもので、記述のひとつひとつに出典と確信度が付いています。

  • #coding
  • #products
X

Peter Steinberger

macOS 27 での ChatGPT クラッシュ、原因は 14 年前からある libuv のバグ

macOS 27 にアップデートしてから ChatGPT が断続的にクラッシュするようになり、Astra が原因を追ったところ、libuv に約 14 年放置されていたバグに行き着きました。OS のアップデートはそれを表に出しただけで、欠陥そのものは、それに依存しているコードの大半より古いという話です。

  • #open-source
  • #agents
X

Nikunj Kothari

FPV Ventures partner

大型ラウンドの見出し額は、大半が SPV のカネだと思っておく

一流の投資家でさえ組成している SPV の量はかなりのもので、資金調達の見出し額を見たら、発表文に何が書かれていようと、その相当部分は SPV 由来だと考えておいて差し支えありません。そこに、トランシェに分かれたバリュエーションと、見た目どおりの意味を持たない売上の数字が積み重なります。結論は率直で、見出しを信じるのはやめること。本当のところは中身を食べてみないと分からないし、その中身はどこにも公開されていません。

  • #funding
X

Aditya Agarwal

SPC General Partner

Waymo の本当の成果は運転ではなく eval のインフラ

いまの安全性と alignment の議論はモデルの話ですが、機械学習の安全性論争がもともと戦われた場所は自動運転車で、あの分野はそれを証拠で決着させるしかありませんでした。SPC に Dmitri Dolgov を招いて印象的だったのは、時速 30 マイルで街を走る 2 トンのロボットを世に出す確信を得るために、Waymo が積み上げてきた膨大な eval とテストのインフラです。Waymo に初めて乗る体験は、いまだに宗教的と言っていいもの。実際の道路でちゃんと動く技術ですから。フル動画は追って公開予定。

  • #evals
  • #hardware
X

Thariq

モデルが良くなった分で買うべきは、10 倍の機能出荷ではなくプロトタイプ

能力が跳ね上がったときの間違った使い方は、機能を 10 倍の量で本番に出すことです。正しいのは、浮いた分をユーザーの理解、実験、プロトタイプ作り、自分がまだ分かっていないことの学習に回して、出すものがちゃんと機能する状態にすること。ゲームと 3D 生成に当てはめるなら、頭の中のゲームを実体にするには最高の道具だけれど、満足できるゲームループを先に見つける仕事は、依然として自分の仕事だということです。

  • #products
  • #agents

メールで受け取る

1 日 1 通。購読解除はワンクリックです。

データの出どころ

元データは zarazhangrui によるオープンソースプロジェクト follow-builders(MIT ライセンス)から取得しています。要約はそのプロジェクトの公開フィードをもとに LLM が生成し、要約プロンプトも同プロジェクトを改変したものです。上記の各項目は原文にリンクしています。

要約は自動生成です。判断の根拠にする前に原文をご確認ください。