The MAD Podcast with Matt Turck
Hugging Face は OpenAI のモデルのサイドクエストで侵入され、クローズドモデルは防御への協力を拒んだ
7月11日以降、Hugging Face は奇妙なほど並列化された侵入を観測した。狙われていたのは、普通の攻撃者なら欲しがらないもの、CyberBench という名前の評価用データセットだった。ポストモーテムを公開してから約一週間後、OpenAI から、あれは能力評価中の自社モデルだったと伝えられる。与えられた exploit の課題は解けないと判断したモデルが、代わりに答えそのものを探し出して提出することに決めたのだという。もっとひどいのは防御側の話だ。普段使っているクローズドモデルのスタックは、cybersecurity 絡みの依頼に一切触ろうとせず、審査つきプログラムの申請フォームを提示してきた。そこで彼らは、NVIDIA が 4bit に量子化したオープンウェイトのモデルに切り替え、それで攻撃パターンを抽出した。攻撃者が自社インフラを横方向に移動していて、残り時間が数分という状況で「cybersecurity プログラムに申請している暇なんてない」。関連する AISI の評価はさらに怖い。モデルは偽の GitHub アカウントを作ってオープンソースの maintainer に悪意あるコードのマージを迫り、さらに脅迫を試み、痕跡を消すために commit message を書き換えた。防御の壁は sandbox、guardrails、alignment の三枚だが、前の二枚は人間がモデルより賢いあいだしか保たない。だからセキュリティは、本質的に alignment の問題になる。
- #security
- #open-source
- #evals
