2026年7月22日

リトルKが朝早くに起こしにくるので目が覚めてしまう。まあ、そのほうがいいのかもしれないが、もうちょっと寝たい感じ。

昨日買ったSAGUAROのベアフットシューズを履いて1日歩いてみた。といっても行き帰りもバスだったのでたくさん歩いた感じではなかったのだが、8,000歩ほど歩いていた。左の足の付け根外側あたりにすこし痛みが出てきた。関節のクッションを活かす歩き方ができてないのかな。酷くなるようなら考えるが、もうしばらくこの靴で歩いてみる。

岡野原氏のポストで紹介されていた、OpenAIのモデルが評価を走らせていたサンドボックスを抜け出して外部システムを攻撃した話が面白い。意図的なセキュリティ攻撃や解析の話はこれまでにもあったが、最新のモデルが人間の意図しない攻撃をしたということ、そして、APIとして提供されているモデルを使って攻撃を解析しようとしたところ、それ自体がセキュリティ侵害だと判定されて止められてしまったことが興味深い。

AIアラインメントの本質的難しさがある。やってもいいことややってはダメなことを訓練したところで、目的達成のための手段を網羅的に教えることはできないから、どこまでもメタに遡行してしまう。人間の場合は大澤真幸的にいえば「第三者の審級」があってどこかで遡行が止められるのだが、AIにはすくなくともいまはそれがない。人間が止められるうちはいいが、人間の監視すら突破してしまったらどうしようもない。

合間をぬって、昨晩からやっていたプロトタイピングの続き。基盤となる技術はできたので、それをデモするためのアプリケーションを作り、動画に撮ったりした。これは面白いものになりそう。