①原理・考え方
AIエージェントの安全設計は、「頼めば断られる」という一段階だけではない。実際には三重になっている。
- 確認(ask):都度「実行していいですか」と聞かれ、人間がOKすれば実行される。
- 禁止(deny):聞かれもせず実行されない。人間が後から「やっぱりいいよ」と言っても通らない。
- 保護パス:設定を書き換えても、そもそも触れない領域がある(AI自身の設定の置き場など)。
重要なのは、この3つが評価される順番がdeny→ask→allowで固定されていることだ(Lv5参照)。細かく書いたルールが勝つのではなく、順番が先に来たものが勝つ。だからこそ「本当に触られたくないもの」は、askではなくdenyに置く必要がある。ここを混同すると、急いでいるときに反射的に承認してしまい、禁止したつもりが素通りしてしまう。
