AIエージェントのセキュリティの全体像|非決定論的・自律的・適応的・分散的な4特性と、9つのリスク・6つの対策

AIエージェントのセキュリティ|9つのリスクと6つの対策

AIエージェントとは、指示を待つのではなく、目標に向かって自分で手順を決めて動くAIのことです。ならば目標そのものも書き換えさせられるはずだと考えて、実装しました。動きました。ただし提案の根拠として引用された見出しが、実在しないことがありました。しかも「確信度は高い」と自己申告されています。AIの自己申告を信頼境界にしてはいけません。根拠が実在するかを機械が検証する多段の安全弁を、実装ごと書きます。
View Post