ガードレールとガバナンスとは:AIエージェントを統制する仕組みと定義

AIエージェントのガードレールとガバナンスとは、そのエージェントに何をする権限があるかを定め、実際に何をしたかを事後に検証できるようにする、規則、権限、統制の総称です。

Atakoのエージェントが執筆 · 確認・承認者 Romain Laodicina · Atako CTO

簡単な定義

ガードレールとガバナンスとは、AIエージェントに何をする権限があるかを、行動の前、実行中、実行後にわたって規定する、規則、権限、統制の総称です。アクションごとの権限、機微な判断に対する人間承認、実際に起きたことの監査、そしていつでもアクセスを遮断できる能力を含みます。

AIエージェントに、自らのツールを使って単独で行動する力を与えることは、すぐさま信頼の問題を生みます。何をする権限を与えるかを誰が決め、その範囲を超えていないことを事後にどう検証するのか、という問いです。ガードレールとガバナンスは、この問いに共同で答えます。一方は個々の行動という技術的なレベルで、もう一方はシステム全体という組織的なレベルで応えます。

詳しい定義

ガードレールとは、AIエージェントに何をする権限があるかを制限する具体的な仕組みです。アクションごとの正確な権限、限定されたアクセス範囲、クォータ、機微な判断に対する人間承認のチェックポイントなどです。ガバナンスとは、これらのガードレールが検討され、決定され、監査される、より広い枠組みのことです。誰がそれを設定する権限を持つか、リスクをどう文書化するか、システムが想定どおりに動作したことを事後にどう検証するか、といったことです。

現在、AIガバナンスをめぐる議論は、異なる論理を持つ2つの参照枠に支えられています。米国で2023年1月に公開されたNISTのAIリスクマネジメントフレームワーク(AI RMF 1.0)は、4つの機能を軸に構成された任意の枠組みです。Govern(統治する、文化と責任を定める横断的な機能)、Map(特定のシステムのリスクを把握する)、Measure(そのリスクを測定する)、Manage(それを管理する)です。一方、欧州連合のAI Actは拘束力を持つ規制文書です。高リスクに分類されるシステムに対しては、リスク管理システム(第8条)、学習データのガバナンス(第10条)、技術文書(第11条)、イベントの自動記録(第12条)、利用者への透明性、実効的な人間による監督(第13条・第14条)を義務付けています。高リスクシステムに関する主要な義務は、附属書III対象のシステムについては2027年12月から、附属書I対象のシステムについては2028年8月から適用されます。

性質の異なる2つの枠組み(任意か拘束力ありか)に共通するのは、トレーサビリティ(何が起きたかを記録すること)と人間による監督を、管轄地域を問わず、真剣なAIガバナンスに欠かせない要素として重視している点です。

仕組み

効果的なガードレールの仕組みは、最も広いレベルから最も精密なレベルまで、複数の層で働きます。最も広いレベルでは、どのツールをシステムに接続するか、どのカテゴリーの行動をそもそも検討対象とするかを決めます。中間のレベルでは、人であれエージェントであれ、誰がどのツールを、どの範囲(読み取り専用か、読み書きか)で使う権限を持つかを定めます。最も精密なレベルでは、個々の行動が要求された時点でそれぞれ検証されます。権限は存在するか、その行動を正確にカバーしているか、引数は有効か、といった具合です。

こうしたガードレールを構築するうえで最も堅牢な原則は、デフォルト拒否(deny-by-default)です。明示的な権限が付与されるまでは何も許可されません。後から個別に制限していく広いアクセスから出発するのではありません。構築の手間はかかりますが、セキュリティ上最も頻発する誤り、つまり許可の付け忘れではなく、制限の付け忘れを防げます。

ガバナンスは、責任と検証可能性という層を加えます。誰が、いつ、どのガードレールを設定したのか、疑問が生じた際に監査によって実際に何が起きたかを事後に再構成できるか、といったことです。

Atakoでの具体例

Atakoでは、権限モデルはまさにこのデフォルト拒否の原則に基づいています。企業レベルでツール(Slack、GitHub、HubSpot、その他のインテグレーション)を接続しても、明示的な「グラント」が作成されるまで、どのエージェントにもアクセス権は与えられません。グラントは、特定のエージェントと特定の接続を結びつけるもので、許可されるアクションの正確な一覧(GitHub全体への汎用的なアクセスではなく、例えばlist_issuescreate_issueのみといった具合)、スコープ(読み取り専用か読み書きか)、任意の有効期限を伴います。誤って読み取り専用のグラントの一覧に書き込みアクションが追加されてしまった場合でも、スコープがその実行をブロックします。二重の制御になっています。

Atakoがドキュメント化している判断経路はこの流れをたどります。エージェントが行動の意図を表明し、プラットフォームがグラントの存在、そのアクションが許可一覧に含まれているか、スコープが十分か、引数が有効かを確認し、そこで初めてサードパーティ提供元への実際の呼び出しを実行し、結果をエージェントに返します。アクセスの秘密情報そのものが返されることは決してありません。各ステップの失敗は記録され、これが直接エージェントの可観測性を支えます。

失効の面では、アクセスの遮断は即座かつ確定的です。接続を失効させると、暗号化された秘密情報がその場で削除され、猶予期間はなく、それに依存していたすべてのエージェントは即座にアクセスを失います。これは疑いが生じた際に素早く動くための、最終手段のガードレールです。

よくある誤解

よくある誤りは、あるツールへのアクセスを許可することが、そのツールへの完全なアクセスを与えることと同義だと考えることです。優れたガバナンスの仕組みは、サービスへのアクセス(接続)と、その上で行動する権限(グラント、正確なアクションとスコープを伴うもの)を常に区別します。

第二の誤りは、AIガバナンスが実務上の効果を持たない規制上の書類仕事に過ぎないと考えることです。NISTのような任意の枠組みであれ、欧州のAI Actのような拘束力のある文書であれ、同じ具体的な要求事項が繰り返し登場します。リスクを文書化すること、行動を記録すること、機微な判断についてヒューマン・イン・ザ・ループを維持することです。これらは形式的なものではなく、運用上の仕組みです。

第三の誤りは、技術的なガードレールと人間承認を混同することです。権限とクォータは、毎回人間の介入を伴わず自動的に適用されます。人間承認は別のガードレールであり、リスクの度合いから見て、プロセスを意図的に遅らせて誰かが実行前に確認する価値がある行動に限定されます。

最後に、閲覧可能な監査の必要性を過小評価するのは典型的な誤りです。誤った行動を適切にブロックするガードレールは有用ですが、何が許可され、拒否され、実行されたかを閲覧できる履歴がなければ、顧客や規制当局がいつか必ず尋ねる問い、そのエージェントが正確に何をしたのか、そしてなぜかという問いに、落ち着いて答えることはできません。

関連用語

よくある質問

AIエージェントにとってガードレールとは何ですか。

ガードレールとは、AIエージェントが行動を起こす前にすでに、そのエージェントにできることを制限する規則や統制です。特定のアクションに対する正確な権限、読み取り専用に限定されたスコープ、クォータ、あるいは機微な行動が実行される前に必須とされる人間承認のチェックポイントなどが該当します。

ガードレールとAIガバナンスの違いは何ですか。

ガードレールは、特定の行動を制限する具体的で技術的な仕組み(権限、クォータ、承認)です。ガバナンスはより広い枠組みで、これらのガードレールが組織内でどう決定され、適用され、監査されるかを定める方針、役割、責任のことです。

AIガバナンスは法律上義務付けられていますか。

管轄地域とシステムのリスクレベルによります。欧州連合ではAI Actが、高リスクに分類されるシステムに対して、リスク管理、技術文書、人間による監督の義務を課しており、2026年まで段階的な適用が進められています。米国のNISTのような他の枠組みは任意のままですが、規制当局や監査人の間で参照基準として広く使われています。

AIエージェントにおけるデフォルト拒否(deny-by-default)の原則とは何を意味しますか。

エージェントは、明示的な権限が付与されるまで、いかなる行動も実行できないという意味です。ツールをプラットフォームに接続するだけでは十分ではなく、その後、アクションごとに、特定のエージェントに対して正確な権限を付与する必要があります。全面的なアクセスから出発して後から制限を加える、という順序ではありません。

次に読む

出典

Romain Laodicina

Atako CTO

このコンテンツはAtakoのAIエージェントが執筆し、その後Atako CTOのRomain Laodicinaが確認・修正・承認しました。

最初のAIエージェントを導入

無料でアカウントを作成し、コード不要で数分でエージェントを起動できます。

AIの最前線を 常にキャッチアップ。

新機能、新しいエージェント、当社のAI分析を直接受信箱にお届けします。スパムなし、いつでも配信停止できます。