生成AIセキュリティガイドライン
1. 概要
A. 生成AIの概念
生成AI(Generative AI) は、LLM(大規模言語モデル)・拡散モデル(Diffusion)などで学習データの統計的パターンを習得し、テキスト・画像・音声・コードなど新たなコンテンツを自ら生成するAIである。韓国の国家情報院傘下の国家サイバー安保センター(NCSC)は2023年に「ChatGPTなど生成AI活用セキュリティガイドライン」を発刊し、公共・企業の安全な活用原則を提示した。
生成AIが従来のITシステムと根本的に異なる点は、振る舞いの予測不可能性にある。従来のソフトウェアは定められたロジックに従い決定論的に動作するため、入力・出力の境界が明確であり、ファイアウォールやアクセス制御のような境界ベースの統制がよく適合した。しかし生成AIは確率的に次のトークンを予測して出力を作るため、同じ入力にも異なる回答を出し、何を「誤った出力」とみなすか自体が曖昧である。すなわち入力の自然言語が命令でありデータでもあり、出力の正確性を事前に保証できないという二重の不確実性が新たな攻撃面を生む。
また、利用者が自然言語で入力した内容がそのままモデル学習・ログ・キャッシュへ流れ得る点が情報セキュリティの観点で致命的である。従来のシステムで「入力」はフォーム検証を経た定型データであったが、生成AIでは開発者が貼り付けたソースコードの塊、相談員が移した顧客苦情の全文がすべてプロンプトになる。結果として入力・モデル・出力の全区間にわたり新たな脅威が発生するため、境界防御中心の既存統制だけでは不十分であり、生成AI固有の脅威モデルに合わせた別途のガイドラインが必要である。
B. 登場背景および必要性
ガイドラインが求められる根本背景は、AI導入の速度がセキュリティ体系整備の速度を追い越した点にある。2022年末のChatGPT公開以降わずか数か月で事務・開発・相談の現場に生成AIが浸透したが、大半の組織は「何を入力してよいか」「出力をどこまで信頼するか」に関する方針がない状態でこれを使用した。統制なき自律導入(Shadow AI)はやがて機密漏えい・著作権侵害・誤情報反映といった事故につながった。
第二の背景は、規制と責任の具体化である。EU AI Act、韓国AI基本法などが高リスクAIに対する透明性・リスク管理義務を規定することで、生成AIの活用はもはや利便の問題ではなく法的遵守(Compliance)の問題となった。組織は「誰が・何を・どのような統制の下で使用したか」を立証せねばならず、そのためには標準化された活用・セキュリティ指針が先行せねばならない。
C. 活用サービス事例
ガイドラインが実際に必要な理由は、生成AIがすでに広範に業務で使われており、その分機密情報が露出する接点が増えたからである。以下の分野はそれぞれ異なる脅威プロファイルを持つ。例えば開発領域はソースコード漏えいが、顧客接点は個人情報漏えいとプロンプトインジェクションが核心的なリスクである。
| 分野 | 事例 | 主なリスク |
|---|---|---|
| 業務生産性 | 文書要約・作成、翻訳、議事録整理 | 営業秘密・未公開情報の入力 |
| 開発 | コード生成・レビュー、テスト自動化 | ソースコード・認証情報(Secret)漏えい |
| 顧客接点 | チャットボット相談、FAQ自動応答 | 個人情報漏えい、プロンプトインジェクション |
| 創作・マーケティング | 画像・デザイン・コピー生成 | 著作権侵害、ディープフェイク悪用 |
このように分野ごとにリスクの性格が異なるため、画一的な「全面禁止」または「全面許容」の方針はいずれも不適切である。全面禁止はShadow AI(隠れた使用)をかえって助長し、全面許容は統制の空白を生む。したがって業務領域別のリスク度を評価し、許容範囲と統制の強度を差別化するリスクベースのアプローチがガイドラインの出発点となる。
2. 生成AIセキュリティ脅威の全体構造
生成AIの脅威は、データフローの三地点(入力・モデル/サービス・出力) とそれを取り巻くガバナンス層の観点で整理すると体系的に理解できる。以下の構造図は脅威がどの地点で発生するかを一目で示す。
flowchart LR
subgraph GOV["ガバナンス(方針・教育・監査)"]
subgraph FLOW["データフロー"]
I["入力(プロンプト)"] --> P["モデル/サービス"]
P --> O["出力(生成物)"]
end
end
I -.機微情報入力.-> R1["情報漏えい"]
I -.悪意ある指示.-> R2["プロンプトインジェクション"]
P -.学習・RAG改ざん.-> R3["データ汚染"]
P -.反復クエリ・API露出.-> R5["モデル窃取・逆推論"]
O -.事実性の限界.-> R4["ハルシネーション"]
O -.生成能力の悪用.-> R6["悪性コンテンツ生成"]
入力段では、利用者が機密・個人情報をプロンプトに入れると、その内容が学習・ログに保存され再現・漏えいし得る(情報漏えい)ほか、信頼されない入力がシステム指示を上書きして統制を回避するプロンプトインジェクションが起きる。特にインジェクションは、文書・Webページに隠した指示がRAGを通じて流入する間接(Indirect)プロンプトインジェクションへと進化しており、利用者が直接悪意ある入力をしなくても攻撃が成立する。
モデル/サービス段では、学習・RAGデータが改ざんされると偏りやバックドアが埋め込まれるデータ汚染(Poisoning) が発生し、APIを反復クエリしてモデルを複製したり学習データを推論するモデル窃取・メンバーシップ推論が問題となる。これは組織の知的財産と学習に使われた個人情報を同時に脅かす。
出力段では、統計的生成の本質的限界であるハルシネーションにより存在しない事実がもっともらしく提示され意思決定を誤らせ、生成能力を悪用したマルウェア・フィッシングメール・ディープフェイクが作られる。ハルシネーションはバグではなく確率的生成の副産物であるため完全な除去は不可能であり、根拠提示・検証で管理せねばならない点が特徴である。
| 脅威 | 主な原因 | 発生し得るセキュリティ脅威 |
|---|---|---|
| 情報漏えい | 機密・個人情報をプロンプトに入力 → 学習・ログ保存 | 営業秘密・個人情報の露出、再現漏えい |
| プロンプトインジェクション | 信頼されない入力・文書がシステム指示を上書き | 指示回避、権限奪取、データ漏えい |
| データ汚染(Poisoning) | 学習・RAGデータの改ざん | 偏り・バックドア、誤答の誘導 |
| ハルシネーション | 統計的生成の事実性の限界 | 誤情報の業務反映、意思決定の誤り |
| 悪用(Misuse) | 生成能力の誤用 | マルウェア・フィッシング・ディープフェイク生成 |
| モデル窃取・逆推論 | API露出・クエリ反復 | モデル複製、学習データ・メンバーシップ推論 |
例えば2023年、あるグローバル製造企業で開発者が社内ソースコードをチャットボットに貼り付けてレビューを任せたところ、機密コードが外部モデルサービスへ流入した事故が知られ、入力段の情報漏えいが最も現実的な脅威であることが浮き彫りとなった。以後この企業は生成AIの社内使用を一時全面禁止したのち、閉鎖型の自社モデルを構築して限定的に再許容する方向へ方針を転換した。
3. 開発・活用時のセキュリティ考慮事項と階層別対応
対応戦略の核心は、脅威が発生する地点に合わせて入力・モデル・出力・ガバナンスの階層別統制(Defense in Depth) を組むことである。以下のアーキテクチャは、利用者の要求が複数の統制関門を通過して安全に処理される過程を示す。
sequenceDiagram
participant U as 利用者
participant F as 入力フィルタ(DLP・マスキング)
participant G as AIゲートウェイ(認証・ログ)
participant M as LLM/RAG
participant V as 出力検収(フィルタ・根拠検証)
U->>F: プロンプト入力
F->>F: 機微情報の検知・マスキング
F->>G: 浄化された要求
G->>M: 認証・隔離された要求を伝達
M->>M: システム/利用者プロンプトの分離
M->>V: 生成結果
V->>V: 有害・ハルシネーション検証、ウォーターマーキング
V->>U: 安全な応答
A. 入力段の統制。 最も優先度の高い防御線である。機微情報がそもそもモデルへ流入しないよう、DLP(データ漏えい防止) や正規表現・NERベースの検知で住民登録番号・カード番号・APIキーなどをマスキングする。組織次元では「何を入力してはならないか」を明示した入力禁止方針と承認手続を設け、技術統制を回避する例外を最小化する。入力段の統制は事故を事後に収拾するのではなく源泉遮断する点で、費用対効果が最も大きい。
B. モデル/サービス段の統制。 プロンプトインジェクションを防ぐには、システムプロンプトと利用者入力を明確に隔離し、利用者入力を信頼しないという前提で指示とデータを区分処理する。RAGを使うなら、インデックス化の前に文書の出所と完全性を検証し、間接インジェクション・汚染を遮断する。またモデル窃取を防ぐため、APIに認証・レート制限をかけ、すべてのクエリをログ化して異常クエリのパターンを検知する。
C. 出力段の統制。 生成結果をそのまま信頼せず、フィルタ・検収の層を置く。有害・差別・個人情報の含有を検査し、事実性が重要な業務では根拠(出所)の提示を強制してハルシネーションを人が検証できるようにする。生成物にはウォーターマーキング・出所表示(C2PAなど)を入れてディープフェイク悪用を追跡する。出力段は「人による最終確認(Human-in-the-loop)」と結合したときに最も効果的である。
D. ガバナンス層。 上記の技術統制全体を、組織の方針・教育・監査が包む。利用方針・承認手続、定期的な従業員教育、機微業務のためのプライベートモデル・網分離、そして活用履歴に対する監査がここに属する。大半の情報漏えいが悪意より不注意に由来するため、ガバナンスは技術で防げない「人の過ち」を減らす最後の安全網である。
階層別統制を設計する際に留意すべき点は、各階層が独立して作動せねばならないことである。入力フィルタが破られてもモデル段の隔離がインジェクションを濾し取り、それすら失敗しても出力検収が機微情報の漏えいを防ぐという形で多重防御線(Defense in Depth) を構成してこそ、単一統制の失敗が即座に事故につながらない。特に生成AIは新規脅威が絶えず登場するため、特定の統制一層に依存する設計は危険である。
| 区分 | セキュリティ考慮事項 | 対応方案 |
|---|---|---|
| 入力 | 機微情報の流入遮断 | 入力フィルタリング・マスキング、DLP、機微情報の入力禁止方針 |
| モデル/サービス | インジェクション・汚染・窃取の防止 | プロンプト隔離(システム/利用者の分離)、入力検証、アクセス統制・ログ、RAGデータ検証、レート制限 |
| 出力 | 有害・不正確な結果の統制 | 出力フィルタ・検収、根拠提示、ウォーターマーキング、ハルシネーション検証、Human-in-the-loop |
| ガバナンス | 組織次元の統制 | 利用方針・承認手続、従業員教育、プライベートモデル・網分離、監査 |
4. 既存の情報セキュリティとの比較および事例
生成AIセキュリティが既存の情報セキュリティと異なる地点を理解すると、なぜ別途の統制が必要かが明確になる。従来のセキュリティは「信頼境界」を引いて内部を保護する方式であったが、生成AIでは入力の自然言語自体が潜在的命令であるため、境界の内側でも攻撃が成立する。また従来のセキュリティは完全性・機密性・可用性(CIA)を扱ったが、生成AIはここに事実性(正確性)と偏りという新たな軸を加える。
| 観点 | 既存の情報セキュリティ | 生成AIセキュリティ |
|---|---|---|
| 脅威対象 | データ・システム(定型) | データ + モデル + 出力(非定型) |
| 攻撃ベクトル | コード脆弱性・ネットワーク | 自然言語プロンプト・学習データ |
| 核心属性 | 機密・完全・可用(CIA) | CIA + 事実性・偏り・説明可能性 |
| 統制方式 | 境界・署名ベース | 階層・検証・ガバナンスベース |
この表で特に注目すべき差は攻撃ベクトルである。既存のセキュリティで攻撃者はコード脆弱性やネットワーク経路を狙ったが、生成AIでは正常な使用経路である「自然言語入力」自体が攻撃手段となる。ファイアウォールを通過した正常トラフィックの中に悪意ある指示が含まれ得るため、トラフィックの正誤をネットワーク層で判断しにくい。このため統制の重心はネットワーク境界からアプリケーション・データ・出力検証の層へ移動する。
具体事例として、公共機関が民願回答の草案を生成AIで作る際に存在しない法令条項を引用したハルシネーション事例が報告され、これは出力検証(根拠提示)なしに結果を信頼してはならないという教訓を残した。逆に金融業界は閉鎖型LLMを社内に構築し、すべてのクエリをログ・監査する方式で、生産性の利益は取りつつデータ漏えいのリスクを統制する模範事例を作りつつある。
もう一つの事例として、開発生産性ツールが社内に拡散する中で、開発者がコード自動補完にAPIキー・DB接続情報などの秘密情報(Secret) を不用意に含めて要求する問題が露呈した。これに対応して一部企業はIDEプラグイン段階でSecretパターンを検知・遮断する入力フィルタを導入したが、これは「脅威が発生する地点(入力段)に最も近い所で防ぐ」という階層防御の原則をよく示す。三つの事例に共通する教訓は、生成AIセキュリティは特定の一地点の統制で完結せず、入力遮断・出力検証・組織方針が共に作動してこそ実効を持つということである。
5. 深化:国際・国内の標準と最新動向
生成AIセキュリティは個別企業の努力を超え、標準化・規制フレームワークへ急速に収斂している。技術士の観点では、以下のフレームワークを連携させてリスクベースの管理体系を設計できねばならない。
- OWASP Top 10 for LLM Applications:LLMアプリケーション固有の脅威を整理した事実上の標準で、プロンプトインジェクション・機微情報の露出・サプライチェーン・データ汚染・過度な代理権(Excessive Agency)などを扱う。AIエージェントがツールを自律呼び出しする時代となり、「過度な権限委任」脅威の比重が大きくなっている。
- NIST AI RMF(AIリスク管理フレームワーク)1.0:Govern・Map・Measure・Manageの四大機能でAIリスクを管理し、2024年に生成AIプロファイル(NIST AI 600-1)を別途追加して生成AI固有のリスクに対する統制項目を提示した。
- ISO/IEC 42001:AIマネジメントシステム(AIMS)の国際標準で、ISMS(27001)のように組織がAIリスクを継続管理する体系を認証の形で要求する。
- 規制:EU AI Actはリスクベース(禁止・高リスク・限定的・最小)アプローチで透明性・文書化義務を課し、段階的に施行される。韓国のAI基本法(人工知能の発展と信頼基盤の造成等に関する基本法)は高影響AI・生成AIの透明性(生成物表示)義務などを規定する。ただし詳細な施行令・基準は引き続き整備される段階であるため、最新の告示を確認せねばならない。
このように標準は「何を防ぐか(OWASP)」から「組織がいかに継続管理するか(NIST・ISO)」「国家が何を強制するか(規制)」へと階層化されており、実務はこの三つをマッピングして自社統制として実装する方向へ進む。
注目すべき最新動向は、脅威の重心が単一プロンプト攻撃から自律エージェント・マルチモーダルへ拡張していることである。ツールを呼び出し複数段階を自律遂行するAIエージェントは、一度のインジェクションが実際のシステム操作(ファイル削除、決済など)につながり得るため、リスクの波及が大きい。また画像・音声まで扱うマルチモーダルモデルは、画像の中に隠した指示でインジェクションを試みる新たな攻撃面を作る。したがって防御体系もテキスト中心から脱し、エージェントの行為承認・マルチモーダル入力検証へ拡張されねばならない。
6. 考慮事項および示唆点
- 技術・方針・人的統制の三軸並行:DLPやプロンプト隔離のような技術統制だけでは不十分である。利用方針と従業員教育が共に進んでこそ実質的な防御となる。大半の情報漏えいは悪意より不注意に由来するため、人への投資こそがセキュリティ投資である。
- データ主権と配備モデル選択のトレードオフ:機微業務は外部の商用API ではなく閉鎖型・オンプレミスLLMとRAGで構成し、データが組織外へ出ないようにする。ただし自社構築はGPU・運用コストが大きいため、データの機微度に応じて商用API・プライベートインスタンス・オンプレミスを差別適用するハイブリッド戦略が現実的である。
- 規制・ガバナンス連携:EU AI Act、韓国AI基本法、ISO/IEC 42001などを連携させてリスクベースの管理体系を整え、生成物表示・説明可能性などの信頼性要件を事前に設計へ反映(Security/Compliance by Design)する。
- AIエージェント時代の権限最小化:ツールを自律呼び出しするエージェントは「過度な代理権」が新たな脅威となる。エージェントに付与する権限を最小化し、危険な行為には人の承認を置く統制が必要である。
- 攻防の常時化(継続的レッドチーム):敵対的プロンプト・脱獄(Jailbreak)手法は絶えず進化するため、一回性の点検ではなくレッドチーム・監視を常時運営して防御を継続更新せねばならない。
- 透明性・説明可能性の確保:規制が求める生成物表示(ウォーターマーキング)・意思決定根拠の提示は、事後対応ではなくサービス設計時点で反映せねばならず、これは利用者の信頼と法的責任の疎明の双方に寄与する。
参考資料
- 韓国NIS 国家サイバー安保センター「ChatGPTなど生成AI活用セキュリティガイドライン」— https://www.ncsc.go.kr
- OWASP Top 10 for LLM Applications — https://owasp.org/www-project-top-10-for-large-language-model-applications/
- NIST, AI Risk Management Framework — https://www.nist.gov/itl/ai-risk-management-framework
- EU Artificial Intelligence Act — https://artificialintelligenceact.eu/
一言まとめ: 生成AIセキュリティは情報漏えい・プロンプトインジェクション・データ汚染・ハルシネーション・悪用・モデル窃取の脅威を、入力(DLP)・モデル(隔離・検証)・出力(フィルタ・根拠・ウォーターマーキング)・ガバナンス(方針・教育・監査)の階層別に統制し、技術・方針・教育の三軸並行とデータ主権の確保、OWASP・NIST・EU AI Actなど標準・規制の連携を核心とする。