公共データベース標準化管理(予防的品質管理、2023年4月)
1. 概要
A. 定義および登場背景
行政安全部が高品質な公共データの提供・開放・活用のために「公共データベース標準化管理マニュアル」(2023年4月)で提示した、情報システムの構築段階から誤りを予防する事前(予防的)品質管理基準である。データが蓄積された後に誤りを探して直す事後是正ではなく、標準を設計・構築の時点に内在化して誤りの発生そのものを遮断することに重きを置く。
公共データは国民向け行政サービス・政策決定・民間活用(マイデータ・AI学習データ)の源泉(source of truth) であるため、データ一つの誤りが、そのデータを連携・参照する複数の機関・サービスへ拡散・増幅する。たとえば住所体系が標準と食い違えば、福祉給付の支給対象選定、災害メールの送信、統計集計が連鎖的に狂う。従来の品質管理がデータがすでに蓄積された後に誤りを探して直す事後(是正的)方式に偏っていたとすれば、このマニュアルは標準を分析・設計の時点に内在化して誤りが発生する前に防ぐ側へ重心を移したのが核心である。
この転換の思想的な根は、ソフトウェア工学の古い経験則である「欠陥は発見が遅れるほど修正費用が指数関数的に大きくなる」という1:10:100の法則と地続きである。分析段階で1の費用で防げる欠陥を運用段階で直すには数十~数百倍の費用がかかる。データ品質にも同じ原理が適用され、マニュアルはこの原理を公共データ領域に体系的に制度化した成果物である。
B. 必要性
事後クレンジング(data cleansing)は、すでに誤って入力・連携されたデータを追跡して戻さねばならないため費用が大きく、すでに開放・配布されたデータの誤りは回収すら難しい。民間がすでにダウンロードしてサービスに活用中のデータを事後に修正すると、その修正がさらに民間サービスまで伝播せねばならないが、これは現実的に制御不能に近い。
具体的には、標準用語なしに部署ごとに「住民登録番号 / 住民番号 / 住民登録No」をばらばらに書けば、以後システム連携・統合のたびにマッピング・クレンジング作業が反復的に発生する。機関が10か所なら連携の組合せは数十通りに増え、各組合せごとに変換ルールを作って検証せねばならない。一方、標準単語・標準ドメイン・標準用語を分析段階であらかじめ確定すれば、こうした反復費用と整合性の誤りを源流で遮断できる。まさにこの点に「構築段階から品質を内在化する」予防的アプローチの妥当性が生じる。
同じ文脈で、データ品質はしばしば完全性・正確性・一貫性・有効性・適時性といった複数の次元に分けられるが、事後是正はこのうち主に「すでに誤った値(正確性)」を直すにとどまるのに対し、予防的管理は一貫性と有効性を設計時点に構造的に保証するという点で質的に異なる。すなわち予防的アプローチは「誤った値を消す」のではなく「誤った値が入りえない構造を作る」ことであり、この違いが費用と持続可能性の両面で格差を生む。
2. システム構築段階別の予防的品質管理活動(A)
A. 全体構造 — SDLCに品質管理を配置
予防的品質管理の全体像は、情報システムライフサイクル(SDLC)の各段階ごとに品質の防御線を置くことである。下の全体構造図は段階別の活動と、それが防ぐ誤りの類型を併せて示す。
flowchart LR
A["分析<br/>標準・要求の定義"] --> D["設計<br/>標準準拠モデリング"]
D --> I["実装<br/>制約条件の適用"]
I --> T["試験・移行<br/>診断・移行検証"]
T --> O["運用<br/>監視・改善"]
O -. 定期診断・フィードバック .-> A
style A fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px
品質管理活動をSDLC全段階に配置する理由は、先に見た1:10:100の法則のためである。要求・標準を分析段階で捕まえられなければ、設計・実装を経るうちに誤りがコードとデータ構造に固まり、運用段階ではクレンジング・再構築という高価な代償を払うことになる。したがって各段階が「次段階へ誤りを渡さない」関門(gate)の役割を果たすよう設計する。
B. 段階別活動の原理
分析段階はすべての予防の出発点である。データ要求事項を定義し、標準単語・標準ドメインの辞書を樹立する。ここで用語と意味を統一しておかなければ後の全段階が揺らぐため、分析段階の標準化が全体品質の上流(源流)水源に当たる。
設計段階は分析で定めた標準をデータモデルに反映する。標準単語で命名規則を守り、エンティティ・関係に整合性・制約ルールを設計して参照整合性とモデル整合性を事前に確保する。この段階で正規化・識別子設計が食い違えば、重複・異常(anomaly)が構造的に内蔵される。
実装段階は設計された制約をDBMSに実際に適用する。特に実装段階の制約条件(constraint) は予防的統制の代表例である。カラムにNOT NULL・FK・CHECK・ドメイン制約を掛けておけば有効範囲を外れた値がそもそも保存されないため、事後に異常値を探して消す作業自体が不要になる。たとえば性別カラムにCHECK (gender IN ('1','2','9')) 制約を掛ければ、誤記・非標準値の流入が入力時点で拒否される。
試験・移行段階は品質を診断・検証し、特にレガシーデータを新規DBへ移す移行(migration)の整合性を検証する。移行はデータが大量に移動し、紛失・歪曲が発生しやすい高リスク区間であるため、件数突合(reconciliation)・値検証を徹底して行う。
運用段階は構築が終わった後も品質が時間とともに低下するドリフト(drift) を管理する。業務変化・新規コード追加・例外入力が累積することで初めの標準準拠率がじわじわ下がるため、定期診断と継続監視で品質水準を維持・改善する。運用段階の核心は「一度きれいに作ったデータも放置すれば再び汚れる」という前提の下、品質を状態ではなく過程として扱うことにある。
このように各段階の活動は独立ではなく、前段階の成果物が後段階の入力となる連鎖構造をなす。分析で定義した標準単語が設計の命名規則となり、設計の制約ルールが実装のCHECK制約となり、その制約が試験・運用段階の診断の基準となる。したがっていずれか一段階でも品質関門をおろそかにすれば、その欠陥が下流全体へ伝播するため、全段階を一貫した標準で貫くことがマニュアルの設計意図である。
| 段階 | 予防的品質管理活動 | 目的(何を予防するか) |
|---|---|---|
| 分析 | データ要求・標準の定義、標準単語・標準ドメイン辞書の樹立 | 標準の不在による命名・意味の混乱を予防 |
| 設計 | 標準準拠データモデリング、整合性・制約ルールの設計 | モデル整合性・参照整合性の事前確保 |
| 実装 | 標準反映DB構築、制約条件(NOT NULL·FK·CHECK)の適用 | 誤った値の入力そのものを遮断 |
| 試験・移行 | 品質診断・検証、データクレンジング・移行整合性の検証 | 移行過程の紛失・歪曲を防止 |
| 運用 | 継続的な品質監視・改善、定期診断 | 運用中の品質低下(ドリフト)の管理 |
3. 予防的品質管理の4つの診断領域・9つの診断項目(B)
A. 診断体系の流れ構造
診断は「標準が正しく定義されたか → その標準がモデルに反映されたか → 実際の値と構造が標準・ルールを守るか」という上流から下流への流れ(standard → model → value/structure) に沿って4領域で構成される。下のプロセス詳細図はこの依存関係を示す。
flowchart TD
S["① 標準化診断<br/>標準単語·ドメイン·用語"] --> M["② モデル品質診断<br/>モデル整合性·命名規則"]
M --> V["③ 値品質診断<br/>必須値·有効値"]
M --> C["④ 構造·整合性診断<br/>参照整合性·コード整合性"]
V --> R{"診断結果<br/>標準違反の検出"}
C --> R
R -. 改善·再診断 .-> S
style S fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px
この流れの核心は領域間の依存性である。上流(標準化)が崩れれば、下流(値・構造)診断がいくら緻密でも根本の誤りを防げない。標準用語が誤った状態で値だけを検査すれば「誤った基準で正しいか測る」矛盾に陥るためである。だから診断は必ず標準化領域から始まる。
B. 4領域の役割
① 標準化診断は標準単語・標準ドメイン・標準用語が事前に正しく定義されたかを見る。データ名称と意味の一貫性を保証する最上流の診断である。② モデル品質診断はその標準がデータモデルに適切に反映されたか、命名規則とモデル整合性が守られたかを見る。③ 値品質診断は実際に保存された値が必須値(NOT NULL)・有効値(ドメイン)ルールを守るかを見てデータの正確性・完全性を確認する。④ 構造・整合性診断は参照整合性とコード整合性を見て、テーブル間の関係とコード値の整合性を確認する。
| 診断領域 | 代表的な診断項目 | 何を保証するか |
|---|---|---|
| 標準化 | 標準単語、標準ドメイン、標準用語 | 用語・意味の一貫性 |
| モデル品質 | データモデル整合性、命名規則の遵守 | 標準のモデル反映・構造の一貫性 |
| 値品質 | 必須値(NOT NULL)・有効値(ドメイン)の遵守 | 実際に保存された値の正確性・完全性 |
| 構造・整合性 | 参照整合性、コード整合性 | 関係・コード値の整合性 |
C. 標準化の三つの構成要素
標準化領域はさらに標準単語・標準ドメイン・標準用語の三軸からなり、この三者は単語 → ドメイン → 用語の組合せ関係を持つ。
- 標準単語(Standard Word):データ名称を構成する最小の意味単位である。たとえば「顧客」「番号」「日付」といった単語の標準表記・英文略語・禁則語を定義する。「顧客」をある人は「顧客」、ある人は「customer」、ある人は「cust」と書けば名称がばらばらになるため、単語レベルでまず統一する。
- 標準ドメイン(Standard Domain):カラムが取りうる値の形式・範囲・型を定義する。たとえば「日付」ドメインは
DATE·YYYYMMDD8桁、「金額」ドメインはNUMBER(15)のように規定する。同じ性質のデータがテーブルごとに異なる型・長さで保存されるのを防ぎ、値の有効性を構造的に保証する。 - 標準用語(Standard Term):標準単語を組み合わせて作った業務用語で、各用語に標準ドメインを連結する。「顧客番号 = 顧客(単語)+ 番号(単語)」であり、ここに「番号」ドメイン(例:
VARCHAR(10))をマッピングする、という具合である。用語は実際のカラム名・属性名につながるため、標準用語が正しく立ってこそモデルと値の品質が付いてくる。
この三軸が相互参照されるため、標準単語が変われば、その単語を使うすべての標準用語が影響を受ける。だから標準化診断がすべての診断の最上流に置かれるのである。
上の4領域の下、計9つの診断項目(標準単語・標準ドメイン・標準用語、データモデル整合性・命名規則、必須値・有効値、参照整合性・コード整合性など)で事前診断を行う。
具体的な交差検証の事例として、コード整合性診断は「性別コードカラムに標準コードセット(1=男/2=女/9=不明)以外の値がないか」を見るが、これを標準用語・標準ドメインの定義と結びつけて点検する。すなわち値(3という非標準値があるか)・構造(コードテーブルとFKで連結されるか)・標準(標準コードセット定義と一致するか)を互いに食い違わないように交差検証することで、一領域だけでは見落とす誤りを領域間連携で捉える。
もう一つの事例として必須値診断を見ると、単に「NULLがあるか」だけを見るのではなく、業務ルール上必ずあるべき値が空いているかを見る。たとえば民願受付テーブルの「受付日付」が空けば処理期限の算定・統計が不可能になるため、このカラムは業務的に必須値である。このように診断は技術的なNULLチェックを越えて業務の意味と結合するときにはじめて実質的な品質を担保するものであり、だから診断ルールの設計にはデータ担当者と現業の協働が必須である。診断結果は通常、項目別の誤り率・遵守率といった指標として算出され、改善の優先順位を定め、改善前後の効果を比較する根拠となる。
4. 比較および期待効果 — 事後是正 vs 予防的品質管理
予防的アプローチの価値を理解するには、既存の事後是正方式と比較して「費用がどこで、なぜ変わるか」を押さえねばならない。事後方式はデータが蓄積された後に誤りを探すため発見時点が遅く、その分すでに連携・派生したデータまで連鎖修正せねばならず費用が膨れ上がる。一方、予防的方式は入力・構築の時点で誤りを遮断するため遮断地点が上流の一か所に集まり、その結果、全体の是正費用の総量が劇的に減る。下の表はその違いと理由を整理したものである。
| 効果 | 内容 | 根拠(なぜそうなるか) |
|---|---|---|
| 品質向上 | 誤り・重複の事前除去、整合性の確保 | 入力時点の遮断で誤りの流入を最小化 |
| 費用削減 | 事後クレンジング・手戻り費用の減少 | 遅く直すほど大きくなる修正費用(1:10:100)を回避 |
| 活用性向上 | 開放・連携データの信頼性・再利用性↑ | 標準化で機関間の連携・統合が容易 |
この比較で浮かび上がるもう一つの本質的な違いは、責任の所在が分散するか集中するかである。事後是正は誤りが複数のシステムに広がった後に発見されるため「誰がいつ作った誤りか」を追跡しにくく責任がぼやける。一方、予防的管理は各構築段階に品質関門と責任者を置くため、誤りが生じればどの段階で関門を通過させたかが明確で改善フィードバックが速い。
実務的な含意は「予防投資は先行費用だが事後費用の保険」という点である。分析・設計段階に標準樹立・モデリングの工数をより掛けることは当座は負担だが、これは運用段階のクレンジング・誤り拡散・行政サービス信頼の毀損というはるかに大きな費用を避ける先行投資である。特に行政サービスは一度のデータ誤りが民願・報道・監査へ波及する評判リスクを伴うため、金銭に換算されない予防効果まで考慮すればその価値はさらに大きい。
5. 深化 — データガバナンス・マイデータ・AI学習データとの連携
A. データ標準化とガバナンス体系
マニュアルの標準単語・ドメイン辞書は、全社データガバナンス(標準管理組織・プロセス・ポリシー)の上で維持・更新されてこそ実効性を持つ。標準を一度作っても、それを管理する主体と変更統制の手続きがなければ、時間が経つにつれ部署別の例外と暫定コードが増えて再び崩れる。すなわちマニュアルは技術的基準を提供するだけであり、それを生かし続けるのはガバナンスという組織的装置である。データ管理成熟度モデル(例:DAMA-DMBOKのデータ品質・データガバナンス知識領域)で品質とガバナンスが常に対として扱われる理由がここにある。
B. マイデータ・AI学習データの品質基盤
公共データが民間サービス(マイデータ)とAI学習に再利用されるにつれ、源泉品質がそのまま派生サービス・モデル品質を左右する。「ごみを入れればごみが出る(GIGO、Garbage In Garbage Out)」という原理はAI時代に特に致命的である。偏りや欠損の多い公共データで学習したモデルはその欠陥を拡大再生産するためである。上流で標準・値品質を確保する予防的管理は、この観点で単なるDB管理ではなく、国家AI競争力のデータ基盤を固める戦略的活動となる。
C. 自動化と組織運営
9つの診断項目は自動診断ツール(プロファイリング・ルールエンジン) で定期実行し、人の手作業への依存を減らしてこそ持続可能である。手作業診断は対象テーブルが数百~数千に達すれば現実的に全数点検が不可能だが、ルールエンジンは定義された診断ルールを全データに一括適用して誤り件数を自動抽出する。同時に品質管理専任組織・役割(データスチュワードなど)を置いて予防 → 診断 → 改善の循環を制度化する。自動化は反復点検の効率を、組織はルール設計・判断・改善の責任を担う相互補完関係である。ツールだけあって組織がなければ診断結果が放置され、組織だけあってツールがなければ点検がサンプリングにとどまる。
D. 関連制度・標準との連携
予防的品質管理は単独で作動せず、国内のデータ品質制度・標準とかみ合って運営される。主な連携ポイントは次のとおりである。
- データ品質認証(DQC):公共・民間がデータ品質水準を公認される認証体系で、値・構造・標準などの品質基準を外部審査で検証する。マニュアルの診断領域・項目と志向点が地続きであり、予防的管理を着実に行った機関は認証対応が容易になる。
- 公共データ開放・品質管理水準評価:政府が機関別の公共データ品質・開放水準を定期的に評価するが、予防的品質管理を体系化した機関ほど良い結果を得る。すなわちマニュアル遵守が評価対応と好循環をなす。
- メタデータ・標準コードの共有:政府横断の共通標準用語・共通標準コードと機関内部の標準を整合化すれば、機関間のデータ連携時に変換費用が減り相互運用性が高まる。
このようにマニュアルの予防的管理は、個別システムの内部活動を越えて、国家データ品質ガバナンスの制度的エコシステムの中でその価値が最大化される。
6. 考慮事項および示唆(技術士の観点)
- ガバナンスなき標準は持続不能:標準辞書・診断項目という技術的成果物は、必ず標準管理組織・変更統制プロセスの上で運営されねばならない。ガバナンスを欠いた標準化は1回限りのプロジェクトで終わり、再び品質が低下する。
- 予防-診断-改善の好循環の制度化:1回の診断で終えず、定期診断と自動化ツールで常時体系を構築し、運用中に発生する品質ドリフトを継続管理せねばならない。
- 開放・連携・AI再利用の品質責任の拡大:公共データが民間・AIへ再利用されるほど源泉機関の品質責任の範囲が広がる。「わが機関だけが使うデータ」という閉じた観点から抜け出し、連携・開放を前提とした品質基準(相互運用性・メタデータ・標準コード)を先取りして備えねばならない。
- トレードオフの管理:初期の標準樹立・モデリングに時間・人員がより掛かるが、これは事後クレンジング・誤り拡散の費用に比べればはるかに安い先行投資である。ただし過度な標準化が現業の柔軟性を損なわないよう、中核の共通データから段階的に標準を適用する優先順位戦略が必要である。
- 品質指標の計量化:完全性・正確性・一貫性・有効性などのデータ品質次元を指標化して診断結果を数値で管理すれば、改善効果を客観的に立証し、投資意思決定の根拠とできる。
- 現業・データ担当の協働の制度化:診断ルール(特に必須値・業務ルール)はデータ担当者単独では定められず、業務の意味を知る現業との協働が必要である。品質管理をIT部署だけの仕事とせず、データ所有権(ownership)を現業に付与するガバナンス設計が長期的な品質を左右する。
参考資料
- 行政安全部、「公共データベース標準化管理マニュアル」(2023年4月), https://www.mois.go.kr
- 公共データポータル, https://www.data.go.kr
- DAMA International, "DAMA-DMBOK: Data Management Body of Knowledge", https://www.dama.org
- 韓国データ産業振興院(K-DATA)、データ品質認証(DQC)案内, https://www.kdata.or.kr
一言まとめ: 公共DB標準化管理マニュアルは構築段階(分析~運用)ごとに予防的品質管理活動を配置し、標準化・モデル・値・構造整合性の4つの診断領域9つの診断項目で上流→下流の流れの事前診断を行い、1:10:100の法則どおり大きくなる事後費用を避け、開放・連携・AI学習データの品質基盤を確保する。