コードで語るマニフェスト:政府データの機械可読化と実績検証

IT 정책 제안
コードで語るマニフェスト:政府データの機械可読化と実績検証

안녕하세요~ 오카무-입니다! 오늘은 "コードで語るマニフェスト" 콘셉트로 정부·지방자치단체의 데이터 공개 방식과 시스템을 엔지니어 관점에서 까보고, 개선안을 코드 수준에서 제안해보려고 해요.

  • 이 글 3줄 요약
- 공개 데이터는 CSV가 있는데도 PDF에 묻혀 있거나, CSV가 있어도 메타데이터가 부족해서 쓰기 힘듦

- KPI와 실적(예: デジタル田園都市構想交付金のKPI, 須賀川市の評価)은 공개되어도 머신리더블·검증 가능한 형태가 아님

- 해결책은 표준화된 API, 스키마 검증 파이프라인, 자동화된 성능측정과 데이터 카탈로그

結論

데이터 공개는 이미 하고 있긴 한데, 엔지니어적으론 "읽기 쉬운 데이터"가 더 중요해요. 要するに, 파일 몇 개 던져놓는 건 공개가 아니라는 말입니다. API + 스키마 + CI를 도입하면 정책의数値目標と実績のギャップがコードで追跡できるようになります!

レポート本文

何を見たか(データソース)

これ見てくださいよ:

  • デジタル庁ポータル(https://www.digital.go.jp/ ): 政策のハブだけどAPIカタログがまだ分散気味
  • NICTER注意喚起のCSV(https://notice.go.jp/docs/status_nicter.csv): 生のCSVが公開されている例
  • 交付金や評価資料(例:デジタル田園都市関連のガイドライン、須賀川市の実績評価ページ https://www.city.sukagawa.fukushima.jp/... ): KPIと実績がPDF/HTMLで混在

問題点(技術的観点)

  • フォーマットの不統一
  • - PDFでまとめてある資料が多い。PDFは人間向けで機械的解析が難しい。

    - 一部CSVはあるが、スキーマや列名のメタ情報が欠如。

    - 要するに、データはあるけど使うときに前処理が必要すぎるということです。

  • APIの欠如または分散
  • - e-StatなどのAPIはあるものの、各省庁・自治体で提供方式がバラバラ。

    - エンジニア的に言うと、API一本で集めたいのにエンドポイントが点在しているんですよね。

  • KPIと実績のトレーサビリティ不足
  • - 政策ごとのKPIがPDF目標値として存在しても、定期的な数値更新が機械判定できない。

    - 例えば交付金の達成度を自動集計できれば検証が容易になるのに、それができてない。

    技術的な改善提案(具体的)

  • 機械可読の一次公開: CSV/JSON-LD + DCAT
  • - PDFは説明書で、データはCSV/JSON-LDで公開。

    - データカタログ(DCAT)でエンドポイント、スキーマ、ライセンスを明示。

  • スキーマ定義とCIによる品質保証
  • - JSON Schema / OpenAPIでスキーマを定義し、gitベースで管理。

    - データ更新時にスキーマ検証・バリデーションをCIで自動実行。

  • KPIのAPI化と差分監視
  • - KPIメタデータ(目標・集計方法・データソース)を機械可読化。

    - 毎月の実績をAPIで取得し、差分アラートを出すパイプラインを作る。

  • サンプルコード(CSV取得→PandasでKPI差分確認)
  • import pandas as pd
    

    kpi = pd.read_csv('https://www.city.sukagawa.fukushima.jp/shisei/.../kpi.csv')

    actual = pd.read_csv('https://notice.go.jp/docs/status_nicter.csv')

    単純マッチング例

    merged = kpi.merge(actual, on='indicator_id', how='left')

    merged['gap'] = merged['target'] - merged['value']

    print(merged[['indicator_id','target','value','gap']].head())

    要するに、データがちゃんと整備されていれば、こんなコードで政策の達成度を定点観測できますよね。

    運用面の工夫

    • データ公開のSLA(更新頻度、遅延許容)を明記する
    • データリネージ(どのシステムが生成したか)をメタデータで残す
    • 市民・研究者向けのサンプルクエリ集を提供する(クエリの再利用性向上)

    まとめ

    • 現状はデータが表に出てきているが、機械可読性とスキーマ管理が弱い
    • API化+スキーマ+CIで、政策の数値目標と実績のギャップを自動で追跡できる
    • 小さく始めるなら:1) まずPDF内の表をCSV化して公開、2) JSON Schemaで必須列を定義、3) 月次CIで整合性チェック

    おかむーから一言

    스타트업 출신으로서 말하는데, 기술로 사회문제를 해결하려면 데이터가 먼저 읽혀야 해요. 코드로 말하면 정책의信頼도가 올라갑니다!

    공유하기