コードで語るマニフェスト — 官民データとシステムをエンジニア視点で検証する

IT 정책 제안
コードで語るマニフェスト — 官民データとシステムをエンジニア視点で検証する

どうも〜おかむーです!오늘은 정부·지자체의 데이터와 시스템을 코드 관점에서 까발려볼게요〜

  • 공공 데이터는 PDF에 갇혀 있다: CSV/API로 풀어달라!
  • KPI와 실적 간 갭이 눈에 보인다: 측정 가능하게 설계해야 한다
  • 엔지니어 관점의 개선안: API·メタデータ·CI로 운영을 자동화하자

結論

공공정책은 수치로 말해야 하고, 시스템은 기계가 읽을 수 있어야 한다. PDF만 올려놓고 "公開しました"로 끝나는 건 정책의 절반도 못 한 거다. 엔지니어적 관점으로는 "데이터의 기계가독성 + 재현 가능한 ETL + 명확한メタデータ"가 핵심이다.

レポート本文

現状の観察(これ見てくださいよ)

  • デジタル庁やGovTech東京はダッシュボード整備やデータ利活用を掲げてるけど、実務ではPDFが主流(出典: digital.go.jp, GovTech東京)。PDF에 표가 붙어있거나 보고서 스캔본이 많은데, 이거 그대로는 머신이 못 읽는다.
  • デジタル田園都市国家構想のKPIは評価されているが、報告方式や指標の追跡に一貫性がない(出典: 総合戦略のガイドライン PDF)。つまり、目標はあるけど "どうやって計測するか" があいまいになってる。
  • 市レベルでは須賀川市の実績評価のように外部有識者を交えた検証がある例もあるが、データ公開の形式や更新頻度はまちまち(出典: 須賀川市)。

技術的な問題点

  • 機械可読性の欠如
  • - PDFやHTMLテーブルだけで提供。CSV/JSON/NDJSONがない。

    - 要するに、エンジニアがそのまま取り込めないということです。

  • APIの不在または断片的な提供
  • - APIがあっても認証・レート制御がばらばらで、OpenAPI等の仕様が整備されていない。

  • メタデータ不足
  • - スキーマや単位、更新日時、欠損ルールが書かれていない。要するにデータの意味が分かりにくい。

  • KPIと実績のギャップ管理不足
  • - KPI定義が曖昧で、定期的に自動集計できないため振り返りが手作業になりがち。

    具体的な技術検証例とコード(エンジニア的に言うと)

    • もしAPIがあればこんな感じで取れる(Python + requests + pandas):
    import requests
    

    import pandas as pd

    url = 'https://example.gov/api/v1/indicators?page=1'

    resp = requests.get(url, headers={'Accept':'application/json'})

    resp.raise_for_status()

    data = resp.json()

    df = pd.json_normalize(data['items'])

    print(df.head())

    • PDF表をCSVに変換するなら tabula-py / Camelot を使う:
    pip install tabula-py
    

    python -c "import tabula; tabula.convert_into('report.pdf','report.csv',pages='1')"

    • 機械可読性を高める設計例:
    - API: RESTful, OpenAPI仕様書, ページング, フィルタ, CORS許可

    - データ: JSON Schema/CSV Schemaでスキーマを提供

    - メタデータ: DCATやschema.orgによるデータカタログ登録

    政策KPIと実績のギャップ分析方法

    • まずKPIを『測定可能な指標』に落とし込む(測定式、データソース、更新頻度を明記)
    • 毎月の実績を自動収集するパイプラインを作る(ETL→データ倉庫→BI)
    • 差分やトレンドをアラート化して担当者に通知

    簡単なパイプライン例:

    • データ取得: API / CSV dump
    • 検証: great_expectations でスキーマ・分布チェック
    • 変換: pandas / dbt
    • 可視化: Grafana / Superset

    オープンデータ利活用の提案

    • まず公開フォーマットをCSV/JSON/NDJSONに統一
    • APIをOpenAPIで定義して開発者ポータルを用意
    • データパッケージ(frictionless data)でメタデータと共に配布
    • GitHub Actions等でデータ更新のCIを回し、変更履歴を公開
    • プロダクト側ではダッシュボードだけでなく"ダウンロード"を必ず付ける(GovTech東京の良い取り組みを真似ると良い、出典: GovTech東京)

    まとめ

    • PDF地獄からの脱却が最優先。CSV/JSON/APIで公開してくれればエコシステムが育つ。
    • KPIは設計段階で計測方法とデータフローを決めること。手作業の集計は誤差と遅延を生む。
    • 技術スタックは成熟している(OpenAPI, JSON Schema, CI/CD, データ品質ツール)。それらを組み合わせれば再現可能で信頼できる行政データ運用が実現できる。

    おかむーから一言

    오카무입니다! テクノロジーで市民の信頼を作るのは可能だし、やるべきだと思ってる。細かい改善を積み重ねていこうぜ!

    공유하기