コードで語るマニフェスト:官公庁データをエンジニア視点で検証する

IT 정책 제안
コードで語るマニフェスト:官公庁データをエンジニア視点で検証する

안녕하세요~ 오카무-예요! 오늘은 정부・지자체가 내놓는 정책과 데이터를 엔지니어의 눈으로 뜯어보는 이야기를 해볼게요~

  • 이 글 한눈 요약
- 공공데이터는 ‘PDF 중심 공개’가 여전히 많아서 자동화가 힘듦

- e-Gov / Digital庁 / GovTech東京 등은 인프라와 실험을 동시에 진행 중

- 해결책은 CSV/JSON 제공, API 표준화, 데이터 카탈로그와 버전 관리

結論

정책의 성패는 코드에서 판가름 난다! 수치 목표(KPI)와 실적은 이미 존재하지만, 그 데이터가 PDF에 박혀있거나 서로 다른 포맷으로 흩어져 있으면 감시·분석·재현이 불가능하다. 엔지니어적으로 말하면, "데이터 접근성 = 정책 검증 가능성" 이다.

レポート本文

現状把握:公開フォーマットとAPIの状況

これ見てくださいよ。日本の主要ポータル

  • e-Gov(https://www.e-gov.go.jp/)は行政手続きの入口を集約
  • e-Gov電子申請(https://shinsei.e-gov.go.jp/)はオンライン申請対応
  • デジタル庁(https://www.digital.go.jp/)は政策横断の司令塔
  • GovTech東京は都庁内ダッシュボード整備などの実績あり(GovTech東京のページ参照)

ただし、実務ではまだ「PDFに目標値と実績を埋め込む」パターンが多い(例えば地方の実績評価ページや交付金報告書)。要するに、機械可読じゃないんですよね。PDFは人が読むには良いけど、プログラムが継続的に監視・可視化するには致命的。

技術的問題点(具体的に)

  • フォーマット不統一:CSV/JSON/Excel/PDFが混在
  • API欠如または限定的:一部はオープンAPIがあるが、KPIレベルの時系列データまで吐かない
  • メタデータ不足:スキーマやライセンスが明確でない
  • バージョン管理不在:過去データの追跡が困難

コードでできること(具体例)

エンジニア的に言うと、これAPI一本で解決する話なんですよね。例:e-Stat(統計局)APIで時系列を取ってきて、地方のPDF実績と突合するワークフロー。

Pythonでの簡易サンプル(PDFから表を抽出してCSV化する例):

# requirements: tabula-py または camelot

import camelot

PDFの表抽出

tables = camelot.read_pdf('report.pdf', pages='1-end')

for i, t in enumerate(tables):

t.to_csv(f'table_{i}.csv')

APIを使って時系列を取る例(e-Statの擬似コード):

import requests

API_KEY = 'YOUR_ESTAT_KEY'

url = 'https://api.e-stat.go.jp/rest/3.0/app/json/getStatsData'

params = {

'appId': API_KEY,

'statsDataId': '0003412310',

'metaGetFlg': 'Y'

}

r = requests.get(url, params=params)

data = r.json()

要するにJSONが返れば後はpandasで整形

KPIと実績のギャップ検証

交付金や地方戦略の総合戦略にはKPIが入っているが、その実績評価はPDFやHTMLのサマリーのみで公開されることが多い(参考:総務省のチェックガイドラインや須賀川市の評価ページ)。エンジニア観点では定量的再現性が無ければ“達成した/していない”の判定自体が曖昧になる。

改善提案(実装レベル)

  • マスト:KPIは機械可読フォーマット(CSV/JSON/JSON-LD)で公開
  • APIゲートウェイ:e-Gov側で政策横断の標準APIを公開(OpenAPI spec)
  • データカタログ:CKAN等を用いた中央カタログでスキーマとライセンスを明示
  • CIパイプライン:PDFが更新されたら自動で表抽出→差分検出→Slack通知
  • ダッシュボード:主要KPIをGrafana等で公開(読み取り専用のAPIキーで安全な公開が可能)

技術スタック例:Python(pandas), Airflow(ETL scheduling), CKAN(カタログ), Postgres(時系列DB), Grafana(可視化)

運用上の注意点

  • 認証とアクセス制御:個人情報はAPIで公開しない。集約済み指標を出す
  • スキーマ安定性:APIのスキーマは後方互換を保つ
  • メタデータとライセンス:CC-BY等で二次利用を促す

まとめ

  • PDF中心の公開は政策検証の致命的ボトルネック
  • e-Gov・デジタル庁・GovTechの取り組みは有望だが、運用と標準化が鍵
  • エンジニアならAPI一つでガバナンスを強化できる。CSV/JSONでKPIを吐かせよう!

おかむーから一言

정책은 수치로 말해야 하고, 수치는 코드로 읽혀야 합니다. 테크로 사회를 바꾸는 건 생각보다 단순해요—데이터를 열고, API를 만들고, 자동화하면 됩니다!

공유하기