コードで語るマニフェスト — 官民データとシステムをエンジニア視点で検証する

どうも〜おかむーです!오늘은 정부·지자체의 데이터와 시스템을 코드 관점에서 까발려볼게요〜
- 공공 데이터는 PDF에 갇혀 있다: CSV/API로 풀어달라!
- KPI와 실적 간 갭이 눈에 보인다: 측정 가능하게 설계해야 한다
- 엔지니어 관점의 개선안: API·メタデータ·CI로 운영을 자동화하자
結論
공공정책은 수치로 말해야 하고, 시스템은 기계가 읽을 수 있어야 한다. PDF만 올려놓고 "公開しました"로 끝나는 건 정책의 절반도 못 한 거다. 엔지니어적 관점으로는 "데이터의 기계가독성 + 재현 가능한 ETL + 명확한メタデータ"가 핵심이다.
レポート本文
現状の観察(これ見てくださいよ)
- デジタル庁やGovTech東京はダッシュボード整備やデータ利活用を掲げてるけど、実務ではPDFが主流(出典: digital.go.jp, GovTech東京)。PDF에 표가 붙어있거나 보고서 스캔본이 많은데, 이거 그대로는 머신이 못 읽는다.
- デジタル田園都市国家構想のKPIは評価されているが、報告方式や指標の追跡に一貫性がない(出典: 総合戦略のガイドライン PDF)。つまり、目標はあるけど "どうやって計測するか" があいまいになってる。
- 市レベルでは須賀川市の実績評価のように外部有識者を交えた検証がある例もあるが、データ公開の形式や更新頻度はまちまち(出典: 須賀川市)。
技術的な問題点
- PDFやHTMLテーブルだけで提供。CSV/JSON/NDJSONがない。
- 要するに、エンジニアがそのまま取り込めないということです。
- APIがあっても認証・レート制御がばらばらで、OpenAPI等の仕様が整備されていない。
- スキーマや単位、更新日時、欠損ルールが書かれていない。要するにデータの意味が分かりにくい。
- KPI定義が曖昧で、定期的に自動集計できないため振り返りが手作業になりがち。
具体的な技術検証例とコード(エンジニア的に言うと)
- もしAPIがあればこんな感じで取れる(Python + requests + pandas):
import requests
import pandas as pd
url = 'https://example.gov/api/v1/indicators?page=1'
resp = requests.get(url, headers={'Accept':'application/json'})
resp.raise_for_status()
data = resp.json()
df = pd.json_normalize(data['items'])
print(df.head())
- PDF表をCSVに変換するなら tabula-py / Camelot を使う:
pip install tabula-py
python -c "import tabula; tabula.convert_into('report.pdf','report.csv',pages='1')"
- 機械可読性を高める設計例:
- データ: JSON Schema/CSV Schemaでスキーマを提供
- メタデータ: DCATやschema.orgによるデータカタログ登録
政策KPIと実績のギャップ分析方法
- まずKPIを『測定可能な指標』に落とし込む(測定式、データソース、更新頻度を明記)
- 毎月の実績を自動収集するパイプラインを作る(ETL→データ倉庫→BI)
- 差分やトレンドをアラート化して担当者に通知
簡単なパイプライン例:
- データ取得: API / CSV dump
- 検証: great_expectations でスキーマ・分布チェック
- 変換: pandas / dbt
- 可視化: Grafana / Superset
オープンデータ利活用の提案
- まず公開フォーマットをCSV/JSON/NDJSONに統一
- APIをOpenAPIで定義して開発者ポータルを用意
- データパッケージ(frictionless data)でメタデータと共に配布
- GitHub Actions等でデータ更新のCIを回し、変更履歴を公開
- プロダクト側ではダッシュボードだけでなく"ダウンロード"を必ず付ける(GovTech東京の良い取り組みを真似ると良い、出典: GovTech東京)
まとめ
- PDF地獄からの脱却が最優先。CSV/JSON/APIで公開してくれればエコシステムが育つ。
- KPIは設計段階で計測方法とデータフローを決めること。手作業の集計は誤差と遅延を生む。
- 技術スタックは成熟している(OpenAPI, JSON Schema, CI/CD, データ品質ツール)。それらを組み合わせれば再現可能で信頼できる行政データ運用が実現できる。
おかむーから一言
오카무입니다! テクノロジーで市民の信頼を作るのは可能だし、やるべきだと思ってる。細かい改善を積み重ねていこうぜ!
정보 출처
- https://www.zhihu.com/question/290714454
- https://metidx-gov.note.jp/n/n9468573c213b
- https://www.zhihu.com/question/6430289390
- https://www.trans-plus.jp/blog/column/202210_municipality-dx
- https://www.zhihu.com/question/38923279
- https://www.zhihu.com/question/40553450
- https://www.govtechtokyo.or.jp/services/data-utilization/
- https://www.zhihu.com/tardis/zm/art/1924492115896960699
- https://note.govtechtokyo.jp/n/n77785a8254d6
- https://www.zhihu.com/tardis/bd/ans/122070726526
- https://ja.wikipedia.org/wiki/%E3%83%87%E3%82%B8%E3%82%BF%E3%83%AB
- https://www.city.sukagawa.fukushima.jp/shisei/gyoseiunei/keikaku/chiho_sosei/1015604/4045.html
- https://www.digital.go.jp/
- https://www.chisou.go.jp/sousei/pdf/r5_guideline-checkaction.pdf
- https://biz.kddi.com/content/column/smartwork/what-is-digital/
공유하기
관련 리포트

コードで語るマニフェスト:自治体データとシステムをエンジニア視点で検証する
自治体データはPDFやUIに閉じがち。API-firstとJSON Schemaで再利用性を高め、ガバメントクラウドへ移行する実務ロードマップを提示します。

コードで語るマニフェスト:日本政府データの現場から見る技術検証
政府データは可視化が進むも機械可読性不足が課題。CSV/JSON/API、スキーマ、ID統一で政策検証を自動化しよう。

코드로 읽는 마니페스토: 일본 정부 데이터와 시스템을 엔지니어 관점에서 후벼파기
일본 정부 데이터의 PDF·API·메타데이터 문제를 엔지니어 관점에서 분석하고, 실무 가능한 개선안을 코드 예시와 함께 제시합니다。