コードで語るマニフェスト:官公庁データをエンジニア視点で検証する

안녕하세요~ 오카무-예요! 오늘은 정부・지자체가 내놓는 정책과 데이터를 엔지니어의 눈으로 뜯어보는 이야기를 해볼게요~
- 이 글 한눈 요약
- e-Gov / Digital庁 / GovTech東京 등은 인프라와 실험을 동시에 진행 중
- 해결책은 CSV/JSON 제공, API 표준화, 데이터 카탈로그와 버전 관리
結論
정책의 성패는 코드에서 판가름 난다! 수치 목표(KPI)와 실적은 이미 존재하지만, 그 데이터가 PDF에 박혀있거나 서로 다른 포맷으로 흩어져 있으면 감시·분석·재현이 불가능하다. 엔지니어적으로 말하면, "데이터 접근성 = 정책 검증 가능성" 이다.
レポート本文
現状把握:公開フォーマットとAPIの状況
これ見てくださいよ。日本の主要ポータル
- e-Gov(https://www.e-gov.go.jp/)は行政手続きの入口を集約
- e-Gov電子申請(https://shinsei.e-gov.go.jp/)はオンライン申請対応
- デジタル庁(https://www.digital.go.jp/)は政策横断の司令塔
- GovTech東京は都庁内ダッシュボード整備などの実績あり(GovTech東京のページ参照)
ただし、実務ではまだ「PDFに目標値と実績を埋め込む」パターンが多い(例えば地方の実績評価ページや交付金報告書)。要するに、機械可読じゃないんですよね。PDFは人が読むには良いけど、プログラムが継続的に監視・可視化するには致命的。
技術的問題点(具体的に)
- フォーマット不統一:CSV/JSON/Excel/PDFが混在
- API欠如または限定的:一部はオープンAPIがあるが、KPIレベルの時系列データまで吐かない
- メタデータ不足:スキーマやライセンスが明確でない
- バージョン管理不在:過去データの追跡が困難
コードでできること(具体例)
エンジニア的に言うと、これAPI一本で解決する話なんですよね。例:e-Stat(統計局)APIで時系列を取ってきて、地方のPDF実績と突合するワークフロー。
Pythonでの簡易サンプル(PDFから表を抽出してCSV化する例):
# requirements: tabula-py または camelot
import camelot
PDFの表抽出
tables = camelot.read_pdf('report.pdf', pages='1-end')
for i, t in enumerate(tables):
t.to_csv(f'table_{i}.csv')
APIを使って時系列を取る例(e-Statの擬似コード):
import requests
API_KEY = 'YOUR_ESTAT_KEY'
url = 'https://api.e-stat.go.jp/rest/3.0/app/json/getStatsData'
params = {
'appId': API_KEY,
'statsDataId': '0003412310',
'metaGetFlg': 'Y'
}
r = requests.get(url, params=params)
data = r.json()
要するにJSONが返れば後はpandasで整形
KPIと実績のギャップ検証
交付金や地方戦略の総合戦略にはKPIが入っているが、その実績評価はPDFやHTMLのサマリーのみで公開されることが多い(参考:総務省のチェックガイドラインや須賀川市の評価ページ)。エンジニア観点では定量的再現性が無ければ“達成した/していない”の判定自体が曖昧になる。
改善提案(実装レベル)
- マスト:KPIは機械可読フォーマット(CSV/JSON/JSON-LD)で公開
- APIゲートウェイ:e-Gov側で政策横断の標準APIを公開(OpenAPI spec)
- データカタログ:CKAN等を用いた中央カタログでスキーマとライセンスを明示
- CIパイプライン:PDFが更新されたら自動で表抽出→差分検出→Slack通知
- ダッシュボード:主要KPIをGrafana等で公開(読み取り専用のAPIキーで安全な公開が可能)
技術スタック例:Python(pandas), Airflow(ETL scheduling), CKAN(カタログ), Postgres(時系列DB), Grafana(可視化)
運用上の注意点
- 認証とアクセス制御:個人情報はAPIで公開しない。集約済み指標を出す
- スキーマ安定性:APIのスキーマは後方互換を保つ
- メタデータとライセンス:CC-BY等で二次利用を促す
まとめ
- PDF中心の公開は政策検証の致命的ボトルネック
- e-Gov・デジタル庁・GovTechの取り組みは有望だが、運用と標準化が鍵
- エンジニアならAPI一つでガバナンスを強化できる。CSV/JSONでKPIを吐かせよう!
おかむーから一言
정책은 수치로 말해야 하고, 수치는 코드로 읽혀야 합니다. 테크로 사회를 바꾸는 건 생각보다 단순해요—데이터를 열고, API를 만들고, 자동화하면 됩니다!
정보 출처
- https://www.zhihu.com/question/290714454
- https://metidx-gov.note.jp/n/n9468573c213b
- https://www.zhihu.com/question/6430289390
- https://zenn.dev/govtechtokyo/articles/b65dc687e50918
- https://www.zhihu.com/question/38923279
- https://www.e-gov.go.jp/
- https://www.govtechtokyo.or.jp/services/data-utilization/
- https://shinsei.e-gov.go.jp/
- https://note.govtechtokyo.jp/n/n77785a8254d6
- https://shinsei.e-gov.go.jp/contents/preparation
- https://ja.wikipedia.org/wiki/%E3%83%87%E3%82%B8%E3%82%BF%E3%83%AB
- https://www.chisou.go.jp/sousei/pdf/r5_guideline-checkaction.pdf
- https://column.nippoukun.bpsinc.jp/what-is-digitization/
- https://www.city.sukagawa.fukushima.jp/shisei/gyoseiunei/keikaku/chiho_sosei/1015604/4045.html
- https://www.digital.go.jp/
공유하기
관련 리포트

コードで語るマニフェスト:自治体データとシステムをエンジニア視点で検証する
自治体データはPDFやUIに閉じがち。API-firstとJSON Schemaで再利用性を高め、ガバメントクラウドへ移行する実務ロードマップを提示します。

コードで語るマニフェスト:日本政府データの現場から見る技術検証
政府データは可視化が進むも機械可読性不足が課題。CSV/JSON/API、スキーマ、ID統一で政策検証を自動化しよう。

코드로 읽는 마니페스토: 일본 정부 데이터와 시스템을 엔지니어 관점에서 후벼파기
일본 정부 데이터의 PDF·API·메타데이터 문제를 엔지니어 관점에서 분석하고, 실무 가능한 개선안을 코드 예시와 함께 제시합니다。