コードで語るマニフェスト:自治体データの機械可読化と現場的改善案

안녕하세요~ 오카무입니다! 오늘은 정부·지자체 데이터가 실제로 어떻게 공개되고 있는지, 엔지니어 관점에서 뜯어보고 실용적인 개선안을 제안하려고 해요〜
- 많은 행정자료가 PDF로 묶여 있어 데이터 재활용이 어려움
- 디지털청·총무성의 기계判読性 지침은 있으나 현장 반영은 아직 미흡
- API·표준스키마·파이프라인으로 실무 문제를 해결할 수 있음
結論
데이터 공개는 '있다/없다' 문제가 아니라 '기계가 읽을 수 있느냐'의 문제입니다. PDF에 박혀있는数字をCSVやJSONに変換하는自動パイプラインを整備すれば、住民サービスと政策評価の両方が一気に改善しますよね。
レポート本文
現状把握と根本問題
これ見てくださいよ:総務省やデジタル庁は既に「機械判読可能」ルールや自治体システム標準化の資料を出してます(参考: https://www.digital.go.jp/assets/... 、https://www.soumu.go.jp/...)。
でも現場を覗くと、公開データの多くがPDF、あるいはWeb上の画像化された表になってるんです。エンジニア的に言うと、これはAPI一本で解決する話なんですよね。要するに、データが機械で読み取れない形式で公開されているから、分析・可視化・二次利用が止まっているということです。
技術的評価:フォーマット・API・メタデータ
- フォーマット: CSV/Excel/JSONが理想。PDF/画像は最悪。デジタル庁の草案でもレベル1ではExcel/CSV推奨(https://www.digital.go.jp/...)。
- API有無: 多くの自治体はAPI未整備。APIあってもスキーマが統一されていない。
- メタデータ: 列名・単位・更新頻度がないと解析コストが爆発する。
実用コード例(現場リファレンス)
エンジニアならわかると思うんですけど、まずはCSVがあればpandasで一発。PDFだけの時はtabulaやpdfplumberで抽出するパターンを作ると楽。
# CSVダウンロード→JSON変換(例)
import requests, pandas as pd
url = 'https://example.local.gov/dataset.csv'
r = requests.get(url)
open('dataset.csv','wb').write(r.content)
df = pd.read_csv('dataset.csv')
df.to_json('dataset.json', orient='records', force_ascii=False)
# PDFテーブル抽出の例(tabula-py)
import tabula
tables = tabula.read_pdf('report.pdf', pages='all', multiple_tables=True)
後処理でヘッダ推定・型変換を入れる
要するに、PDF→CSVのETLを自動化してAPIで吐くインフラを作れば良いんです。
政策評価:目標と実績のギャップ
総務省・デジタル庁は標準化・ガバメントクラウド移行を進めています(参考: https://www.digital.go.jp/policies/local_governments)。ただ、現場のデータ公開は「技術力」「リソース」「運用ルール不足」で遅れがち。目標は高いけど、実績はまだら模様です。自治体間格差が大きく、全国横断で使える標準スキーマが不足しているのが原因。
改善提案(技術的なロードマップ)
具体的には、OpenAPIでエンドポイントを定義して、GitHub ActionsでCSV/JSONをバリデート→自動デプロイするワークフローが安価で効果高いです。
まとめ
- 現状:指針はあるが、実践はPDF多用で遅れている
- 技術解決:ETL自動化+API公開+スキーマ標準化
- 効果:政策評価の迅速化、民間イノベーションの促進、住民向けサービス改善
おかむーから一言
테크로 사회를 업데이트하는 게 제 목표예요. 정책도 코드로 말하면 훨씬 빠르게 개선됩니다 — 같이 만들어봅시다!
정보 출처
- https://www.zhihu.com/question/290714454
- https://www.digital.go.jp/assets/contents/node/basic_page/field_ref_resources/256dcba6-b936-4031-b88d-3abb27e27f9b/f7af0ca4/20260331_meeting_executive_outline_06.pdf
- https://www.zhihu.com/question/6430289390
- https://www.soumu.go.jp/menu_news/s-news/01toukatsu01_02000186.html
- https://www.zhihu.com/question/38923279
- https://www.keiba.go.jp/
- https://www.digital.go.jp/policies/local_governments
- https://www.keiba.go.jp/KeibaWeb/TodayRaceInfo/TodayRaceInfoTop
- https://www.soumu.go.jp/menu_seisaku/chiho/jichitaijoho_system/index.html
- https://www.keiba.go.jp/live/
- https://www.city.fukuoka.lg.jp/soki/system/shisei/koukyousisetsu-yoyaku_12_2_2.html
- https://www.intec.co.jp/column/smartcity-08.html
- https://www3.11489.jp/fukuoka/user/Home
- https://www.digital.go.jp/resources/data_case_study_private
- https://kotobank.jp/word/%E5%85%AC%E5%85%B1-494676
공유하기
관련 리포트

コードで語るマニフェスト:自治体データとシステムをエンジニア視点で検証する
自治体データはPDFやUIに閉じがち。API-firstとJSON Schemaで再利用性を高め、ガバメントクラウドへ移行する実務ロードマップを提示します。

コードで語るマニフェスト:日本政府データの現場から見る技術検証
政府データは可視化が進むも機械可読性不足が課題。CSV/JSON/API、スキーマ、ID統一で政策検証を自動化しよう。

코드로 읽는 마니페스토: 일본 정부 데이터와 시스템을 엔지니어 관점에서 후벼파기
일본 정부 데이터의 PDF·API·메타데이터 문제를 엔지니어 관점에서 분석하고, 실무 가능한 개선안을 코드 예시와 함께 제시합니다。