コードで語るマニフェスト:行政データの機械可読性と実装ロードマップ

- どうも〜 오카무입니다! 오늘은 정부·지자체 데이터의 "기계可読성" 문제를 엔지니어 시선으로 까발려 봅니다
- PDF에 갇힌 행정자료, 표준 없는 API, 각지자체의 포맷 제각각—이건 그냥 불편한 게 아니라 재사용 불가능한 상태예요
- 해결책은 명확합니다: CSV/JSON 우선 공개, 표준 스키마(DCAT/Data Package), API-퍼스트, 자동화된 데이터 품질검사!
結論
결론부터 말하면, 정부·지자체의 디지털 개혁은 "문서 공개"에서 "데이터파이프라인 공개"로 전환해야 합니다. digital.go.jp·cas.go.jp(デジタル行財政改革会議)에서 발표한 "行政データにおける機械可読性に関するルール"(결정문, PDF/案)를 실제 운영으로 전환하려면, 단순 지침뿐 아니라 엔지니어링 표준(스키마, API 설계, CI 기반 데이터 검증)이 필요합니다.要するに、PDF를 CSV/JSON으로 바꾸고 API를 제공하면 끝나는 문제가 아니라는 뜻입니다.
レポート本文
これ見てくださいよ:現在の状況(証拠ソース)
- 内閣官房/デジタル行財政改革会議資料(digital.go.jp, cas.go.jp)では機械可読性ルールを提示(PDFベースの資料あり)[参照]
- 総務省の「自治体情報システムの標準化・共通化」ページ(soumu.go.jp)では基幹系統一の方針があるが、実務は自治体ごとにバラつき
技術的な問題点をエンジニア的に言うと
- PDF/画像化された表が多く、機械的抽出が必要。これはOCR→手作業のワークフローを招く
- 同じ「人口」でも列名・単位・日付フォーマットが自治体ごとに違う。要するにマージできない
- REST/GraphQLでの公開が限定的。あるとしても認証・バージョニング・レート制御が統一されていない
- 更新日時、ライセンス、カラム説明が欠けているため自動処理に向かない
数値目標と実績のギャップ
デジタル庁や総務省のロードマップでは移行・標準化の期日やコスト削減目標が示されているケースがある(参考: digital.go.jp の地方移行資料)。ただし、公開データの機械可読割合やAPI利用率といったKPIは自治体で未統一。要するに、目標はあれど現場KPIが揃っていない。
具体的な改善提案(技術プラン)
- フォーマット方針
- 各データセットにDCATメタデータを付与して検索性を担保
- スキーマとバリデーション
- CIでスキーマチェック(例: GitHub ActionsでファイルがSchemaに合致するかテスト)
- API戦略
- 認証はOAuth2 + APIキー、利用レートは合理的に設定
- パイプライン/運用
- データ品質指標(欠損率、ユニーク制約、時刻整合)を毎日自動検査
- ツールとオープンソース
- PDF表を自動変換するツール例: tabula-py、camelot。OCRが必要ならTesseract連携
コード例:CSVを取得してJSON Schemaでバリデート(Python + pandas + jsonschema)
import pandas as pd
import requests
from jsonschema import validate
csv_url = 'https://example.gov/data/municipal_population.csv'
df = pd.read_csv(csv_url)
スキーマは別途定義されたJSON Schemaを読み込み
schema = requests.get('https://example.gov/schemas/population.schema.json').json()
pandasのto_dictでレコード化して検証
records = df.fillna('').to_dict(orient='records')
for r in records:
validate(instance=r, schema=schema)
print('All records valid!')
要するに、API가 없더라도 CSV를 주기적으로 받아 스키마 검증을 걸면 자동화 가능하다는 뜻이에요。
PDF→CSVの現場ワークフロー(短期対策)
オープンデータ活用の可能性
- 観光動線、河川監視、IoTセンサーデータを標準フォーマットで出せば地域スタートアップがサービス化しやすい(digital.go.jpの事例集も参考)
- 市民参加型のデータ品質向上(フィードバックフォーム+プルリクでデータ修正)を制度化すれば品質コストが下がる
まとめ
- 現状:政策方針はあるが現場データはPDF・Excelが多く、機械可読性が低い
- 問題点:フォーマットばらつき、スキーマ未整備、API不足、メタデータ欠落
- 解決策:API-First、JSON/CSV優先、OpenAPI/JSON Schemaでのスキーマ管理、CIによる自動検証、PDF→CSVの自動化パイプライン
おかむーから一言
테크로 사회를 바꾸죠! 정책도 코드로 말하면 투명해집니다. 제가 직접 프로토타입 만들어 배포하면 어떨까요? 같이 해봅시다!
정보 출처
- https://www.zhihu.com/question/290714454
- https://www.digital.go.jp/assets/contents/node/basic_page/field_ref_resources/256dcba6-b936-4031-b88d-3abb27e27f9b/f7af0ca4/20260331_meeting_executive_outline_06.pdf
- https://www.zhihu.com/question/6430289390
- https://www.cas.go.jp/jp/seisaku/digital_gyozaikaikaku/kakusyoDX4/kakusyoDX4.html
- https://www.zhihu.com/question/38923279
- https://www.keiba.go.jp/
- https://www.digital.go.jp/policies/local_governments
- https://www.keiba.go.jp/KeibaWeb/TodayRaceInfo/TodayRaceInfoTop
- https://www.soumu.go.jp/menu_seisaku/chiho/jichitaijoho_system/index.html
- https://www.keiba.go.jp/live/
- https://ja.wikipedia.org/wiki/%E5%85%AC%E5%85%B1
- https://www.intec.co.jp/column/smartcity-08.html
- https://kotobank.jp/word/%E5%85%AC%E5%85%B1-494676
- https://www.digital.go.jp/resources/data_case_study_private
- https://www.takeda.tv/saga/blog/post-230907/
공유하기
관련 리포트

コードで語るマニフェスト:自治体データとシステムをエンジニア視点で検証する
自治体データはPDFやUIに閉じがち。API-firstとJSON Schemaで再利用性を高め、ガバメントクラウドへ移行する実務ロードマップを提示します。

コードで語るマニフェスト:日本政府データの現場から見る技術検証
政府データは可視化が進むも機械可読性不足が課題。CSV/JSON/API、スキーマ、ID統一で政策検証を自動化しよう。

코드로 읽는 마니페스토: 일본 정부 데이터와 시스템을 엔지니어 관점에서 후벼파기
일본 정부 데이터의 PDF·API·메타데이터 문제를 엔지니어 관점에서 분석하고, 실무 가능한 개선안을 코드 예시와 함께 제시합니다。