コードで語るマニフェスト:自治体オープンデータを技術で検証する

안녕하세요~ 오카무입니다! 오늘은 정부·지자체 데이터와 시스템을 엔지니어 관점에서 파헤쳐보려고 해요~
- 이 글은 공개 데이터의 기계판독성, API 제공 여부, 파일 포맷 품질을 점검합니다
- CSV vs PDF 문제, 스키마·메타데이터 부재, 실적·목표의 갭을 사례로 분석합니다
- 개선 가능한 엔지니어링 방안(스키마, API, CI, 모니터링)을 제안합니다
結論
지자체 오픈데이터는 '있긴 한데 쓰기 어렵다'가 현실이에요. CSV로 공개된 데이터도 스키마 표준·메타데이터가 없으면 재현 불가능하고, PDF에 갇힌 자료는 자동화 파이프라인에서 무용지물입니다. 엔지니어적 해결은 단순합니다: 기계판독 가능한 포맷(JSON/CSV+스키마), 표준화된 메타데이터(ライセンス・更新日・カラム説明), API 제공, 그리고 배포 파이프라인에 대한 CI를 도입하면 생산성이 확 바뀝니다.
レポート本文
現状のスナップショット
これ見てくださいよ:東京都オープンデータカタログ(https://catalog.data.metro.tokyo.lg.jp/dataset)や函館市のCSV一覧(https://www.harp.lg.jp/opendata/dataset/79.html)はCSVを公開しているけど、各データセットのスキーマ記述がまちまちなんですよね。新潟市のCSVマニュアル(https://www.city.niigata.lg.jp/.../csv_manual_v1.1.pdf)は良い手引きだけど、全自治体で徹底されているわけじゃない。
一方で「デジタル田園都市国家構想交付金」関連の事例を集めるRAIDA(https://raida.go.jp/)や各市の実績公開(例:須賀川市の実績評価ページ)を見ると、政策の数値目標と公開データの実績が散逸している例が多いです。要するに、政策目標はあるけど、それを検証するための機械可読データが揃ってないということです。
技術的な問題点(優先度付き)
- 同じ項目名でも型や単位がバラバラ。合算や比較が手でやらないとできない。
- 表や報告書がPDFに埋め込まれているとOCR/レイアウト崩れで自動化できない。
- 一括ダウンロードはできても、フィルタ・ページングを備えたREST APIがない。
- 利用条件が不明だと再利用に法務的なハードルが残る。
- いつデータが変わったか追えないと再現性が損なわれる。
具体的な技術検証とコード例
エンジニア的に言うと、まずはCSVを読み込み、スキーマ検証→正規化→結合のパイプラインを作ればOK。簡単なPython例を示しますね。
# pandas로 CSV를 읽고 간단한 스키마 체크
import pandas as pd
from pandera import DataFrameSchema, Column, Int, String
df = pd.read_csv('koto_public_facilities.csv')
schema = DataFrameSchema({
'id': Column(Int),
'name': Column(String),
'latitude': Column(float),
'longitude': Column(float)
})
validated = schema.validate(df)
要するに、スキーマ 검증을 CI 파이프라인에 넣으면 데이터의 무결성을 자동으로 잡을 수 있습니다!さらに、PDFしかない資料はCamelotやtabula-pyで抽出→手動検査→スキーマ適合の流れで取り出せますが、理想はそもそもCSV/JSONで出してもらうこと。
政策目標と実績のギャップ分析手法
- RAIDAなどの交付金事例データをAPIで集め、施策ごとのKPI(利用者数、費用対効果、納期遵守率)を定量化する
- 例:須賀川市の「デジタル田園都市構想」評価を機械可読化して、目標値と実績を月次で差分分析する
テクニック:ETLパイプラインで時間軸を揃え、欠損値は明示的にラベル("NA_REPORT")しておくと、政策評価の信頼度が上がります。
改善提案(技術ロードマップ)
短いGitHub Actions例(疑似):
name: csv-check
on: [push]
jobs:
validate:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v2
- run: pip install goodtables
- run: goodtables schema.yml data/*.csv
活用可能性
正しく公開されれば、以下がすぐ実現できます:
- 地域横断の分析(複数市町村の公共施設データ統合)
- 助成金の費用対効果を可視化して再配分の根拠にする
- 市民向けアプリのAPI連携で行政手続きのDXを加速
リスクとガバナンス
データ公開は透明性を担保する半面、個人情報やセキュリティ面の配慮が必要。公開前に自動でPseudonymizeするルールや、アクセス制御の考え方を設計しておくこと。
まとめ
- 現状:データはあるけど“使える形”でないケース多数
- 技術的コア:スキーマ+API+CIでデータの再利用性を担保すべき
- 影響:これをやれば政策評価・市民サービスの改善が即座に進む
おかむーから一言
테크로 사회를 바꾸는 건 가능하다고 믿습니다. 작은 스키마 하나가 수십만 시간의 노동을 줄여주고, 정책의 성과를 확실히 보여줄 수 있어요. 같이 해봅시다!
정보 출처
- https://catalog.data.metro.tokyo.lg.jp/dataset
- https://www.city.niigata.lg.jp/shisei/seisaku/it/open-data/index.files/csv_manual_v1.1.pdf
- https://www.harp.lg.jp/opendata/dataset/79.html
- https://opendata.pref.tokushima.lg.jp/dataset/5036.html
- https://opendata.pref.aomori.lg.jp/dataset/1480.html
- https://www.chisou.go.jp/sousei/about/kouhukin/index.html
- https://www.digital.go.jp/
- https://raida.go.jp/
- https://ja.wikipedia.org/wiki/%E3%83%87%E3%82%B8%E3%82%BF%E3%83%AB
- https://www.city.sukagawa.fukushima.jp/shisei/gyoseiunei/keikaku/chiho_sosei/1015604/4045.html
- https://www.jinji.go.jp/content/900024615.csv
- https://www.env.go.jp/content/900398071.csv
- https://www.inpit.go.jp/content/100869372.csv
- https://www.mhlw.go.jp/content/001429362.csv
- https://www.soumu.go.jp/main_content/000323625.csv
공유하기
관련 리포트

コードで語るマニフェスト:自治体データとシステムをエンジニア視点で検証する
自治体データはPDFやUIに閉じがち。API-firstとJSON Schemaで再利用性を高め、ガバメントクラウドへ移行する実務ロードマップを提示します。

コードで語るマニフェスト:日本政府データの現場から見る技術検証
政府データは可視化が進むも機械可読性不足が課題。CSV/JSON/API、スキーマ、ID統一で政策検証を自動化しよう。

코드로 읽는 마니페스토: 일본 정부 데이터와 시스템을 엔지니어 관점에서 후벼파기
일본 정부 데이터의 PDF·API·메타데이터 문제를 엔지니어 관점에서 분석하고, 실무 가능한 개선안을 코드 예시와 함께 제시합니다。