코드로 말하는 마니페스토: 지방공공데이터, CSV에서 API까지

IT 정책 제안
코드로 말하는 마니페스토: 지방공공데이터, CSV에서 API까지

어이, 오카무-예요! 오늘은 지방정부 오픈데이터와 시스템을 엔지니어 시선으로 후벼파볼게요~

  • 데이터는 공개되어 있지만 기계가 읽기 쉬운 형태는 드물다
  • CKAN/API 쓰는 곳은 장점이지만 메타데이터·스키마 품질이 아쉽다
  • 실무적 개선안: 표준 스키마, API 일원화, 품질검증 파이프라인 필요

結論

지방자치단체의 오픈데이터는 양적으로 성장했지만, 실질적 활용성(기계가 바로 쓰는 API·정형 스키마·신뢰 가능한 메타데이터)은 아직 미완성이다. 엔지니어적으로 말하면 데이터가 "파일 풀" 상태로 흩어져 있어서 API 한 번으로 해결할 수 있는 문제를 수작업으로 처리하게 만드는 구조다.

레포트 본문

これ見てくださいよ:現状サマリ

  • 東京都オープンデータ카탈로그(data.metro.tokyo.lg.jp)에서는 1899년부터의 都営水道水源量 같은 CSV가 공개돼 있다(예: 수치·시계열 데이터). CSV가 있어도 컬럼명·메타데이터가 명확하지 않으면 자동화가 힘들다.
  • 横浜市 데이터 포털(data.city.yokohama.lg.jp)은 많은 데이터셋을 제공하지만 일부는 설명이 비어 있음(메타데이터 불충분).
  • CKAN을 도입한 大仙市 등은 레지스트리·API 키 접근을 제공해 기술적 가능성이 높다.

엔지니어적 관점: 데이터가 CSV로 존재하는 건 좋은 시작이지만, 다음 문제가 남음!

  • 문자 인코딩(Shift_JIS vs UTF-8) 문제로 파싱이 깨지는 경우 많음
  • 날짜 포맷·지역 코드 불일치(自治体ごとにコード体系が異なる)로 조인 어려움
  • 메타데이터(単位・更新頻度・ライセンス) 미기재가 흔함

要するに、ファイル이 공개되어도 "使えるAPI"가 아니다라는 얘기입니다.

API・フォーマットの評価

  • CKANベース: 메타데이터 표준이 있어 레지스트리화·검색성이 좋음. 다만 개별 데이터셋의 스키마 품질은 별개.
  • 単一ファイル公開(CSV/XLSX): 접근성은 높지만 자동처리 파이프라인 연결이 어려움.
  • PDFのみ公開: 최악. 기계독해(OCR) 없이 데이터 활용 불가.

実務でやるべきチェックリスト:

  • CSVはUTF-8で提供されているか
  • 列名/単位/更新日がメタデータに含まれているか
  • 地域コードはJIS X 0401等で標準化されているか
  • APIがある場合はOpenAPI/Swaggerで記述されているか

具体的なコード例(データ取得→前処理)

# 예: 東京都のCSV를 받아서 전처리하는 간단한 예시

import requests

import io

import pandas as pd

url = 'https://catalog.data.metro.tokyo.lg.jp/dataset/.../resource/.../download/water_sources.csv'

resp = requests.get(url, timeout=10)

resp.encoding = 'utf-8' # 엔코딩 가정, 필요시 chardet로 확인

df = pd.read_csv(io.StringIO(resp.text))

날짜 파싱

if 'date' in df.columns:

df['date'] = pd.to_datetime(df['date'], errors='coerce')

단위 표기 정리

if 'amount' in df.columns:

df['amount_m3'] = df['amount'].astype(str).str.replace(',', '').astype(float)

print(df.head())

要するに、こういう前処理が各自治体ごとに都度発生してしまうのが非効率なんですよね。

政策目標と実績のギャップ検証(方法論)

データが揃っている分野(例: 給水量、公共施設稼働率、福祉サービス事業所リスト)では、政策の数値目標と実績を機械的に突き合わせるパイプラインを作れる:

  • 目標値を機械可読にする(政策ドキュメントをJSON/CSVで公開)
  • 実績データを定期的に取得して照合
  • 差分アラートをダッシュボードで可視化
  • このフローを自動化すれば、政策のPDCAが回りやすくなる。エンジニア的に言うと、これはCI/CDパイプライン作るのと同じノリです。

    改善提案(技術スタックと運用)

    • 標準スキーマ採用: 国が推奨する政府標準フォーマット(DCAT-AP JP, 政府統一のCSVフォーマット)を必須に
    • APIゲートウェイ: 各自治体のデータを統合するAPIレイヤーを設置(認証はAPIキー/OAuth)
    • 品質ゲート: CIでCSVのスキーマ検証、必須メタデータ欠落で公開停止のルール
    • データカタログのメタデータ充実: 更新日・取得方法・単位・地域コードを必須項目化
    • サンプルコード・SDK配布: Python/R/JS用の公式ライブラリで実装コストを下げる

    これやれば、データ利活用がぐっと進むんですよね。

    活用事例の可能性

    • リアルタイム水需給ダッシュボード(東京都の水源CSV+IoTセンシングを組み合わせ)
    • 地域保健のKPI監視(横浜・埼玉の保健統計をAPI結合)
    • 民間企業によるデータ駆動サービス(Digital庁の事例カタログ参照)

    まとめ

    • 公開量はあるが、機械可読性とメタデータ品質でボトルネックがある
    • CKANやCSV提供は良い出発点。だが標準スキーマ・API化・品質ゲートがないと活用が進まない
    • 技術施策としてはAPIゲートウェイ、スキーマ検証CI、SDK配布が効果的

    おかむーから一言

    테크로 사회를 바꾸는 건 결국 작은 자동화의 누적이에요. 정책도 코드로 말하게 만들면 시민에게 더 빠르고 투명하게 돌아갑니다. 같이 해봅시다!

    공유하기