コードで語るマニフェスト:自治体オープンデータを技術で検証する

IT 정책 제안
コードで語るマニフェスト:自治体オープンデータを技術で検証する

안녕하세요~ 오카무입니다! 오늘은 정부·지자체의 데이터와 시스템을 코드 관점에서 까다롭게(?) 들여다볼 거예요. 엔지니어적 관점에서 정책을 데이터를 통해 검증하고, 실용적인 개선안을 제안합니다!

  • 이 글은 실제 공공 데이터 포털(東京都オープンデータ카탈로그·埼玉県·中央区 등)을 참고해 기계가 읽을 수 있는 데이터 관행을 검토합니다
  • PDF에 갇힌 지표, 불완전한 CSV 스키마, API 부재 등 현실적 문제를 기술적으로 분석합니다
  • 개선 제안은 표준화(CSVW/Data Package), API 제공, 자동 검증 파이프라인을 중심으로 합니다

結論

국·지자체는 데이터 공개 자체는 많이 해뒀지만, 엔지니어가 바로 쓰기엔 가공 비용이 크다. PDF·엑셀 중심 공개, 불명확한 메타데이터, API 부재가 재현성과 자동화의 걸림돌이다. 그래서 "기계가 바로 소비할 수 있는 데이터"를 목표로 표준화·자동검증·API 발행을 우선 도입해야 한다!

レポート本文

データソースと現状チェック

これ見てくださいよ:東京都のオープンデータカタログや埼玉県ポータル、中央区の公開ページでは多数のCSVやXLSXが公開されている(例: catalog.data.metro.tokyo.lg.jp や opendata.pref.saitama.lg.jp)。ただし、実務で使おうとすると次の課題が出てくるんです。

  • フォーマット混在(CSV/Excel/PDF)で機械判読性が低い
  • メタデータが貧弱でスキーマ不明(列名の意味や単位が直書きされてない)
  • APIが無いか脆弱で、定期取得や差分取得が難しい

要するに、データは公開しているけど“ELTパイプライン”に直結してないということです。

PDF vs CSV — 機械可読性の問題

新潟市のCSVマニュアル(csv_manual_v1.1.pdf)みたいなガイドはあるんだけど、実際の公開物はまだPDFにデータが埋め込まれていたり、XLSXでしか配布されなかったりする。PDFはスクレイピングコストを増やすし、OCRノイズが入ると検証が面倒!

エンジニア的に言うと、API一本で解決する話なんですよね。差分取得、認証、メタデータ付与ができれば、ダッシュボードも自動更新できます。

APIの有無とデータフォーマット品質評価

Digital庁や一部自治体はAPI化を進めているけど、都道府県・市区町村レベルで格差がある。NOTICEのようにCSVで直接公開されているケース(notice.go.jp/docs/status_notice.csv)はありがたいけど、スキーマバージョンや更新ログが無いと再現性が落ちる。

評価のチェックリスト(技術観点):

  • 公開フォーマット: CSV/JSON-LD/ODataの有無
  • メタデータ: CSVW / Data Package / schema.org の採用
  • バージョン管理: 更新履歴・差分APIの提供
  • ライセンス: 明確な再利用許諾(CC BY等)

コードで見る簡単な検証例

データ를 주기적으로 확인하고 정합성을 검사하는 스크립트 예시입니다.

# requirements: pandas, requests

import pandas as pd

import requests

url = "https://notice.go.jp/docs/status_notice.csv"

resp = requests.get(url)

with open('status_notice.csv','wb') as f:

f.write(resp.content)

df = pd.read_csv('status_notice.csv')

print(df.dtypes)

기본 무결성 체크

print('missing per column:', df.isnull().sum())

이 코드는 단순하지만, 자동화 파이프라인의 첫 단계(추출·로컬 저장·스키마 검사)에 해당합니다. 스키마 검증은 frictionless-py(또는 goodtables)로 확장하면 좋아요.

KPIと実績のギャップ分析のアプローチ

「デジタル田園都市国家構想」関連の交付金KPIは国のガイドラインに沿っているが、地方の実績公表(例: 須賀川市の実績評価)を見ていると、KPI定義のばらつきや数値更新の遅延が目立つ。要点:

  • KPIは定義(分母・分子・期間)が厳密である必要あり
  • 実績データは機械可読フォーマットで定期公開しないと比較・検証が困難
  • 外部有識者により検証可能な生データの公開が信頼性を上げる

改善提案(具体的)

  • 公開フォーマットをCSV/JSON-LDへ統一、PDFは報告書用に限定
  • CSVW or Data Packageでスキーマを配布(列説明・型・単位・例)
  • 差分取得可能なREST APIを提供(ETag/Last-Modified/offset-based)
  • CIでデータ品質を自動検증(行数変化/型チェック/ユニーク制約)
  • KPIのメタデータ(定義・測定方法)を機械可読化し、ダッシュボードと紐付け
  • Open licenseを明記
  • これにより、自治体内部でも外部開発者でも再利用コストが劇的に下がります!

    まとめ

    • 公開は増えたが、機械可読性・メタデータ・APIの整備不足が課題
    • 技術的対策は既知(CSVW/Data Package/API/自動検証)で、導入はそれほど難しくない
    • 小さくてもスモールスタートでAPIと自動検証を回すことが鍵

    おかむーから一言

    テクノロジーで社会をアップデートするって、結局“誰でも使えるデータ”を作ることだと思ってます。コード一本で市民サービスが変わる、その現場を一緒に作りましょう!

    공유하기