コードで語るマニフェスト:自治体データの機械可読性をエンジニア視点で検証する

IT政策提案
コードで語るマニフェスト:自治体データの機械可読性をエンジニア視点で検証する
  • 如何快速判断政府发布的数据能不能直接用?
  • PDF 堆栈比比皆是,但 CSV/API 才能真正驱动创新!
  • 从规则、现状到代码实践,给出可执行的改进路线图

結論

どうも〜おかむーです!结论先说:日本政府/自治体在“機械可読性”(machine-readable)上已经有明确的规则和讨论(见デジタル庁、内閣官房的相关资料),但现实中大量行政数据仍以PDF、画像或封装格式发布,导致数据难以直接利用。要真正把“公開”变成“利活用”,不仅要有制度(ルールの運用・メタデータ整備)也需要工程实践(标准化API、CSV/JSON一次导出、データパイプライン)。エンジニア的に言うと、API一本で全部解決する話じゃないんですよね。ガバナンスとパイプライン両方必要ってことです。

レポート本文

1) 現状把握:どこにボトルネックがあるか

これ見てくださいよ:内閣官房・デジタル庁が出している「行政データにおける機械可読性に関するルール(案)」や会議資料(参照:https://www.digital.go.jp/...、https://www.cas.go.jp/...)は“機械が直接読める形式を標準にする”と明記してます。要するに、CSV/Excel/JSON/APIが望ましいということです。

でも現場を見ると:

  • 多くのデータがPDF(表は画像化、スキャン含む)で公開されている
  • ダッシュボードはあるがダウンロードできない、APIがない
  • メタデータやライセンス情報が欠落しているケースが多い

これが実務でどう響くかというと、研究者やスタートアップはまずデータを整形するだけで時間を溶かすんですよね。正直、改善余地ありまくりだと思ってます!

2) 技術的問題点の洗い出し

  • フォーマット問題:PDF vs CSV/JSON
- PDFは視覚表現には強いが機械読取性が弱い。要するに、表が埋め込まれていても構造化されていないケースが多い。
  • APIの不在
- APIがあれば最新データにアクセスできるのに、更新ごとにPDFが置かれるだけで履歴管理や差分取得が困難になる。
  • メタデータ不足
- カラムの意味、更新頻度、ライセンスが不明だと再利用にブレーキがかかる。

3) コードで語る:実践的な検証と対処法

エンジニア的に言うと、まずは「取れるか」「整形できるか」を試すのが手っ取り早い。

  • PDF表をCSVに落とす(例:tabula-py)
# pip install tabula-py pandas

import tabula

ローカルのPDFから表を抽出してCSVへ

tables = tabula.read_pdf('report.pdf', pages='all', multiple_tables=True)

import pandas as pd

for i, t in enumerate(tables):

t.to_csv(f'table_{i}.csv', index=False)

ただし、スキャン画像やレイアウト複雑なPDFだとOCRが必要。Google Vision APIやTesseractで事前に文字を抽出して正規化するフローが必要になります。

  • APIやCSVがある場合の取り込み(例:pandasで直接読み込み)
import pandas as pd

もし自治体がCSVを公開していれば直接読み込める

df = pd.read_csv('https://example.pref.jp/dataset/records.csv')

時系列で差分をとる等の前処理

df['date'] = pd.to_datetime(df['date'])

df = df.sort_values('date')

  • データパイプライン化の検討
- 定期取得(cron)、データ検証(スキーマチェック)、カタログ登録(Data Catalog / CKAN / Data Portal)を自動化する

- 例:GitHub Actions + Great Expectations + Data Catalog登録API

4) 政策目標と実績のギャップ分析(例示)

デジタル庁等は“機械可読化を推進”と打ち出しているが、現場の公開フォーマットを見ると遵守率はまちまち。例えば「特定カテゴリの50%をCSVで公開」という目標があったとすると、実績はそれを下回る自治体が多いはず(具体数値は各自治体のオープンデータカタログで確認可能)。

要するに、ルールがあるだけで満足せず、可視化されたKPI(可読化率、API提供率、メタデータ完全率)を公開することが重要です。

5) 改善提案(エンジニア観点)

  • ルールの運用:データ公開前に「機械可読性チェックリスト」を必須化する
- ファイル形式(CSV/JSON/Excel)、エンコーディング、ヘッダ整備、NULL表現、ライセンス表記
  • 技術スタック推奨:
- データカタログ:CKANやDataHubでメタデータ管理

- API設計:REST/GraphQL + OpenAPIでスキーマを明示

- パイプライン:CIで検証→アーカイブ→カタログ登録

  • 開発支援:GovTechや地方DXチームによるテンプレート提供(CSVテンプレ、OpenAPIテンプレ)
  • レガシーPDF対策:OCR+ルールベースの抽出ジョブを用意して、抽出結果をレビュー→CSV化するワークフローを半自動化

6) 活用シナリオの提示

  • 観光データ(ライブカメラ、積雪深センサ):CSV/JSONで公開すればリアルタイムアプリや観光ダッシュボードに直結
  • 企業情報/補助金データ:APIで追跡すれば不正検出や政策評価がやりやすくなる

まとめ

  • ルール(デジタル庁・内閣官房)は整備されつつあるが、現場の実装との差がある
  • PDF中心の公開は短期的には見栄えが良くても、中長期での利活用を阻害する
  • 解決は「ガバナンス×エンジニアリング」の同時進行。チェックリスト、テンプレ、パイプライン、データカタログが鍵

おかむーから一言

僕は2度の起業とフルスタック開発を通じて、データの“使いやすさ”がイノベーションを決めると確信してます!テクノロジーで行政をアップデートしましょう、まずはCSV一本、API一本から始めるのがおすすめです〜