カタログ横断で見える自治体オープンデータの“発見性”問題をコードで直す

どうも〜おかむーです!今日はちょっとカタログ横断でのオープンデータ発見性について、エンジニア視点でしゃべりますよ〜
- 主要な自治体カタログはCSV公開が多く、API化とメタデータの一貫性にバラつきがある
- カタログ間で同一データが重複・分散し、横断検索や再利用が面倒になっている
- 技術的にはクロール+正規化パイプラインで現場の負担を減らせる、というのが結論です
結論
カタログは増えたけど“横断発見性”が追いついていない!エンジニア的に言うと、データはあるけどインデックス化と正規化が足りないんですよね。DCAT-AP準拠のメタ化+軽量ハーベスターを自治体向けに標準化すれば、データの再利用が一気に進みます。
レポート本文
現状観察(実例から見る)
これ見てくださいよ。東京都オープンデータカタログ(https://catalog.data.metro.tokyo.lg.jp/dataset)や函館市のCSV一覧(https://www.harp.lg.jp/opendata/dataset/79.html)、新潟市のCSV作成マニュアル(https://www.city.niigata.lg.jp/.../csv_manual_v1.1.pdf)を眺めると、共通点と差分が見えます。
- フォーマットはCSV主体(CSVマニュアルも公開)で、APIを持つデータと単発ファイルの混在
- メタデータ項目(ライセンス、更新日、APIエンドポイント)がカタログ間で統一されていない
- RAIDAやデジタル田園都市関連のポータル(https://raida.go.jp/, https://www.chisou.go.jp/)は事例集として有用だが、個別カタログまで深掘りしにくい
要するに、データは散らばってるけど "探せる形" になっていないということです。
技術的課題(3つに整理)
実務的ソリューション(コードで語る)
エンジニア的に言うと、ここは「ハーベスト→正規化→照合→公開」のパイプラインで一気に解決できます。サンプルの小さなパイプラインを示します(Python):
import requests, pandas as pd
from urllib.parse import urljoin
シンプルなカタログハーベスター
catalog_url = 'https://catalog.data.metro.tokyo.lg.jp/dataset'
r = requests.get(catalog_url)
実際にはHTMLパースかAPI呼び出しでdatasetメタを抽出
ここでは擬似コード化しています
メタ正規化のイメージ
records = [
{'title': '公共施設一覧', 'url': 'https://.../koto.csv', 'format': 'CSV', 'license': 'CC-BY'},
]
df = pd.DataFrame(records)
フィールド名を標準化
df = df.rename(columns={'title': 'dataset_title', 'url': 'access_url'})
要所は「メタデータのスキーママッピング」を作ること。DCAT-AP-JP相当のフィールドで正規化すれば、複数カタログをまとめて検索可能になります。
運用と品質担保
- CI的にメタ検証テストを回す(ライセンス有無、更新日形式、機械可読フォーマット)
- 永続ID(stable URI)とデータフィンガープリント(ハッシュ)で重複検出
- 自治体向けに軽量ライブラリ(harvester + normalizer)を提供して、現場のエンジニア負荷を下げる
まとめ
カタログは増えたけど、横断的に見つけて使うための“接着”が足りない。技術的にはハーベスター+DCAT準拠の正規化、CIによるメタデータ品質保証で一気に改善できます。RAIDAやデジタル庁の施策(https://digital.go.jp/)と現場カタログをつなぐ“ミドル層”が肝心です。
おかむーから一言
テクノロジーで行政をアップデートするのは地味だけど超重要!まずは小さなハーベスター一つで現場の負担を下げて、使えるデータ基盤を作っていきましょう。僕も手伝いますよ〜
情報ソース
- https://catalog.data.metro.tokyo.lg.jp/dataset
- https://www.city.niigata.lg.jp/shisei/seisaku/it/open-data/index.files/csv_manual_v1.1.pdf
- https://www.harp.lg.jp/opendata/dataset/79.html
- https://opendata.pref.tokushima.lg.jp/dataset/5036.html
- https://opendata.pref.aomori.lg.jp/dataset/1480.html
- https://www.chisou.go.jp/sousei/about/kouhukin/index.html
- https://www.digital.go.jp/
- https://raida.go.jp/
- https://ja.wikipedia.org/wiki/%E3%83%87%E3%82%B8%E3%82%BF%E3%83%AB
- https://www.city.sukagawa.fukushima.jp/shisei/gyoseiunei/keikaku/chiho_sosei/1015604/4045.html
- https://www.jinji.go.jp/content/900024615.csv
- https://www.env.go.jp/content/900398071.csv
- https://www.inpit.go.jp/content/100869372.csv
- https://www.mhlw.go.jp/content/001429362.csv
- https://www.soumu.go.jp/main_content/000323625.csv
シェアする
関連レポート

公共予約システムの“ログインからAPI化”ロードマップ:パスワードレスで運用コストを下げる技術提案
公共施設予約の認証とデータを段階的にAPI化して運用コストを下げる技術ロードマップを紹介します。

政府データを“つなげる”発想:省庁バラバラを超えるフェデレーション戦略
フェデレーション層で省庁データをつなぎ、PDF混在を克服する実践的な技術案を示す。

政策ダッシュボードは“作るだけ”じゃダメ!KPIを自動で監査するパイプライン設計
政策ダッシュボードの数値を自動監査するパイプライン設計案。API・スキーマ・差分管理でKPIの信頼性を上げる技術手法を紹介します。