コードで語るマニフェスト:自治体データの機械可読性をエンジニア視点で検証する

- 如何快速判断政府发布的数据能不能直接用?
- PDF 堆栈比比皆是,但 CSV/API 才能真正驱动创新!
- 从规则、现状到代码实践,给出可执行的改进路线图
結論
どうも〜おかむーです!结论先说:日本政府/自治体在“機械可読性”(machine-readable)上已经有明确的规则和讨论(见デジタル庁、内閣官房的相关资料),但现实中大量行政数据仍以PDF、画像或封装格式发布,导致数据难以直接利用。要真正把“公開”变成“利活用”,不仅要有制度(ルールの運用・メタデータ整備)也需要工程实践(标准化API、CSV/JSON一次导出、データパイプライン)。エンジニア的に言うと、API一本で全部解決する話じゃないんですよね。ガバナンスとパイプライン両方必要ってことです。
レポート本文
1) 現状把握:どこにボトルネックがあるか
これ見てくださいよ:内閣官房・デジタル庁が出している「行政データにおける機械可読性に関するルール(案)」や会議資料(参照:https://www.digital.go.jp/...、https://www.cas.go.jp/...)は“機械が直接読める形式を標準にする”と明記してます。要するに、CSV/Excel/JSON/APIが望ましいということです。
でも現場を見ると:
- 多くのデータがPDF(表は画像化、スキャン含む)で公開されている
- ダッシュボードはあるがダウンロードできない、APIがない
- メタデータやライセンス情報が欠落しているケースが多い
これが実務でどう響くかというと、研究者やスタートアップはまずデータを整形するだけで時間を溶かすんですよね。正直、改善余地ありまくりだと思ってます!
2) 技術的問題点の洗い出し
- フォーマット問題:PDF vs CSV/JSON
- APIの不在
- メタデータ不足
3) コードで語る:実践的な検証と対処法
エンジニア的に言うと、まずは「取れるか」「整形できるか」を試すのが手っ取り早い。
- PDF表をCSVに落とす(例:tabula-py)
# pip install tabula-py pandas
import tabula
ローカルのPDFから表を抽出してCSVへ
tables = tabula.read_pdf('report.pdf', pages='all', multiple_tables=True)
import pandas as pd
for i, t in enumerate(tables):
t.to_csv(f'table_{i}.csv', index=False)
ただし、スキャン画像やレイアウト複雑なPDFだとOCRが必要。Google Vision APIやTesseractで事前に文字を抽出して正規化するフローが必要になります。
- APIやCSVがある場合の取り込み(例:pandasで直接読み込み)
import pandas as pd
もし自治体がCSVを公開していれば直接読み込める
df = pd.read_csv('https://example.pref.jp/dataset/records.csv')
時系列で差分をとる等の前処理
df['date'] = pd.to_datetime(df['date'])
df = df.sort_values('date')
- データパイプライン化の検討
- 例:GitHub Actions + Great Expectations + Data Catalog登録API
4) 政策目標と実績のギャップ分析(例示)
デジタル庁等は“機械可読化を推進”と打ち出しているが、現場の公開フォーマットを見ると遵守率はまちまち。例えば「特定カテゴリの50%をCSVで公開」という目標があったとすると、実績はそれを下回る自治体が多いはず(具体数値は各自治体のオープンデータカタログで確認可能)。
要するに、ルールがあるだけで満足せず、可視化されたKPI(可読化率、API提供率、メタデータ完全率)を公開することが重要です。
5) 改善提案(エンジニア観点)
- ルールの運用:データ公開前に「機械可読性チェックリスト」を必須化する
- 技術スタック推奨:
- API設計:REST/GraphQL + OpenAPIでスキーマを明示
- パイプライン:CIで検証→アーカイブ→カタログ登録
- 開発支援:GovTechや地方DXチームによるテンプレート提供(CSVテンプレ、OpenAPIテンプレ)
- レガシーPDF対策:OCR+ルールベースの抽出ジョブを用意して、抽出結果をレビュー→CSV化するワークフローを半自動化
6) 活用シナリオの提示
- 観光データ(ライブカメラ、積雪深センサ):CSV/JSONで公開すればリアルタイムアプリや観光ダッシュボードに直結
- 企業情報/補助金データ:APIで追跡すれば不正検出や政策評価がやりやすくなる
まとめ
- ルール(デジタル庁・内閣官房)は整備されつつあるが、現場の実装との差がある
- PDF中心の公開は短期的には見栄えが良くても、中長期での利活用を阻害する
- 解決は「ガバナンス×エンジニアリング」の同時進行。チェックリスト、テンプレ、パイプライン、データカタログが鍵
おかむーから一言
僕は2度の起業とフルスタック開発を通じて、データの“使いやすさ”がイノベーションを決めると確信してます!テクノロジーで行政をアップデートしましょう、まずはCSV一本、API一本から始めるのがおすすめです〜
信息来源
- https://ja.wikipedia.org/wiki/%E5%85%AC%E5%85%B1
- https://www.intec.co.jp/column/smartcity-08.html
- https://kotobank.jp/word/%E5%85%AC%E5%85%B1-494676
- https://www.digital.go.jp/resources/data_case_study_private
- https://www.takeda.tv/saga/blog/post-230907/
- https://www.zhihu.com/question/290714454
- https://www.digital.go.jp/assets/contents/node/basic_page/field_ref_resources/256dcba6-b936-4031-b88d-3abb27e27f9b/f7af0ca4/20260331_meeting_executive_outline_06.pdf
- https://www.zhihu.com/question/6430289390
- https://www.cas.go.jp/jp/seisaku/digital_gyozaikaikaku/kakusyoDX4/kakusyoDX4.html
- https://www.zhihu.com/question/38923279
- https://www.zhihu.com/question/40553450
- https://www.govtechtokyo.or.jp/services/data-utilization/
- https://www.zhihu.com/tardis/zm/art/1924492115896960699
- https://note.govtechtokyo.jp/n/n77785a8254d6
- https://www.zhihu.com/question/372341437
相关报告

代码で語るマニフェスト:以香川县公共设施预约系统为例的技术与数据审视
以香川县公共设施预约系统为例,从API、数据格式与标准化角度检视自治体系统,给出可执行的技术改进方案与代码示例。

用代码说话的宣言:从机器可读性到API化,解读日本数字化政策的数据工程路径
从Digital庁到e-Stat,评估日本数位政策的数据交付形态,提出API化与工程化改进路线,附代码与验证示例。

コードで語るマニフェスト:日本政府データをエンジニア視点で検証する
政府のマニフェストをデータとコードで検証。PDF多用やAPI断片化を指摘し、e-StatやJapan Dashboardを例に具体的な改善案とコード例を提示します。