代码で语るマニフェスト:把地方政府数据从PDF拉回到API时代

どうも〜おかむーです!今天来聊聊地方政府的数据和系统,带点工程师视角的硬核建议〜
- 地方数据常见问题:分散、PDF为王、缺乏API和结构化元数据
- 技术结论:要让行政数据成为AI-ready,就得把PDF拆成CSV/JSON、建OpenAPI并做持续质量检测
- 政策建议:采用标准化基线(総務省/デジタル庁的框架)、CI/CD化数据发布、明确ライセンス和スキーマ
結論
地方自治体的数据公开在方针上已有中央推动(参见総務省/デジタル庁关于自治体システムの標準化・共通化),但实务层面仍被PDF/非正規CSV堵住。エンジニア的に言うと、政策目标(数値目標や進捗)はAPI一本で検証できるはずなのに、現状は人海戦术でスクレイピングしてやっと辿り着く状態。要するに、機械可読化・API化・スキーマ化を中央と各自治体で実装するのが最短ルートということです。
レポート本文
なにが問題か?これ見てくださいよ
中央のドキュメントは揃ってるんです(例:総務省の「自治体情報システムの標準化・共通化」やデジタル庁の施策ページ、内閣官房のAI-Ready資料)。参考:
- 総務省:自治体情報システム標準化(https://www.soumu.go.jp/...)
- デジタル庁:地方公共団体の基幹業務システムの統一(https://www.digital.go.jp/...)
- 内閣官房:官民のデータ利活用/AI-Ready(https://www.cas.go.jp/...)
それでも現場では:
- 多くの公開書類がPDF(表は画像やスキャン、埋め込みの非正規CSV)
- APIが未整備、あっても断片的で仕様不統一
- スキーマ・データ辞書・更新タイムスタンプ・ライセンスが欠如
要するに、機械は読む気がない公開形式が多すぎるんです!okamu.roのチェックリストが言ってるように「機械可読性」を明確にしないとAIも分析も回らない。
数値目標と実績のギャップの見方
政策文書に「◯年までにX%」という目標が置かれてても、実績はPDF中の表で年次別に埋まってるだけ、というケースが多い。データの追跡性がなければ、進捗の自動集計・可視化・アラートは作れない。
分析フロー(理想):
現状はスクレイピング→手動クレンジング→集計、これだと再現性ないですよね。
APIの有無、データフォーマット品質チェック項目(エンジニア目線)
- 公開フォーマット:JSON/CSV/Bulk downloadの有無
- メタデータ:スキーマ、更新日時、バージョン、ライセンス
- 接続性:REST/OpenAPI仕様、CORS、認証(必要時)
- 機械可読性:テーブルが画像PDFに埋め込まれていないか
- 安定性:エンドポイントの稼働率、SLA
具体的な技術改善案(やることリスト)
- すぐできること:PDF表のCSV変換パイプラインを作る(Tabula/ Camelot)→一時的対応として有効
- 中長期:全てのレポートについてCSV/JSONの副本を同時公開
- API化:OpenAPI Specを作り、自治体向けテンプレートを中央が提供
- データ品質CI:GitHub ActionsやCloud Buildでスキーマチェック、行数・null率の閾値監視
- メタデータ:DCAT-APやschema.org/JSON-LDで説明を付加
サンプル:簡単な品質チェック(Python)
import requests, json
r = requests.get('https://api.city.example.jp/v1/progress')
data = r.json()
简単なスキーマチェック
required = ['year','metric','value']
for row in data:
assert all(k in row for k in required)
PDFフェイルバックの例(Tabula CLI)
tabula -p all -f CSV report.pdf -o report.csv
中央がやるべき支援(政策とエンジニアの橋渡し)
- 標準テンプレートを配る(OpenAPI + JSON Schema + CI例) — 総務省/デジタル庁の既存取り組みと接続
- 標準PMOツールで進捗を可視化(参照:総務省の標準化PMOツール運用)
- 教育:自治体IT担当に対するデータ品質研修
- クラウド/OSSの共同利用:共通プラットフォームで運用コストを下げる
ケーススタディ:Data StaRtやAI-Readyの示唆
Stat.go.jp的Data StaRt事例は「データを元に施策を設定→実行→評価する」ワークフロー実例を示してる(https://www.stat.go.jp/dstart/case/)。内閣官房のAI-Ready資料は機械可読性ルールの必要性を明記しており、施策文書と同時にデータ放流を義務化する方向が必要です(https://www.cas.go.jp/...)。
まとめ
- 問題点:PDF多用・API未整備・メタデータ欠落でデータ利活用が阻害されている
- 技術的解:CSV/JSONの同時公開、OpenAPIとJSON Schema、CIでの品質監視、中央テンプレ配布
- 効果:政策の透明性向上、進捗の自動検証、AI/民間サービスによる価値創造
おかむーから一言
どうも〜おかむーです!テクノロジーで行政をアップデートするのは地味だけど強烈に効果ある仕事なんですよ。まずはAPI一本、CSV一個、で世界は変わるんです!
信息来源
- https://www.zhihu.com/question/659922888
- https://www.digital.go.jp/policies/local_governments
- https://www.zhihu.com/question/418844521
- https://www.soumu.go.jp/menu_seisaku/chiho/jichitaijoho_system/index.html
- https://www.zhihu.com/question/1998674473453364460
- https://www.zhihu.com/question/290714454
- https://okamu.ro/insight/ai-ready-administrative-data-checklist
- https://www.zhihu.com/question/6430289390
- https://www.cas.go.jp/jp/seisaku/digital_gyozaikaikaku/data8/data8_siryou1.pdf
- https://www.zhihu.com/question/38923279
- https://ja.wikipedia.org/wiki/%E5%85%AC%E5%85%B1
- https://www.intec.co.jp/column/smartcity-08.html
- https://kotobank.jp/word/%E5%85%AC%E5%85%B1-494676
- https://www.stat.go.jp/dstart/case/
- https://adtechmanagement.com/minnadepr-column/2025/11/02/koukyou-toha/
相关报告

代码で語るマニフェスト:以香川县公共设施预约系统为例的技术与数据审视
以香川县公共设施预约系统为例,从API、数据格式与标准化角度检视自治体系统,给出可执行的技术改进方案与代码示例。

用代码说话的宣言:从机器可读性到API化,解读日本数字化政策的数据工程路径
从Digital庁到e-Stat,评估日本数位政策的数据交付形态,提出API化与工程化改进路线,附代码与验证示例。

コードで語るマニフェスト:日本政府データをエンジニア視点で検証する
政府のマニフェストをデータとコードで検証。PDF多用やAPI断片化を指摘し、e-StatやJapan Dashboardを例に具体的な改善案とコード例を提示します。