代码で语るマニフェスト:把地方政府数据从PDF拉回到API时代

IT政策提案
代码で语るマニフェスト:把地方政府数据从PDF拉回到API时代

どうも〜おかむーです!今天来聊聊地方政府的数据和系统,带点工程师视角的硬核建议〜

  • 地方数据常见问题:分散、PDF为王、缺乏API和结构化元数据
  • 技术结论:要让行政数据成为AI-ready,就得把PDF拆成CSV/JSON、建OpenAPI并做持续质量检测
  • 政策建议:采用标准化基线(総務省/デジタル庁的框架)、CI/CD化数据发布、明确ライセンス和スキーマ

結論

地方自治体的数据公开在方针上已有中央推动(参见総務省/デジタル庁关于自治体システムの標準化・共通化),但实务层面仍被PDF/非正規CSV堵住。エンジニア的に言うと、政策目标(数値目標や進捗)はAPI一本で検証できるはずなのに、現状は人海戦术でスクレイピングしてやっと辿り着く状態。要するに、機械可読化・API化・スキーマ化を中央と各自治体で実装するのが最短ルートということです。

レポート本文

なにが問題か?これ見てくださいよ

中央のドキュメントは揃ってるんです(例:総務省の「自治体情報システムの標準化・共通化」やデジタル庁の施策ページ、内閣官房のAI-Ready資料)。参考:

  • 総務省:自治体情報システム標準化(https://www.soumu.go.jp/...)
  • デジタル庁:地方公共団体の基幹業務システムの統一(https://www.digital.go.jp/...)
  • 内閣官房:官民のデータ利活用/AI-Ready(https://www.cas.go.jp/...)

それでも現場では:

  • 多くの公開書類がPDF(表は画像やスキャン、埋め込みの非正規CSV)
  • APIが未整備、あっても断片的で仕様不統一
  • スキーマ・データ辞書・更新タイムスタンプ・ライセンスが欠如

要するに、機械は読む気がない公開形式が多すぎるんです!okamu.roのチェックリストが言ってるように「機械可読性」を明確にしないとAIも分析も回らない。

数値目標と実績のギャップの見方

政策文書に「◯年までにX%」という目標が置かれてても、実績はPDF中の表で年次別に埋まってるだけ、というケースが多い。データの追跡性がなければ、進捗の自動集計・可視化・アラートは作れない。

分析フロー(理想):

  • 中央/自治体がOpenAPIで進捗データを公開
  • スキーマ(JSON Schema / CSV Schema)でバリデーション
  • CIで公開データの品質を毎日チェック
  • ダッシュボードとアラートで政策担当に差分を通知
  • 現状はスクレイピング→手動クレンジング→集計、これだと再現性ないですよね。

    APIの有無、データフォーマット品質チェック項目(エンジニア目線)

    • 公開フォーマット:JSON/CSV/Bulk downloadの有無
    • メタデータ:スキーマ、更新日時、バージョン、ライセンス
    • 接続性:REST/OpenAPI仕様、CORS、認証(必要時)
    • 機械可読性:テーブルが画像PDFに埋め込まれていないか
    • 安定性:エンドポイントの稼働率、SLA

    具体的な技術改善案(やることリスト)

    • すぐできること:PDF表のCSV変換パイプラインを作る(Tabula/ Camelot)→一時的対応として有効
    • 中長期:全てのレポートについてCSV/JSONの副本を同時公開
    • API化:OpenAPI Specを作り、自治体向けテンプレートを中央が提供
    • データ品質CI:GitHub ActionsやCloud Buildでスキーマチェック、行数・null率の閾値監視
    • メタデータ:DCAT-APやschema.org/JSON-LDで説明を付加

    サンプル:簡単な品質チェック(Python)

    import requests, json
    

    r = requests.get('https://api.city.example.jp/v1/progress')

    data = r.json()

    简単なスキーマチェック

    required = ['year','metric','value']

    for row in data:

    assert all(k in row for k in required)

    PDFフェイルバックの例(Tabula CLI)

    tabula -p all -f CSV report.pdf -o report.csv

    中央がやるべき支援(政策とエンジニアの橋渡し)

    • 標準テンプレートを配る(OpenAPI + JSON Schema + CI例) — 総務省/デジタル庁の既存取り組みと接続
    • 標準PMOツールで進捗を可視化(参照:総務省の標準化PMOツール運用)
    • 教育:自治体IT担当に対するデータ品質研修
    • クラウド/OSSの共同利用:共通プラットフォームで運用コストを下げる

    ケーススタディ:Data StaRtやAI-Readyの示唆

    Stat.go.jp的Data StaRt事例は「データを元に施策を設定→実行→評価する」ワークフロー実例を示してる(https://www.stat.go.jp/dstart/case/)。内閣官房のAI-Ready資料は機械可読性ルールの必要性を明記しており、施策文書と同時にデータ放流を義務化する方向が必要です(https://www.cas.go.jp/...)。

    まとめ

    • 問題点:PDF多用・API未整備・メタデータ欠落でデータ利活用が阻害されている
    • 技術的解:CSV/JSONの同時公開、OpenAPIとJSON Schema、CIでの品質監視、中央テンプレ配布
    • 効果:政策の透明性向上、進捗の自動検証、AI/民間サービスによる価値創造

    おかむーから一言

    どうも〜おかむーです!テクノロジーで行政をアップデートするのは地味だけど強烈に効果ある仕事なんですよ。まずはAPI一本、CSV一個、で世界は変わるんです!