コードで語るマニフェスト:行政データはこう直せば使えるようになる

안녕하세요~ 오카무입니다! 오늘은 공공데이터와 지방자치단체 시스템을 엔지니어 관점에서 후다닥 뜯어보려고요〜
- 이 글 3줄 요약
- 엔지니어적 관점에서 해결책은: 기계가 읽는 형식(CSV/JSON), 표준 API(OpenAPI), 메타데이터(DCAT/JSON-LD)를 우선 도입하는 것!
- 구체적 코드 예제와 이행 로드맵을 제안합니다 — 이건 API 한 줄로 해결되는 문제예요.
結論
정부·지자체의 오픈데이터는 이미 가치가 높지만 형식과 접근성에서 병목이 크다. PDF에 묶인 통계표를 CSV/JSON으로 전환하고, 표준화된 API와 메타데이터를 제공하면 데이터 이용률과 재현성은 즉시 개선된다. 要するに, "기계가 읽을 수 있게" 바꾸면 정책 검증이 쉬워진다.
레포트本文
현황 스냅샷 — 무엇이 문제인가
これ見てくださいよ。総務省의 오픈데이터 전략 문서와 e-Gov API 카탈로그는 이미 존재합니다(https://www.soumu.go.jp, https://api-catalog.e-gov.go.jp)。그런데도 실제 데이터는:
- PDF 혹은 HTML 표에 삽입된 통계표가 많음(기계판독성 낮음) — digital.go.jp의 기계可読性ルール案(検索結果[11])도 여전히 도입중
- 메타데이터 부족: 어떤 필드가 무엇인지, 단위와 갱신 주기 정보가 체계적으로 제공되지 않음
- API는 부분적으로 존재하지만, 포맷·認証·スキーマ가 통일되어 있지 않음(카탈로그는 있으나整備は段階的)
要するに: 데이터는 "있다". 하지만 "쓸 수 있게" 제공하진 않는다.
기술적 문제를 조금 더 파고들기
- PDF vs CSV: PDF는 시각화·인쇄엔 좋지만 파싱 비용이 큽니다. OCR/표 인식으로 추출하면 오류가 생기고 재현성이 낮음.
- 스키마 부재: 기관마다 컬럼명이 달라서 매핑(CSV->통합 스토어)이 매번 수작업
- 업데이트 불투명: 데이터 버전관리·증분 제공 없어 파이프라인 자동화가 어렵다
エンジニア的に言うと、이건 데이터 레이크 설계가 안 된 상태예요. 표준화(스키마), 자동화(증분API), 및 메타데이터(DCAT)가 핵심
코드 예제: 현실적인 접근법
1) e-Gov 공개 API 호출 (curl)
curl -s "https://api-catalog.e-gov.go.jp/.../endpoint?limit=100" -H "Accept: application/json"
2) 받아서 Pandas로 정제 (예시)
import pandas as pd
import requests
r = requests.get('https://.../dataset.csv')
df = pd.read_csv(pd.compat.StringIO(r.text))
날짜 파싱, 단위 통일
df['date'] = pd.to_datetime(df['date'], errors='coerce')
df['value'] = pd.to_numeric(df['value'], errors='coerce')
스키마 검증
expected = {'date':'datetime64[ns]','value':'float64'}
이런 파이프라인을 매번 수작업으로 짜는 대신, 정부가 CSV/JSON과 OpenAPI 스펙을 제공하면 재사용 가능한 ETL 모듈을 공개 라이브러리로 배포할 수 있어요.
정책 목표 vs 실적 — 숫자로 보는 갭 분석
総務省의 オープンデータ戦略은「情報のオープン化」や「API整備」を掲げています(検索結果[7])。그러나 현장 데이터의 기계판독성 규칙案(検索結果[11])을 보면 아직 레벨分け와移行の段階にある。수치 목표(예: 공개 데이터 수, API 엔드포인트 수)에 비해 실제 이용 건수·다운로드 수는 낮은 편인데, 가장 큰 원인은 포맷과メタ情報の欠如です。
要するに: 목표는 있으나, 엔지니어링 작업(フォーマット変換、スキーマ定義、認証設計)이 병행되지 않아서 성과가 제한되는 구조
개선 제안(기술 로드맵)
- 모든 통계표는 CSV/JSON 등 기계판독형으로 우선 공개(예외적으로 PDF는 별도 제공)
- digital.go.jp의ルール案을 법적・運用ガイドライン으로 확정
- OpenAPI + JSON Schema로 엔드포인트 표준화
- DCAT-AP/JSON-LD로 데이터셋 메타데이터 제공
- PDF→CSV 변환 도구(기계학습 기반 표 인식)와 검증기
- 공통 ETL 라이브러리(pandas 기반)와 예제 노트북 공개
- 기관 간 스키마 레지스트리 운영
- 버전 관리와 changelog 자동 생성
具体的なOpenAPIスニペットの例:
openapi: 3.0.0
info:
title: municipality-statistics
paths:
/population:
get:
summary: Population by year
parameters:
- in: query
name: year
schema:
type: integer
responses:
'200':
content:
application/json:
schema:
$ref: './schemas/population.json'
これで、データ利用者はスキーマを見て即座にパイプラインを作れるようになります!
활용 사례 제안
- 지역 예산·정책의 KPI를 API로 연동해 실시간 대시보드화
- 민간 스타트업들이 민원·교통·복지 데이터를 결합해 지역 서비스 개발
- 학계·저널리스트의 재현 가능한 분석을 위한 데이터 패키지(版本管理付き)
まとめ
- 문제: 데이터는 있지만 기계판독성·메타데이터·API 표준이 부족
- 해결책: CSV/JSON 우선 공개, OpenAPI/JSON Schema, DCAT 메타데이터, 변환·검증 툴 제공
- 효과: 정책의 투명성·검증 가능성 증가, 민간의 재사용 촉진, 정부 내부의 자동화 비용 절감
おかむーから一言
기술로 사회를 바꾸는 건 결국 작은 엔지니어링 결정들의 모임입니다. PDF를 CSV로 바꾸는 것, API 스펙 하나 만드는 것 — 이게 모여서 정책의 재현성과 신뢰를 만듭니다. 나부터 뛰겠습니다, 여러분도 같이해요!
정보 출처
- https://www.zhihu.com/question/290714454
- https://metidx-gov.note.jp/n/n9468573c213b
- https://www.zhihu.com/question/6430289390
- https://zenn.dev/govtechtokyo/articles/b65dc687e50918
- https://www.zhihu.com/question/38923279
- https://www.e-gov.go.jp/digital-government/api
- https://www.soumu.go.jp/menu_seisaku/ictseisaku/ictriyou/opendata/opendata03.html
- https://japan-opendata.github.io/awesome-japan-opendata/
- https://www.jichi.ac.jp/
- https://api-catalog.e-gov.go.jp/info/ja/apicatalog/list
- https://www.digital.go.jp/assets/contents/node/basic_page/field_ref_resources/256dcba6-b936-4031-b88d-3abb27e27f9b/f7af0ca4/20260331_meeting_executive_outline_06.pdf
- https://www.soumu.go.jp/menu_news/s-news/01toukatsu01_02000186.html
공유하기
관련 리포트

コードで語るマニフェスト:自治体データとシステムをエンジニア視点で検証する
自治体データはPDFやUIに閉じがち。API-firstとJSON Schemaで再利用性を高め、ガバメントクラウドへ移行する実務ロードマップを提示します。

コードで語るマニフェスト:日本政府データの現場から見る技術検証
政府データは可視化が進むも機械可読性不足が課題。CSV/JSON/API、スキーマ、ID統一で政策検証を自動化しよう。

코드로 읽는 마니페스토: 일본 정부 데이터와 시스템을 엔지니어 관점에서 후벼파기
일본 정부 데이터의 PDF·API·메타데이터 문제를 엔지니어 관점에서 분석하고, 실무 가능한 개선안을 코드 예시와 함께 제시합니다。