コードで語るマニフェスト:自治体データの機械可読性をエンジニア目線で検証する

안녕하세요~ 오카무입니다! 오늘은 정부·지방자치단체의 데이터와 시스템을 엔지니어링 관점에서 까다롭게 들여다보는 시간이에요. 코드로 정책을 말한다는 콘셉트로, "기계 가독성" 문제부터 API 설계, 실무적 개선안까지 하나씩 정리합니다.
- 이 글 3줄 요약
- 엔지니어 관점에서는 표준 스키마·API·검증 파이프라인이 핵심이다. 구현은 생각보다 단순하다!
- 제안: 카탈로그 + JSON Schema + CI 기반 데이터 파이프라인으로 90% 이상 기계가 읽는 데이터로 전환하자
結論
정부와 지자체가 "데이터 공개"를 말로만 하지 말고, 기계가 즉시 쓰게 만드는 것이 중요하다. PDF→CSV 변환, API 제공, 그리고 스키마 검증을 통해 정책의 투명성과 재현성을 확보할 수 있다. 구체적 로드맵(카탈로그 구축 → 스키마 표준화 → API 게이트웨이 → 데이터 CI)을 제시한다.
레포트 본문
현황 스냅샷 — 이거 좀 보세요
공식 문서들(digital.go.jp, 内閣官房의 デジタル行財政改革会議 자료 등)을 보면 "行政データにおける機械可読性に関するルール"를 이미 정리하려 하고 있어요(참고: digital.go.jp PDF). 그런데 실제로 각 지방자치단체의 데이타 포털을 보면:
- 통계는 PDF(보고서)로만 공개되는 경우가 많다
- 같은 항목이라도 컬럼명·단위가 지자체마다 제각각
- API가 있어도 인증·버전 관리가 불명확
요약하면 "사람이 읽기엔 괜찮지만, 코드로 돌리기엔 엉성한 상태"인 거죠.
문제를 엔지니어적으로 정리하면
- 포맷 문제: PDF/画像, 비표준 XLS, 인코딩 문제
- 스키마 부재: 데이터셋마다 필드·타입·단위가 달라 결합이 어렵다
- 배포·접근성: API가 없거나, 있어도 안정성·레ート 제한·문서화가 부족
기술적 검증 & 코드 예시
1) PDF 테이블 추출(현장 예시)
# tabula-py 예시: report.pdf의 모든 표를 DataFrame으로 읽기
import tabula
dfs = tabula.read_pdf('report.pdf', pages='all', multiple_tables=True)
첫 번째 표를 CSV로 저장
dfs[0].to_csv('extracted.csv', index=False)
2) CSV → 스키마 검증(간단한 예)
import pandas as pd
from jsonschema import validate
schema = {
'type': 'array',
'items': {
'type': 'object',
'properties': {
'year': {'type': 'integer'},
'population': {'type': 'number'}
},
'required': ['year','population']
}
}
df = pd.read_csv('extracted.csv')
records = df.to_dict(orient='records')
validate(records, schema)
3) 데이터 API 빠른 프로토타입(FastAPI)
from fastapi import FastAPI
import pandas as pd
app = FastAPI()
@app.get('/api/population')
def get_population():
df = pd.read_csv('population.csv')
return df.to_dict(orient='records')
이런 예시는 "기본 원칙"을 보여줘요: 데이터는 가능한 한 빨리 CSV/JSON으로 바꾸고, 스키마로 검증해서 API로 내보내면 다른 시스템에서 바로 쓸 수 있어요.
정책 목표 vs 실적 갭 분석(방법론)
정책 문건(예: デジタル行財政改革会議의 기계可読性ルール)에 따르면 단계별로 기계 가독성을 끌어올리는 계획이 있어요. 이를 측정하려면 지표가 필요합니다:
- 지표 예시
- OpenAPI 명세를 가진 데이터셋 수
- 메타데이터(DCAT) 포함 비율
- 자동검증 통과 비율
현재는 CSV/JSON 비율이 낮고, API 문서화가 미흡한 곳이 많으니 목표(예: 90% 기계가 읽을 수 있음)와 격차가 명확합니다.
실무적 개선 제안(로드맵)
- CKAN이나 Data.go.jp와 연동되는 포털을 전 지자체에 배포
- DCAT/JSON-LD 기반 메타데이터 요구
- 인구·사업체·施設 등 도메인별 JSON Schema 템플릿 제공
- PDF→CSV 추출(탐지+사전 처리) → 검증 → Parquet 저장
- 저장소: S3 + 라벨링된 버전 관리
- OpenAPI로 표준화, 버전·요금/레이트 제한 정책 명시
- Pull Request 기반으로 데이터 변경 검증(스키마·값 범위 등)
- 민간 개발자와 공동 개발 가능한 샌드박스 API, 예제 데이터셋 제공
비용·優先度(짧게)
- 우선순위 1: CSV/JSON으로 노출되는 핵심 데이터(예: 人口、医療、福祉) 확보
- 우선순위 2: 카탈로그 + 스키마 템플릿
- 우선순위 3: 자동화 파이프라인과 API 게이트웨이 구축
導入コスト는 초기 인프라·매뉴얼·교육에 집중되지만, 일단 표준을 맞추면 재사용·연계로 장기적 비용 절감이 확실합니다.
活用例 — 오픈데이터가 풀어줄 사회문제
- 재난 대응: 센서·河川監視 데이터(CSV/API)를 실시간 파이프라인에 연결해 대시보드로 활용
- 지역경제 분석: 事業所データ를 표준 스키마로 맞추면 민간 애플리케이션에서 자동으로 가공 가능
- 정책 검증: 정책 목표치와 실적(数値) 비교를 자동화해 정책 피드백 루프를 짧게 만들기
技術的リスクとガバナンス
- 개인정보·민감정보: 익명화·集計化が必須
- 품질 보증: 검증 규칙(값 범위·타입)을 중앙에서 관리
- 변화 관리: 스키마 변경 시 버전 호환성 보장
参考ソース
- digital.go.jp の「行政データにおける機械可読性に関するルール(案)」
- 内閣官房 デジタル行財政改革会議
- GovTech東京 のデータ利活用事例
まとめ
- 지금 필요한 건 "데이터 공개"가 아니라 "기계가 바로 쓰는 데이터 공개"입니다.
- PDF→CSV, 스키마 표준화, API 제공, 자동화 파이프라인 이 네 가지가 핵심이에요.
- 기술적 구현은 단순한 편이라 빠르게 시범사업을 돌려서 성과를 보이는 게 중요합니다. 데이터로 정책을 검증할 수 있어야 정책도 진짜로 바뀌거든요!
おかむーから一言
테크로 사회를 바꾸자고요! 작은 CSV 한 파일이 정책의 투명성과 시민의 신뢰를 바꿉니다. 함께 만들어보시죠〜
정보 출처
- https://ja.wikipedia.org/wiki/%E5%85%AC%E5%85%B1
- https://www.intec.co.jp/column/smartcity-08.html
- https://kotobank.jp/word/%E5%85%AC%E5%85%B1-494676
- https://www.digital.go.jp/resources/data_case_study_private
- https://www.takeda.tv/saga/blog/post-230907/
- https://www.zhihu.com/question/290714454
- https://www.digital.go.jp/assets/contents/node/basic_page/field_ref_resources/256dcba6-b936-4031-b88d-3abb27e27f9b/f7af0ca4/20260331_meeting_executive_outline_06.pdf
- https://www.zhihu.com/question/6430289390
- https://www.cas.go.jp/jp/seisaku/digital_gyozaikaikaku/kakusyoDX4/kakusyoDX4.html
- https://www.zhihu.com/question/38923279
- https://www.zhihu.com/question/40553450
- https://www.govtechtokyo.or.jp/services/data-utilization/
- https://www.zhihu.com/tardis/zm/art/1924492115896960699
- https://note.govtechtokyo.jp/n/n77785a8254d6
- https://www.zhihu.com/question/372341437
공유하기
관련 리포트

コードで語るマニフェスト:自治体データとシステムをエンジニア視点で検証する
自治体データはPDFやUIに閉じがち。API-firstとJSON Schemaで再利用性を高め、ガバメントクラウドへ移行する実務ロードマップを提示します。

コードで語るマニフェスト:日本政府データの現場から見る技術検証
政府データは可視化が進むも機械可読性不足が課題。CSV/JSON/API、スキーマ、ID統一で政策検証を自動化しよう。

코드로 읽는 마니페스토: 일본 정부 데이터와 시스템을 엔지니어 관점에서 후벼파기
일본 정부 데이터의 PDF·API·메타데이터 문제를 엔지니어 관점에서 분석하고, 실무 가능한 개선안을 코드 예시와 함께 제시합니다。