코드로 말하는 매니페스토 — 정부 데이터·시스템을 엔지니어 시선으로 뜯어보기

- 이 기사 3줄 요약
- e-Stat·デジタル庁 같은 공공 데이터는 API·CSV로 풀면 즉시 활용 가능, 엔지니어적 개선 포인트는 명확하다
- 개선 제안: 표준화된 API, 머신리더블 퍼블리싱, 오픈 카탈로그·배치 덤프 제공으로 정책 검증을 자동화하자
結論
결론부터 말하면, 정책은 숫자로 말해야 하고 데이터는 코드로 검증해야 한다! 지금 정부·지자체는 데이터를 공개하고는 있지만 형식·접근성에서 엔지니어 친화적이지 않은 경우가 많다. e-Stat처럼 API를 제공하는 곳은 재사용성이 높지만, 대다수 문서는 PDF와 HTML 테이블에 묻혀 있다. 要するに, '머신리더블'로의 전환이 곧 검증가능한 거버넌스의 출발점이다.
레포트 본문
데이터 소스 실태(예: 디지털庁, e-Stat, 지자체 보고서)
이거 보세요! デジタル庁(digital.go.jp)과 e-Stat(総務省統計局)은 오픈데이터 철학을 표방하고 API·카탈로그를 운영 중이다. 그런데 실제로 지자체별 사업평가 보고서(예: デジタル田園都市国家構想交付金 관련 PDF, 검색결과[12])는 PDF 형태로 배포돼서 자동처리가 힘들다.
- 문제점 요약
- 메타데이터 부족: 발행일·更新履歴·ライセンス 표기가 일관되지 않음
- API 부재: 일부 중앙 DB(e-Stat)는 API가 있으나, 지자체별 데이터는 REST/GraphQL 엔드ポイント가 없음
엔지니어적으로 말하면, 이건 단순한 불편이 아니라 자동화·모니タリング 파이프라인을 불가능하게 만드는 기술적 부채다!
머신리더블화: 기술적 검증과 방법론
정책의 수치 목표와 실적을 비교하려면 데이터가 CSV/JSON/Parquet로 있어야 한다. 여기서 실제로 쓸 수 있는 워크플로우를 제시한다:
1) 원천이 PDF인 경우
- tabula-py 또는 Camelot으로 테이블 추출
- 추출 결과를 pandas로 정규화(열 표준화, 날짜 포맷 통일)
Python 예시(요약):
import requests
from io import BytesIO
import tabula
import pandas as pd
r = requests.get('https://example.prefecture.jp/report.pdf')
with BytesIO(r.content) as f:
dfs = tabula.read_pdf(f, pages='all', multiple_tables=True)
dfs는 테이블 리스트, pandas로 정리
요약하면, PDF → 테이블 추출 → 스키마 정규화 → 검증(유효범위 체크) 순서로 자동화한다.
2) API/CSV가 있는 경우
- e-Stat API처럼 JSON/CSV로 바로 데이타를 가져옴
- 스키마 버전관리를 위해 OpenAPI/JSON Schema를 배포
requests를 이용한 간단 호출 예:
import requests
import pandas as pd
res = requests.get('https://api.e-stat.go.jp/...&format=csv')
df = pd.read_csv(io.StringIO(res.text))
정책 수치 목표 ↔ 실적 갭 분석
검색결과의 사례들(地方自治体의 デジタル田園都市施策 문서)을 보면 KPI 설정은 되어 있는데 실적 보고가 분절적이고 업데이트 빈도가 낮다. 기술적으로는 다음을 점검하면 된다:
- KPI 메타데이터가 구조화됐는가(지표명, 계산식, 분모/분자 정의)
- 시간 해상도(분기/월간)가 실적 데이터와 일치하는가
- 데이터 출처가 추적가능한가(원자료 링크·버전)
간단한 계산 예: 달성률 = 実績 / 目標. pandas로 기간별 그룹화 후 시계열 차이를 시각화하면 정책 효과를 빠르게 감지할 수 있다.
오픈데이터 활용 가능성 및 개선 제안
현실적인 개선 로드맵은 다음과 같다:
- 예: 예산·KPI·交付金 실적 테이블을 CSV/JSON로 일괄 공개
- 클라이언트가 안정적으로 파이프라인을 유지하게 해줌
- 매일/주간 전체 덤프(Parquet 권장) + 변경점(diff) 파일 제공
- R/Python용 경량 라이브러리로 데이터 취득·검증 보조
이런 개선은 단순히 개발자 편의만 위한 게 아니다. 정책 검증 가능성을 높여 행정의 책임성을 강화한다!
운영·보안·거버넌스 고려사항
- 인증·로그: 민감한 행정데이터는 인증을 붙이고, 감사로그를 남겨야 함
- 라이センス: 재사용 허가(オープンライセンス) 명시
- 데이터品質 스코어: 결측·중복·정합성 지표를 공개해 신뢰도를 가시화
まとめ
- 정부·지자체 데이터는 공개돼 있지만 형식 때문에 활용이 제한되는 경우가 많다
- 엔지ニア視点: API·CSV·스키마·버전관리로 '검증 가능한 정책'을 만들자
- 현실적 제안: 우선순위 데이터의 머신리더블 공개, OpenAPI·주기적 덤프, SDK 제공으로 생태계를 활성화
おかむーから一言
오캄무입니다! 기술로 사회를 바꾸려면 데이터부터 제대로 구축해야죠. 실무적으로 가능한 작은 변화(CSV 한 파일, 공개 API 한 엔드포인트)가 정책의 검증 가능성을 확 바꿉니다. 같이 해봅시다!
정보 출처
- https://www.zhihu.com/question/290714454
- https://metidx-gov.note.jp/n/n9468573c213b
- https://www.zhihu.com/question/6430289390
- https://www.trans-plus.jp/blog/column/202210_municipality-dx
- https://www.zhihu.com/question/38923279
- https://www.zhihu.com/question/40553450
- https://www.govtechtokyo.or.jp/services/data-utilization/
- https://www.zhihu.com/tardis/zm/art/1924492115896960699
- https://note.govtechtokyo.jp/n/n77785a8254d6
- https://bus.gov.ru/
- https://www.digital.go.jp/
- https://www.chisou.go.jp/sousei/pdf/r5_guideline-checkaction.pdf
- https://column.nippoukun.bpsinc.jp/what-is-digitization/
- https://www.city.sukagawa.fukushima.jp/shisei/gyoseiunei/keikaku/chiho_sosei/1015604/4045.html
- https://ja.wikipedia.org/wiki/%E3%83%87%E3%82%B8%E3%82%BF%E3%83%AB
공유하기
관련 리포트

コードで語るマニフェスト:自治体データとシステムをエンジニア視点で検証する
自治体データはPDFやUIに閉じがち。API-firstとJSON Schemaで再利用性を高め、ガバメントクラウドへ移行する実務ロードマップを提示します。

コードで語るマニフェスト:日本政府データの現場から見る技術検証
政府データは可視化が進むも機械可読性不足が課題。CSV/JSON/API、スキーマ、ID統一で政策検証を自動化しよう。

코드로 읽는 마니페스토: 일본 정부 데이터와 시스템을 엔지니어 관점에서 후벼파기
일본 정부 데이터의 PDF·API·메타데이터 문제를 엔지니어 관점에서 분석하고, 실무 가능한 개선안을 코드 예시와 함께 제시합니다。