코드로 말하는 매니페스토 — 정부 데이터·시스템을 엔지니어 시선으로 뜯어보기

IT 정책 제안
코드로 말하는 매니페스토 — 정부 데이터·시스템을 엔지니어 시선으로 뜯어보기
  • 이 기사 3줄 요약
- 정부·지자체 데이터는 ‘있긴 한데’ 쓰기 힘든 형태(PDF)에 묶여 있는 경우가 많다

- e-Stat·デジタル庁 같은 공공 데이터는 API·CSV로 풀면 즉시 활용 가능, 엔지니어적 개선 포인트는 명확하다

- 개선 제안: 표준화된 API, 머신리더블 퍼블리싱, 오픈 카탈로그·배치 덤프 제공으로 정책 검증을 자동화하자

結論

결론부터 말하면, 정책은 숫자로 말해야 하고 데이터는 코드로 검증해야 한다! 지금 정부·지자체는 데이터를 공개하고는 있지만 형식·접근성에서 엔지니어 친화적이지 않은 경우가 많다. e-Stat처럼 API를 제공하는 곳은 재사용성이 높지만, 대다수 문서는 PDF와 HTML 테이블에 묻혀 있다. 要するに, '머신리더블'로의 전환이 곧 검증가능한 거버넌스의 출발점이다.

레포트 본문

데이터 소스 실태(예: 디지털庁, e-Stat, 지자체 보고서)

이거 보세요! デジタル庁(digital.go.jp)과 e-Stat(総務省統計局)은 오픈데이터 철학을 표방하고 API·카탈로그를 운영 중이다. 그런데 실제로 지자체별 사업평가 보고서(예: デジタル田園都市国家構想交付金 관련 PDF, 검색결과[12])는 PDF 형태로 배포돼서 자동처리가 힘들다.

  • 문제점 요약
- 포맷: PDF나 스캔된 보고서가 여전히 많음 → 텍스트 추출 비용 발생

- 메타데이터 부족: 발행일·更新履歴·ライセンス 표기가 일관되지 않음

- API 부재: 일부 중앙 DB(e-Stat)는 API가 있으나, 지자체별 데이터는 REST/GraphQL 엔드ポイント가 없음

엔지니어적으로 말하면, 이건 단순한 불편이 아니라 자동화·모니タリング 파이프라인을 불가능하게 만드는 기술적 부채다!

머신리더블화: 기술적 검증과 방법론

정책의 수치 목표와 실적을 비교하려면 데이터가 CSV/JSON/Parquet로 있어야 한다. 여기서 실제로 쓸 수 있는 워크플로우를 제시한다:

1) 원천이 PDF인 경우

  • tabula-py 또는 Camelot으로 테이블 추출
  • 추출 결과를 pandas로 정규화(열 표준화, 날짜 포맷 통일)

Python 예시(요약):

import requests

from io import BytesIO

import tabula

import pandas as pd

r = requests.get('https://example.prefecture.jp/report.pdf')

with BytesIO(r.content) as f:

dfs = tabula.read_pdf(f, pages='all', multiple_tables=True)

dfs는 테이블 리스트, pandas로 정리

요약하면, PDF → 테이블 추출 → 스키마 정규화 → 검증(유효범위 체크) 순서로 자동화한다.

2) API/CSV가 있는 경우

  • e-Stat API처럼 JSON/CSV로 바로 데이타를 가져옴
  • 스키마 버전관리를 위해 OpenAPI/JSON Schema를 배포

requests를 이용한 간단 호출 예:

import requests

import pandas as pd

res = requests.get('https://api.e-stat.go.jp/...&format=csv')

df = pd.read_csv(io.StringIO(res.text))

정책 수치 목표 ↔ 실적 갭 분석

검색결과의 사례들(地方自治体의 デジタル田園都市施策 문서)을 보면 KPI 설정은 되어 있는데 실적 보고가 분절적이고 업데이트 빈도가 낮다. 기술적으로는 다음을 점검하면 된다:

  • KPI 메타데이터가 구조화됐는가(지표명, 계산식, 분모/분자 정의)
  • 시간 해상도(분기/월간)가 실적 데이터와 일치하는가
  • 데이터 출처가 추적가능한가(원자료 링크·버전)

간단한 계산 예: 달성률 = 実績 / 目標. pandas로 기간별 그룹화 후 시계열 차이를 시각화하면 정책 효과를 빠르게 감지할 수 있다.

오픈데이터 활용 가능성 및 개선 제안

현실적인 개선 로드맵은 다음과 같다:

  • 우선순위 엔드포인트 공개
  • - 예: 예산·KPI·交付金 실적 테이블을 CSV/JSON로 일괄 공개

  • OpenAPI 스펙 + 스키마 버전관리
  • - 클라이언트가 안정적으로 파이프라인을 유지하게 해줌

  • 정기 배치 덤프와 변경 로그
  • - 매일/주간 전체 덤프(Parquet 권장) + 변경점(diff) 파일 제공

  • PDF는 보조 형식으로, 원본 데이터는 머신리더블로 제공
  • ガバメントのSDK 제공
  • - R/Python용 경량 라이브러리로 데이터 취득·검증 보조

    이런 개선은 단순히 개발자 편의만 위한 게 아니다. 정책 검증 가능성을 높여 행정의 책임성을 강화한다!

    운영·보안·거버넌스 고려사항

    • 인증·로그: 민감한 행정데이터는 인증을 붙이고, 감사로그를 남겨야 함
    • 라이センス: 재사용 허가(オープンライセンス) 명시
    • 데이터品質 스코어: 결측·중복·정합성 지표를 공개해 신뢰도를 가시화

    まとめ

    • 정부·지자체 데이터는 공개돼 있지만 형식 때문에 활용이 제한되는 경우가 많다
    • 엔지ニア視点: API·CSV·스키마·버전관리로 '검증 가능한 정책'을 만들자
    • 현실적 제안: 우선순위 데이터의 머신리더블 공개, OpenAPI·주기적 덤프, SDK 제공으로 생태계를 활성화

    おかむーから一言

    오캄무입니다! 기술로 사회를 바꾸려면 데이터부터 제대로 구축해야죠. 실무적으로 가능한 작은 변화(CSV 한 파일, 공개 API 한 엔드포인트)가 정책의 검증 가능성을 확 바꿉니다. 같이 해봅시다!

    공유하기