코드로 읽는 공공데이터 매니페스토 — PDF에서 API까지, 무엇을 바꿔야 할까

どうも〜おかむーです!
- 정부·지방자치단체 데이터, PDF에 박혀 있으면 쓸모 반감된다!
- 기계가 읽을 수 있는 데이터 제공(API/CSV/OpenAPI)이 핵심이다!
- UX는 프론트엔드 문제가 아니라 데이터+엔지니어링 문제다!
結論
정부와 지방자치단체는 ‘기계가 바로 읽을 수 있는’ 데이터 퍼블리싱을 기본으로 삼아야 한다. PDF 배포만으로는 투명성과 활용성을 보장할 수 없고, API와 표준 포맷(CSV/JSON/OpenAPI)을 통한 배포 및 품질관리 체계를 즉시 강화해야 한다.
레포트 본문
에자일하게 말하자면, 이건 단순한 디자인 개선 제안이 아니다. 데이터 인프라 설계와 운영 프로세스의 문제다. 여기서 검색 결과들을 엮어서 기술적으로 분석해보자.
현황 스냅샷 — 참고 자료
- Digital庁: UI 가이드라인과 체크리스트(検索結果[2]) — UI 점검과 함께 데이터 가독성 문제도 지적하고 있음
- 内閣官房/行財政改革会議: 행정데이터의 기계가독성 룰 결정(検索結果[14], [12]) — CSV/Excel 우선권고, PDF는 보조
- e-Gov API 카탈로그(検索結果[7])와 Tokyo Open Data API(検索結果[9]) — API는 존재하지만 적용 범위와 품질이 제각각
이 데이터, PDF에 박혀 있는 거 보세요! 정책 수치·목표치는 종종 PDF 리포트의 표에 숨어있는데, 엔지니어적으론 이걸 긁어쓰는 건 비용과 불확실성의 연속이다. 要するに: 데이터가 기계친화적으로 공개되어 있지 않으면 재현 가능성과 추적 가능성이 깨진다.
기술적 문제점 정리
- 포맷 문제: PDF나 이미지 스캔본이 여전히 많다. 기계 판독(ocr/tabula)로 처리해야 하고, 품질 보장이 어렵다.
- 메타데이터 부재: 스키마, 단위, 업데이트 주기,ライセンス 정보가 불충분하다.
- API 품질: 인증·버전·レート制限·스펙(예: OpenAPI) 표준화가 안 돼 있어 사용자가 재사용하기 어려움.
- UX-데이터 단절: 프론트엔드 개선만으로는 근본 해결 불가. 백엔드 데이터 설계가 병행되어야 한다.
정책 목표 vs 실적 — 숫자 검증의 관점
예컨대 어떤 지자체가 "시민 서비스 전부 전자화" 같은 목표를 내걸었다면, 검증 가능한 지표(온라인 전환율, API 호출수, 오픈데이터 카탈로그 등록건수 등)를 설정해야 한다. 목표: 문서 100% 공개 → 실적: PDF 80%, 기계가독성 20% 같은 식으로 격차를 수치화하라. 要するに: 수치 목표도 메트릭화 가능한 항목으로 바꿔야 한다.
실전 기술 제안(코드 예시 포함)
1) 우선 공개 포맷 표준화
- CSV/JSON을 기본으로, 시간축 데이터는 time series 표준(ISO 8601) 사용
- 메타데이터는 JSON-LD 또는 DCAT으로 제공
2) API 설계 및 배포
- OpenAPI 스펙 제공, 버전 관리, changelog 유지
- 예: Tokyo Open Data API에서 공공시설 목록 GET 엔드포인트 호출 예시
curl -s "https://portal.data.metro.tokyo.lg.jp/PublicFacility?limit=10" | jq '.items[] | {name: .facilityName, type: .facilityType, addr: .address}'
3) 데이터 파이프라인(간단한 파이썬 예)
import requests
import pandas as pd
r = requests.get('https://portal.data.metro.tokyo.lg.jp/PublicFacility?limit=100')
items = r.json().get('items', [])
df = pd.json_normalize(items)
df[['facilityName','facilityType','address']].to_csv('public_facilities.csv', index=False)
4) PDF에 갇힌 통계는 ETL로 구조화
- Tabula/ Camelot로 표 추출, 추출 결과를 사람이 검증한 뒤 CSV로 변환
- 자동화 파이프라인: PDF 업로드 → OCR/표 추출 → 검증 단계 → 게시
5) 거버넌스와 품질관리
- 데이터 카탈로그(e.g., e-Gov API 카탈로그)와 연계, 메트릭(신선도, 누락, 스키마 변경) 대시보드 운영
- SLA 설정: 응답시간, 가용성, 데이터 신선도
UX와 데이터의 결합: 사례에서 배우기
渋谷区 사례(検索結果[3])처럼 프론트엔드 UX를 개선한 건 훌륭하다. 하지만 그 데이터가 실시간으로 바뀌고, API로 외부에 노출되면 더 큰 가치가 생긴다. 디자인은 '인터랙션 레이어', 데이터는 '진짜 자산'인 셈이다.
まとめ
- PDF 중심 배포 관행을 멈추고 CSV/JSON + OpenAPI 형태로 전환하자
- 메타데이터와 기계가독성 규칙(内閣官房・Digital庁 가이드)에 따라 공개품질을 측정하자
- API 스펙, 버전관리, 인증·레ート 정책을 표준화해서 재사용성을 높이자
- UX 개선은 데이터 신뢰와 결합될 때 진가를 발휘한다
おかむーから一言
기술로 사회를 업데이트하는 건 결국 작은 데이터 설계의 연속입니다. 엔지니어 시선으로 말하면, 정책은 코드화될 수 있어야 성과로 이어져요。テクノロジーで勝負しましょう!
정보 출처
- https://zenn.dev/govtechtokyo/articles/b65dc687e50918
- https://www.digital.go.jp/policies/servicedesign/government-system-ui
- https://lg.reserva.be/ux-design/
- https://picks-design.com/blog/5751/
- https://www.trans-plus.jp/blog/column/202210_municipality-dx
- https://www.jichi.ac.jp/
- https://www.e-gov.go.jp/digital-government/api
- https://www.jichi.ac.jp/web_text/
- https://portal.data.metro.tokyo.lg.jp/opendata-api/
- https://www.jichi.ac.jp/library/
- https://ja.wikipedia.org/wiki/%E6%97%A5%E6%9C%AC%E3%81%AE%E8%A1%8C%E6%94%BF%E6%A9%9F%E9%96%A2
- https://www.digital.go.jp/assets/contents/node/basic_page/field_ref_resources/256dcba6-b936-4031-b88d-3abb27e27f9b/f7af0ca4/20260331_meeting_executive_outline_06.pdf
- https://kotobank.jp/word/%E8%A1%8C%E6%94%BF-52748
- https://www.cas.go.jp/jp/seisaku/digital_gyozaikaikaku/kakusyoDX4/kakusyoDX4.html
- https://www.weblio.jp/content/%E8%A1%8C%E6%94%BF
공유하기
관련 리포트

コードで語るマニフェスト:自治体データとシステムをエンジニア視点で検証する
自治体データはPDFやUIに閉じがち。API-firstとJSON Schemaで再利用性を高め、ガバメントクラウドへ移行する実務ロードマップを提示します。

コードで語るマニフェスト:日本政府データの現場から見る技術検証
政府データは可視化が進むも機械可読性不足が課題。CSV/JSON/API、スキーマ、ID統一で政策検証を自動化しよう。

코드로 읽는 마니페스토: 일본 정부 데이터와 시스템을 엔지니어 관점에서 후벼파기
일본 정부 데이터의 PDF·API·메타데이터 문제를 엔지니어 관점에서 분석하고, 실무 가능한 개선안을 코드 예시와 함께 제시합니다。