코드로 읽는 공공데이터 매니페스토 — PDF에서 API까지, 무엇을 바꿔야 할까

IT 정책 제안
코드로 읽는 공공데이터 매니페스토 — PDF에서 API까지, 무엇을 바꿔야 할까

どうも〜おかむーです!

  • 정부·지방자치단체 데이터, PDF에 박혀 있으면 쓸모 반감된다!
  • 기계가 읽을 수 있는 데이터 제공(API/CSV/OpenAPI)이 핵심이다!
  • UX는 프론트엔드 문제가 아니라 데이터+엔지니어링 문제다!

結論

정부와 지방자치단체는 ‘기계가 바로 읽을 수 있는’ 데이터 퍼블리싱을 기본으로 삼아야 한다. PDF 배포만으로는 투명성과 활용성을 보장할 수 없고, API와 표준 포맷(CSV/JSON/OpenAPI)을 통한 배포 및 품질관리 체계를 즉시 강화해야 한다.

레포트 본문

에자일하게 말하자면, 이건 단순한 디자인 개선 제안이 아니다. 데이터 인프라 설계와 운영 프로세스의 문제다. 여기서 검색 결과들을 엮어서 기술적으로 분석해보자.

현황 스냅샷 — 참고 자료

  • Digital庁: UI 가이드라인과 체크리스트(検索結果[2]) — UI 점검과 함께 데이터 가독성 문제도 지적하고 있음
  • 内閣官房/行財政改革会議: 행정데이터의 기계가독성 룰 결정(検索結果[14], [12]) — CSV/Excel 우선권고, PDF는 보조
  • e-Gov API 카탈로그(検索結果[7])와 Tokyo Open Data API(検索結果[9]) — API는 존재하지만 적용 범위와 품질이 제각각

이 데이터, PDF에 박혀 있는 거 보세요! 정책 수치·목표치는 종종 PDF 리포트의 표에 숨어있는데, 엔지니어적으론 이걸 긁어쓰는 건 비용과 불확실성의 연속이다. 要するに: 데이터가 기계친화적으로 공개되어 있지 않으면 재현 가능성과 추적 가능성이 깨진다.

기술적 문제점 정리

  • 포맷 문제: PDF나 이미지 스캔본이 여전히 많다. 기계 판독(ocr/tabula)로 처리해야 하고, 품질 보장이 어렵다.
  • 메타데이터 부재: 스키마, 단위, 업데이트 주기,ライセンス 정보가 불충분하다.
  • API 품질: 인증·버전·レート制限·스펙(예: OpenAPI) 표준화가 안 돼 있어 사용자가 재사용하기 어려움.
  • UX-데이터 단절: 프론트엔드 개선만으로는 근본 해결 불가. 백엔드 데이터 설계가 병행되어야 한다.

정책 목표 vs 실적 — 숫자 검증의 관점

예컨대 어떤 지자체가 "시민 서비스 전부 전자화" 같은 목표를 내걸었다면, 검증 가능한 지표(온라인 전환율, API 호출수, 오픈데이터 카탈로그 등록건수 등)를 설정해야 한다. 목표: 문서 100% 공개 → 실적: PDF 80%, 기계가독성 20% 같은 식으로 격차를 수치화하라. 要するに: 수치 목표도 메트릭화 가능한 항목으로 바꿔야 한다.

실전 기술 제안(코드 예시 포함)

1) 우선 공개 포맷 표준화

  • CSV/JSON을 기본으로, 시간축 데이터는 time series 표준(ISO 8601) 사용
  • 메타데이터는 JSON-LD 또는 DCAT으로 제공

2) API 설계 및 배포

  • OpenAPI 스펙 제공, 버전 관리, changelog 유지
  • 예: Tokyo Open Data API에서 공공시설 목록 GET 엔드포인트 호출 예시
curl -s "https://portal.data.metro.tokyo.lg.jp/PublicFacility?limit=10" | jq '.items[] | {name: .facilityName, type: .facilityType, addr: .address}'

3) 데이터 파이프라인(간단한 파이썬 예)

import requests

import pandas as pd

r = requests.get('https://portal.data.metro.tokyo.lg.jp/PublicFacility?limit=100')

items = r.json().get('items', [])

df = pd.json_normalize(items)

df[['facilityName','facilityType','address']].to_csv('public_facilities.csv', index=False)

4) PDF에 갇힌 통계는 ETL로 구조화

  • Tabula/ Camelot로 표 추출, 추출 결과를 사람이 검증한 뒤 CSV로 변환
  • 자동화 파이프라인: PDF 업로드 → OCR/표 추출 → 검증 단계 → 게시

5) 거버넌스와 품질관리

  • 데이터 카탈로그(e.g., e-Gov API 카탈로그)와 연계, 메트릭(신선도, 누락, 스키마 변경) 대시보드 운영
  • SLA 설정: 응답시간, 가용성, 데이터 신선도

UX와 데이터의 결합: 사례에서 배우기

渋谷区 사례(検索結果[3])처럼 프론트엔드 UX를 개선한 건 훌륭하다. 하지만 그 데이터가 실시간으로 바뀌고, API로 외부에 노출되면 더 큰 가치가 생긴다. 디자인은 '인터랙션 레이어', 데이터는 '진짜 자산'인 셈이다.

まとめ

  • PDF 중심 배포 관행을 멈추고 CSV/JSON + OpenAPI 형태로 전환하자
  • 메타데이터와 기계가독성 규칙(内閣官房・Digital庁 가이드)에 따라 공개품질을 측정하자
  • API 스펙, 버전관리, 인증·레ート 정책을 표준화해서 재사용성을 높이자
  • UX 개선은 데이터 신뢰와 결합될 때 진가를 발휘한다

おかむーから一言

기술로 사회를 업데이트하는 건 결국 작은 데이터 설계의 연속입니다. 엔지니어 시선으로 말하면, 정책은 코드화될 수 있어야 성과로 이어져요。テクノロジーで勝負しましょう!

공유하기