コードで語るマニフェスト:行政データはこう直せば使えるようになる

IT 정책 제안
コードで語るマニフェスト:行政データはこう直せば使えるようになる

안녕하세요~ 오카무입니다! 오늘은 공공데이터와 지방자치단체 시스템을 엔지니어 관점에서 후다닥 뜯어보려고요〜

  • 이 글 3줄 요약
- 많은 행정 데이터가 아직 PDF·이미지에 갇혀 있고, 기계판독성 규칙과 API는 도입 중입니다. (출처: digital.go.jp, soumu.go.jp, e-Gov)

- 엔지니어적 관점에서 해결책은: 기계가 읽는 형식(CSV/JSON), 표준 API(OpenAPI), 메타데이터(DCAT/JSON-LD)를 우선 도입하는 것!

- 구체적 코드 예제와 이행 로드맵을 제안합니다 — 이건 API 한 줄로 해결되는 문제예요.

結論

정부·지자체의 오픈데이터는 이미 가치가 높지만 형식과 접근성에서 병목이 크다. PDF에 묶인 통계표를 CSV/JSON으로 전환하고, 표준화된 API와 메타데이터를 제공하면 데이터 이용률과 재현성은 즉시 개선된다. 要するに, "기계가 읽을 수 있게" 바꾸면 정책 검증이 쉬워진다.

레포트本文

현황 스냅샷 — 무엇이 문제인가

これ見てくださいよ。総務省의 오픈데이터 전략 문서와 e-Gov API 카탈로그는 이미 존재합니다(https://www.soumu.go.jp, https://api-catalog.e-gov.go.jp)。그런데도 실제 데이터는:

  • PDF 혹은 HTML 표에 삽입된 통계표가 많음(기계판독성 낮음) — digital.go.jp의 기계可読性ルール案(検索結果[11])도 여전히 도입중
  • 메타데이터 부족: 어떤 필드가 무엇인지, 단위와 갱신 주기 정보가 체계적으로 제공되지 않음
  • API는 부분적으로 존재하지만, 포맷·認証·スキーマ가 통일되어 있지 않음(카탈로그는 있으나整備は段階的)

要するに: 데이터는 "있다". 하지만 "쓸 수 있게" 제공하진 않는다.

기술적 문제를 조금 더 파고들기

  • PDF vs CSV: PDF는 시각화·인쇄엔 좋지만 파싱 비용이 큽니다. OCR/표 인식으로 추출하면 오류가 생기고 재현성이 낮음.
  • 스키마 부재: 기관마다 컬럼명이 달라서 매핑(CSV->통합 스토어)이 매번 수작업
  • 업데이트 불투명: 데이터 버전관리·증분 제공 없어 파이프라인 자동화가 어렵다

エンジニア的に言うと、이건 데이터 레이크 설계가 안 된 상태예요. 표준화(스키마), 자동화(증분API), 및 메타데이터(DCAT)가 핵심

코드 예제: 현실적인 접근법

1) e-Gov 공개 API 호출 (curl)

curl -s "https://api-catalog.e-gov.go.jp/.../endpoint?limit=100" -H "Accept: application/json"

2) 받아서 Pandas로 정제 (예시)

import pandas as pd

import requests

r = requests.get('https://.../dataset.csv')

df = pd.read_csv(pd.compat.StringIO(r.text))

날짜 파싱, 단위 통일

df['date'] = pd.to_datetime(df['date'], errors='coerce')

df['value'] = pd.to_numeric(df['value'], errors='coerce')

스키마 검증

expected = {'date':'datetime64[ns]','value':'float64'}

이런 파이프라인을 매번 수작업으로 짜는 대신, 정부가 CSV/JSON과 OpenAPI 스펙을 제공하면 재사용 가능한 ETL 모듈을 공개 라이브러리로 배포할 수 있어요.

정책 목표 vs 실적 — 숫자로 보는 갭 분석

総務省의 オープンデータ戦略은「情報のオープン化」や「API整備」を掲げています(検索結果[7])。그러나 현장 데이터의 기계판독성 규칙案(検索結果[11])을 보면 아직 레벨分け와移行の段階にある。수치 목표(예: 공개 데이터 수, API 엔드포인트 수)에 비해 실제 이용 건수·다운로드 수는 낮은 편인데, 가장 큰 원인은 포맷과メタ情報の欠如です。

要するに: 목표는 있으나, 엔지니어링 작업(フォーマット変換、スキーマ定義、認証設計)이 병행되지 않아서 성과가 제한되는 구조

개선 제안(기술 로드맵)

  • 기계판독성 우선 정책
  • - 모든 통계표는 CSV/JSON 등 기계판독형으로 우선 공개(예외적으로 PDF는 별도 제공)

    - digital.go.jp의ルール案을 법적・運用ガイドライン으로 확정

  • 표준 API와 메타데이터
  • - OpenAPI + JSON Schema로 엔드포인트 표준화

    - DCAT-AP/JSON-LD로 데이터셋 메타데이터 제공

  • 점진적 이행을 위한 툴킷 제공
  • - PDF→CSV 변환 도구(기계학습 기반 표 인식)와 검증기

    - 공통 ETL 라이브러리(pandas 기반)와 예제 노트북 공개

  • 거버넌스·운영
  • - 기관 간 스키마 레지스트리 운영

    - 버전 관리와 changelog 자동 생성

    具体的なOpenAPIスニペットの例:

    openapi: 3.0.0
    

    info:

    title: municipality-statistics

    paths:

    /population:

    get:

    summary: Population by year

    parameters:

    - in: query

    name: year

    schema:

    type: integer

    responses:

    '200':

    content:

    application/json:

    schema:

    $ref: './schemas/population.json'

    これで、データ利用者はスキーマを見て即座にパイプラインを作れるようになります!

    활용 사례 제안

    • 지역 예산·정책의 KPI를 API로 연동해 실시간 대시보드화
    • 민간 스타트업들이 민원·교통·복지 데이터를 결합해 지역 서비스 개발
    • 학계·저널리스트의 재현 가능한 분석을 위한 데이터 패키지(版本管理付き)

    まとめ

    • 문제: 데이터는 있지만 기계판독성·메타데이터·API 표준이 부족
    • 해결책: CSV/JSON 우선 공개, OpenAPI/JSON Schema, DCAT 메타데이터, 변환·검증 툴 제공
    • 효과: 정책의 투명성·검증 가능성 증가, 민간의 재사용 촉진, 정부 내부의 자동화 비용 절감

    おかむーから一言

    기술로 사회를 바꾸는 건 결국 작은 엔지니어링 결정들의 모임입니다. PDF를 CSV로 바꾸는 것, API 스펙 하나 만드는 것 — 이게 모여서 정책의 재현성과 신뢰를 만듭니다. 나부터 뛰겠습니다, 여러분도 같이해요!

    공유하기