コードで語るマニフェスト:自治体データの機械可読性をエンジニア目線で検証する

IT 정책 제안
コードで語るマニフェスト:自治体データの機械可読性をエンジニア目線で検証する

안녕하세요~ 오카무입니다! 오늘은 정부·지방자치단체의 데이터와 시스템을 엔지니어링 관점에서 까다롭게 들여다보는 시간이에요. 코드로 정책을 말한다는 콘셉트로, "기계 가독성" 문제부터 API 설계, 실무적 개선안까지 하나씩 정리합니다.

  • 이 글 3줄 요약
- 많은 행정데이터가 여전히 PDF에 잠겨 있고, CSV/API 제공은 부족하다. (digital.go.jp 문서 참조)

- 엔지니어 관점에서는 표준 스키마·API·검증 파이프라인이 핵심이다. 구현은 생각보다 단순하다!

- 제안: 카탈로그 + JSON Schema + CI 기반 데이터 파이프라인으로 90% 이상 기계가 읽는 데이터로 전환하자

結論

정부와 지자체가 "데이터 공개"를 말로만 하지 말고, 기계가 즉시 쓰게 만드는 것이 중요하다. PDF→CSV 변환, API 제공, 그리고 스키마 검증을 통해 정책의 투명성과 재현성을 확보할 수 있다. 구체적 로드맵(카탈로그 구축 → 스키마 표준화 → API 게이트웨이 → 데이터 CI)을 제시한다.

레포트 본문

현황 스냅샷 — 이거 좀 보세요

공식 문서들(digital.go.jp, 内閣官房의 デジタル行財政改革会議 자료 등)을 보면 "行政データにおける機械可読性に関するルール"를 이미 정리하려 하고 있어요(참고: digital.go.jp PDF). 그런데 실제로 각 지방자치단체의 데이타 포털을 보면:

  • 통계는 PDF(보고서)로만 공개되는 경우가 많다
  • 같은 항목이라도 컬럼명·단위가 지자체마다 제각각
  • API가 있어도 인증·버전 관리가 불명확

요약하면 "사람이 읽기엔 괜찮지만, 코드로 돌리기엔 엉성한 상태"인 거죠.

문제를 엔지니어적으로 정리하면

  • 포맷 문제: PDF/画像, 비표준 XLS, 인코딩 문제
- 要するに: 기계가 직접 읽을 수 있는 CSV/JSON이 최우선이다
  • 스키마 부재: 데이터셋마다 필드·타입·단위가 달라 결합이 어렵다
- 要するに: JSON Schema/DCAT 같은 메타데이터 표준이 필요
  • 배포·접근성: API가 없거나, 있어도 안정성·레ート 제한·문서화가 부족
- 要するに: OpenAPI로 문서화하고 게이트웨이로 관리

기술적 검증 & 코드 예시

1) PDF 테이블 추출(현장 예시)

# tabula-py 예시: report.pdf의 모든 표를 DataFrame으로 읽기

import tabula

dfs = tabula.read_pdf('report.pdf', pages='all', multiple_tables=True)

첫 번째 표를 CSV로 저장

dfs[0].to_csv('extracted.csv', index=False)

2) CSV → 스키마 검증(간단한 예)

import pandas as pd

from jsonschema import validate

schema = {

'type': 'array',

'items': {

'type': 'object',

'properties': {

'year': {'type': 'integer'},

'population': {'type': 'number'}

},

'required': ['year','population']

}

}

df = pd.read_csv('extracted.csv')

records = df.to_dict(orient='records')

validate(records, schema)

3) 데이터 API 빠른 프로토타입(FastAPI)

from fastapi import FastAPI

import pandas as pd

app = FastAPI()

@app.get('/api/population')

def get_population():

df = pd.read_csv('population.csv')

return df.to_dict(orient='records')

이런 예시는 "기본 원칙"을 보여줘요: 데이터는 가능한 한 빨리 CSV/JSON으로 바꾸고, 스키마로 검증해서 API로 내보내면 다른 시스템에서 바로 쓸 수 있어요.

정책 목표 vs 실적 갭 분석(방법론)

정책 문건(예: デジタル行財政改革会議의 기계可読性ルール)에 따르면 단계별로 기계 가독성을 끌어올리는 계획이 있어요. 이를 측정하려면 지표가 필요합니다:

  • 지표 예시
- 전체 공개 데이터 중 CSV/JSON 비율

- OpenAPI 명세를 가진 데이터셋 수

- 메타데이터(DCAT) 포함 비율

- 자동검증 통과 비율

현재는 CSV/JSON 비율이 낮고, API 문서화가 미흡한 곳이 많으니 목표(예: 90% 기계가 읽을 수 있음)와 격차가 명확합니다.

실무적 개선 제안(로드맵)

  • 데이터 카탈로그(포털) 표준화
  • - CKAN이나 Data.go.jp와 연동되는 포털을 전 지자체에 배포

    - DCAT/JSON-LD 기반 메타데이터 요구

  • 스키마 템플릿 제공
  • - 인구·사업체·施設 등 도메인별 JSON Schema 템플릿 제공

  • 자동화 파이프라인
  • - PDF→CSV 추출(탐지+사전 처리) → 검증 → Parquet 저장

    - 저장소: S3 + 라벨링된 버전 관리

  • API 게이트웨이 & 문서화
  • - OpenAPI로 표준화, 버전·요금/레이트 제한 정책 명시

  • 데이터 CI/CD
  • - Pull Request 기반으로 데이터 변경 검증(스키마·값 범위 등)

  • 커뮤니티·ビルド시스템
  • - 민간 개발자와 공동 개발 가능한 샌드박스 API, 예제 데이터셋 제공

    비용·優先度(짧게)

    • 우선순위 1: CSV/JSON으로 노출되는 핵심 데이터(예: 人口、医療、福祉) 확보
    • 우선순위 2: 카탈로그 + 스키마 템플릿
    • 우선순위 3: 자동화 파이프라인과 API 게이트웨이 구축

    導入コスト는 초기 인프라·매뉴얼·교육에 집중되지만, 일단 표준을 맞추면 재사용·연계로 장기적 비용 절감이 확실합니다.

    活用例 — 오픈데이터가 풀어줄 사회문제

    • 재난 대응: 센서·河川監視 데이터(CSV/API)를 실시간 파이프라인에 연결해 대시보드로 활용
    • 지역경제 분석: 事業所データ를 표준 스키마로 맞추면 민간 애플리케이션에서 자동으로 가공 가능
    • 정책 검증: 정책 목표치와 실적(数値) 비교를 자동화해 정책 피드백 루프를 짧게 만들기

    技術的リスクとガバナンス

    • 개인정보·민감정보: 익명화·集計化が必須
    • 품질 보증: 검증 규칙(값 범위·타입)을 중앙에서 관리
    • 변화 관리: 스키마 변경 시 버전 호환성 보장

    参考ソース

    • digital.go.jp の「行政データにおける機械可読性に関するルール(案)」
    • 内閣官房 デジタル行財政改革会議
    • GovTech東京 のデータ利活用事例

    まとめ

    • 지금 필요한 건 "데이터 공개"가 아니라 "기계가 바로 쓰는 데이터 공개"입니다.
    • PDF→CSV, 스키마 표준화, API 제공, 자동화 파이프라인 이 네 가지가 핵심이에요.
    • 기술적 구현은 단순한 편이라 빠르게 시범사업을 돌려서 성과를 보이는 게 중요합니다. 데이터로 정책을 검증할 수 있어야 정책도 진짜로 바뀌거든요!

    おかむーから一言

    테크로 사회를 바꾸자고요! 작은 CSV 한 파일이 정책의 투명성과 시민의 신뢰를 바꿉니다. 함께 만들어보시죠〜

    공유하기