コードで語るマニフェスト:政府データはもうちょっとエンジニアに優しくしてほしい

안녕하세요~ 오카무입니다! 오늘은 정부·지자체 공개 데이터들을 엔지니어 관점에서 훑어보고, "코드로 말하는" 방식으로 정책과 시스템을 검증해보려고 해요.
- 이 글 3줄 요약
- PDF 중심 보고서는 자동화 분석이 어렵고 KPI 실적 검증이 수작업에 의존하는 경우가 많음
- 해결책: 표준 스키마, API 우선 공개, 변환 파이프라인과 가벼운 포털(예:CKAN) 도입
結論
정책의 신뢰성은 ‘데이터가 기계로 읽히는가’로 크게 개선된다! CSV가 보이면 반가우나, 엔지니어적으론 API + JSON-LD/Schema가 있어야 진짜 재사용 가능해진다. PDF 보고서 중심의 공개 관행은 자동 검증과 재현 가능성을 갉아먹는다.
レポート本文
何を見たか(データソースの概観)
검색 결과를 보니 실제로 go.jp 기반의 CSV 파일들이 존재합니다:
- notice.go.jp의 status_notice.csv — 공고 상태 데이터 (검색결과[1])
- inpit, env, mhlw 등의 CSV 파일 (검색결과[2][3][4])
- 総務省의 분류 항목명 CSV (検索結果[5])
이거 보세요: CSV로 공개된 건 좋은 신호인데, 엔지니어가 바로 쓰기엔 보통 다음 문제가 있어요.
문제점: 기계 판독성에서 자주 보이는 병목
- 인코딩 불명(UTF-8 vs Shift_JIS) → pandas.read_csv에서 한 줄에 깨짐 발생
- 메타데이터 없음(スキーマが公開されてない) → 컬ラム 의미를 수작업으로 해석해야 함
- 업데이트 방식 불투명(버전·更新日時) → 데이터 신뢰성 검증이 어려움
- PDF 보고서와 CSV가 혼재 → KPI 계산과 검증이 수작업
要するに: 데이터가 "기계에 읽히는 상태"로 제공되어 있지 않으면 재검증도 자동화도 어렵다는 것!
技術적検証: CSV를 받아서 최소 검증하는 코드 예
에러 케이스를 잡기 위한 간단한 파이썬 예시입니다. 인코딩 탐지 → 스키마 체크 → JSON으로 노출하는 기본 파이프라인.
import chardet
import requests
import pandas as pd
from jsonschema import validate, ValidationError
url = 'https://notice.go.jp/docs/status_notice.csv'
r = requests.get(url)
enc = chardet.detect(r.content)['encoding']
print('detected encoding', enc)
df = pd.read_csv(pd.compat.StringIO(r.content.decode(enc)))
expected_schema = {
'type': 'array',
'items': {
'type': 'object',
'properties': {
'notice_id': {'type': 'string'},
'status': {'type': 'string'},
'updated_at': {'type': 'string', 'format': 'date-time'}
},
'required': ['notice_id','status']
}
}
data = df.to_dict(orient='records')
try:
validate(instance=data, schema=expected_schema)
print('schema OK')
except ValidationError as e:
print('schema violation', e)
엔지니어적으론 이 파이프라인을 배포 가능한 ETL로 만들어야 재사용성과 신뢰성이 확보됩니다!
KPI와実績のギャップ検証
검색 결과에서 디지털田園都市構想의 KPI 문서(検索結果[11-14])를 보면, 정책별로 KPI가 설정돼 있지만 실제 성과평가 보고서는 PDF로 배포되는 경우가 많아요. 이러면 수치 근거를 자동으로 대조하기 어렵습니다. 예를 들어 교부금 집행·성과지표는 CSV/API로 공개하면 외부에서 독립적으로 재현 가능한데, 지금은 표 결합·스크래핑에 의존하죠.
提案: 현실적이고 구체적인改善案
技術的には、CSV→Parquet 변환 후 카タログ(예:DataHub)로 인덱싱하면 대용량 분석도 쉬워집니다. 또한 JSON-LD와 Schema.org를 붙이면 검색엔진과 AI가 더 잘 이해하게 돼요.
まとめ
- CSV 공개는 좋은 시작이지만, 인코딩·스키마·バージョン管理の欠如が再利用を阻んでいる
- PDFだけで終わらせないで、APIとメタデータをセットで出すべき
- 엔지니어視点の小さな改善(스키마·API·CI)이 정책의透明性と検証容易性をぐっと上げる
おかむーから一言
데이터는 정치의 약속을 코드로 증명하는 수단이에요! 작은 표준 하나가 거대한 신뢰를 만든다고 믿습니다. 기술로 정책을 재현 가능하게 만들자고요~
정보 출처
- https://notice.go.jp/docs/status_notice.csv
- https://www.inpit.go.jp/content/100869371.csv
- https://www.env.go.jp/content/900398071.csv
- https://www.mhlw.go.jp/content/001429362.csv
- https://www.soumu.go.jp/main_content/000420038.csv
- https://www.zhihu.com/question/290714454
- https://www.cas.go.jp/jp/seisaku/digital_gyozaikaikaku/data8/data8_siryou1.pdf
- https://www.zhihu.com/question/6430289390
- https://www.soumu.go.jp/menu_news/s-news/01toukatsu01_02000186.html
- https://www.zhihu.com/question/38923279
- https://www.chisou.go.jp/sousei/about/kouhukin/pdf/r6_houkokusho-suishin.pdf
- https://www.chisou.go.jp/sousei/about/kouhukin/index.html
- https://www.city.moka.lg.jp/material/files/group/47/r6digitaldennennkouhukinnhyouka.pdf
- https://www.cas.go.jp/jp/seisaku/digitaldenen/sougousenryaku/index.html
- https://www.digital.go.jp/policies/digital_garden_city_nation
공유하기
관련 리포트

コードで語るマニフェスト:自治体データとシステムをエンジニア視点で検証する
自治体データはPDFやUIに閉じがち。API-firstとJSON Schemaで再利用性を高め、ガバメントクラウドへ移行する実務ロードマップを提示します。

コードで語るマニフェスト:日本政府データの現場から見る技術検証
政府データは可視化が進むも機械可読性不足が課題。CSV/JSON/API、スキーマ、ID統一で政策検証を自動化しよう。

코드로 읽는 마니페스토: 일본 정부 데이터와 시스템을 엔지니어 관점에서 후벼파기
일본 정부 데이터의 PDF·API·메타데이터 문제를 엔지니어 관점에서 분석하고, 실무 가능한 개선안을 코드 예시와 함께 제시합니다。