정책브리핑 변환 품질 비교

읽힘 vs OpenDataLoader

정책브리핑 보도자료 99건 기준,
읽힘이 OpenDataLoader보다 더 정확하게 변환합니다.
무엇을 비교했나요? 정책브리핑 최신 보도자료 99건을 각각 두 도구로 변환한 뒤, 같은 기준(ground truth)으로 정확도를 측정했습니다.
입력 형식 읽힘: HWPX 파일 → Markdown
OpenDataLoader: PDF 파일 → Markdown
평가 기준 텍스트 유사도(NID), 표 정확도(TEDS), 구조 보존도(MHS) 세 가지를 종합한 점수
※ 이번 비교는 공식 OpenDataLoader 벤치 코퍼스가 아닌 별도 구성한 정책브리핑 corpus입니다. 공식 리더보드와 수치를 직접 비교하면 안 됩니다.
NID 텍스트 유사도 변환된 텍스트가 원문과 얼마나 가까운지
TEDS 표 정확도 표를 얼마나 정확하게 변환했는지
MHS 구조 보존도 제목·목록 등 계층 구조를 충실히 옮겼는지
읽힘 종합 점수
-
정책브리핑 99건 기준
텍스트·표·구조를 종합한 정확도
OpenDataLoader 종합 점수
-
같은 ground truth로 측정한
PDF 변환 종합 정확도
읽힘 우세 (종합 점수 차)
-
읽힘 점수 − OpenDataLoader 점수
검증 문서 수
-
정책브리핑 최신 보도자료에서
ground truth 생성에 성공한 문서

전체 점수 비교

각 지표별로 두 도구의 평균 점수를 비교합니다. 점수가 높을수록 원문에 가깝게 변환됐다는 의미입니다. 읽힘은 HWPX를, OpenDataLoader는 PDF를 입력으로 사용했습니다.

실제 변환 결과 비교

같은 문서를 두 도구로 변환한 결과와 ground truth를 나란히 볼 수 있습니다. 아래 버튼으로 문서를 선택하세요. 점수 차이가 크거나 특징적인 문서를 선별했습니다.

읽힘 점수
OpenDataLoader 점수

Ground Truth


        

읽힘


        

OpenDataLoader


        

문서별 점수

각 문서에 대한 두 도구의 점수입니다. 차이 컬럼이 양수(↑)이면 읽힘이 앞섰고, 음수(↓)이면 OpenDataLoader가 앞섰다는 의미입니다. 기본 정렬은 점수 차이가 큰 순서입니다.

측정 방법과 출처

지표 정의는 opendataloader-bench를 따랐고, 정책브리핑 ground truth는 이 저장소에서 별도로 생성했습니다.

Ground Truth 생성 방법

이 벤치마크의 ground truth는 정책브리핑 공식 홈페이지의 문서 뷰어 HTML에서 추출했습니다. PDF나 HWPX를 재변환한 것이 아니라, 정책브리핑이 직접 제공하는 웹 뷰어 렌더링을 기준으로 삼았습니다.

1단계 — 문서 뷰어 HTML 수집

정책브리핑 보도자료 각 문서의 공식 뷰어 URL에서 HTML을 수집합니다. 이 HTML에는 원문의 제목·본문·표·목록이 정책브리핑이 의도한 그대로 담겨 있습니다.

2단계 — HTML → Markdown 변환

수집한 HTML을 Markdown으로 변환합니다. 불필요한 메타 태그·스크립트·스타일을 제거하고, 제목 계층·표·목록·인용 구조를 Markdown 문법으로 정규화합니다.

3단계 — 정규화 및 검수

공백·줄바꿈·특수문자를 정규화하고, 문서 구조가 올바르게 추출됐는지 확인합니다. 뷰어 HTML 파싱에 실패하거나 내용이 불충분한 문서는 corpus에서 제외했습니다.

※ 정책브리핑 문서 뷰어가 표현하지 못하는 일부 복잡한 표(이미지형 표 등)는 ground truth에서도 반영되지 않을 수 있습니다.

지표 상세 정의

아래는 각 지표의 공식 정의 및 참고 자료입니다.