텍스트·표·구조를 종합한 정확도
읽힘 vs OpenDataLoader
OpenDataLoader: PDF 파일 → Markdown
텍스트·표·구조를 종합한 정확도
PDF 변환 종합 정확도
ground truth 생성에 성공한 문서
전체 점수 비교
각 지표별로 두 도구의 평균 점수를 비교합니다. 점수가 높을수록 원문에 가깝게 변환됐다는 의미입니다. 읽힘은 HWPX를, OpenDataLoader는 PDF를 입력으로 사용했습니다.
실제 변환 결과 비교
같은 문서를 두 도구로 변환한 결과와 ground truth를 나란히 볼 수 있습니다. 아래 버튼으로 문서를 선택하세요. 점수 차이가 크거나 특징적인 문서를 선별했습니다.
Ground Truth
읽힘
OpenDataLoader
문서별 점수
각 문서에 대한 두 도구의 점수입니다. 차이 컬럼이 양수(↑)이면 읽힘이 앞섰고, 음수(↓)이면 OpenDataLoader가 앞섰다는 의미입니다. 기본 정렬은 점수 차이가 큰 순서입니다.
측정 방법과 출처
지표 정의는 opendataloader-bench를 따랐고, 정책브리핑 ground truth는 이 저장소에서 별도로 생성했습니다.
Ground Truth 생성 방법
이 벤치마크의 ground truth는 정책브리핑 공식 홈페이지의 문서 뷰어 HTML에서 추출했습니다. PDF나 HWPX를 재변환한 것이 아니라, 정책브리핑이 직접 제공하는 웹 뷰어 렌더링을 기준으로 삼았습니다.
정책브리핑 보도자료 각 문서의 공식 뷰어 URL에서 HTML을 수집합니다. 이 HTML에는 원문의 제목·본문·표·목록이 정책브리핑이 의도한 그대로 담겨 있습니다.
수집한 HTML을 Markdown으로 변환합니다. 불필요한 메타 태그·스크립트·스타일을 제거하고, 제목 계층·표·목록·인용 구조를 Markdown 문법으로 정규화합니다.
공백·줄바꿈·특수문자를 정규화하고, 문서 구조가 올바르게 추출됐는지 확인합니다. 뷰어 HTML 파싱에 실패하거나 내용이 불충분한 문서는 corpus에서 제외했습니다.
지표 상세 정의
아래는 각 지표의 공식 정의 및 참고 자료입니다.