본문으로 건너뛰기

파싱 벤치마크 (parser-chain)

240개 픽스처(12 포맷)에 대한 honest 재실측 결과입니다. 출처: @comfozi/doc-import docs/parser-chain.md + recovery-harness.

포맷별 행 복원율

포맷복원율포맷복원율
csv100%txt74.6% (fallback)
xlsx100% (SheetJS)eml74.2% (fallback)
json100%html69.8%
md70.0%pdf-text63.6% (pdfjs→fallback)
  • text-real 전체 88.3%, 필드정확 97.7%(166 text 문서 기준).
  • 난이도별 clean/noisy 행복원 = 100%, hard가 평균을 끈다.
  • 테스트: npm test 44 pass (46 중 2 skip), tsc --noEmit clean.

정직 경계

  • 이미지 74건(pdf-image/png/jpg/photo)은 live-bridge = 오프라인 미채점(정상).
  • 잘 안 되는 hard 케이스(70%대·일부 0%)는 숨기지 않고 그대로 공개합니다.
  • 필드 정확도 "97.7%"는 텍스트 문서 서브셋 기준이며 240 전체 기준이 아닙니다.

핵심

장당 과금 없이 — 구독 CLI AI로 측정하고 튜닝한 파싱. 노이즈 표 폴백 파서가 txt를 0 → 74.6%로 끌어올립니다.