파싱 벤치마크 (parser-chain)
240개 픽스처(12 포맷)에 대한 honest 재실측 결과입니다. 출처: @comfozi/doc-import docs/parser-chain.md + recovery-harness.
포맷별 행 복원율
| 포맷 | 복원율 | 포맷 | 복원율 |
|---|---|---|---|
| csv | 100% | txt | 74.6% (fallback) |
| xlsx | 100% (SheetJS) | eml | 74.2% (fallback) |
| json | 100% | html | 69.8% |
| md | 70.0% | pdf-text | 63.6% (pdfjs→fallback) |
- text-real 전체 88.3%, 필드정확 97.7%(166 text 문서 기준).
- 난이도별 clean/noisy 행복원 = 100%, hard가 평균을 끈다.
- 테스트:
npm test44 pass (46 중 2 skip),tsc --noEmitclean.
정직 경계
- 이미지 74건(pdf-image/png/jpg/photo)은
live-bridge= 오프라인 미채점(정상). - 잘 안 되는 hard 케이스(70%대·일부 0%)는 숨기지 않고 그대로 공개합니다.
- 필드 정확도 "97.7%"는 텍스트 문서 서브셋 기준이며 240 전체 기준이 아닙니다.
핵심
장당 과금 없이 — 구독 CLI AI로 측정하고 튜닝한 파싱. 노이즈 표 폴백 파서가 txt를 0 → 74.6%로 끌어올립니다.