Red-team 검증 리포트
발표 주장을 말로만 보지 않고 실제 코드·테스트·실험을 돌려 반증을 시도한 적대적 검토 결과입니다.
실증으로 확인된 것 (통과)
- "오류 2.4배 감소" — 실제 AUC 0.868 → 0.946 로 역산, 오류비율 2.424로 정확히 재현.
- 240 파싱 픽스처 실재 — 디스크에 12개 포맷 240개 파일 + 결정적 생성기(재현 가능).
- 정형 100% / 노이즈 70%대 — harness 라이브 실행으로 재현(csv/xlsx/json 100%, txt 74.6% 등).
- 하드 케이스 공개 — 79개 hard 픽스처 실재, 0% 복원 케이스까지 열거.
- 구독 CLI AI 파싱 실재 —
parse-fleet가 실제 CLI 세션을 spawn, 라이브 run 로그 존재. - GBM 브라우저 export — 패리티 정확 일치, 지도학습 AUC 0.78–0.79 라이브 확인.
- 스코어 마스킹 정합성 — 코드·config·슬라이드·나레이션(v1.3)이 모두 일치, 이전 모순 해소.
- 7 플러그인 · 빌드타임 정적 레지스트리 — 정확히 한정됨(과장 없음).
정정한 것
| 항목 | 이전 | 정정 |
|---|---|---|
| 파싱 테스트 수 | "23 tests" | 44 통과 (46 중 2 skip) |
| 필드 정확도 | "99.3%" | 97.7% (honest 재실측, 166 text 문서 기준) |
| 슬롯 수 | "4개" | 5개 (공용 4 + pipeline 전용 1) |
| 코어 표현 | "한 줄도 안 건드린다" | "코어 계약 유지(추가만, 수정·삭제 없이)" |
미검증 / 소프트
- 모델 비교(Claude 0.825 vs Codex 0.786)·속도(22.4→5.8s) 수치는 계산 아티팩트가 없는 소프트 근거로, 발표에서도 그렇게 명시합니다.
- 필드 정확도는 166개 텍스트 문서 기준입니다(이미지 74개는 오프라인 미채점).
핵심 태도: 정직성 = 심사 신뢰의 차별성. 안 되는 것은 안 된다고 적습니다.