본문으로 건너뛰기

Red-team 검증 리포트

발표 주장을 말로만 보지 않고 실제 코드·테스트·실험을 돌려 반증을 시도한 적대적 검토 결과입니다.

실증으로 확인된 것 (통과)

  • "오류 2.4배 감소" — 실제 AUC 0.868 → 0.946 로 역산, 오류비율 2.424로 정확히 재현.
  • 240 파싱 픽스처 실재 — 디스크에 12개 포맷 240개 파일 + 결정적 생성기(재현 가능).
  • 정형 100% / 노이즈 70%대 — harness 라이브 실행으로 재현(csv/xlsx/json 100%, txt 74.6% 등).
  • 하드 케이스 공개 — 79개 hard 픽스처 실재, 0% 복원 케이스까지 열거.
  • 구독 CLI AI 파싱 실재parse-fleet가 실제 CLI 세션을 spawn, 라이브 run 로그 존재.
  • GBM 브라우저 export — 패리티 정확 일치, 지도학습 AUC 0.78–0.79 라이브 확인.
  • 스코어 마스킹 정합성 — 코드·config·슬라이드·나레이션(v1.3)이 모두 일치, 이전 모순 해소.
  • 7 플러그인 · 빌드타임 정적 레지스트리 — 정확히 한정됨(과장 없음).

정정한 것

항목이전정정
파싱 테스트 수"23 tests"44 통과 (46 중 2 skip)
필드 정확도"99.3%"97.7% (honest 재실측, 166 text 문서 기준)
슬롯 수"4개"5개 (공용 4 + pipeline 전용 1)
코어 표현"한 줄도 안 건드린다""코어 계약 유지(추가만, 수정·삭제 없이)"

미검증 / 소프트

  • 모델 비교(Claude 0.825 vs Codex 0.786)·속도(22.4→5.8s) 수치는 계산 아티팩트가 없는 소프트 근거로, 발표에서도 그렇게 명시합니다.
  • 필드 정확도는 166개 텍스트 문서 기준입니다(이미지 74개는 오프라인 미채점).

핵심 태도: 정직성 = 심사 신뢰의 차별성. 안 되는 것은 안 된다고 적습니다.