해결하려는 실패 사례
현재 Retriever 수치는 내부 DRAFT 12질의의 Recall@5 87.50%, 핵심 근거 Recall@5 100%뿐이다. 규모와 qrel 판정 범위가 작아 독립 검증·현장 검색 정확도·Reranker 학습 근거로 사용할 수 없다.
가설
KOSHA SDS section 단위의 답변 가능·불가능 질의를 100~200개로 확대하고 CAS·중복 표현 누수를 차단하면, BM25·Dense·Hybrid·RRF·Reranker의 차이를 재현 가능하게 비교하고 근거 없음 기권 실패를 분리할 수 있다.
데이터와 분리
- 범주: 보호구, 누출 대응, 소화 방법, 응급조치, 저장·취급, 안정성·반응성, 물질 식별, 답변 불가능
- qrel: CAS, 문서 ID, SDS section, 근거 문장, relevance 등급, labeler, reviewer, 검수 상태, 출처·버전
- 동일 CAS·동일 문서·duplicate group이 train/dev/test를 가로지르지 않게 분리
- 12개 기존 질의는 회귀셋으로 유지하며 새 독립 test처럼 표현하지 않음
- 사람 정답이 필요한 relevance 등급은 자동 확정하지 않음
비교 구성
A. BM25
B. Dense retrieval
C. BM25 + Dense
D. RRF
E. Hybrid + Reranker
qrel 확대와 검수 전에는 Reranker를 파인튜닝하지 않는다.
주요 지표
- Recall@5
- nDCG@5
- MRR
- 핵심 사실 coverage
- 답변 불가 질의 기권율
- 잘못된 CAS 근거 반환 건수
- 인용 완전성·정확성
안전·채택 조건
- 잘못된 CAS 근거 반환 0건
- 답변 불가 질의에서 근거 없는 생성 주장 0건
- 핵심 사실 coverage와 nDCG@5가 기준선보다 개선
- 기존 12질의 안전 회귀 비감소
- 작은 aggregate 향상만으로 채택하지 않고 범주별 실패를 함께 기록
중단 조건
- 사람이 정답을 결정해야 하는 모호한 relevance 라벨
- 출처·문서 버전·근거 문장 provenance 누락
- CAS 또는 duplicate group 분리 실패
- qrel 12개만으로 Dense/Reranker 학습을 요구하는 경우
비용
후보 생성·BM25/Dense CPU 비교는 로컬 우선 0원. GPU 학습은 별도 Gate 전에는 실행하지 않는다.
사실 상태
- 기존 12질의 평가: 부분 구현 또는 개발용 데모
- 171질의·1,848 질의-근거 후보와 12개 검수 배치: 부분 구현 또는 개발용 데모
- 171질의 독립 이중 검수: 설계 완료·구현 전
- Hybrid/Reranker 개선: 검증되지 않은 가설
주장 범위
완료 후에도 KOSHA SDS 문서 집합의 section 검색 성능만 주장한다. 실제 현장 질문 분포, 현장 안전성, 전국 소방 검색 정확도를 증명하지 않는다.
2026-09-11 평가 준비 확인
PR #64에서 별도 실험 브랜치의 status/pool-run/pool-audit 도구를 현재 Parser·행동 카드 코드에 연결했습니다. 로컬 663 테스트·Ruff·계약 drift와 Docker 빌드를 포함한 PR CI가 통과했습니다. 도구 구현은 완료했으나 독립 검수는 미완료입니다.
실제 artifact 기준 171질의의 단일 lexical-hybrid 반환 803회가 후보 pool에 모두 포함됐고 누락/blocker는 0입니다. 이는 Recall@5나 관련성 점수가 아닙니다. 단일 라벨러 시트의 시작/승인 0행, 완료 0/171이며 기존 빈 배치 12개는 template hash와 일치했습니다.
독립 검수 담당 지정과 사람이 정답을 작성하는 Gate가 남아 status:blocked / evidence-needed를 유지합니다. 이 이슈를 PR 병합으로 자동 종료하지 않습니다. 먼저 한 질의와 그 질의의 모든 근거 행으로 작성 절차를 연습할 수 있지만 연습을 독립 검증 완료로 세지 않습니다.
재현·hash·원본 접근·한계: 평가 준비 보고서
해결하려는 실패 사례
현재 Retriever 수치는 내부 DRAFT 12질의의 Recall@5 87.50%, 핵심 근거 Recall@5 100%뿐이다. 규모와 qrel 판정 범위가 작아 독립 검증·현장 검색 정확도·Reranker 학습 근거로 사용할 수 없다.
가설
KOSHA SDS section 단위의 답변 가능·불가능 질의를 100~200개로 확대하고 CAS·중복 표현 누수를 차단하면, BM25·Dense·Hybrid·RRF·Reranker의 차이를 재현 가능하게 비교하고 근거 없음 기권 실패를 분리할 수 있다.
데이터와 분리
비교 구성
A. BM25
B. Dense retrieval
C. BM25 + Dense
D. RRF
E. Hybrid + Reranker
qrel 확대와 검수 전에는 Reranker를 파인튜닝하지 않는다.
주요 지표
안전·채택 조건
중단 조건
비용
후보 생성·BM25/Dense CPU 비교는 로컬 우선 0원. GPU 학습은 별도 Gate 전에는 실행하지 않는다.
사실 상태
주장 범위
완료 후에도 KOSHA SDS 문서 집합의 section 검색 성능만 주장한다. 실제 현장 질문 분포, 현장 안전성, 전국 소방 검색 정확도를 증명하지 않는다.
2026-09-11 평가 준비 확인
PR #64에서 별도 실험 브랜치의 status/pool-run/pool-audit 도구를 현재 Parser·행동 카드 코드에 연결했습니다. 로컬 663 테스트·Ruff·계약 drift와 Docker 빌드를 포함한 PR CI가 통과했습니다. 도구 구현은 완료했으나 독립 검수는 미완료입니다.
실제 artifact 기준 171질의의 단일 lexical-hybrid 반환 803회가 후보 pool에 모두 포함됐고 누락/blocker는 0입니다. 이는 Recall@5나 관련성 점수가 아닙니다. 단일 라벨러 시트의 시작/승인 0행, 완료 0/171이며 기존 빈 배치 12개는 template hash와 일치했습니다.
독립 검수 담당 지정과 사람이 정답을 작성하는 Gate가 남아 status:blocked / evidence-needed를 유지합니다. 이 이슈를 PR 병합으로 자동 종료하지 않습니다. 먼저 한 질의와 그 질의의 모든 근거 행으로 작성 절차를 연습할 수 있지만 연습을 독립 검증 완료로 세지 않습니다.
재현·hash·원본 접근·한계: 평가 준비 보고서