Skip to content

test(retriever): section-level qrel 확대와 Hybrid 검색 비교 #33

Description

@hywznn

해결하려는 실패 사례

현재 Retriever 수치는 내부 DRAFT 12질의의 Recall@5 87.50%, 핵심 근거 Recall@5 100%뿐이다. 규모와 qrel 판정 범위가 작아 독립 검증·현장 검색 정확도·Reranker 학습 근거로 사용할 수 없다.

가설

KOSHA SDS section 단위의 답변 가능·불가능 질의를 100~200개로 확대하고 CAS·중복 표현 누수를 차단하면, BM25·Dense·Hybrid·RRF·Reranker의 차이를 재현 가능하게 비교하고 근거 없음 기권 실패를 분리할 수 있다.

데이터와 분리

  • 범주: 보호구, 누출 대응, 소화 방법, 응급조치, 저장·취급, 안정성·반응성, 물질 식별, 답변 불가능
  • qrel: CAS, 문서 ID, SDS section, 근거 문장, relevance 등급, labeler, reviewer, 검수 상태, 출처·버전
  • 동일 CAS·동일 문서·duplicate group이 train/dev/test를 가로지르지 않게 분리
  • 12개 기존 질의는 회귀셋으로 유지하며 새 독립 test처럼 표현하지 않음
  • 사람 정답이 필요한 relevance 등급은 자동 확정하지 않음

비교 구성

A. BM25
B. Dense retrieval
C. BM25 + Dense
D. RRF
E. Hybrid + Reranker

qrel 확대와 검수 전에는 Reranker를 파인튜닝하지 않는다.

주요 지표

  • Recall@5
  • nDCG@5
  • MRR
  • 핵심 사실 coverage
  • 답변 불가 질의 기권율
  • 잘못된 CAS 근거 반환 건수
  • 인용 완전성·정확성

안전·채택 조건

  • 잘못된 CAS 근거 반환 0건
  • 답변 불가 질의에서 근거 없는 생성 주장 0건
  • 핵심 사실 coverage와 nDCG@5가 기준선보다 개선
  • 기존 12질의 안전 회귀 비감소
  • 작은 aggregate 향상만으로 채택하지 않고 범주별 실패를 함께 기록

중단 조건

  • 사람이 정답을 결정해야 하는 모호한 relevance 라벨
  • 출처·문서 버전·근거 문장 provenance 누락
  • CAS 또는 duplicate group 분리 실패
  • qrel 12개만으로 Dense/Reranker 학습을 요구하는 경우

비용

후보 생성·BM25/Dense CPU 비교는 로컬 우선 0원. GPU 학습은 별도 Gate 전에는 실행하지 않는다.

사실 상태

  • 기존 12질의 평가: 부분 구현 또는 개발용 데모
  • 171질의·1,848 질의-근거 후보와 12개 검수 배치: 부분 구현 또는 개발용 데모
  • 171질의 독립 이중 검수: 설계 완료·구현 전
  • Hybrid/Reranker 개선: 검증되지 않은 가설

주장 범위

완료 후에도 KOSHA SDS 문서 집합의 section 검색 성능만 주장한다. 실제 현장 질문 분포, 현장 안전성, 전국 소방 검색 정확도를 증명하지 않는다.

2026-09-11 평가 준비 확인

PR #64에서 별도 실험 브랜치의 status/pool-run/pool-audit 도구를 현재 Parser·행동 카드 코드에 연결했습니다. 로컬 663 테스트·Ruff·계약 drift와 Docker 빌드를 포함한 PR CI가 통과했습니다. 도구 구현은 완료했으나 독립 검수는 미완료입니다.

실제 artifact 기준 171질의의 단일 lexical-hybrid 반환 803회가 후보 pool에 모두 포함됐고 누락/blocker는 0입니다. 이는 Recall@5나 관련성 점수가 아닙니다. 단일 라벨러 시트의 시작/승인 0행, 완료 0/171이며 기존 빈 배치 12개는 template hash와 일치했습니다.

독립 검수 담당 지정과 사람이 정답을 작성하는 Gate가 남아 status:blocked / evidence-needed를 유지합니다. 이 이슈를 PR 병합으로 자동 종료하지 않습니다. 먼저 한 질의와 그 질의의 모든 근거 행으로 작성 절차를 연습할 수 있지만 연습을 독립 검증 완료로 세지 않습니다.

재현·hash·원본 접근·한계: 평가 준비 보고서

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    area:data모델 artifact와 공식 근거 데이터area:evaluation모델·후단·E2E 평가 Gatearea:llmParser·Resolver·Retriever·RAG·Rule Engineevidence-needed측정값·원본·artifact hash 등 근거가 필요함priority:p3후속 개선 또는 낮은 우선순위status:blocked외부 입력이나 권한 때문에 진행 중단type:test평가·실험·회귀 검증

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions