Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

1 Commit
 
 
 
 
 
 

Repository files navigation

HBM Competitive Intelligence System

SK Hynix HBM 경쟁사 R&D 기술 동향 자동 분석 시스템

Samsung·Micron의 HBM 관련 공개 정보(특허·논문·채용공고·IR)를 자동 수집·분석하여, TRL(Technology Readiness Level) 기반 경쟁사 기술 전략 보고서를 생성하는 멀티에이전트 AI 시스템입니다.


프로젝트 개요

항목 내용
분석 대상 Samsung, Micron의 HBM4 / PIM / CXL R&D 기술 동향
분석 관점 SK Hynix R&D 팀 즉시 활용 가능한 경쟁사 위협 평가
핵심 방법론 TRL 1~9 단계 평가 + 간접지표(특허·논문·채용) 기반 추정
최종 산출물 TRL 비교 매트릭스 포함 Markdown/PDF 보고서 (outputs/)

시스템 아키텍처

멀티에이전트 워크플로우 (LangGraph Supervisor Pattern)

START
  │
  ▼
Supervisor (GPT-4o)
  ├──► RAG Agent       → 내부 기술 문서 검색 (FAISS + BM25 Hybrid)
  ├──► Web Agent       → 공개 정보 수집 (Tavily / ArXiv / KIPRIS / Semantic Scholar)
  ├──► TRL Evaluator   → HBM4·PIM·CXL 3사 TRL 구조화 평가
  └──► Report Generator → TRL 매트릭스 포함 Markdown 보고서 생성
         │
         ▼
        END → PDF / Markdown 저장 (outputs/)

모든 Sub-Agent는 Supervisor로 복귀. Supervisor가 수집 충분성을 판단해 다음 단계를 결정합니다.

데이터 수집 파이프라인

소스 도구 수집 대상
내부 문서 FAISS + BM25 (RAG) PDF·TXT 기술 문서
웹 검색 Tavily Search API 뉴스·IR·기술 블로그
학술 논문 ArXiv, Semantic Scholar ISSCC·IEDM·VLSI 논문
특허 KIPRIS API 삼성전자 HBM·PIM·CXL 특허
채용공고 Samsung Careers 크롤러 R&D 채용 키워드

주요 기능

  • RAG 파이프라인: PDF·TXT 문서 → FAISS 벡터스토어 → BM25+Dense RRF + CrossEncoder Reranker
  • 하이브리드 검색: BM25 + Dense Retrieval을 RRF(Reciprocal Rank Fusion)로 통합
  • TRL 자동 평가: RAG + Web 수집 결과 기반 HBM4·PIM·CXL 기술별 TRL 구조화
  • 확증 편향 방지: RAG(내부)·Web(외부)를 독립 수집 후 Supervisor가 통합 판단
  • 보고서 자동 생성: Markdown → PDF 자동 변환 (weasyprint 사용)
  • 폴백 모드: Tavily·RAG 없이도 LLM 단독 모드로 실행 가능

기술 스택

분류 기술
에이전트 프레임워크 LangGraph ≥ 0.2.50, LangChain ≥ 0.3.0
LLM GPT-4o (Supervisor·TRL·Report), GPT-4o-mini (RAG·Web)
임베딩 intfloat/multilingual-e5-large (HuggingFace)
벡터 DB FAISS (faiss-cpu)
키워드 검색 rank-bm25
Reranker cross-encoder/ms-marco-MiniLM-L-6-v2
웹 검색 Tavily Search API
특허 검색 KIPRIS REST API
논문 검색 Semantic Scholar API (무료)
PDF 출력 weasyprint + markdown2
실행 환경 Python 3.11+, Jupyter Notebook

디렉토리 구조

hbm-competitive-intel/
├── agents/
│   ├── supervisor.py           # 라우팅·수집 충분성 판단·종료 결정
│   ├── rag_agent.py            # 내부 문서 벡터 검색
│   ├── web_search_agent.py     # 경쟁사 공개정보 수집
│   ├── trl_evaluator.py        # TRL 구조화 평가 에이전트
│   └── report_generator.py     # Markdown 보고서 초안 생성
├── graph/
│   ├── state.py                # AgentState TypedDict 정의
│   └── workflow.py             # LangGraph StateGraph 구성
├── prompts/                    # 에이전트별 프롬프트 템플릿
├── rag/
│   ├── vectorstore.py          # FAISS 벡터스토어 빌드·로드
│   ├── retriever.py            # HBMRetriever (BM25+Dense RRF + Reranker)
│   ├── embeddings.py           # HuggingFace 임베딩 설정
│   └── indexer.py              # 문서 인덱싱
├── utils/
│   ├── pdf_exporter.py         # Markdown → PDF 변환
│   └── pretty_print.py         # 출력 유틸리티
├── data/
│   └── vectorstore/            # FAISS 인덱스 (로컬 생성, git 제외)
├── outputs/                    # 생성된 보고서 저장 (git 제외)
├── tool_kipris.py              # KIPRIS 특허 수집 도구
├── tool_semantic_scholar.py    # Semantic Scholar 논문 수집 도구
├── tool_careers_crawler.py     # Samsung Careers 채용공고 크롤러
├── main.ipynb                  # Jupyter 실행 진입점
├── app.py                      # CLI 실행 스크립트
├── requirements.txt
└── .env.example                # 환경변수 템플릿 (키 값 없음)

빠른 시작

1. 환경 설정

cd hbm-competitive-intel

# 가상환경 생성
python -m venv venv
source venv/bin/activate  # Windows: venv\Scripts\activate

# 패키지 설치
pip install -r requirements.txt

2. API 키 설정

cp .env.example .env
# .env 파일에 아래 키 입력
OPENAI_API_KEY=sk-...          # 필수
TAVILY_API_KEY=tvly-...        # 선택 (없으면 LLM 폴백)
LANGCHAIN_API_KEY=lsv2_...     # 선택 (LangSmith 트레이싱)
KIPRIS_API_KEY=...             # 선택 (특허 수집)

3. 실행

# Jupyter 노트북 (권장)
jupyter notebook main.ipynb

# CLI 실행
python app.py --query "Samsung HBM4 Hybrid Bonding 기술 동향 분석"

# RAG 없이 LLM 폴백 모드
python app.py --query "..." --no-rag

# 벡터스토어 강제 재빌드
python app.py --query "..." --rebuild-rag

RAG 평가 지표

지표 목표값 설명
Hit Rate@5 ≥ 0.80 HBM 도메인 특화 평가셋 10건 기준
MRR ≥ 0.70 첫 번째 정답 순위 기반 역수 평균
Avg Latency 쿼리당 검색 지연 시간

main.ipynb Section 7에서 4가지 검색 전략 비교 평가 실행 가능 (Naive / Hybrid / HyDE / MultiQuery).


TRL 평가 프레임워크

TRL 구간 의미 신뢰도
1~3 기초 연구 / 개념 검증
4~6 개발 / 시제품 검증 (비공개 구간) 낮음 (★간접지표 추정)
7~8 파일럿 / 실증 배치 높음
9 양산 / 상용화 높음

TRL 4~6 구간은 영업비밀로 직접 확인 불가. 특허·채용공고·학회 발표를 간접지표로 추정하며 반드시 ★간접지표 기반 추정 명시.

About

No description, website, or topics provided.

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages