Skip to content

Latest commit

 

History

History
98 lines (69 loc) · 7.43 KB

File metadata and controls

98 lines (69 loc) · 7.43 KB

RouteFit — Assumptions & Verified Facts

이 문서는 RouteFit 추천/비용 계산의 근거가 되는 외부 사실을 검증 시점과 출처와 함께 기록하는 SSOT다. 원칙: "절대적 최적"이라고 말하지 않는다. 모든 주장에 확인 시점 + 출처 + 신뢰도를 붙인다. 이 파일에 없는 사실을 코드/카피에 하드코딩하지 않는다.

  • 최초 검증: 2026-07-13
  • 검증 방법: 각 벤더 공식 문서/가격 페이지 웹 확인
  • 관련 문서: pricing-catalog.md — 가격 규칙 스키마·동기화·안전장치

0. 제품 포지셔닝 (변하지 않는 전제)

RouteFit은 실시간 모델 라우터가 아니다. 기업 조건을 입력하면 어떤 라우팅 전략·모델 조합·예상 비용·구현 방식이 맞는지 추천하는 의사결정 지원 도구다.

  • 경쟁 대상이 아니라 상위 레이어: "RouteLLM / LiteLLM / Bedrock Router / Azure Router / 직접 구현 중 우리 회사엔 무엇이 맞는가?"에 답한다.
  • LiteLLM = AI Gateway (연결·재시도·fallback·LB). RouteLLM = 실제 라우팅/평가 프레임워크. RouteFit = 그 위의 Advisor.

1. 라우팅 4개 층위 (섞으면 안 됨)

층위 시점 대표 방법 결과 화면에서
인프라 라우팅 Load balancing, failover, capacity routing 모델 라우팅과 분리 표시
모델 라우팅 생성 Rule / Semantic / Classifier / Learned(RouteLLM) 핵심 추천 축
모델 캐스케이드 생성 품질판정 FrugalGPT, quality gate, escalation 핵심 추천 축
추론 최적화 생성 Speculative decoding / speculative cascade 자체 서빙 영역 (참고용)

규칙: 결과 화면에서 모델 라우팅과 인프라 라우팅을 반드시 별도로 표시한다. (예: Google Model Optimizer = 모델 라우팅, Global Endpoint = 인프라 라우팅 — 별개 기능)


2. 관리형 라우터 — 벤더별 현황 (as of 2026-07-13)

2.1 AWS Bedrock Intelligent Prompt Routing ✅ 검증됨

  • 동작: 동일 모델 패밀리 내 정확히 2개 모델 중, 요청별 품질을 예측해 최저 비용 모델로 라우팅.
  • 언어: 영어 프롬프트/일반 챗 어시스턴트 유즈케이스에 최적화. 공식 문서가 "다른 언어·커스텀 유즈케이스는 프로덕션 전에 자체 테스트하라"고 명시.
    • 한국어·제조·법무 등 특화 환경은 자체 평가 필요의 근거. (RouteFit의 핵심 추천 로직)
  • 성능: AWS 공식 표기 "정확도 손상 없이 최대 30% 비용 절감." (논문류 "98%/2배"와 구분해서 관리형 라우터의 현실 벤치마크로 사용)
  • 상태: GA (2025-04). 더는 preview 아님.
  • 주의: 애플리케이션별 실제 성능 데이터를 지속 반영하지는 않음.
  • 카탈로그 주의: 지원 모델 패밀리 목록은 자주 바뀐다 → 특정 모델명 하드코딩 금지.
  • 출처: https://docs.aws.amazon.com/bedrock/latest/userguide/prompt-routing.html, https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-bedrock-intelligent-prompt-routing-generally-available/

2.2 Microsoft Foundry (Azure AI Foundry) Model Router ✅ 검증됨

2.3 Google — ⚠️ 이름/상태 업데이트됨

  • 리브랜딩: "Vertex AI" → Gemini Enterprise Agent Platform (GA 2026-04-22). Vertex AI가 이 플랫폼에 편입됨.
    • → UI/카피에서 "Vertex AI Model Optimizer"라 쓰지 말고 "Gemini Enterprise Agent Platform — Model Optimizer" 로 표기.
  • Model Optimizer: Gemini 전용 단일 메타 엔드포인트 (Flash/Pro/버전 자동 선택). 품질·비용 선호 기반 라우팅. 과거 "유료 실험 기능" 표현은 이제 관리형 기능에 가까움 → 카피를 부드럽게.
  • Global Endpoint: capacity-aware 인프라 라우팅으로 여전히 별개 기능. (모델 난이도 라우팅 아님)
  • 가격 주의: 비글로벌 엔드포인트는 GA된 Gemini 3+ 계열에 대해 2026-07-01부터 신규 가격 적용. 그 이전엔 Global 엔드포인트 가격이 비글로벌에도 적용됨 → 비용엔진에서 시점 처리 필요.
  • 출처: https://cloud.google.com/products/gemini-enterprise-agent-platform, https://cloud.google.com/gemini-enterprise-agent-platform/generative-ai/pricing

3. 연구/프레임워크 — 절감률은 마케팅 숫자로 쓰지 않는다

  • RouteLLM: 요청 생성 강/약 모델 선택. 사람 선호 데이터 + 증강 데이터로 라우터 학습. 논문은 일부 실험에서 품질 유지하며 2배+ 절감 가능성 보고 — 특정 데이터셋/당시 가격 기준.
  • FrugalGPT: 약→강 캐스케이드. 논문은 조건에 따라 최대 98% 절감 또는 동일비용 품질개선 보고 — 역시 특정 조건 기준. 제품에서 일반 절감률로 표기 금지.
  • Speculative Cascades: 토큰 생성 중 소/대 모델 협업. 자체 서빙 추론 인프라 최적화 영역 (API 모델 선택과 다른 층위).
  • 공통 시사점: 고도화된 라우터보다 먼저 필요한 건 평가 데이터(질문 예시·모델별 답변·사람 선호·실패 유형). → RouteFit의 Data Readiness 진단 근거.

4. 가격 계산 인프라


5. 확정된 기술 스택 결정

항목 결정 이유
프론트 React 18 + Vite + Tailwind 순수 클라이언트, 무료 배포(GitHub Pages/Vercel), LinkedIn 링크 즉시 클릭
백엔드 없음 genai-prices JS 번들로 가격 계산까지 클라이언트 완결
엔진 TS 모듈 (문서의 engine/*.py 포팅) 언어 통일
가격 동기화 Node/TS 스크립트 + GitHub Actions (빌드타임) 런타임은 브라우저, 동기화는 빌드타임 → 언어 하나
가격 데이터 번들 catalog.json (빌드 시 생성) 오프라인 동작, last-known-good

갱신 로그

  • 2026-07-13: 최초 작성. 클라우드 3사 라우터 현황 + genai-prices JS + 스택 확정 기록.