이 문서는 RouteFit 추천/비용 계산의 근거가 되는 외부 사실을 검증 시점과 출처와 함께 기록하는 SSOT다. 원칙: "절대적 최적"이라고 말하지 않는다. 모든 주장에 확인 시점 + 출처 + 신뢰도를 붙인다. 이 파일에 없는 사실을 코드/카피에 하드코딩하지 않는다.
- 최초 검증: 2026-07-13
- 검증 방법: 각 벤더 공식 문서/가격 페이지 웹 확인
- 관련 문서:
pricing-catalog.md— 가격 규칙 스키마·동기화·안전장치
RouteFit은 실시간 모델 라우터가 아니다. 기업 조건을 입력하면 어떤 라우팅 전략·모델 조합·예상 비용·구현 방식이 맞는지 추천하는 의사결정 지원 도구다.
- 경쟁 대상이 아니라 상위 레이어: "RouteLLM / LiteLLM / Bedrock Router / Azure Router / 직접 구현 중 우리 회사엔 무엇이 맞는가?"에 답한다.
- LiteLLM = AI Gateway (연결·재시도·fallback·LB). RouteLLM = 실제 라우팅/평가 프레임워크. RouteFit = 그 위의 Advisor.
| 층위 | 시점 | 대표 방법 | 결과 화면에서 |
|---|---|---|---|
| 인프라 라우팅 | — | Load balancing, failover, capacity routing | 모델 라우팅과 분리 표시 |
| 모델 라우팅 | 생성 전 | Rule / Semantic / Classifier / Learned(RouteLLM) | 핵심 추천 축 |
| 모델 캐스케이드 | 생성 후 품질판정 | FrugalGPT, quality gate, escalation | 핵심 추천 축 |
| 추론 최적화 | 생성 중 | Speculative decoding / speculative cascade | 자체 서빙 영역 (참고용) |
규칙: 결과 화면에서 모델 라우팅과 인프라 라우팅을 반드시 별도로 표시한다. (예: Google Model Optimizer = 모델 라우팅, Global Endpoint = 인프라 라우팅 — 별개 기능)
- 동작: 동일 모델 패밀리 내 정확히 2개 모델 중, 요청별 품질을 예측해 최저 비용 모델로 라우팅.
- 언어: 영어 프롬프트/일반 챗 어시스턴트 유즈케이스에 최적화. 공식 문서가 "다른 언어·커스텀 유즈케이스는 프로덕션 전에 자체 테스트하라"고 명시.
- → 한국어·제조·법무 등 특화 환경은 자체 평가 필요의 근거. (RouteFit의 핵심 추천 로직)
- 성능: AWS 공식 표기 "정확도 손상 없이 최대 30% 비용 절감." (논문류 "98%/2배"와 구분해서 관리형 라우터의 현실 벤치마크로 사용)
- 상태: GA (2025-04). 더는 preview 아님.
- 주의: 애플리케이션별 실제 성능 데이터를 지속 반영하지는 않음.
- 카탈로그 주의: 지원 모델 패밀리 목록은 자주 바뀐다 → 특정 모델명 하드코딩 금지.
- 출처: https://docs.aws.amazon.com/bedrock/latest/userguide/prompt-routing.html, https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-bedrock-intelligent-prompt-routing-generally-available/
- 모드: Cost / Quality / Balanced 3종. Balanced가 기본 — 최고 품질 대비 약 1~2% 이내 품질에서 가장 저렴한 모델을 선택.
- 후보군: 단일 배포로 OpenAI·Anthropic·DeepSeek·Meta·xAI 약 18개 모델 통합. Balanced에서 복잡도별로 nano→mini→large로 분배.
- 버전:
2025-11-18(계속 갱신형 — 새 모델/기능이 버전 ID 변경 없이 추가됨). - → 문서의 "다양한 벤더·오픈 모델을 관리형으로" 주장 확정. Azure 관리 환경/지원 모델 범위에 종속.
- 출처: https://learn.microsoft.com/en-us/azure/foundry/openai/concepts/model-router-how-it-works, https://azure.microsoft.com/en-us/pricing/details/ai-foundry-models/model-router/
- 리브랜딩: "Vertex AI" → Gemini Enterprise Agent Platform (GA 2026-04-22). Vertex AI가 이 플랫폼에 편입됨.
- → UI/카피에서 "Vertex AI Model Optimizer"라 쓰지 말고 "Gemini Enterprise Agent Platform — Model Optimizer" 로 표기.
- Model Optimizer: Gemini 전용 단일 메타 엔드포인트 (Flash/Pro/버전 자동 선택). 품질·비용 선호 기반 라우팅. 과거 "유료 실험 기능" 표현은 이제 관리형 기능에 가까움 → 카피를 부드럽게.
- Global Endpoint: capacity-aware 인프라 라우팅으로 여전히 별개 기능. (모델 난이도 라우팅 아님)
- 가격 주의: 비글로벌 엔드포인트는 GA된 Gemini 3+ 계열에 대해 2026-07-01부터 신규 가격 적용. 그 이전엔 Global 엔드포인트 가격이 비글로벌에도 적용됨 → 비용엔진에서 시점 처리 필요.
- 출처: https://cloud.google.com/products/gemini-enterprise-agent-platform, https://cloud.google.com/gemini-enterprise-agent-platform/generative-ai/pricing
- RouteLLM: 요청 생성 전 강/약 모델 선택. 사람 선호 데이터 + 증강 데이터로 라우터 학습. 논문은 일부 실험에서 품질 유지하며 2배+ 절감 가능성 보고 — 특정 데이터셋/당시 가격 기준.
- FrugalGPT: 약→강 캐스케이드. 논문은 조건에 따라 최대 98% 절감 또는 동일비용 품질개선 보고 — 역시 특정 조건 기준. 제품에서 일반 절감률로 표기 금지.
- Speculative Cascades: 토큰 생성 중 소/대 모델 협업. 자체 서빙 추론 인프라 최적화 영역 (API 모델 선택과 다른 층위).
- 공통 시사점: 고도화된 라우터보다 먼저 필요한 건 평가 데이터(질문 예시·모델별 답변·사람 선호·실패 유형). → RouteFit의 Data Readiness 진단 근거.
- 패키지:
@pydantic/genai-prices(npm) — 브라우저 동작 확인. 번들 오프라인 데이터 + 선택적 시간당 자동 갱신. 동기calcPrice()제공.- → 백엔드/Python 불필요. React+Vite 순수 클라이언트로 가격 계산까지 완결.
- 단, RouteFit은 Batch/캐시/롱컨텍스트/채널별 조건부 가격이 필요하므로 자체 pricing-rules 카탈로그를 병행한다.
pricing-catalog.md참조.
- 출처: https://github.com/pydantic/genai-prices, https://github.com/pydantic/genai-prices/blob/main/packages/js/README.md
| 항목 | 결정 | 이유 |
|---|---|---|
| 프론트 | React 18 + Vite + Tailwind | 순수 클라이언트, 무료 배포(GitHub Pages/Vercel), LinkedIn 링크 즉시 클릭 |
| 백엔드 | 없음 | genai-prices JS 번들로 가격 계산까지 클라이언트 완결 |
| 엔진 | TS 모듈 (문서의 engine/*.py 포팅) |
언어 통일 |
| 가격 동기화 | Node/TS 스크립트 + GitHub Actions (빌드타임) | 런타임은 브라우저, 동기화는 빌드타임 → 언어 하나 |
| 가격 데이터 | 번들 catalog.json (빌드 시 생성) |
오프라인 동작, last-known-good |
- 2026-07-13: 최초 작성. 클라우드 3사 라우터 현황 + genai-prices JS + 스택 확정 기록.