Skip to content

Latest commit

 

History

History
372 lines (279 loc) · 13.2 KB

File metadata and controls

372 lines (279 loc) · 13.2 KB

大模型选型框架详解

一、选型流程(5步法)

Step 1: 明确使用场景
   ↓
Step 2: 确定硬约束(上下文长度、部署方式、合规要求)
   ↓
Step 3: 初筛候选模型(满足硬约束的模型)
   ↓
Step 4: 评分排序(能力/成本/延迟三维度)
   ↓
Step 5: 小流量验证 → 全量上线

二、Step 1:场景分类与需求提炼

2.1 场景类型详解

场景类型 典型需求 核心关注维度 优先模型类型
聊天机器人 多轮对话、低延迟、自然交互 延迟、成本、中文 低延迟模型(GPT-4o mini/豆包/通义Plus)
内容创作 长文写作、文风控制、创意生成 中文、创意能力 国内旗舰(混元/通义Max/文心)
代码助手 代码生成、解释、调试、补全 代码能力、上下文 Claude 4/Qwen Coder/DeepSeek V3
数据分析 数字理解、逻辑推理、图表解读 推理能力、准确性 GPT-o3/DeepSeek R1/混元T1
文档处理 长文档摘要、信息提取、QA 上下文长度、处理速度 Gemini 2.5 Pro/Qwen 2.5/Llama 4
智能客服 低延迟、高并发、一致性 成本、延迟、并发 GPT-4o mini/豆包/通义Plus
知识问答 事实准确性、知识广度、引用 知识截止日期、准确性 GPT-4o/Claude 4/混元Turbo
Agent/工具调用 结构化输出、Function Calling 格式遵循、工具调用稳定性 GPT-4o/Claude 4/Qwen Max
翻译 多语言、领域术语、流畅度 多语言能力、术语准确性 GPT-4o/通义Max/Claude 4
图像理解 图文问答、OCR、图表理解 多模态能力 GPT-4o/Gemini 2.5 Pro/通义VL

2.2 需求收集模板

向用户确认以下信息(根据实际情况裁剪):

为给你推荐最合适的模型,需要了解几个关键信息:

1. 【必问】主要使用场景是?(聊天/代码/创作/推理/其他)
2. 【必问】每月预算大概多少?或者"尽量节省"?
3. 【必问】数据是否可以出境?(涉及国内合规要求)
4. 【可选】需要处理多长的文本?(如:单条几K token / 长文档几百K)
5. 【可选】预计并发量多少?(QPS)
6. 【可选】是否需要图像/音频/视频理解?
7. 【可选】对中文能力要求是否很高?

三、Step 2:硬约束检查清单

回答以下问题,过滤不满足条件的模型:

检查项 判断标准 不满足时的处理
数据合规 国内业务数据不能出境 仅保留国内模型
上下文长度 模型 max_context >= 需求 排除上下文不足的模型
部署方式 必须API / 可接受自部署 / 必须本地 按需求过滤
多模态 有图像/音频需求 仅保留支持多模态的模型
速率要求 QPS 需求 > 模型 RPM 限制 排除速率不足的模型
预算上限 预估月成本 > 预算 排除成本过高的模型

国内模型清单(数据合规优先)

腾讯:混元 Turbo、混元 T1
阿里:通义千问 Max/Plus/VL
百度:文心 4.0 Turbo、文心 4.5
DeepSeek:DeepSeek V3、DeepSeek R1
智谱AI:GLM-4 Plus、GLM-4 9B
月之暗面:Kimi K1.5、Kimi VL
字节跳动:豆包 1.5 Pro
科大讯飞:讯飞星火 4.0

四、Step 3 & 4:评分矩阵详解

4.1 通用评分矩阵(权重版)

维度 权重 评分标准(1-5分)
推理能力 30% 见下方「推理能力评分细则」
多模态支持 25% 见下方「多模态评分细则」
上下文能力 20% 见下方「上下文评分细则」
响应速度 15% 见下方「速度评分细则」
成本效益 10% 见下方「成本评分细则」

总分 = Σ(各维度得分 × 权重)

4.2 各维度评分细则

推理能力(30%)

分数 MMLU GPQA MATH 代表模型
5分 ≥88 ≥75 ≥90 GPT-o3、Claude 4、DeepSeek R1
4分 82-87 65-74 85-89 GPT-4o、Qwen-Max、混元T1
3分 75-81 55-64 75-84 Qwen-Plus、GLM-4、Kimi K1.5
2分 68-74 45-54 65-74 Qwen 14B、Llama 3.3 70B
1分 <68 <45 <65 小参数模型(7B以下)

多模态支持(25%)

分数 支持类型 代表模型
5分 图文音视频全覆盖 Gemini 2.5 Pro、Kimi VL
4分 图文音(无视频) GPT-4o、Claude 4、文心4.5
3分 图文(无音频) 混元Turbo、通义VL、GLM-4
2分 仅文本+简单图像 部分开源模型
1分 仅文本 DeepSeek V3/R1(纯文本)

上下文能力(20%)

分数 最大上下文 代表模型
5分 ≥1M tokens Gemini 2.5 Pro、Llama 4 Scout(10M)
4分 128K-1M Claude 4、Qwen 2.5、Kimi K1.5
3分 32K-128K GPT-4o、混元Turbo、文心4.0
2分 8K-32K 讯飞星火4.0、部分小模型
1分 <8K 早期模型、极小参数模型

响应速度(15%)

分数 首 token 延迟 生成速度(tokens/s) 代表模型
5分 <300ms >100 GPT-4o mini、豆包、GLM-4 Flash
4分 300-500ms 60-100 GPT-4o、通义Plus
3分 500ms-1s 40-60 Claude 4 Sonnet、混元Turbo
2分 1-2s 20-40 大模型满血版(GPT-o3、DeepSeek R1)
1分 >2s <20 超大参数模型、未优化部署

成本效益(10%)

分数 API 成本(每 1M tokens 输入) 代表模型
5分 <$0.1 或 ¥0.005 DeepSeek V3、豆包、通义Plus
4分 $0.1-0.5 或 ¥0.01-0.05 GPT-4o mini、GLM-4 Plus
3分 $0.5-2 或 ¥0.05-0.15 GPT-4o、混元Turbo、文心
2分 $2-5 或 ¥0.15-0.5 Claude 4 Sonnet
1分 >$5 或 >¥0.5 GPT-o3、Claude Opus

4.3 场景自适应权重调整

不同场景下,可调整权重以更匹配需求:

场景 推理能力 多模态 上下文 响应速度 成本效益
代码助手 35% 5% 25% 15% 20%
内容创作 20% 30% 20% 10% 20%
智能客服 15% 15% 10% 40% 20%
文档处理 20% 25% 40% 5% 10%
深度推理 50% 5% 15% 10% 25%
实时对话 15% 20% 10% 35% 20%

五、常见场景推荐速查表

使用方式:找到对应场景,直接参考推荐模型列表。

5.1 通用对话

预算充足 预算有限 必须本地部署
GPT-4o、Claude 4 Sonnet 豆包 1.5 Pro、通义Plus、GLM-4 Plus Qwen 2.5 32B、GLM-4 32B

5.2 代码生成/调试

预算充足 预算有限 必须本地部署
Claude 4 Sonnet、GPT-4o DeepSeek V3、Qwen 2.5 Coder 32B Qwen 2.5 Coder 32B、DeepSeek R1 14B(蒸馏)

5.3 深度推理/数学/逻辑

预算充足 预算有限 必须本地部署
GPT-o3、Claude 4、DeepSeek R1 DeepSeek R1(API)、混元 T1 DeepSeek R1 14B/32B(蒸馏)、Qwen 2.5 32B+CoT

5.4 中文内容创作

预算充足 预算有限 必须本地部署
混元 Turbo、通义千问 Max、文心 4.5 通义Plus、GLM-4 Plus、豆包 Qwen 2.5 32B、GLM-4 32B

5.5 长文档处理(>100K tokens)

预算充足 预算有限 必须本地部署
Gemini 2.5 Pro、Claude 4(200K) Qwen 2.5 72B、Llama 4 Maverick(API) Qwen 2.5 72B、Llama 3.3 70B

5.6 多模态(图像/音频/视频理解)

预算充足 预算有限 必须本地部署
GPT-4o、Gemini 2.5 Pro 通义VL Plus、Kimi VL Qwen 2.5 VL 7B/32B

5.7 实时客服/高并发

预算充足 预算有限 备注
GPT-4o mini、Claude 4 Haiku 豆包 1.5 Pro、通义Plus、GLM-4 Flash 实时场景优先低延迟模型

5.8 Agent/工具调用(Function Calling)

预算充足 预算有限 备注
GPT-4o、Claude 4 Sonnet Qwen Max/Plus、混元 Turbo 优先选择 Function Calling 支持稳定的模型

六、成本估算方法

6.1 API 调用成本公式

月成本 = 日均调用次数 × 30
    × (平均输入 token 数 × 输入单价 + 平均输出 token 数 × 输出单价)
    / 1,000,000

6.2 典型场景 Token 消耗参考

场景 平均输入 tokens 平均输出 tokens
短对话(客服) 200 150
长对话(咨询) 800 500
代码生成(函数级) 300 200
代码生成(文件级) 1000 800
文档摘要(10K字) 5000 500
深度推理(CoT) 500 1500

6.3 自部署成本估算

月成本(自部署)= GPU 租赁费 + 电费 + 运维人力

典型配置成本(阿里云/腾讯云 按需价格):
- 1×A100 40GB:约 ¥8,000-12,000/月
- 2×A100 40GB:约 ¥16,000-24,000/月
- 8×A100 40GB:约 ¥64,000-96,000/月
- 本地部署(买断):A100 约 ¥80,000-120,000/张

6.4 成本对比示例

场景:日均 10,000 次调用,平均输入 500 tokens,输出 300 tokens

模型 月成本(USD/CNY) 说明
GPT-4o ~$1,050 / ~¥7,500 高端模型
Claude 4 Sonnet ~$1,575 / ~¥11,250 高端模型
DeepSeek V3 ~$113 / ~¥810 性价比极高
豆包 1.5 Pro ~¥225 国内最低之一
通义 Plus ~¥135 国内低成本
Qwen 2.5 14B 自部署 ~¥8,000(GPU费) 固定成本,量越大越划算

结论:调用量 < 50万次/月,API 更划算;> 100万次/月,考虑自部署。


七、小流量验证方案(Step 5)

7.1 A/B 测试设计

# 流量分配示例(伪代码)
traffic_split = {
    "model_candidate_a": 0.1,   # 10% 流量给候选模型A
    "model_candidate_b": 0.1,   # 10% 流量给候选模型B
    "model_baseline": 0.8        # 80% 流量给基线模型(或当前使用模型)
}

7.2 评估指标

指标 定义 数据来源
用户满意度评分 用户主动评分或点赞率 用户反馈系统
任务完成率 用户达成目标的比例 业务指标
平均响应时间 首 token 延迟 + 生成时间 监控系统
成本 per 成功请求 总成本 / 成功请求数 成本监控
错误率 失败请求 / 总请求 监控系统
Token 消耗 平均每次请求的 token 数 API 日志

7.3 验证周期建议

第1周:1-5% 流量,观察有无严重问题(报错/超时/格式异常)
第2周:10% 流量,收集用户反馈和数据
第3周:20% 流量,验证稳定性和成本
第4周:决策 → 全量上线 或 回滚 或 继续优化

八、Fallback 与高可用设计

8.1 多级 Fallback 策略

用户请求
  ↓
Primary Model(主模型)
  ↓ 失败/超时/超限
Secondary Model(备用模型,能力相近但不同厂商)
  ↓ 失败
Third Model(保底模型,成本低、稳定性高)
  ↓ 全部失败
返回友好错误 + 建议用户稍后重试

8.2 推荐 Fallback 组合

主模型 备用1 备用2(保底)
GPT-4o Claude 4 Sonnet GPT-4o mini
混元 Turbo 通义 Max 通义 Plus
DeepSeek V3 Qwen Max Qwen Plus
国内模型 另一家国内模型 开源本地部署模型

8.3 速率限制应对策略

  • 提前测试:上线前实测各模型的 RPM/TPM 限制
  • 请求队列:实现请求排队机制,避免突发流量触发限制
  • 多 Key 轮询:速率受限时切换 API Key
  • 降级策略:高负载时自动切换到低成本/低延迟模型

九、避坑指南

  1. 不要只看 Benchmark 分数

    • 通用 Benchmark(MMLU等)与实际业务场景表现可能差异很大
    • 优先参考同类场景的真实使用反馈
  2. 注意输出格式稳定性

    • 部分模型输出格式不够稳定,影响下游解析
    • 上线前务必测试输出格式的一致性
  3. 关注内容审核策略

    • 部分模型审核过严,可能拒绝合理请求
    • 客服场景特别需要注意审核策略与业务匹配
  4. 测试速率限制

    • 上线前务必测试实际速率限制,避免用量突增被限流
    • 特别关注免费 tier 的严格限制
  5. 预留 Fallback 方案

    • 主模型不可用时,必须有备用模型自动切换机制
    • 见第八章的 Fallback 设计
  6. 注意知识截止日期

    • 需要最新知识的场景,选择支持联网的模型或 RAG 方案
    • 各模型知识截止日期不同,需确认是否满足需求
  7. 国内业务优先国内模型

    • 数据合规要求
    • 延迟更低(无需科学上网)
    • 中文能力通常更好
    • 计费用人民币,无汇率风险
  8. 不要忽视隐性成本

    • Vector DB(RAG 场景)
    • 内容审核成本
    • 日志存储成本
    • 人工标注/反馈成本