Step 1: 明确使用场景
↓
Step 2: 确定硬约束(上下文长度、部署方式、合规要求)
↓
Step 3: 初筛候选模型(满足硬约束的模型)
↓
Step 4: 评分排序(能力/成本/延迟三维度)
↓
Step 5: 小流量验证 → 全量上线
场景类型
典型需求
核心关注维度
优先模型类型
聊天机器人
多轮对话、低延迟、自然交互
延迟、成本、中文
低延迟模型(GPT-4o mini/豆包/通义Plus)
内容创作
长文写作、文风控制、创意生成
中文、创意能力
国内旗舰(混元/通义Max/文心)
代码助手
代码生成、解释、调试、补全
代码能力、上下文
Claude 4/Qwen Coder/DeepSeek V3
数据分析
数字理解、逻辑推理、图表解读
推理能力、准确性
GPT-o3/DeepSeek R1/混元T1
文档处理
长文档摘要、信息提取、QA
上下文长度、处理速度
Gemini 2.5 Pro/Qwen 2.5/Llama 4
智能客服
低延迟、高并发、一致性
成本、延迟、并发
GPT-4o mini/豆包/通义Plus
知识问答
事实准确性、知识广度、引用
知识截止日期、准确性
GPT-4o/Claude 4/混元Turbo
Agent/工具调用
结构化输出、Function Calling
格式遵循、工具调用稳定性
GPT-4o/Claude 4/Qwen Max
翻译
多语言、领域术语、流畅度
多语言能力、术语准确性
GPT-4o/通义Max/Claude 4
图像理解
图文问答、OCR、图表理解
多模态能力
GPT-4o/Gemini 2.5 Pro/通义VL
向用户确认以下信息(根据实际情况裁剪):
为给你推荐最合适的模型,需要了解几个关键信息:
1. 【必问】主要使用场景是?(聊天/代码/创作/推理/其他)
2. 【必问】每月预算大概多少?或者"尽量节省"?
3. 【必问】数据是否可以出境?(涉及国内合规要求)
4. 【可选】需要处理多长的文本?(如:单条几K token / 长文档几百K)
5. 【可选】预计并发量多少?(QPS)
6. 【可选】是否需要图像/音频/视频理解?
7. 【可选】对中文能力要求是否很高?
回答以下问题,过滤不满足条件的模型:
检查项
判断标准
不满足时的处理
数据合规
国内业务数据不能出境
仅保留国内模型
上下文长度
模型 max_context >= 需求
排除上下文不足的模型
部署方式
必须API / 可接受自部署 / 必须本地
按需求过滤
多模态
有图像/音频需求
仅保留支持多模态的模型
速率要求
QPS 需求 > 模型 RPM 限制
排除速率不足的模型
预算上限
预估月成本 > 预算
排除成本过高的模型
腾讯:混元 Turbo、混元 T1
阿里:通义千问 Max/Plus/VL
百度:文心 4.0 Turbo、文心 4.5
DeepSeek:DeepSeek V3、DeepSeek R1
智谱AI:GLM-4 Plus、GLM-4 9B
月之暗面:Kimi K1.5、Kimi VL
字节跳动:豆包 1.5 Pro
科大讯飞:讯飞星火 4.0
维度
权重
评分标准(1-5分)
推理能力
30%
见下方「推理能力评分细则」
多模态支持
25%
见下方「多模态评分细则」
上下文能力
20%
见下方「上下文评分细则」
响应速度
15%
见下方「速度评分细则」
成本效益
10%
见下方「成本评分细则」
总分 = Σ(各维度得分 × 权重)
分数
MMLU
GPQA
MATH
代表模型
5分
≥88
≥75
≥90
GPT-o3、Claude 4、DeepSeek R1
4分
82-87
65-74
85-89
GPT-4o、Qwen-Max、混元T1
3分
75-81
55-64
75-84
Qwen-Plus、GLM-4、Kimi K1.5
2分
68-74
45-54
65-74
Qwen 14B、Llama 3.3 70B
1分
<68
<45
<65
小参数模型(7B以下)
分数
支持类型
代表模型
5分
图文音视频全覆盖
Gemini 2.5 Pro、Kimi VL
4分
图文音(无视频)
GPT-4o、Claude 4、文心4.5
3分
图文(无音频)
混元Turbo、通义VL、GLM-4
2分
仅文本+简单图像
部分开源模型
1分
仅文本
DeepSeek V3/R1(纯文本)
分数
最大上下文
代表模型
5分
≥1M tokens
Gemini 2.5 Pro、Llama 4 Scout(10M)
4分
128K-1M
Claude 4、Qwen 2.5、Kimi K1.5
3分
32K-128K
GPT-4o、混元Turbo、文心4.0
2分
8K-32K
讯飞星火4.0、部分小模型
1分
<8K
早期模型、极小参数模型
分数
首 token 延迟
生成速度(tokens/s)
代表模型
5分
<300ms
>100
GPT-4o mini、豆包、GLM-4 Flash
4分
300-500ms
60-100
GPT-4o、通义Plus
3分
500ms-1s
40-60
Claude 4 Sonnet、混元Turbo
2分
1-2s
20-40
大模型满血版(GPT-o3、DeepSeek R1)
1分
>2s
<20
超大参数模型、未优化部署
分数
API 成本(每 1M tokens 输入)
代表模型
5分
<$0.1 或 ¥0.005
DeepSeek V3、豆包、通义Plus
4分
$0.1-0.5 或 ¥0.01-0.05
GPT-4o mini、GLM-4 Plus
3分
$0.5-2 或 ¥0.05-0.15
GPT-4o、混元Turbo、文心
2分
$2-5 或 ¥0.15-0.5
Claude 4 Sonnet
1分
>$5 或 >¥0.5
GPT-o3、Claude Opus
不同场景下,可调整权重以更匹配需求:
场景
推理能力
多模态
上下文
响应速度
成本效益
代码助手
35%
5%
25%
15%
20%
内容创作
20%
30%
20%
10%
20%
智能客服
15%
15%
10%
40%
20%
文档处理
20%
25%
40%
5%
10%
深度推理
50%
5%
15%
10%
25%
实时对话
15%
20%
10%
35%
20%
使用方式:找到对应场景,直接参考推荐模型列表。
预算充足
预算有限
必须本地部署
GPT-4o、Claude 4 Sonnet
豆包 1.5 Pro、通义Plus、GLM-4 Plus
Qwen 2.5 32B、GLM-4 32B
预算充足
预算有限
必须本地部署
Claude 4 Sonnet、GPT-4o
DeepSeek V3、Qwen 2.5 Coder 32B
Qwen 2.5 Coder 32B、DeepSeek R1 14B(蒸馏)
预算充足
预算有限
必须本地部署
GPT-o3、Claude 4、DeepSeek R1
DeepSeek R1(API)、混元 T1
DeepSeek R1 14B/32B(蒸馏)、Qwen 2.5 32B+CoT
预算充足
预算有限
必须本地部署
混元 Turbo、通义千问 Max、文心 4.5
通义Plus、GLM-4 Plus、豆包
Qwen 2.5 32B、GLM-4 32B
预算充足
预算有限
必须本地部署
Gemini 2.5 Pro、Claude 4(200K)
Qwen 2.5 72B、Llama 4 Maverick(API)
Qwen 2.5 72B、Llama 3.3 70B
预算充足
预算有限
必须本地部署
GPT-4o、Gemini 2.5 Pro
通义VL Plus、Kimi VL
Qwen 2.5 VL 7B/32B
预算充足
预算有限
备注
GPT-4o mini、Claude 4 Haiku
豆包 1.5 Pro、通义Plus、GLM-4 Flash
实时场景优先低延迟模型
5.8 Agent/工具调用(Function Calling)
预算充足
预算有限
备注
GPT-4o、Claude 4 Sonnet
Qwen Max/Plus、混元 Turbo
优先选择 Function Calling 支持稳定的模型
月成本 = 日均调用次数 × 30
× (平均输入 token 数 × 输入单价 + 平均输出 token 数 × 输出单价)
/ 1,000,000
场景
平均输入 tokens
平均输出 tokens
短对话(客服)
200
150
长对话(咨询)
800
500
代码生成(函数级)
300
200
代码生成(文件级)
1000
800
文档摘要(10K字)
5000
500
深度推理(CoT)
500
1500
月成本(自部署)= GPU 租赁费 + 电费 + 运维人力
典型配置成本(阿里云/腾讯云 按需价格):
- 1×A100 40GB:约 ¥8,000-12,000/月
- 2×A100 40GB:约 ¥16,000-24,000/月
- 8×A100 40GB:约 ¥64,000-96,000/月
- 本地部署(买断):A100 约 ¥80,000-120,000/张
场景 :日均 10,000 次调用,平均输入 500 tokens,输出 300 tokens
模型
月成本(USD/CNY)
说明
GPT-4o
~$1,050 / ~¥7,500
高端模型
Claude 4 Sonnet
~$1,575 / ~¥11,250
高端模型
DeepSeek V3
~$113 / ~¥810
性价比极高
豆包 1.5 Pro
~¥225
国内最低之一
通义 Plus
~¥135
国内低成本
Qwen 2.5 14B 自部署
~¥8,000(GPU费)
固定成本,量越大越划算
结论 :调用量 < 50万次/月,API 更划算;> 100万次/月,考虑自部署。
# 流量分配示例(伪代码)
traffic_split = {
"model_candidate_a" : 0.1 , # 10% 流量给候选模型A
"model_candidate_b" : 0.1 , # 10% 流量给候选模型B
"model_baseline" : 0.8 # 80% 流量给基线模型(或当前使用模型)
}
指标
定义
数据来源
用户满意度评分
用户主动评分或点赞率
用户反馈系统
任务完成率
用户达成目标的比例
业务指标
平均响应时间
首 token 延迟 + 生成时间
监控系统
成本 per 成功请求
总成本 / 成功请求数
成本监控
错误率
失败请求 / 总请求
监控系统
Token 消耗
平均每次请求的 token 数
API 日志
第1周:1-5% 流量,观察有无严重问题(报错/超时/格式异常)
第2周:10% 流量,收集用户反馈和数据
第3周:20% 流量,验证稳定性和成本
第4周:决策 → 全量上线 或 回滚 或 继续优化
用户请求
↓
Primary Model(主模型)
↓ 失败/超时/超限
Secondary Model(备用模型,能力相近但不同厂商)
↓ 失败
Third Model(保底模型,成本低、稳定性高)
↓ 全部失败
返回友好错误 + 建议用户稍后重试
主模型
备用1
备用2(保底)
GPT-4o
Claude 4 Sonnet
GPT-4o mini
混元 Turbo
通义 Max
通义 Plus
DeepSeek V3
Qwen Max
Qwen Plus
国内模型
另一家国内模型
开源本地部署模型
提前测试 :上线前实测各模型的 RPM/TPM 限制
请求队列 :实现请求排队机制,避免突发流量触发限制
多 Key 轮询 :速率受限时切换 API Key
降级策略 :高负载时自动切换到低成本/低延迟模型
不要只看 Benchmark 分数
通用 Benchmark(MMLU等)与实际业务场景表现可能差异很大
优先参考同类场景的真实使用反馈
注意输出格式稳定性
部分模型输出格式不够稳定,影响下游解析
上线前务必测试输出格式的一致性
关注内容审核策略
部分模型审核过严,可能拒绝合理请求
客服场景特别需要注意审核策略与业务匹配
测试速率限制
上线前务必测试实际速率限制,避免用量突增被限流
特别关注免费 tier 的严格限制
预留 Fallback 方案
主模型不可用时,必须有备用模型自动切换机制
见第八章的 Fallback 设计
注意知识截止日期
需要最新知识的场景,选择支持联网的模型或 RAG 方案
各模型知识截止日期不同,需确认是否满足需求
国内业务优先国内模型
数据合规要求
延迟更低(无需科学上网)
中文能力通常更好
计费用人民币,无汇率风险
不要忽视隐性成本
Vector DB(RAG 场景)
内容审核成本
日志存储成本
人工标注/反馈成本