文章目录
- D4 | 模型选型指南:什么时候用 GPT-4o、Claude 3.5、DeepSeek?
-
- 写在前面
- 一、6 大模型 × 6 维度对比
-
- 1.1 6 维度评估框架
- 1.2 6 大模型总览表
- 1.3 关键指标怎么算
- 二、10 个真实业务场景的选型推荐
-
- 2.1 场景 1:客服机器人
- 2.2 场景 2:代码生成 / Code Review
- 2.3 场景 3:长文分析(>100K Token)
- 2.4 场景 4:中文创作(公众号、文案、营销)
- 2.5 场景 5:多模态(图像/视频理解)
- 2.6 场景 6:翻译(中英、英中等)
- 2.7 场景 7:数据抽取(结构化输出)
- 2.8 场景 8:数学/逻辑推理
- 2.9 场景 9:实时对话(低延迟)
- 2.10 场景 10:大规模生产(成本敏感)
- 2.11 场景速查表
- 三、自建评测体系(5 步)
-
- 3.1 第 1 步:建评测集
- 3.2 第 2 步:选评估指标
- 3.3 第 3 步:批量跑对比
- 3.4 第 4 步:算总账
- 3.5 第 5 步:选型决策
- 四、4 个常见坑(避坑指南)
-
- 坑 1:Token 化差异导致\”看起来便宜其实贵\”
- 坑 2:长 Context 性能衰减
- 坑 3:API 频繁限流
- 坑 4:中文能力被高估
- 五、这一篇的小结
-
- 5.1 6 个 Key Takeaway
- 5.2 速查表(建议打印贴墙)
- 5.3 思考题
- 下篇预告
D4 | 模型选型指南:什么时候用 GPT-4o、Claude 3.5、DeepSeek?
写给\”已经在用 LLM,但不知道怎么选\”的你
本文是《60 天 AI 全栈转型:传统开发者的大模型工程师之路》S1 第 4 篇 配套代码仓库:https://gitcode.com/road-emblem/60-days-ai-stack
写在前面
D3 我们讲了 6 大 LLM 厂商的 API 怎么调——但会调不等于会选。
真实生产环境里,你迟早会面对这些问题:
- “客服机器人用哪个模型?”
- “代码生成 GPT-4o 还是 Claude?”
- “中文创作用通义还是 DeepSeek?”
- “这个月账单超出预算 3 倍,谁的锅?”
- “为什么大家都在用的模型,到我这里效果就差?”
D4 的目标:给你一套可复用的模型选型方法论。
这一篇你会拿到:
- 6 大模型 × 6 维度的深度对比表
- 10 个真实业务场景的选型推荐
- 5 步自建评测体系——不靠宣传靠实测


![[特殊字符]DeepSeek‑Harness(DSH)小白保姆教程-171主机测评](https://www.171host.com/wp-content/uploads/2026/08/20260816085112-6a817a009aabf-220x150.png)