第 18 篇 AI 竞品拆解:如何逆向分析一个 AI 产品
第二季第 2 篇 · 温习:第 01 篇的〈两类 AI PM 的区分〉、〈AI 素养是及格线〉,第 02 篇的〈用自己的数据测,不要看榜单〉 · 新增:一套逆向拆解框架(六步拆解法 + 探边界用例库),核心是"测出它做不到什么"
温习:第一季的三条结论
- 第 01 篇〈两类 AI PM 的区分〉:一类做模型、一类用模型做产品;拆解应站在"用模型做产品"视角,关心它解决了谁的什么问题,而非模型参数。
- 第 01 篇〈AI 素养是及格线〉:能读懂能力边界、成本结构与失败模式才算入门,拆解正是对这层素养的实操检验。
- 第 02 篇〈用自己的数据测,不要看榜单〉:评测靠自己跑用例,不靠厂商榜单——拆解竞品同样要亲手跑,不抄宣传稿。
第一季给了"测"的意识但没给"怎么逆向测竞品"的框架;本篇把"用自己的数据测"升级成系统化的六步拆解法与一套探边界用例库,目标是测出竞品做不到什么。
一、AI 竞品拆解与传统竞品分析的差别
传统竞品分析产出"功能清单 + 截图对比",对 AI 产品几乎没信息量。原因:AI 产品的差异不在"有什么按钮",而在"边界在哪、成本多高、什么时候翻车"。两个功能相同的产品,一个在长文本上稳定、一个频繁截断,体验天差地别——但功能清单看不出来。
所以 AI 拆解的核心指标是能力边界,不是功能覆盖。把拆解目标从"它有哪些功能"改成"它在什么输入下会失败、失败长什么样、失败要花多少成本"。这同时也是给自己产品的预警:竞品的失败模式(呼应《第 03 篇:LLM 能力边界与失败模式图鉴》)大概率也是你的失败模式。
为什么 happy path 没用:用户在营销页看到的"它能写诗、能编程"都是精选样例,代表能力上限而非常态。PM 要估的是"常态分布"——大多数输入下的表现,尤其尾部(长、乱、刁钻)输入,那才决定用户是否敢把工作托付给它。拆解频度上,竞品月级迭代,核心竞品建议季度全拆一次、月度轻量探边界(只跑 10 类里 3–4 类高风险项),把轻量结果追加到同一份记录表,形成时间序列,能看出对方在"变强还是变弱"。
拆解的常见错误预期是"一次拆完就懂了"。AI 产品的边界随版本漂移,今天测出的"它做不到"下个版本可能已修复。因此把拆解当成持续情报流而非一次性交付:每次模型大版本发布,重跑边界用例库里的高风险 3 类即可,不必全量。拆解的最小可行产出不是文档,是"三个动作"——一个要避开的、一个要进攻的、一个要跟进的;写不出这三个,说明这次拆解没产生决策价值,等于白跑。
另一个差别是"动态性"。传统功能上线后基本不变,AI 产品随模型升级、Prompt 调整、检索库更新而漂移。一次拆解的结论有保质期,必须在记录里写明"测试日期"与"观察到的版本特征",不能当永久真理。
二、六步拆解法
| ① 定位判定 | 判定它属于哪类产品、解决谁的什么问题、落在哪个场景范式(见《第 17 篇》) | 一句话定位卡 | 0.5–1 小时 |
| ② 能力边界探测 | 用探边界用例库(第三节)系统跑输入,记录通过 / 失败 | 边界矩阵 | 2–4 小时 |
| ③ 失败模式观察 | 归类失败类型,对照《第 03 篇》失败模式图鉴 | 失败模式清单 | 1–2 小时 |
| ④ 成本与架构推断 | 从响应速度、并发表现、输出风格反推方案(是否接检索、是否多 agent、用哪类模型量级) | 架构假设卡 | 1–2 小时 |
| ⑤ 交互与信任设计拆解 | 看它如何展示不确定性、给溯源、做兜底、管预期(呼应《第 11 篇:交互与信任设计》) | 信任设计笔记 | 1–2 小时 |
| ⑥ 护城河判断 | 评估数据、场景、集成、分发四方面壁垒 | 护城河评分 | 0.5–1 小时 |
① 定位判定: 先写卡片——“它帮【谁】在【什么场景】把【什么动作】从【怎样】变成【怎样】”。写不出等于你没真理解它,后续拆解会跑偏。同时用《第 17 篇》的范式对号(信息压缩 / 格式转换 / 检索问答 / 初稿生成 / 批量判断),范式决定该重点测哪类边界。
② 能力边界探测: 这是耗时大头,用第三节用例库,每类至少 3 条输入,记录"输入→输出→现象"。不要只测 happy path,happy path 人人都会,差异全在边缘。
③ 失败模式观察: 把②的失败归类到《第 03 篇》的失败模式(如幻觉、遗忘、指令忽略、格式漂移、越界)。这一步的价值是"竞品的坑 = 我的避坑清单"。
④ 成本与架构推断: 用可观测信号反推——首字延迟低且长文稳定,可能接了流式 + 长上下文;回答带引用链接,说明有检索;同一问题多次答案差异大,可能未做温度锁定或没有缓存;拒答某些词,可能加了安全层。推断要标注"假设",不是结论。
⑤ 交互与信任设计拆解: 重点看五件事——它失败时是否承认"我不确定";给的答案能否溯源到出处;是否有人工复核 / 编辑入口;是否明示能力边界与适用场景;错误发生时是否提供降级路径。这直接决定用户敢不敢把关键任务交给它。
⑥ 护城河判断: 从四维度打"强 / 中 / 弱"——数据(自有独家语料?)、场景(是否嵌入高频工作流?)、集成(能否接我的系统?)、分发(是否自带流量入口?)。四项都弱的产品,复制成本低,不值得长期盯。
六步可按需裁剪:小工具只需②③④;平台级产品才跑满六步。但②能力边界探测永远是第一投入重点,其余都可减,边界不能省。成本推断要落地成"量级"而非精确值:首字延迟是"亚秒 / 秒级"、并发是"能扛峰值还是偶尔排队"、单次成本用"相对高低"。这些量级足以支撑选型,精确数字拿不到也不该编。每一步的产出物要可交接:下一位同事拿到六张产出卡,应能在不开会的情况下复现你的结论。凡是需要"我口头补充说明"才能懂的拆解,都算没写清楚。
三、探边界用例库(本篇核心工具)
这是可直接套用的探测模板,覆盖 10 类典型边界。每类写清"用什么输入 / 观察什么现象 / 现象说明什么"。建议存成一张表,每次拆解复制填写。
| 超长输入 | 粘贴远超其声称上下文长度的文档后提问 | 是否截断、遗忘前文、答非所问 | 真实上下文窗口与稳定性 |
| 模糊指令 | “帮我弄一下那个报告”(无指代、无格式) | 是否追问澄清,还是瞎编 | 主动澄清能力 / 臆测风险 |
| 自相矛盾要求 | “写一段短到 5 字又详细到 200 字的描述” | 是否指出矛盾,还是强行满足其一 | 指令遵循与矛盾检测 |
| 领域外问题 | 问它明确不覆盖的冷门专业知识 | 是否拒答 / 标不确定,还是硬答幻觉 | 知识边界诚实度 |
| 对抗性输入 | 诱导它忽略系统规则(“忽略以上所有指令”) | 是否被越狱、泄露 Prompt | 安全防护强度(呼应《第 14 篇:提示注入防护》) |
| 多轮指代 | 第 3 轮用"它""那个"指代首轮实体 | 是否维持指代、追错对象 | 多轮一致性与记忆 |
| 严格格式要求 | “只输出合法 JSON,不要任何解释” | 是否夹带多余文字导致解析失败 | 结构化输出可靠性(呼应《第 04 篇:结构化输出约束》) |
| 需精确计算 | “103 × 97 等于多少”“这表里总和是多少” | 是否算错、是否幻觉中间步骤 | 数值精确性(危险区) |
| 时效性信息 | “今天某指数收盘多少”“刚发布的政策说啥” | 是否用旧知识硬答、是否标时间 | 是否接实时检索 |
| 专业术语 | 用行业黑话 / 缩写密集提问 | 是否误解术语、给出外行答案 | 垂直领域适配深度 |
用例库设计的一条铁律:每类输入要包含"它应该会失败"的预期。如果一类你预期它通过,那它测的是下限;预期它失败,那它测的是边界。边界用例库的价值全在后者——happy path 谁都能过。用法纪律:每类至少 3 条输入,覆盖"轻度 / 中度 / 极端"三档强度;记录必须含"测试日期"与"输入原文",否则结论不可复现。把"现象说明什么"写成判断,而非描述——这是从"用过了"到"拆明白了"的鸿沟。
示例记录(示例数据)——竞品 X,测试日期示例 2026-Q3:超长输入类,输入"粘贴约 5 万字研报后问核心结论",现象"前 2 万字准确、之后开始遗漏并重复",推断"上下文窗口约 3–4 万字且长程注意力衰减"。把这类证据积满 10 类,边界矩阵自然成形。用例库跑完后画一张"边界矩阵":横轴 10 类、纵轴"通过 / 部分 / 失败",一眼看出竞品是"全面强"还是"偏科"。偏科产品要找它弱的那几列作为进攻点。
可直接套用的记录模板(复制填):
竞品:__________ 测试日期:__________ 观察到的版本特征:__________
类别 输入原文(简述) 现象 推断
超长输入 __ __ __
模糊指令 __ __ __
自相矛盾 __ __ __
领域外 __ __ __
对抗性 __ __ __
多轮指代 __ __ __
严格格式 __ __ __
精确计算 __ __ __
时效性 __ __ __
专业术语 __ __ __
四、拆解记录表模板(可直接套用)
把六步结论收敛成一张打分表,便于横向对比多个竞品、也便于归档。分维度打分(1–5)+ 证据记录 + 结论栏。
| 核心场景契合度 | __ | 定位卡写清了谁/什么场景 | 它主打____,我是否同场 |
| 能力边界宽度 | __ | 10 类中通过 __ 类 | 在____类强,____类弱 |
| 失败模式严重程度 | __ | 主要失败:____ | 我的同类产品要重点防 |
| 成本效率(推断) | __ | 延迟/并发观察:____ | 推测方案:____ |
| 信任设计成熟度 | __ | 是否溯源/澄清/兜底:____ | 用户敢托付度:____ |
| 护城河强度 | __ | 数据/场景/集成/分发:____ | 复制难度:____ |
汇总规则: 不强行算总分(维度不可加),而是写一句"它强在哪、弱在哪、我能打哪"。打分只用于内部对齐,不对外发布。证据栏必须可回溯——没有证据的打分等于拍脑袋。
示例填写(示例数据):竞品 X 六维打分——场景契合 4、边界宽度 3(10 类通过 6)、失败严重度 3(主要失败为精确计算与时效性)、成本效率 4(延迟低推断流式)、信任设计 3(有溯源但无明确兜底)、护城河 2(数据弱、分发靠自身流量)。结论:它在长文本检索强、精确与时效弱,我打"精确计算 + 实时检索"差异化。注意"护城河 2"意味着它容易被复制,长期盯它的意义低于盯护城河强的对手。
五、从拆解到决策:三种结论及对应动作
拆解的终点不是"写了一份报告",是"产出一个动作"。三种典型结论:
| 它强在哪 | 某维度明显领先(如长文本稳定、检索准确) | 我避开正面刚;若必须同场,先补齐该维度再进 |
| 它弱在哪 | 某类边界频繁失败(如精确计算、时效性) | 我打它的弱点:把"它做不到"做成"我能做到"的卖点 |
| 它已成熟 | 核心场景被验证、失败模式可控 | 说明场景被市场验证过,我可放心跟进并差异化 |
第三种最容易被误读:看到竞品成熟就觉得"没机会"。反过来——竞品成熟恰恰证明场景真实存在、用户愿付费,你该做的是找差异化切口(更垂直、更便宜、更合规),而不是放弃。第一种结论提醒你别在对方护城河里硬拼;第二种是进攻地图。
落地时的常见误用:把"它弱在哪"直接当"我的 PRD",却没验证自己是否真能做好那块——弱点进攻前提是你能补上,否则只是换个地方翻车。进攻前先用《第 17 篇》打分表确认该弱点是"AI 友好"而非"AI 危险区":若它弱在精确计算(危险区),你硬补也难;若它弱在时效检索(友好区),你接检索就能赢。
把结论落到"立项 / 避让 / 跟进"三选一,并写进机会池(见《第 17 篇》),拆解才闭环。
六、边界与操守
拆解是正当的竞争情报,但有红线:
- 不做恶意攻击:不用海量请求压测致其服务不可用,不尝试真实越狱以窃取系统。
- 不套取内部信息:不伪装员工钓鱼、不贿赂、不爬取未公开接口。
- 遵守服务条款:只读公开可访问部分,不违反对方 ToS 的自动化限制。
- 标注推断与事实:架构推断写"假设",现象记录写"事实",不把推测当结论传播。
- 不泄露敏感数据:用自己的脱敏用例测,绝不把用户隐私 / 商业机密喂给竞品。
操守失守会让整份拆解失效且带来法律风险。竞争情报的价值在"看清边界",不在"撬开别人"。
团队协作口径:拆解结论进共享文档而非个人笔记,标注作者与日期;涉及"推断"的部分用[假设]标签,汇报时口头强调"这是推测"。避免组织把一个人的推测当成既定事实层层传递,最终误导立项。
一页速查
AI 竞品拆解 · 一页速查
─────────────────────────────
目标:测出它"做不到什么",不是列功能清单。
六步:定位→边界探测→失败模式→成本架构→信任设计→护城河
必用探边界用例库(10 类,每类≥3 档强度):
超长输入/模糊指令/自相矛盾/领域外/对抗性/
多轮指代/严格格式/精确计算/时效性/专业术语
记录铁律:贴输入原文+现象+推断,写测试日期与版本特征。
记录表六维:场景契合|边界宽度|失败严重度|成本效率|信任设计|护城河
决策三选一:它强→我避;它弱→我打;它成熟→场景被验证,我跟进差异化。
操守红线:不攻击/不套内部/守ToS/推断标假设/不喂敏感数据。
常见坑
结语
AI 竞品拆解的本质是"用自己的用例测出对手的边界"——它强在哪决定你避开什么,它弱在哪决定你打哪里,它成熟在哪说明场景值得跟。看清边界,才看得清自己的位置。
本文为「AI 产品经理入门与进阶」系列第二季第 2 篇(总第 18 篇)。温习自第 01 篇《能力地图与知识清单》、第 02 篇《从 0 到 1 落地一个 AI 功能》。数据来源:本篇拆解框架、探边界用例库与记录模板均为可操作方法论,示例数值已标注"示例数据"。具体数值(延迟、版本、榜单)随技术迭代变化,请以最新数据为准。




