体检的目标
不是得出「我们 GEO 做得好不好」这种模糊结论,而是回答三个具体问题:
- AI 现在怎么说我们?说得对不对?
- 在客户真正会问的决策问题里,我们在不在答案里?
- 如果不在,缺的是信息、内容,还是可信度?
三个问题的答案会直接指向下一步该做什么,避免花冤枉钱。
第一步:整理 20 个提问词
分五组,每组 4 个。选词原则是「像客户那样说话」,不要用行业术语,也不要用品牌词。
A 组:品牌认知(4 个)
- 「XX 公司是做什么的」
- 「XX 品牌怎么样,靠谱吗」
- 「XX 公司的产品有哪些」
- 「XX 公司在哪里,怎么联系」
B 组:品类决策(4 个)
- 「本地做 XX 哪家好」
- 「XX 哪个牌子口碑好」
- 「XX 行业值得推荐的品牌有哪些」
- 「选 XX 要注意什么」
C 组:价格与预算(4 个)
- 「XX 大概多少钱」
- 「XX 的报价一般包含哪些内容」
- 「XX 便宜的会不会有坑」
- 「预算 X 万,XX 怎么做比较合适」
D 组:顾虑与风险(4 个)
- 「XX 有没有隐藏收费」
- 「XX 售后怎么样」
- 「XX 常见的问题有哪些」
- 「XX 做失败了怎么办」
E 组:对比与替代(4 个)
- 「XX 和 YY 哪个更适合」
- 「自己做 XX 和找服务商做有什么区别」
- 「XX 的替代方案有哪些」
- 「XX 行业内哪几家的做法比较规范」
把 XX、YY 替换成你行业里真实的品类词和竞争对手名。
第二步:四个引擎各问一遍
用豆包、DeepSeek、文心一言、通义千问(如果有条件,再加上元宝、Kimi、智谱清言、秘塔)。
问的时候注意三点:
- 用新对话,别在旧对话里追问,避免上下文干扰。
- 不要提自己的品牌名,除非是 A 组问题。
- 同一时间一次性问完,记录日期,作为基线。
第三步:填诊断记录表
每个问题每引擎一行,记录下面几列:
| 列 | 内容 |
|---|---|
| 问题编号 | A1–E4 |
| 引擎 | 豆包 / DeepSeek / … |
| 是否提及本品牌 | 是 / 否 |
| 提及位置 | 第 1 个 / 第 3 个 / 仅在末尾 |
| 描述是否准确 | 准确 / 部分偏差 / 完全错误 |
| 引用的来源 | 抄下 AI 给出的来源链接或平台名 |
| 竞品出现情况 | 答案里提到了哪几个同行 |
截图存档,按「日期-引擎-问题编号」命名。文件夹结构固定下来,三个月后你会感谢自己。
第四步:读结果
四种典型结果,对应四类问题:
| 现象 | 说明问题在 | 先做什么 |
|---|---|---|
| A 组说错(地址、业务、成立时间) | 信息层 | 信源一致性整改 |
| A 组准确,B–E 组完全没你 | 内容层 | 补决策型内容 |
| 提你但不推荐你(如「XX 是其中之一」) | 证据层 | 补可核验的事实与第三方印证 |
| 提你但描述负面或过时 | 声誉层 | 处理历史负面与旧信息 |
多数企业的真实情况是两三种叠加,按上表从上往下处理,不要跳步。
第五步:七天后复测一次
同一个清单,隔七天再问一遍。目的不是看有没有提升(一周内基本不会有),而是看同一引擎的答案稳不稳定。
如果同一个问题两次答案差异巨大,说明这个问题上模型没有稳定信源,这是个机会——谁先把明确的信息铺上去,谁更可能被采用。
体检时最容易犯的三个错
错误一:只看品牌词。 搜自己名字 AI 能说两句就满意了,忽略了决策词。这是最普遍的问题。
错误二:把单次结果当验收标准。 AI 有随机性,同一个问题换一次生成结果可能就变了。要看趋势,不看单点。
错误三:拿截图去质问服务商。 截图是诊断材料,不是 KPI。它的用途是发现问题,不是结算依据。
下一步可以做什么
把 20 个提问词写下来,今天先问 A 组和 B 组,8 个问题、4 个引擎,大概 20 分钟。做完你至少知道 AI 眼里的你是什么样。
如果做完发现 A 组就有明显错误,那不用犹豫,先修信息——这是所有工作的前提。如果 A 组干净但 B–E 组一片空白,那说明你的内容策略需要重新规划,可以拿这份记录表来做一次免费诊断。

