智子展开,无所遁形。
一个把产品拆到骨头缝里的 Agent Skill。给它一个 URL,它还你一份每条结论都挂得上证据的拆解报告。
市面上的 teardown 工具都停在门口:抓落地页、抄定价表、看看 sitemap。 Sophon 能进去。登录态、onboarding、免费额度用尽时弹出的那道 gate、 credits 背后的毛利结构,这些公开资料里查不到的东西,才是拆解真正的价值所在。
你想做一个产品,找到了三个标杆。然后呢?
看官网只能看到它想让你看到的:漂亮的 hero 文案、精心排布的定价表、几句客户证言。 你看不到的是:新用户从进站到第一次拿到有用产出要几分钟、卡在哪一步会流失、 免费额度到底怎么算、付费墙弹出来时它说什么话、这笔生意到底赚不赚钱。
Sophon 把这些挖出来,然后回答五个问题:
- 它靠什么赚钱,单位经济学成立吗
- 它的增长引擎是哪一个,可复制性如何
- 它最脆的假设是什么
- 如果你要做同类,抄什么、避什么、从哪个缝切
- 这个市场还剩多少空间
维度定死,不增不删。每一维都有「看什么 / 证据从哪来 / 专家追问」三栏。
| 维度 | 拆什么 |
|---|---|
| 定位与人群 | 服务谁、解决什么 JTBD、最窄切入口、护城河类型 |
| 增长策略 | SEO(sitemap 规模、程序化痕迹、免费工具矩阵、竞品词截流)、社媒(账号矩阵、内容类型、创始人号)、裂变(affiliate 分成、产品内自传播) |
| 商业化 | 档位结构与价值锚定、付费墙位置、credits 机制、试用设计、信任信号 |
| 产品与体验 | 核心工作流、首次体验(TTFV、激活步数、空状态)、状态与错误处理 |
| 技术与运营 | 技术栈线索、上游依赖、性能、更新节奏 |
「专家追问」栏是这套框架的灵魂。 它不问「它做了什么」,问的是: 它为什么这么做、这个设计背后的假设是什么、假设最脆的地方在哪、你能从哪里切进去。
举例:商业化维不会只记录「Pro 档 39 美元」,而是追问 「为什么把 carousel 锁在 Pro 而不是 Starter,它假设什么样的人会为这个功能升级,这个假设成立吗」。
七个阶段,顺序执行。每个阶段都写清了「产出什么」和「拿不到怎么降级」。
阶段 0 能力探测与合规预检 探本次会话有什么浏览器能力、查 robots 与 ToS
阶段 1 静态采集 跑脚本落盘 HTML / sitemap / meta / CSS
阶段 2 浏览器接入与登录 继承已有登录态,或人工交接(skill 不碰密码)
阶段 3 流程录制 逐帧截图 + Psych 曲线 + TTFV 等指标
阶段 4 商业化深拆 双轴定价 + 付费墙实测 + credits 单位经济学
阶段 5 五维分析 先填窄分类,再写专家追问
阶段 6 输出报告 十三节报告,交付前过三道闸
不指定时默认 standard。降档是常态不是失败,报告首页会写清降到哪一档、因为什么。
| 档 | 需要什么 | 耗时 | 能下什么判断 |
|---|---|---|---|
| quick | 只要网络 | 10 分钟 | 定位、增长打法、价目表结构。不许下体验判断 |
| standard | 浏览器能力 + 配合登录一次 | 40 到 90 分钟 | 加上首次体验、Psych 曲线、付费墙位置 |
| deep | 加自有付费账号并明确授权 | 2 到 4 小时 | 全维 + 单位经济学,可判断「这单赚不赚钱」 |
不许用低档的采集写高档的结论。 这是本 skill 最容易犯也最致命的错, 所以报告元信息里同时标三根轴:深度档(你想多深)、浏览器能力档(会话有什么工具)、 证据档(实际拿到了什么登录态)。
调研过一圈现有的 teardown skill 与 agent,这四件事没有任何现成项目在做。
不碰明文密码。两条路:继承你已经登录的浏览器(最优,零登录动作), 或人工交接(agent 停下告诉你该做什么,你自己登录,它检测到成功后继续)。 登录一次要能复用,否则每轮重跑都打扰人。
不是截一张定价页,而是正常用满免费额度,记录: gate 在第几步弹出、硬墙还是软墙、话术走恐惧诉求还是价值诉求、有没有降级挽留。 这类信息任何公开资料都查不到。
从公开单价、每档额度、单次消耗、底层模型 API 真实价格,反推 credit-to-cost ratio 与毛利带。 参照线:AI 原生产品毛利 50 到 60% 算健康,传统 SaaS 是 80 到 90%。 拆一个 AI 产品不算这笔账,等于没拆。
借 Growth.Design 的 Psych Framework: 把用户兴奋度当成一个可加可减的油箱,流程每一帧打 +Psych / -Psych,画成曲线找塌陷点。 截图如果只用来配图,等于白截。 这套让逐帧截图变成可量化的结论。
这是一个 Agent Skill,不绑定某一个客户端。把整个目录放进你的 agent 读取 skills 的位置即可:
# 通用做法:克隆到你的 skills 目录
git clone https://github.com/ai798-Lab/sophon.git <你的 skills 目录>/sophon常见位置:~/.claude/skills/sophon/(Claude Code)· ~/.codex/skills/sophon/(Codex)·
其他 agent 按各自文档放到对应目录。skill 本体是纯 Markdown 加两个 Python 脚本,没有客户端专有依赖。
对能力的唯一要求:能读写本地文件、能跑 python3、能联网抓页面。
浏览器能力是可选的,有则档次高,没有会自动降级并在报告里写清楚(见下方三档深度)。
对你的 agent 说人话即可:
深度拆解 https://example.com
拆一下这个产品的商业化 https://example.com
往死里拆 https://example.com(我有付费账号)
快速看一眼 https://example.com
它会先告诉你本次在哪一档、能做到什么、做不到什么,然后开工。
一个 teardown-<domain>/ 目录:
raw/ 原始采集(HTML、sitemap、capability.json)
evidence/ 编号证据(截图、分类结果、索引)
analysis/ 分析产物(frames、psych、metrics、pricing-scorecard、paywall-gates、unit-economics)
report.md 最终报告(十三节 + 抄改清单)
报告结尾是一张抄改清单:左栏「可以直接抄的设计」,右栏「它的瑕疵与你的改法」。 这张表就是你产品方案的前身。
这套 skill 可不可信,全押在这一条上。
借 Baymard 的 UX-Ray 思路: 不让 AI 自由下判断。AI 只做窄分类(选项预设,比如付费墙类型只能选 硬墙 / 软墙 / 时间墙 / 额度墙 / 无墙),结论由固定 rubric 产出。
每条结论必须带四种标注之一:
[E-pricing-03]挂得上证据编号[推断]有推理链,但没有直接证据[人工输入位]需要你补充(比如没登录时的产品内体验)[未知]拿不到,明说拿不到
没有标注的句子不许出现在结论里。挂不上证据的结论,删掉或降级为推断。
带登录能力之后,这些是写死的,任何情况不许绕过:
- 永不接触明文密码。只走继承登录态或人工交接两条路
- 连真实浏览器时只操作目标域名的标签页,不读其他标签页,不碰邮箱、银行、内部系统
- 不用真实支付信息。走到支付页记录后停下,绝不提交
- 不批量注册假账号,不绕验证码,不做压力测试
- 动手前查 robots.txt 与 ToS,命中禁区停下问你,不自作主张降低标准
建议你准备一个拆解专用账号。用主号的代价是: 邮箱会进它所有的营销序列,而且以后拆同类产品时你已经不是新用户,看不到 onboarding 了。
大方说清楚,免得你踩坑。
1. 只端到端跑过一次,而且那一次的结论被自审推翻了一半。 2026-08-14 对 scorper.ai 跑完了七个阶段(Tier 1 连真实 Chrome,付费试用期内实测), 五维框架、Psych 曲线、单位经济学反推、证据对账、十三节报告全部走通。 那次实跑暴露并已修掉两个问题:
- 阶段 3 的截图只回到会话上下文、不写成文件,导致流程层证据关掉会话就没了。
现在阶段 3 强制要求每帧当场落盘 DOM 文本并写
frames.md,截图不再是唯一载体。 - 红旗 9(Psych 曲线无负分)会误伤:帧级净分全正、但帧内子项和注册段都有负分。 现在这条红旗要求先复核这两处再定罪。
随后又做了一轮五视角自审(框架对账 · 深度攻击 · 证据核验 · GitHub 调研 · 方法论调研), 给那份报告打了 4 分(满分 10),并揪出七类系统性失误。这七类已全部转成 skill 里的硬规则:
| 首跑犯的错 | 现在由什么拦住 |
|---|---|
| 增长引擎判成 GEO,只有意图证据没有效果证据 | 2.1 的 GEO 交接闸:命中触发判据就必须跑第三方版图与 AI 可见度实测,或明写已交接且不下结论 |
| 三块增长并列罗列,从不点名谁是主导 | 2.0 的 循环总账:主导只能有一个,未点名不许写「增长引擎是 X」;主导若是创始人受众,必须去查它的量级 |
| 护城河靠一句话自由发挥 | 护城河改为 7 Powers 七力窄分类 + accrual_asset 与 exit_cost 两字段 + 一条 rubric 硬规则 |
| 竞争集合 100% 由对方的对比页框定 | 竞争集合强制第二来源,差集单独成表,必查零成本替代 |
| Psych 打分越界、把注册段排除后宣布无塌陷 | 4.0 的三条机械校验:单帧上下限 · 必须覆盖注册段 · 必须写范围声明 |
| 把 92% 毛利当成优点,且漏算通道费与试用补贴 | 单位经济学补三项成本 + 一条自检:AI 产品里 90% 以上毛利是橙色信号不是加分 |
| 抄改清单两栏,读者会去抄最便宜也最容易被反抄的那几条 | 清单改三栏(加「你抄不了的前提条件」),并强制 castle / shack 标注,左栏至少一条 castle |
另外补了两道:阶段 1 的 Wayback 反演(首次拆解也能做 diff), 以及交付前的第四道闸 红队 murder board(独立 subagent 只拿报告与证据来杀结论, 因为同一条推理链自我复核会互相背书,首跑就是这么把两条错结论带到交付的)。
样本仍然只有一个,而且是个体量不大的单页 SaaS。 换成多产品线的大站、或者 onboarding 有分叉的产品,大概还会暴露新问题。
2. Psych 打分带主观性。 虽然给了评分参照表和塌陷点判定规则,但 +2 还是 +3 这种粒度上, 不同的人跑同一条流程可能给出不同的曲线。它适合找塌陷点,不适合跨产品比绝对值。
3. 平台能力差异大。 Tier 1(连真实浏览器)和 Tier 5(只有 WebFetch)拿到的东西完全不是一个量级。 在 Tier 5 环境下 standard 档根本无法达成,skill 会直接降到 quick 并说明。 不要在 Tier 5 下期待体验维的结论。
4. credits 反推是估算,不是财报。 底层模型价格、单次实际消耗量都需要假设,所有数字都会标注为估算并写清假设。 它能告诉你「这个毛利结构大概健不健康」,不能告诉你「它上个月赚了多少」。
5. 快照 diff 需要时间才有价值。 同一目标重跑才能看出变化。第一次跑只有快照,没有 diff。
6. references/prompts.md 是旧版兜底模板,和深度文件有轻微重叠。
如果实测下来从没用到,会直接删掉而不是继续维护。
调研过 gstack(Gary Tan 现役开源)· lenny-skills v2 · aso-audit-mcp · geo-optimizer-skill · inference-sh 的 competitor-teardown · landingpage-cro-audit-kit 之后, 只把能变成本框架里一个字段、一条规则或一张表的东西搬了进来,其余明确不搬。 整套框架照搬进来,得到的是两套互相打架的枚举和一堆填不出的空格。
| 借了 | 借成什么形状 | 出处 |
|---|---|---|
| 护城河判定 | 7 Powers 七力窄分类 + accrual_asset 与 exit_cost 两字段 + 一条 rubric 硬规则 | Hamilton Helmer · lenny-skills |
| Can't vs Won't | 护城河耐久性的两问 | lenny-skills v2 competitive-strategy |
| 快照 diff 的方向 | 变化先归三轴(解决方案质量 · 分发覆盖 · 定价)再追问 | 同上的 Chess Move |
| 结论五问的成色 | 每问指定必须挂到的证据类型,挂不上写证据不足 | gstack office-hours 的逼问纪律 |
| 评分锚 | 不满分必须写出「这个产品的满分长什么样」;量尺首次就打满要报失效 | gstack plan-devex-review |
| agent 可调用性 | 轴二加第五维,四个检查项 | aso-audit-mcp 的可读与可用之分 |
| GEO 交接闸 | 命中判据就必须跑第三方版图与 AI 可见度实测,或明写交接 | geo-teardown 八维 · geo-optimizer-skill |
| 抄改清单第三栏与 castle / shack | 前提条件必填,shack 不得当护城河依据 | Helmer 的可模仿性判据 |
| AI 依赖侧写 | model_delta_direction · failure_cost · feedback_capture 三字段 | lenny-skills 的 ai-product-strategy 语料 |
| 试用六档谱系 | 补 premium sampling 与 reverse trial 两档 | pricing-strategy 语料(Albert Cheng · Lauryn Isford) |
| 没借 | 为什么 |
|---|---|
| gstack 的六道 office-hours 逼问全套 | 那是对话式设计,一问一停靠人在现场;本 skill 批量产出报告,硬搬会把报告变成问卷。只取它的纪律,不取它的形式 |
| ASO 的六柱 34 信号 | DNS-AID · x402 · agent cards 这类尚未成为事实标准的信号,对绝大多数目标是空格,且权重带 agent 支付叙事偏向。只取「可读与可用是两件事」这一点 |
| competitive-strategy 的护城河七项 | 与 7 Powers 语义重叠。同一件事有两套枚举,等于没有枚举 |
| 四模式(扩张 / 选择性扩张 / 守范围 / 收缩) | 那是给「自己要动手改的计划」设计的,主语是我方处境;本 skill 拆的是别人的产品,这层已由抄改清单第三栏承载 |
| ICE 打分 | Impact 在拆解语境里是猜测,会造出一堆看着精确其实是编的数字,与「证据不许编」的底线冲突 |
| 47 条可引用性方法的效应量 | 来自论文,不是对被拆产品的实测,写进报告会被当成该产品的收益 |
框架里吸收的外部方法论,都是实战派而非学院派:
- Growth.Design 的 Psych Framework(原文)
- Kyle Poyar 的双轴定价页拆解,含 AI agent 可读性这一新轴
- Baymard 的 AI heuristic evaluation:证据与判断分离
- Userpilot 的 onboarding teardown 指标(TTFV、激活步数、空状态)
- Solvimon 的 AI credits 定价与毛利参照
智子是三体人展开成低维、渗透进任何角落、看穿一切的探测器。 这个 skill 干的是同一件事:展开到产品的每一层,从任何角度看穿它。
MIT License · ai798 Lab