首页 决策 N° D4
D4 decision · 决策周 W5
A ?
·
B ?

这个活该派哪个 type —— 9 维度选型矩阵(D1-D3 升级版)

verdict ?

D1 给了 5 个信号让你判断 Commander;D2/D3 给了两两对比;M1 给了 5-stage 接力时间轴。但 14 个月跑下来发现:判断 type 真正难的不是「这个活是不是指挥型」——是「这个活在 9 个维度上分别得多少分」。这一篇把 9 维度 × 5 type = 45 个数据点摆出来,每维度 1-5 分,配 5 个真实项目跑分复盘,最后给一份 3 步选型流程。

2026-07-23 · 16 分钟阅读 阅读 · W5 · DECISION

这个活该派哪个 type —— 9 维度选型矩阵(D1-D3 升级版)

D1 写了 5 个”该选 Commander”的信号,D2/D3 写了”对话型 vs 共生型”、“监督型 vs 驯化型”。M1 写了 5-stage 接力。读到这里你以为够用了——但 14 个月里我接了 11 个新活,4 个用 D1-D3 选错了 type。

错的原因:4 个维度不够。一个活的”该派哪个 type”至少要看 9 个维度——D1-D3 给的是”是 / 否”判断,但工程活经常是”是 70% / 不是 30%“的灰度。

这一篇把 9 维度 × 5 type 的 45 个数据点全部摆出来——每维度 1-5 分。打分依据来自 14 个月生产环境的真实账本(不是理论推测)。

为什么 D1-D3 不够

D1 给了 5 个”该选 Commander”的信号:

  1. 目标清晰
  2. 边界明确
  3. 结果可量化
  4. 不需要中途决策
  5. 时间可预估

问题:第 1、2 条满足 ≠ 该选 Commander。我有个项目”把 30 章细纲拆成 100 章节目标”——目标清晰、边界明确、可量化,但 Co-thinker 比 Commander 跑得好。

根因:D1-D3 用”5 个二元信号”判断——一个活很少同时是 5 个 yes 或 5 个 no,经常 3 yes + 2 no。这时 D1-D3 没法告诉你哪个 type 更合适。

D4 怎么做:从 14 个月生产环境提取 9 个连续变量(不是 yes/no),每个 type 在每个变量上打分。打分结果不是判断”该选哪个”,是判断”哪个最 match + 哪个最 mismatch”。

9 维度设计逻辑

不是凭空拍脑袋。9 维度来自 14 个月里 11 个新活的”事后归因”——项目跑完之后回头看,真正影响 type 选型的不是”目标清不清”,是 9 个连续变量

9 维度一览

#维度1 分端5 分端
1预算几十 token几十万 token
2时长< 1 小时> 1 周
3上下文1k 字内100k+ 字 corpus
4可逆性出错随时回滚出错 = 全部重来
5不确定性brief 100% 清晰边跑边发现边界
6中继性必须一次性跑完可以分阶段切 type
7监督成本跑完看一眼全程盯每 5 分钟
8出错代价错了无所谓错了 prod 崩
9复用性一次性产出跑通一次复用一年

每个维度都是连续可观测的——你接到一个活,写 1 行 brief 就能填这 9 个分。

9 维度 × 5 type 主表(45 数据点)

维度 \ typeCommanderConversationalistSupervisorCo-thinkerTrainer
1. 预算41335
2. 时长41425
3. 上下文41445
4. 可逆性25231
5. 不确定性14151
6. 中继性15331
7. 监督成本14344
8. 出错代价51335
9. 复用性41335
平均2.92.62.93.33.4

怎么读这张表

  • 每行 = 一个维度。每个 type 在这个维度上得 1-5 分。
  • 每列平均 = 该 type 综合适配度(粗略)。
  • 看 5 分 / 1 分的”对位”:Commander 预算 4(费)但监督成本 1(省)—— 1 小时的 brief 砸几万 token,你 1 天不用看。
  • 看”中位 type”:Co-thinker 平均 3.3、Trainer 3.4——这是因为这俩是”加工型” type,需要在多维度上同时工作。
  • 看”极端 type”:Conversationalist 平均 2.6 最低——但监督成本 4 出错代价 1——它就是”低风险试错”的代表。

重要:平均分是选型依据。选型依据是看你这个活在每个维度的分 vs type 的分——见下面的 3 步流程。

9 维度对照雷达图(5 type 重叠)

雷达图太长放不下,文字版:

              预算

        5     |     4
     Co-thkr | Cmndr
        ┌────┴────┐
   监督 ←┤ 复用  ├→ 时长
        └────┬────┘
    Convers | Suprvsr | Trainer

            出错代价
  • Commander 高峰:预算(4) 时长(4) 上下文(4) 出错(5) 复用(4)
  • Conversationalist 高峰:可逆(5) 中继(5) 不确定(4) 监督(4)
  • Supervisor 高峰:时长(4) 上下文(4) 平衡型
  • Co-thinker 高峰:上下文(4) 不确定(5) 监督(4) 唯一在 5 个维度都≥3
  • Trainer 高峰:预算(5) 时长(5) 上下文(5) 出错(5) 复用(5) — 极端专业型

关键观察:Co-thinker 是”唯一在不确定性维度打到 5 的 type”——这意味着如果你的活是”边想边发现边界”,Co-thinker 比其他 4 个 type 都 match。

5 个真实项目跑 9 维度(实战复盘)

项目 ①:30 章细纲拆 100 章节目标(D1-D3 会选错)

brief:把 30 章细纲(已写好)拆成 100 章章节级目标,每章 3000 字。

9 维度打分(事前):

  • 预算 4 / 时长 4 / 上下文 4 / 可逆 2 / 不确定 2 / 中继 1 / 监督 1 / 出错 5 / 复用 4

D1-D3 选型:5 个信号都 yes → Commander 实际跑:Commander 跑了 4 小时产出了 100 章,但没有人物弧光——每章都是”做 X 学 Y”的清单。

改 D4 选型:可逆 2 错了——拆完才发现 80 章不可逆改。9 维度真实分 = 可逆 4

D4 重打分:可逆 4 + 不确定 3(实际边界不清)+ 监督 1 + 出错 5 = Co-thinker 匹配度 3.3 > Commander 2.9实际跑 Co-thinker:拆细纲前用 5 轮反问”人物弧光”——每章拆完都问”这章让主角变了什么”——产出的 100 章有弧光

教训:D1 的”边界明确”是事后诸葛;事前判断”可逆性”用 D4 的 9 维度比 D1 的二元信号准。

项目 ②:番茄投稿 4 章 1.2 万字

brief:4 章 1.2 万字,番茄投稿风格。

9 维度打分

  • 预算 2 / 时长 3 / 上下文 3 / 可逆 4 / 不确定 2 / 中继 3 / 监督 2 / 出错 3 / 复用 2

D4 选型:预算 2 + 时长 3 + 监督 2 = Commander (4+4+1=9) vs Conversationalist (1+1+4=6) → Commander 赢。 实际跑:Commander 4 章一次跑完,反复读了 1 遍就投了。

项目 ③:M1 5-stage 接力 4 周

brief:4 周把怪招本 v3 改版跑通 5 个 type 接力。

9 维度打分

  • 预算 5 / 时长 5 / 上下文 5 / 可逆 1 / 不确定 4 / 中继 5 / 监督 3 / 出错 5 / 复用 5

D4 选型:5 type 接力 → 没有单一 type match真实解法:M1 写了 5-stage 接力表(Supervisor 5+1+1+1+1=9 起始 → Conversationalist 4 → Co-thinker 3+4+5=12 → Supervisor 9 → Trainer 5+5=10)——接力是多 type 加权而不是单 type。

项目 ④:5 个失败案例 F1-F5 复盘

brief:5 个真实跑翻车的项目复盘 + 教训。

9 维度打分

  • 预算 2 / 时长 2 / 上下文 3 / 可逆 5 / 不确定 1 / 中继 5 / 监督 1 / 出错 1 / 复用 4

D4 选型:可逆 5 + 监督 1 + 中继 5 = Conversationalist (5+4+5=14) 完胜 Commander (2+1+1=4)实际跑:Conversationalist 模式跑了 5 篇,每篇 5 轮反问”为什么这次会翻车”——比 Commander 一次跑好得多。

项目 ⑤:把怪招本 26 页全栈跑通

brief:1 个项目 1 周跑通 Astro 4.16 + 26 个页面 + 5 type color + 5 section 路由。

9 维度打分

  • 预算 5 / 时长 5 / 上下文 5 / 可逆 1 / 不确定 3 / 中继 2 / 监督 2 / 出错 5 / 复用 5

D4 选型:5+5+5 vs Commander (4+4+4=12) — Trainer 5+5+5=15 完胜实际跑:Trainer 模式先把”26 页结构”训成 system prompt 模板,然后 5 段 brief 跑 5 个 section——1 周跑通 26 页,错率 8%。

5 type 的「性格侧写」(看完表还要看的)

主表是数据,侧写是手感。每个 type 有自己的”性格”——这是 14 个月里我分别用 5 种 type 跑了 5 个不同项目后总结的:

Commander ·「任务狂人」

5 段 brief → 4 小时 → 100 章产物。不会问”为什么”,只问”什么时候要”

性格:目标驱动、流程清晰、不喜欢被打断、对模糊 brief 极度敏感(会瞎跑)。 口头禅:「做完了。下一步。」、「brief 不够清晰我重做?」、「这个 brief 写得很漂亮我立刻跑」。 典型 1 周 schedule:1 天写 brief + 4 天等结果 + 2 天 review。 风险:跑完才发现 brief 写错了(“我做的不是你要的”——F1 复盘)。 适合的人:写 brief 能力 > 写 prompt 能力、目标清晰的项目负责人、批量化生产。

Conversationalist ·「陪聊学者」

一问一答,5 轮反问,1 个新想法。不会先做,会先听

性格:好奇、慢热、节奏感强、能在反问中找到你没想清楚的地方。 口头禅:「你确定吗?」、「这个我得问几个问题才能答」、「为什么不是 X?」、「嗯……让我想想」。 典型 1 周 schedule:每天 30 分钟对话,累计 2-3 小时产 1 篇。 风险:对话漂移(“聊着聊着跑题”——F2 复盘)、不能复用(一次性对话)。 适合的人:写不了 brief 但知道”问题在哪”、需要对话厘清模糊目标、写小说 / 反思 / 决策。

Supervisor ·「守门员」

4 个 checkpoint,每个盯 1 次。不替你跑,替你检查

性格:守规矩、敢打断、能在 4 个关键节点发现 agent 跑偏。 口头禅:「这一步我得停一下看看」、「不对,你刚才说的是 Y 现在做的是 Z」、「这里我得 review」、「OK 继续」。 典型 1 周 schedule:跟 agent 同步跑,每 25% 进度停 1 次 review。 风险:监督点设错(“我放了 90% 但 10% 都压在了 agent 主动报告”——F3 复盘)。 适合的人:多 agent 编排 / 后端代码 / 任何”错了 1 个就 prod 崩”的事。

Co-thinker ·「平等的陪练」

5 轮反驳,3 轮接受,2 轮我改方向。不分主从、一起想

性格:敢说”我不同意”、接受反驳、能从你的 brief 里挖出”你没写出来的前提”。 口头禅:「你这个前提是什么?」、「如果反过来呢?」、「你确定要 X 不是 Y?」、「我同意这一点,剩下 3 点我有不同看法」。 典型 1 周 schedule:3 天对话 + 2 天执行。 风险:用错成 Conversationalist(agent 顺着你说——F4 复盘)。 适合的人:商业决策 / 战略 / 任何”想清比做快”的活。

Trainer ·「调教师」

4 周调 1 次,1 年复用。不替你跑,替你建”机器”

性格:偏执、追求一致性、能在 5 个测试 case 上调到 100% 但 prod 翻车。 口头禅:「这个 case 我没覆盖到」、「训练集 vs 生产集分布不一样」、「先标评测标准再调」、「调 1 周 = 1 年不调」。 典型 1 周 schedule:3 天设计评测标准 + 1 周调 prompt。 风险:过拟合到测试集(“5 个 case 全过 prod 80% 翻车”——F5 复盘)。 适合的人:重复性高的活(团队 prompt / 客服标准话术 / 报告模板)、想”一劳永逸”。

3 步选型流程

Step 1:写 brief 时顺手填 9 维度

接到一个活,写 1 行 brief 后追加 9 维度打分

# Brief
1. 输入:[产出物]
2. 时长:[预算小时数]
3. 失败代价:[跑坏的损失]

# 9 维度(1-5)
- 预算 [N]
- 时长 [N]
- 上下文 [N]
- 可逆性 [N]
- 不确定性 [N]
- 中继性 [N]
- 监督成本 [N]
- 出错代价 [N]
- 复用性 [N]

Step 2:9 维 vs 5 type 算”距离”

每个 type 算出”加权距离”(按 9 维度权重):

distance(type) = Σ |你的分 - type分| × 权重

距离最小的 type = 最 match。

默认权重(可调):

  • 预算 0.5 / 时长 0.7 / 上下文 0.8 / 可逆 1.5 / 不确定 1.5 / 中继 1.0 / 监督 1.2 / 出错 1.5 / 复用 0.7

可逆 / 不确定 / 出错 权重高——这 3 个维度错一个就翻车。)

Step 3:跑 + 记录 + 回收

跑完别忘填”事后分”——你跑之前打的事前分 vs 实际跑之后的事后分,差值 = 你的判断偏误

回收表(每跑 1 个活记 1 行):

项目事前分事后分差值type
30 章拆 1002.93.3-0.4 (Co-thinker 更 match)Commander→Co-thinker
番茄 4 章2.92.90Commander ✓
M1 5-stage3.43.5-0.1接力 ✓
F1-F5 复盘2.62.60Conversationalist ✓
26 页全栈3.43.5-0.1Trainer ✓

14 个月统计:D4 选型准确率从 D1-D3 的 64% 提到 89%——25 个项目跑下来,22 个事前分 ± 0.3 内,3 个偏差超过 ± 0.3 都是”事前分打错”(不是 D4 矩阵错)。

复现

# 1. 接到活写 brief + 9 维度打分
# 2. 算 5 type 加权距离
python scripts/type-distance.py --brief brief.md

# 输出:Commander 1.8 / Conversationalist 3.2 / Supervisor 2.1 / Co-thinker 1.3 / Trainer 2.5
# → Co-thinker 距离最小 = 选 Co-thinker

# 3. 跑 + 事后分
# 4. 回收表 append 一行

3 步流程的 3 个反模式

跑 D4 的 14 个月里我踩过 3 个反模式——给你提个醒:

反模式 1:「9 维度我估不准」

症状:写 9 维度时反复改分,每个维度想 5 分钟。 修法前 3 个维度(预算 / 时长 / 上下文)用真实数据(token 数预估、小时数、字符数);后 6 个维度(可逆/不确定/中继/监督/出错/复用)用 gut feeling 1-3 分钟打完。D4 矩阵对前 3 维敏感度低——前 3 维估错了 ±1 分,距离变化 < 0.3。 核心原则打分 5 分钟 vs 跑活 4 小时——打分快一些值得。

反模式 2:「5 个 type 距离都在 0.3 内」

症状:5 个 type 距离分别是 1.2 / 1.3 / 1.4 / 1.4 / 1.5——你不知道选哪个。 修法这种活就不该用 D4 选——它说明你的活是”通用型”(5 个 type 都能跑),直接选 Conversationalist(成本最低、出错代价最低、监督成本中等)。Conversationalist 跑 30 分钟如果是死路,再切别的 type。 核心原则当 D4 算不出来的时候,Conversationalist 是 fallback

反模式 3:「跑完忘了填事后分」

症状:回收表 3 个月只填了 3 行——选型准确率统计没数据。 修法用 cron self 强制——参考 T10「seo-weekly-audit」cron 模式,写个 type-audit-recall 每周一推”上周跑了几个活?回收表填了吗?” 核心原则D4 矩阵只是工具,回收表才是 D4 矩阵能进化的源数据——没回收表,D4 永远是初始版本。

14 个月账本(D4 矩阵 ROI)

阶段项目数选型准确率翻车率平均 token 浪费/项目
D1-D3 阶段1864% (12/18)33% (6/18)1.8 万 token
D4 阶段(前 25 个)2589% (22/25)8% (2/25)0.4 万 token
节省+25 pp-25 pp-1.4 万 token/项目

25 个项目 × 1.4 万 token = 35 万 token 节省 ≈ ¥350——D4 矩阵值 350 块 + 1 个月的翻车坑。

关键 takeaway

  • 9 维度 > 5 个二元信号:D1-D3 适合 64% 的活,D4 89%
  • 可逆 / 不确定 / 出错 3 个维度权重最大(1.5x)——这 3 个错一个就翻车
  • 距离最小 ≠ 选这个 type:还要看”距离差距”——5 个 type 距离都在 0.5 内说明”随便选都行”
  • Co-thinker 是”中位 type”:5 维度 ≥3,唯一在”不确定”维度打到 5
  • Trainer 是”极端专业型”:5 维度 5 分(5/5/5/5/5),但只在”复用性高 + 上下文大”时 match
  • 3 步选型:写 9 维度 → 算距离 → 跑 + 回收
  • 回收表 > D4 矩阵本身——你的偏误才是真实”私人化”数据

D1 给了 5 个 yes/no 信号;D2/D3 给了两两对比;M1 给了 5-stage 接力;D4 给了量化打分。下一步 D5 准备写”接力权重表”——5 type 加权时怎么给每个维度不同的权重。

配套

  • D1 · 该选 Commander 的 5 个信号 — D4 是 D1 的量化版
  • D2 · 对话型 vs 共生型 — D4 的”不确定”维度
  • D3 · 监督型 vs 驯化型 — D4 的”可逆性 + 出错代价”维度
  • M1 · 5 种用法的混合 — D4 是单 type 选型;M1 是多 type 接力
  • T10 · Mavis cron self 1 周省 4 小时 — 跟 D4 一起看:cron self 帮你自动跑”事后分回收表”
DECIDED

怪招本 · W5 · 决策周