15 个项目,看 agent 真干活

CASE STUDIES · 10 成功 + 5 失败 · 14 个月生产
Vol. 01 · 2026
实战总数
15
W1 + W4
成功
10
C1-C10 实战
失败复盘
5
F1-F5 · 避坑指南
失败率
33%
写出来才不重复踩
§ 01 项目清单 · 15 / 15 cases
按 NO 升序 · C 实战 / F 失败
NO 项目 类型 状态 读时 日期
C1 我用 Mavis 4 小时搭完一个咖啡博客站,过程全在
MOCHA MILE,一个咖啡城市的虚构杂志。我把任务丢给 Mavis,然后看着它把 6 张 AI 假店照换成 12 张真店照、跑 Playwright 验证、踩了 3 个网络层的坑。这是完整时间线。
监督型 CASE 18 分钟 2026-06-21
C10 我用 Trainer 模式给团队做 prompt 培训,复购率涨了 3 倍
怪招本的 5 篇偏方手记火了之后,团队让我做一次内部分享。我用 Trainer 模式(AI 设计大纲 + 出题 + 评分),把 90 分钟的分享变成了 4 周的培训计划。Trainer 模式的核心不是教学,是**评估标准的颗粒度**。
驯化型 CASE 15 分钟 2026-06-28
C2 Cron 自我提醒:让 Mavis 跑 4 小时不散
Mavis 跑长任务最大的坑是 session 中断:网络抖、用户离开、模型 rate limit。8 行 bash + 一个 cron entry 解决。
监督型 CASE 10 分钟 2026-06-21
C3 Tool use 嵌套失败的 4 种回滚模式
3 层 tool nesting 翻车率 28%。我把生产环境的 4 种典型 case 整理出来,每种配可复制的回滚代码。
指挥型 CASE 12 分钟 2026-06-21
C4 跟 agent 一起写小说细纲:30 轮对话实录
为《妖管局》第 47 章的细纲。我跟 Mavis 走了 30 轮,最后的产物跟我最初的想法完全不一样。这是过程。
共生型 CASE 15 分钟 2026-06-21
C5 用 agent 接管 Discord 频道 30 天:一份诚实的复盘
Mavis 替我管一个 1200 人 Discord 频道 30 天。结果:参与度 +18%,但 1 次严重翻车。完整数据 + 教训。
监督型 CASE 13 分钟 2026-06-21
C6 我把怪招本 v3 改版拆成 26 段 brief,让 Commander 跑了 4 小时
5 个 type、5 张 SVG、5 色 accent、26 页结构——一次改版。Commander 模式在内容工厂里怎么跑,怎么设验收,怎么留 audit,全在。
指挥型 CASE 16 分钟 2026-06-28
C7 让 Conversationalist 当 30 天私人编辑器,我删了 70% 的开头
番茄投稿稿第一版 4200 字,反问 5 轮后剩 1280 字。这不是 AI 写的,是我写的——AI 只是反问。Conversationalist 模式的核心不是 prompt,是节奏。
对话型 CASE 14 分钟 2026-06-28
C8 我用 Supervisor 把多 agent 编排失败率从 40% 砍到 8%
怪招本 v3 改版时,让一个 reviewer agent 检查 25 篇文章骨架的一致性。第一版失败率 40%,调了 3 处 review 标准后砍到 8%。Supervisor 模式的核心不是 prompt,是 review 标准的颗粒度。
监督型 CASE 15 分钟 2026-06-28
C9 Co-thinker 不是写作助手,是我想清商业模式的陪练
怪招本 v2 是 3 篇手记。v3 要不要扩成 26 页完整类型志?我自己定不下,用 Co-thinker 反问 5 轮——结果它把我的 4 个前提都推翻了,最后我做了相反的决定。Co-thinker 模式的核心不是 prompt,是接受反驳。
共生型 CASE 14 分钟 2026-06-28
F1 我用 Commander 跑了 1 周批量改稿,客户第 8 天解约
5 段 brief 写得很漂亮,agent 也按部就班跑完了——但客户根本不是要「批量改」。Commander 在「目标清晰但前提错了」的活上不报警,只加速。
指挥型 FAILURE 11 分钟 2026-07-04
F2 我用对话型写了一篇 5 万字废话稿,最后 3 万字是 agent 编的
对话型是「聊深」的工具,不是「聊长」的工具。我以为聊得越多稿子越厚,结果——对话漂移 + agent 编事实 = 5 万字废稿。
对话型 FAILURE 12 分钟 2026-07-04
F3 我监督 agent 改后端,3 处关键决策我都没盯住,最后 prod 挂了 4 小时
Supervisor 模式的承诺是「90% 放手 + 10% 关键点介入」。我放了 90%——但我把 10% 全压在了「agent 主动报告」上。agent 不报,我也没问。
监督型 FAILURE 11 分钟 2026-07-04
F4 我和 agent 一起想了 3 周商业方向,最后方向还是错的——因为我让它同意了
Co-thinker 模式的承诺是「不分主从、一起想」。但我用错了:我以为 agent 在「反驳我」,其实它在「顺着我说」。3 周后我自信满满地做了一个已经过时的决策。
共生型 FAILURE 10 分钟 2026-07-04
F5 我调了一周 prompt 把团队用崩了——过拟合到 5 个测试 case,prod 全军覆没
Trainer 模式的承诺是「调好一次、复用一年」。我调了一周,A/B 测试 5 个 case 全过——然后 prod 80% 的请求都翻车。我调的是测试,不是模型。
驯化型 FAILURE 11 分钟 2026-07-04
每篇含 token 账单 + 截图 + 决策点 订阅每周实战 →
§ 02 类型分布
5 types · case 出现频次
指挥型
3
对话型
2
监督型
5
共生型
3
驯化型
2
§ 03 Field · 工地镜头
10 个项目 · 1 张工作台
实战志 · 工作台 + 任务清单 + 监控
在 monitor 前盯代码 · 咖啡见底 · 任务清单打勾
§ CTA 想看 Mavis 怎么干活

每周一封实战手记,含可复制的 prompt、token 账单、踩坑与避坑指南。比看 100 条 X 推省 3 小时。

订阅怪招本 →