15 个项目,看 agent 真干活。
CASE STUDIES · 10 成功 + 5 失败 · 14 个月生产
实战总数
15篇
W1 + W4
成功
10篇
C1-C10 实战
失败复盘
5篇
F1-F5 · 避坑指南
失败率
33%
写出来才不重复踩
§ 01 项目清单 · 15 / 15 cases
按 NO 升序 · C 实战 / F 失败
| NO | 项目 | 类型 | 状态 | 读时 | 日期 |
|---|---|---|---|---|---|
| C1 | 我用 Mavis 4 小时搭完一个咖啡博客站,过程全在 MOCHA MILE,一个咖啡城市的虚构杂志。我把任务丢给 Mavis,然后看着它把 6 张 AI 假店照换成 12 张真店照、跑 Playwright 验证、踩了 3 个网络层的坑。这是完整时间线。 | 监督型 | CASE | 18 分钟 | 2026-06-21 |
| C10 | 我用 Trainer 模式给团队做 prompt 培训,复购率涨了 3 倍 怪招本的 5 篇偏方手记火了之后,团队让我做一次内部分享。我用 Trainer 模式(AI 设计大纲 + 出题 + 评分),把 90 分钟的分享变成了 4 周的培训计划。Trainer 模式的核心不是教学,是**评估标准的颗粒度**。 | 驯化型 | CASE | 15 分钟 | 2026-06-28 |
| C2 | Cron 自我提醒:让 Mavis 跑 4 小时不散 Mavis 跑长任务最大的坑是 session 中断:网络抖、用户离开、模型 rate limit。8 行 bash + 一个 cron entry 解决。 | 监督型 | CASE | 10 分钟 | 2026-06-21 |
| C3 | Tool use 嵌套失败的 4 种回滚模式 3 层 tool nesting 翻车率 28%。我把生产环境的 4 种典型 case 整理出来,每种配可复制的回滚代码。 | 指挥型 | CASE | 12 分钟 | 2026-06-21 |
| C4 | 跟 agent 一起写小说细纲:30 轮对话实录 为《妖管局》第 47 章的细纲。我跟 Mavis 走了 30 轮,最后的产物跟我最初的想法完全不一样。这是过程。 | 共生型 | CASE | 15 分钟 | 2026-06-21 |
| C5 | 用 agent 接管 Discord 频道 30 天:一份诚实的复盘 Mavis 替我管一个 1200 人 Discord 频道 30 天。结果:参与度 +18%,但 1 次严重翻车。完整数据 + 教训。 | 监督型 | CASE | 13 分钟 | 2026-06-21 |
| C6 | 我把怪招本 v3 改版拆成 26 段 brief,让 Commander 跑了 4 小时 5 个 type、5 张 SVG、5 色 accent、26 页结构——一次改版。Commander 模式在内容工厂里怎么跑,怎么设验收,怎么留 audit,全在。 | 指挥型 | CASE | 16 分钟 | 2026-06-28 |
| C7 | 让 Conversationalist 当 30 天私人编辑器,我删了 70% 的开头 番茄投稿稿第一版 4200 字,反问 5 轮后剩 1280 字。这不是 AI 写的,是我写的——AI 只是反问。Conversationalist 模式的核心不是 prompt,是节奏。 | 对话型 | CASE | 14 分钟 | 2026-06-28 |
| C8 | 我用 Supervisor 把多 agent 编排失败率从 40% 砍到 8% 怪招本 v3 改版时,让一个 reviewer agent 检查 25 篇文章骨架的一致性。第一版失败率 40%,调了 3 处 review 标准后砍到 8%。Supervisor 模式的核心不是 prompt,是 review 标准的颗粒度。 | 监督型 | CASE | 15 分钟 | 2026-06-28 |
| C9 | Co-thinker 不是写作助手,是我想清商业模式的陪练 怪招本 v2 是 3 篇手记。v3 要不要扩成 26 页完整类型志?我自己定不下,用 Co-thinker 反问 5 轮——结果它把我的 4 个前提都推翻了,最后我做了相反的决定。Co-thinker 模式的核心不是 prompt,是接受反驳。 | 共生型 | CASE | 14 分钟 | 2026-06-28 |
| F1 | 我用 Commander 跑了 1 周批量改稿,客户第 8 天解约 5 段 brief 写得很漂亮,agent 也按部就班跑完了——但客户根本不是要「批量改」。Commander 在「目标清晰但前提错了」的活上不报警,只加速。 | 指挥型 | FAILURE | 11 分钟 | 2026-07-04 |
| F2 | 我用对话型写了一篇 5 万字废话稿,最后 3 万字是 agent 编的 对话型是「聊深」的工具,不是「聊长」的工具。我以为聊得越多稿子越厚,结果——对话漂移 + agent 编事实 = 5 万字废稿。 | 对话型 | FAILURE | 12 分钟 | 2026-07-04 |
| F3 | 我监督 agent 改后端,3 处关键决策我都没盯住,最后 prod 挂了 4 小时 Supervisor 模式的承诺是「90% 放手 + 10% 关键点介入」。我放了 90%——但我把 10% 全压在了「agent 主动报告」上。agent 不报,我也没问。 | 监督型 | FAILURE | 11 分钟 | 2026-07-04 |
| F4 | 我和 agent 一起想了 3 周商业方向,最后方向还是错的——因为我让它同意了 Co-thinker 模式的承诺是「不分主从、一起想」。但我用错了:我以为 agent 在「反驳我」,其实它在「顺着我说」。3 周后我自信满满地做了一个已经过时的决策。 | 共生型 | FAILURE | 10 分钟 | 2026-07-04 |
| F5 | 我调了一周 prompt 把团队用崩了——过拟合到 5 个测试 case,prod 全军覆没 Trainer 模式的承诺是「调好一次、复用一年」。我调了一周,A/B 测试 5 个 case 全过——然后 prod 80% 的请求都翻车。我调的是测试,不是模型。 | 驯化型 | FAILURE | 11 分钟 | 2026-07-04 |
每篇含 token 账单 + 截图 + 决策点 订阅每周实战 →
§ 02 类型分布
5 types · case 出现频次
指挥型
3
对话型
2
监督型
5
共生型
3
驯化型
2
§ CTA 想看 Mavis 怎么干活?
每周一封实战手记,含可复制的 prompt、token 账单、踩坑与避坑指南。比看 100 条 X 推省 3 小时。
订阅怪招本 →