我把「改变人生」提示词真跑了一遍:82 天、409 场会话,记录替我照了面镜子
2026-09-20
前段时间外网在传一条叫 GPT-Astra 的提示词。原文说它 24 小时拿了 32.6 万阅读。
它最适合三类人:AI 项目开了一堆却不知道哪条线值得继续的;每天忙得停不下来但说不清自己沉淀了什么的人;想认真复盘又不想最后得到一堆性格分析和鸡汤的人。
我把它真跑了一遍——不是让 AI 夸我,而是让它去翻我自己的记录。
跑完之后,我对着屏幕坐了很久。不是因为被说中了什么玄乎的东西,是因为它给的每一条都有日期。
先说它要求什么,再说结果
这条提示词跟常见的复盘模板最大的区别是:它规定了 AI 什么时候必须闭嘴。
原话是「让证据限制结论」。它给了几条硬约束:
- 日志只是碎片,不等于完整的我。不要诊断我,不要臆测动机,也不要把一段时间没有记录理解成我已经放弃
- 只有同一种模式至少出现在 3 个不同会话中,才可以认定为模式。引用带日期的证据,同时主动寻找反例,并明确说明不确定性
- 严格区分「我实际做过的事情」和「AI Agent 声称已经完成的事情」
- 所有时间或效率估算都必须说明依据。不能仅凭时间戳判断投入程度、工作质量或真实耗时
- 不要强行制造”顿悟”或戏剧性的结论
它一共六步:挖掘 → 提炼 → 访谈 → 镜像 → 杠杆 → 沉淀。第一步只允许看元数据,不许读对话正文;拿到了批准才进第二步。
所以下面每一条结论,我都能指到具体日期和具体数字。没有一条是我”感觉”出来的。
数据底盘
翻的是本机 AI 工作记录,时间窗 2026 年 7 月 1 日到 9 月 20 日。
| 项目 | 数值 |
|---|---|
| 会话 | 409 场 |
| 工作区目录 | 273 个 |
| 我的真实发言 | 2001 条 |
| 机器动作(工具调用) | 18563 次 |
| 数据量 | 455.8 MB |
| 有记录的天数 | 82 天里的 76 天 |
平均每天开 5 场新会话。工具调用和我的发言之比是 9.3 : 1——我说一句,机器跑九趟。
发现一:我以为我在”管项目”,其实我在”开窗口”
这是最刺眼的一条。
| 我的发言轮次 | 会话数 | 占比 |
|---|---|---|
| 只有 1 条 | 230 | 56.2% |
| 2 条 | 72 | 17.6% |
| 3–5 条 | 49 | 12.0% |
| 6–10 条 | 27 | 6.6% |
| 11 条以上 | 31 | 7.6% |
73.8% 的会话,我说不超过两句话就结束了。
273 个工作区对应 409 场会话——平均每个工作区活不到两场对话。
我的心理感受是”我同时在推十几条线”。记录说的是另一回事:我开了很多窗口,绝大多数在第二句话之后就没再打开过。
发现二:真正决定成败的,是我跟到第几轮
这条是全部数据里最干净的一条。它呈现出一条单调上升的曲线:
| 我发言的轮次 | 会话数 | 产出了交付物 | 交付率 |
|---|---|---|---|
| 1 条 | 230 | 122 | 53.0% |
| 2 条 | 72 | 45 | 62.5% |
| 3–5 条 | 49 | 37 | 75.5% |
| 6–10 条 | 27 | 25 | 92.6% |
| 11 条以上 | 31 | 27 | 87.1% |
换算一下:1–2 轮就撒手的会话,交付率 55.3%;跟到 6 轮以上的,交付率 89.7%。
产出交付物的会话,平均我说 6.7 条;零产出的会话,平均我说 1.9 条。而零产出的那 153 场里,88.2% 只有不超过 2 条发言。
这条曲线不好看,但它是好消息。因为它说明问题不在工具,不在我选的模型,不在我做的事太多——在我跟到第几轮。
AI 不是”给一句话就出成品”的机器。它是”你不撒手,它就能落地;你一撒手,它就停在半成品”的机器。
我过去三个月最大的浪费,不是做错了什么,是起头之后没跟到底。
发现三:超过一半的产出,来自 10% 的会话
单场产出 3 个以上交付物的会话,一共 42 场——占 10.3%。
它们承载了 230 / 428 = 53.7% 的全部产出。
最高的一场在 7 月 11 日,一条关于视频化演示流程的会话:79 条发言、602 次机器动作、40 个交付物。
第二梯队是 7 月 22 日(13 个)、8 月 26 日(12 个)、7 月 29 日(10 个)。
这不是”二八定律”,这比二八更极端。
它同时说明两件事:我没有必要均匀地对待每一场会话;以及那些真正产出多的会话,都是我待得最久的那几场。跟发现二是同一件事,从另一个角度量出来的。
发现四:我把 43% 的工作放在了凌晨
按我第一次发言的时间统计:
| 时段 | 会话数 | 占比 |
|---|---|---|
| 深夜 00:00–06:00 | 177 | 43.3% |
| 上午 06:00–12:00 | 171 | 41.8% |
| 下午 12:00–18:00 | 52 | 12.7% |
| 晚间 18:00–24:00 | 9 | 2.2% |
02:00 是全天最高峰,65 场。
看到这个数字我第一反应是”这肯定是在硬熬”。然后我去找反例,结果打了自己的脸——这是第三个反例,下面会说。
发现五:我反复跑的不是项目,是同一条流水线
提示词定的判据是「同一种模式至少出现在 3 个不同会话中,才算模式」。
我按这个判据跑了 11 个主题,结果没有一个落选——全部跨 3 个月反复出现:
| 主题 | 出现在多少场会话 | 活跃天数 |
|---|---|---|
| 知识库相关 | 171 | 62 |
| 演示文稿/PPT | 158 | 52 |
| 技能/Skill | 129 | 48 |
| 发布上线 | 105 | 45 |
| 公众号运营 | 83 | 41 |
| 会议与转写 | 78 | 43 |
| 调研/选品 | 72 | 49 |
| 微信/桌面自动化 | 63 | 42 |
| 接口开发 | 57 | 36 |
| 数据/报表 | 56 | 33 |
| 短视频生产 | 47 | 34 |
这可能是整份报告里最反直觉的一页。
我一直以为自己的状态是”AI 项目开了一堆,不知道哪条该继续”。数据的回答是:你不是项目开太多,你是同一条流水线重跑了三个月,每次都是从头。
拿”文档 → 演示 → 视频”这条线举例:7 月起头,8 月重来,9 月又重来。每一次都像新项目,因为每一次都真的从零开始——上一轮的资产没被沉淀成下一次能直接调用的东西。
这才是”说不清自己沉淀了什么”的准确说法:不是没沉淀,是沉淀没有回流。
发现六:九月我的摩擦率翻了一倍
我把”我说的话里带着摩擦”的句子挑出来数了一遍:
| 我说的话属于哪种 | 次数 | 占比 |
|---|---|---|
| 要求验证(确认、核实、别编) | 115 | 5.7% |
| 催进度(继续、接着、还没) | 105 | 5.2% |
| 要求重做(重新、改成、返工) | 88 | 4.4% |
| 追问根因(为什么、到底) | 79 | 3.9% |
| 否定纠错(不对、错了、你没) | 59 | 2.9% |
| 报告失败(没成功、还是不行) | 18 | 0.9% |
| 主动放弃(算了、先这样) | 14 | 0.7% |
按月份看:
- 7 月:21.5%
- 8 月:17.1%
- 9 月:35.0%
九月翻倍。
同期还有两条反向变化,我觉得比摩擦率本身更值得看:
一是任务拆解习惯的衰减。让我列任务、更新任务状态的次数,从 7 月的 306 次掉到 9 月的 66 次,只剩五分之一。
二是动作结构的变化。搜索类动作从 134 涨到 401(三倍),直接跑命令的动作 9 月是全期最高,而”读文件、改文件、写文件”这三样全线下降。
翻译成人话:我越来越像是在”用命令行救火”,越来越不像在”有结构地推进工作”。
我必须把这句话标清楚:这是两个变量同向变化,不是因果结论。 9 月项目本身变复杂了、集成的东西变多了,完全可能是外因。这条属于待验证,不是结论。
三个反例:我自己的直觉错在哪
提示词明确要求「主动寻找能够推翻当前判断的证据」。我找到了三条,每条都在打我自己。
反例一:短会话也能一次交付。 9 月 2 日有一场,我只说了 2 句话,产出 4 个交付物。7 月 30 日有一场 3 句话、4 个交付物。 所以”轮次少=无效”是不成立的。准确的说法是:任务已经定义清楚时,短会话是最好的形态;任务还模糊时,短会话就是浪费。区别在于我起头的时候,问题是想清楚了还是没想清楚。
反例二:凌晨不是低产区,我冤枉了自己。 深夜 00:00–05:00 启动的会话,交付率 68.9%。上午 64.9%。而下午只有 32.7%,平均发言仅 2.5 条。 我本以为要检讨”熬夜导致效率低”。数据说:凌晨反而是我一天里最专注、最能落地的时间段。真正低产的是下午——那是被临时插单和碎片沟通切碎的时段。 所以这里要改的问题不是”别熬夜”,是”别把需要连续推进的事放在下午”。
反例三:最长的会话不是最有效的。 跟到 11 轮以上的会话,交付率 87.1%,低于 6–10 轮那组的 92.6%。 说明有一部分长会话不是”持续产出”,而是”在同一个坑里反复折腾”。长会话里要能分辨:我是在推进,还是在原地打转。
三个 30 天实验
提示词第五步要求:最多选 3 个最值得改的地方,目标只能是——消除无效投入、把重复劳动交给自动化、保护真正有长期价值的工作。每个都要设计成 30 天实验,写清第一个具体行动、成功衡量指标、关键假设。
实验一:把”起个头”变成”跟到底”
针对的证据:1–2 轮会话占 73.8%,交付率只有 55.3%;6 轮以上交付率 89.7%。
第一个具体行动:从明天起,每天只允许自己新开 3 个工作区。开新的之前,必须先处理掉当天最旧的那个未完成会话——要么推进到有交付物,要么明确写下”为什么停”。
成功衡量指标:30 天后,1–2 轮会话的占比从 73.8% 降到 60% 以下;6 轮以上的会话交付率保持在 89% 以上。
关键假设:我的产出瓶颈是”并发太多”而不是”单个任务太难”。如果实验后交付率没变、只是总量下降了,说明假设错了。
实验二:把凌晨留给原创,把下午还给流程
针对的证据:深夜交付率 68.9%,下午仅 32.7%。
第一个具体行动:给下午立一条硬规则——下午不启动需要连续推进的新任务,只做机械性的、可以被打断的、定义清楚的事(批量处理、格式化、核对、发送)。
成功衡量指标:下午会话的平均发言轮次从 2.5 提到 4 以上;下午时段的”要求重做/报告失败”类发言占比下降到全期平均以下。
关键假设:下午的低产是”时段被打碎”造成的,不是”我下午状态差”。区分方法:看下午的长会话(>30 分钟)交付率是否仍然低——如果低,就是状态问题,假设被推翻。
实验三:让沉淀回流,而不是每次从零开始
针对的证据:11 个主题全部跨 3 个月反复出现;同一条”文档→演示→视频”线三个月各起一次头。
第一个具体行动:以后每一次做完一条流程,必须交付两样东西——成品,以及一份能被下一次直接调用的资产。后者包括:这条流程的固定步骤、踩过的坑、可复用的模板或技能。写不进这两样的,不算这条流程做完。
成功衡量指标:30 天内,同一条主题线第二次启动时的会话轮次,比第一次降低 30% 以上(因为有资产可复用,不需要重新摸)。如果轮次没降,说明沉淀的形态不对——写成文档是没用的,必须做成能直接跑的东西。
关键假设:我反复重跑同一条流水线,是因为缺”可复用资产”,不是因为”每次需求都不一样”。反驳方式:抽查三条复现最多的主题线,看第二次的差异到底是本质不同,还是只是我当时忘了上次怎么做的。
关于这条我要补一句:这个实验的方向是”把重复劳动交给自动化”,不是为了多产出,是为了保护那些真正有长期价值的工作——那些需要我本人判断、别人替代不了的事。三个月的数据里,我看不出哪些时间花在了这类事上。这是最需要被保护、也最容易被挤掉的部分。
五个待验证的假设(这一步我不替你回答)
提示词第三步要求”提出最多 5 个待验证假设,每次只问一个中性问题,等回答后再继续”。我把它跑成了自问自答的形式——下面这 5 条,我目前没有答案,只有数据。
1–2 轮就撒手的会话,是因为任务本来就不重要,还是因为我不知道下一步该问什么? 数据支持后半句:其中有相当一部分,指令只有几个字。
我把 43% 的工作放在凌晨,是因为白天被打断,还是因为我在用凌晨逃避白天的协同? 数据支持前半句(下午交付率仅 32.7%),但无法排除后者。
九月摩擦率翻倍,是项目复杂度上升的必然代价,还是我的任务拆解习惯崩了? 两个变量同向变化,无法区分。
42 场高产出会话承载了 53.7% 的产出——这几场是”我的核心工作”,还是”恰好没被打断的那几场”? 这是这份报告里最重要、也最难回答的一条。如果是后者,那我要改的不是优先级,而是保护连续时间。
2001 条发言换来的 428 个交付物里,有多少真正被用上了? 数据不覆盖这一层。本轮完全无法回答。 这是最大的盲区——我只统计了”产出了什么文件”,没法统计”产出的东西是否产生了结果”。
这份分析的边界(必须说清楚)
- 对话正文没有做全量语义分析,主题归类依据的是会话自动标题,属近似值。
- 只覆盖本机客户端。手机端、网页端、其他 AI 工具的使用全部不在样本里——这可能是最大的漏项。
- 时间戳不等于工作时长,会话时长包含挂机。不能凭时间戳判断投入程度和质量。
- 交付物数量 ≠ 交付物质量,更 ≠ 被采用。这是本轮最大的口径缺陷。
- 九月摩擦率上升的因果解释置信度低,只作为待验证假设列出。
最后
我原以为这条提示词的价值在于”它会告诉你一个惊人的真相”。
跑完发现不是。它的价值在于它逼你把”我以为”换成”几号、几次、多少”。
上面这些数字,没有一个是我反思出来的,全是记录里本来就在那儿的。我只是第一次把它们排在一起看。
最有用的一句是它开头那句:日志只是碎片,不等于完整的我。不要诊断我,不要臆测动机,也不要把一段时间没有记录理解成我已经放弃。
所以我也不给这份报告下结论。
先把数据摆出来,然后看接下来 30 天,我能不能把那条 53% 的曲线抬上去。
发表评论: