无尘阁日记

无尘阁日记

我把「改变人生」提示词真跑了一遍:82 天、409 场会话,记录替我照了面镜子
2026-09-20

前段时间外网在传一条叫 GPT-Astra 的提示词。原文说它 24 小时拿了 32.6 万阅读。

它最适合三类人:AI 项目开了一堆却不知道哪条线值得继续的;每天忙得停不下来但说不清自己沉淀了什么的人;想认真复盘又不想最后得到一堆性格分析和鸡汤的人。

我把它真跑了一遍——不是让 AI 夸我,而是让它去翻我自己的记录。

跑完之后,我对着屏幕坐了很久。不是因为被说中了什么玄乎的东西,是因为它给的每一条都有日期


先说它要求什么,再说结果

这条提示词跟常见的复盘模板最大的区别是:它规定了 AI 什么时候必须闭嘴。

原话是「让证据限制结论」。它给了几条硬约束:

  • 日志只是碎片,不等于完整的我。不要诊断我,不要臆测动机,也不要把一段时间没有记录理解成我已经放弃
  • 只有同一种模式至少出现在 3 个不同会话中,才可以认定为模式。引用带日期的证据,同时主动寻找反例,并明确说明不确定性
  • 严格区分「我实际做过的事情」和「AI Agent 声称已经完成的事情」
  • 所有时间或效率估算都必须说明依据。不能仅凭时间戳判断投入程度、工作质量或真实耗时
  • 不要强行制造”顿悟”或戏剧性的结论

它一共六步:挖掘 → 提炼 → 访谈 → 镜像 → 杠杆 → 沉淀。第一步只允许看元数据,不许读对话正文;拿到了批准才进第二步。

所以下面每一条结论,我都能指到具体日期和具体数字。没有一条是我”感觉”出来的。


数据底盘

翻的是本机 AI 工作记录,时间窗 2026 年 7 月 1 日到 9 月 20 日。

项目 数值
会话 409 场
工作区目录 273 个
我的真实发言 2001 条
机器动作(工具调用) 18563 次
数据量 455.8 MB
有记录的天数 82 天里的 76 天

平均每天开 5 场新会话。工具调用和我的发言之比是 9.3 : 1——我说一句,机器跑九趟。


发现一:我以为我在”管项目”,其实我在”开窗口”

这是最刺眼的一条。

我的发言轮次 会话数 占比
只有 1 条 230 56.2%
2 条 72 17.6%
3–5 条 49 12.0%
6–10 条 27 6.6%
11 条以上 31 7.6%

73.8% 的会话,我说不超过两句话就结束了。

273 个工作区对应 409 场会话——平均每个工作区活不到两场对话。

我的心理感受是”我同时在推十几条线”。记录说的是另一回事:我开了很多窗口,绝大多数在第二句话之后就没再打开过。


发现二:真正决定成败的,是我跟到第几轮

这条是全部数据里最干净的一条。它呈现出一条单调上升的曲线:

我发言的轮次 会话数 产出了交付物 交付率
1 条 230 122 53.0%
2 条 72 45 62.5%
3–5 条 49 37 75.5%
6–10 条 27 25 92.6%
11 条以上 31 27 87.1%

换算一下:1–2 轮就撒手的会话,交付率 55.3%;跟到 6 轮以上的,交付率 89.7%。

产出交付物的会话,平均我说 6.7 条;零产出的会话,平均我说 1.9 条。而零产出的那 153 场里,88.2% 只有不超过 2 条发言

这条曲线不好看,但它是好消息。因为它说明问题不在工具,不在我选的模型,不在我做的事太多——在我跟到第几轮。

AI 不是”给一句话就出成品”的机器。它是”你不撒手,它就能落地;你一撒手,它就停在半成品”的机器。

我过去三个月最大的浪费,不是做错了什么,是起头之后没跟到底。


发现三:超过一半的产出,来自 10% 的会话

单场产出 3 个以上交付物的会话,一共 42 场——占 10.3%。

它们承载了 230 / 428 = 53.7% 的全部产出。

最高的一场在 7 月 11 日,一条关于视频化演示流程的会话:79 条发言、602 次机器动作、40 个交付物

第二梯队是 7 月 22 日(13 个)、8 月 26 日(12 个)、7 月 29 日(10 个)。

这不是”二八定律”,这比二八更极端。

它同时说明两件事:我没有必要均匀地对待每一场会话;以及那些真正产出多的会话,都是我待得最久的那几场。跟发现二是同一件事,从另一个角度量出来的。


发现四:我把 43% 的工作放在了凌晨

按我第一次发言的时间统计:

时段 会话数 占比
深夜 00:00–06:00 177 43.3%
上午 06:00–12:00 171 41.8%
下午 12:00–18:00 52 12.7%
晚间 18:00–24:00 9 2.2%

02:00 是全天最高峰,65 场。

看到这个数字我第一反应是”这肯定是在硬熬”。然后我去找反例,结果打了自己的脸——这是第三个反例,下面会说。


发现五:我反复跑的不是项目,是同一条流水线

提示词定的判据是「同一种模式至少出现在 3 个不同会话中,才算模式」。

我按这个判据跑了 11 个主题,结果没有一个落选——全部跨 3 个月反复出现:

主题 出现在多少场会话 活跃天数
知识库相关 171 62
演示文稿/PPT 158 52
技能/Skill 129 48
发布上线 105 45
公众号运营 83 41
会议与转写 78 43
调研/选品 72 49
微信/桌面自动化 63 42
接口开发 57 36
数据/报表 56 33
短视频生产 47 34

这可能是整份报告里最反直觉的一页。

我一直以为自己的状态是”AI 项目开了一堆,不知道哪条该继续”。数据的回答是:你不是项目开太多,你是同一条流水线重跑了三个月,每次都是从头。

拿”文档 → 演示 → 视频”这条线举例:7 月起头,8 月重来,9 月又重来。每一次都像新项目,因为每一次都真的从零开始——上一轮的资产没被沉淀成下一次能直接调用的东西。

这才是”说不清自己沉淀了什么”的准确说法:不是没沉淀,是沉淀没有回流。


发现六:九月我的摩擦率翻了一倍

我把”我说的话里带着摩擦”的句子挑出来数了一遍:

我说的话属于哪种 次数 占比
要求验证(确认、核实、别编) 115 5.7%
催进度(继续、接着、还没) 105 5.2%
要求重做(重新、改成、返工) 88 4.4%
追问根因(为什么、到底) 79 3.9%
否定纠错(不对、错了、你没) 59 2.9%
报告失败(没成功、还是不行) 18 0.9%
主动放弃(算了、先这样) 14 0.7%

按月份看:

  • 7 月:21.5%
  • 8 月:17.1%
  • 9 月:35.0%

九月翻倍。

同期还有两条反向变化,我觉得比摩擦率本身更值得看:

一是任务拆解习惯的衰减。让我列任务、更新任务状态的次数,从 7 月的 306 次掉到 9 月的 66 次,只剩五分之一。

二是动作结构的变化。搜索类动作从 134 涨到 401(三倍),直接跑命令的动作 9 月是全期最高,而”读文件、改文件、写文件”这三样全线下降。

翻译成人话:我越来越像是在”用命令行救火”,越来越不像在”有结构地推进工作”。

我必须把这句话标清楚:这是两个变量同向变化,不是因果结论。 9 月项目本身变复杂了、集成的东西变多了,完全可能是外因。这条属于待验证,不是结论。


三个反例:我自己的直觉错在哪

提示词明确要求「主动寻找能够推翻当前判断的证据」。我找到了三条,每条都在打我自己。

反例一:短会话也能一次交付。 9 月 2 日有一场,我只说了 2 句话,产出 4 个交付物。7 月 30 日有一场 3 句话、4 个交付物。 所以”轮次少=无效”是不成立的。准确的说法是:任务已经定义清楚时,短会话是最好的形态;任务还模糊时,短会话就是浪费。区别在于我起头的时候,问题是想清楚了还是没想清楚。

反例二:凌晨不是低产区,我冤枉了自己。 深夜 00:00–05:00 启动的会话,交付率 68.9%。上午 64.9%。而下午只有 32.7%,平均发言仅 2.5 条。 我本以为要检讨”熬夜导致效率低”。数据说:凌晨反而是我一天里最专注、最能落地的时间段。真正低产的是下午——那是被临时插单和碎片沟通切碎的时段。 所以这里要改的问题不是”别熬夜”,是”别把需要连续推进的事放在下午”。

反例三:最长的会话不是最有效的。 跟到 11 轮以上的会话,交付率 87.1%,低于 6–10 轮那组的 92.6%。 说明有一部分长会话不是”持续产出”,而是”在同一个坑里反复折腾”。长会话里要能分辨:我是在推进,还是在原地打转。


三个 30 天实验

提示词第五步要求:最多选 3 个最值得改的地方,目标只能是——消除无效投入、把重复劳动交给自动化、保护真正有长期价值的工作。每个都要设计成 30 天实验,写清第一个具体行动、成功衡量指标、关键假设。

实验一:把”起个头”变成”跟到底”

针对的证据:1–2 轮会话占 73.8%,交付率只有 55.3%;6 轮以上交付率 89.7%。

第一个具体行动:从明天起,每天只允许自己新开 3 个工作区。开新的之前,必须先处理掉当天最旧的那个未完成会话——要么推进到有交付物,要么明确写下”为什么停”。

成功衡量指标:30 天后,1–2 轮会话的占比从 73.8% 降到 60% 以下;6 轮以上的会话交付率保持在 89% 以上。

关键假设:我的产出瓶颈是”并发太多”而不是”单个任务太难”。如果实验后交付率没变、只是总量下降了,说明假设错了。


实验二:把凌晨留给原创,把下午还给流程

针对的证据:深夜交付率 68.9%,下午仅 32.7%。

第一个具体行动:给下午立一条硬规则——下午不启动需要连续推进的新任务,只做机械性的、可以被打断的、定义清楚的事(批量处理、格式化、核对、发送)。

成功衡量指标:下午会话的平均发言轮次从 2.5 提到 4 以上;下午时段的”要求重做/报告失败”类发言占比下降到全期平均以下。

关键假设:下午的低产是”时段被打碎”造成的,不是”我下午状态差”。区分方法:看下午的长会话(>30 分钟)交付率是否仍然低——如果低,就是状态问题,假设被推翻。


实验三:让沉淀回流,而不是每次从零开始

针对的证据:11 个主题全部跨 3 个月反复出现;同一条”文档→演示→视频”线三个月各起一次头。

第一个具体行动:以后每一次做完一条流程,必须交付两样东西——成品,以及一份能被下一次直接调用的资产。后者包括:这条流程的固定步骤、踩过的坑、可复用的模板或技能。写不进这两样的,不算这条流程做完。

成功衡量指标:30 天内,同一条主题线第二次启动时的会话轮次,比第一次降低 30% 以上(因为有资产可复用,不需要重新摸)。如果轮次没降,说明沉淀的形态不对——写成文档是没用的,必须做成能直接跑的东西。

关键假设:我反复重跑同一条流水线,是因为缺”可复用资产”,不是因为”每次需求都不一样”。反驳方式:抽查三条复现最多的主题线,看第二次的差异到底是本质不同,还是只是我当时忘了上次怎么做的。

关于这条我要补一句:这个实验的方向是”把重复劳动交给自动化”,不是为了多产出,是为了保护那些真正有长期价值的工作——那些需要我本人判断、别人替代不了的事。三个月的数据里,我看不出哪些时间花在了这类事上。这是最需要被保护、也最容易被挤掉的部分。


五个待验证的假设(这一步我不替你回答)

提示词第三步要求”提出最多 5 个待验证假设,每次只问一个中性问题,等回答后再继续”。我把它跑成了自问自答的形式——下面这 5 条,我目前没有答案,只有数据。

  1. 1–2 轮就撒手的会话,是因为任务本来就不重要,还是因为我不知道下一步该问什么? 数据支持后半句:其中有相当一部分,指令只有几个字。

  2. 我把 43% 的工作放在凌晨,是因为白天被打断,还是因为我在用凌晨逃避白天的协同? 数据支持前半句(下午交付率仅 32.7%),但无法排除后者。

  3. 九月摩擦率翻倍,是项目复杂度上升的必然代价,还是我的任务拆解习惯崩了? 两个变量同向变化,无法区分。

  4. 42 场高产出会话承载了 53.7% 的产出——这几场是”我的核心工作”,还是”恰好没被打断的那几场”? 这是这份报告里最重要、也最难回答的一条。如果是后者,那我要改的不是优先级,而是保护连续时间

  5. 2001 条发言换来的 428 个交付物里,有多少真正被用上了? 数据不覆盖这一层。本轮完全无法回答。 这是最大的盲区——我只统计了”产出了什么文件”,没法统计”产出的东西是否产生了结果”。


这份分析的边界(必须说清楚)

  1. 对话正文没有做全量语义分析,主题归类依据的是会话自动标题,属近似值。
  2. 只覆盖本机客户端。手机端、网页端、其他 AI 工具的使用全部不在样本里——这可能是最大的漏项。
  3. 时间戳不等于工作时长,会话时长包含挂机。不能凭时间戳判断投入程度和质量。
  4. 交付物数量 ≠ 交付物质量,更 ≠ 被采用。这是本轮最大的口径缺陷。
  5. 九月摩擦率上升的因果解释置信度低,只作为待验证假设列出。

最后

我原以为这条提示词的价值在于”它会告诉你一个惊人的真相”。

跑完发现不是。它的价值在于它逼你把”我以为”换成”几号、几次、多少”

上面这些数字,没有一个是我反思出来的,全是记录里本来就在那儿的。我只是第一次把它们排在一起看。

最有用的一句是它开头那句:日志只是碎片,不等于完整的我。不要诊断我,不要臆测动机,也不要把一段时间没有记录理解成我已经放弃。

所以我也不给这份报告下结论。

先把数据摆出来,然后看接下来 30 天,我能不能把那条 53% 的曲线抬上去。