专题篇章 · AI 产品心理学

工程指标及格了,用户为什么还骂慢?

前面的章节教你把延迟压下来、把成本抠下来、把幻觉率降下来。这一章换一块秒表:用户脑子里那块。它和服务器的秒表走时不同,打分、续费、卸载都跟着它走。第一课先跑个实验,再把这块表的走时怪癖逐个拆开。

实验一 · 同一个 5 秒,四种活法

下面四个面板背后是同一次请求:同一个问题,同样 5 秒出完整答案。区别只有一个:这 5 秒里给用户看什么。点按钮让四个同时开跑,留意自己的体感。

四方案并排跑 先开跑
跑完之后,点你觉得最难受的那个面板。

方案 A · 空白冻结

什么都不给
点下方按钮开始
0.0s

方案 B · 转圈等待

告诉你它活着
点下方按钮开始
0.0s

方案 C · 流式输出

先给一部分
点下方按钮开始
0.0s

方案 D · 步骤外显

让你看它在干嘛
点下方按钮开始
0.0s
物理时长一模一样:都是 5 秒
实验二 · 先校一校你的体内秒表

刚才多数人最难受的是空白面板。空白除了难受,还有个隐藏代价:它会放大你对时长的估计。感知时间研究把「一边等一边关注时间」的计时叫前瞻计时:注意力越多押在时间本身上,主观时长越膨胀,紧张情绪再把它拉长一截。Zakay 与 Block 的注意闸门模型是这条规律最常被引用的解释。结论先放这,你自己测一遍更有说服力。

凭体感掐 8 秒 未开始
(准备好了就点右边的「开始」)

点「开始」后,左边面板会进入一段没有进度、没有转圈、没有文案的等待。凭体感,觉得过了 8 秒就按停。尽量别在心里数拍子,那是作弊。

你以为的8.0s
实际走过0.0s
偏差0%

这就是空白冻结在数据后台看不见的那笔账:服务器记 5 秒,用户记 6 秒半。无反馈等待的高估误差,实验里两三成很常见。你产品的「体感延迟」比监控面板上的 P99 更糟,且差距由界面决定。

实验三 · 首字时间是根多长的杠杆

秒表既然开在用户心里,工程预算就要花在他计时的区间。下面这台聊天机器人的总时长锁死 5 秒,你只能动一个参数:首字时间 TTFT(从发送到看见第一个字)。拖滑块,点「重放」,右边按所选 TTFT 重演一次打字流,体感分跟着变。

TTFT 滑块 · 总时长不变 拖一拖再重放
2.4s
总时长固定 5.0s,只动首字
体感分
64
帮我把这段会议纪要缩成三条待办
点「重放」看这一档 TTFT 的体感
为什么工程上先压 TTFT:把首字从 5 秒压到 0.5 秒,总时长一秒没省,体感分翻了两三倍;反过来 TTFT 不动、总时长从 5 秒压到 4 秒,这根表几乎不动。接流式、先出提纲、分段返回,性价比都排在升级机器前面。
实验四 · 用户秒表的三个走时怪癖

把前面的体感整理成三条可复用的规律。每一档都有个 mini 演示,三档都切一遍

三个走时怪癖 1 / 3 档
用户的秒表
0.6s · 看见第一个字,秒表停
服务器的秒表
5.0s · 完整答案落地

用户的开表点在按下发送,收表点在看见第一个字。首字之后他的注意力交给了阅读,边读边到的内容几乎没被记进等待的账本。工程团队盯总时长的 P99,用户只记首字,两块表对不上,差评就从缝里钻出来。实验三里 TTFT 那根杠杆的长度,就是这条怪癖给的。

裸奔
带播报
同样 6 秒,哪根更煎熬?

同一次等待:5 秒后答案落地。切换两种结局,看回忆里的时长怎么变。

「等了一小会儿就出来了,答案挺到位,这工具行。」
回忆里的时长
约 4 秒

物理上都是那一次 5 秒。追记式的时间靠事后重建,情绪越糟,重建出来的等待越长。所以延迟和幻觉在差评里常常挤进同一句话:又慢又蠢。答案质量的问题会连坐到速度头上;反过来,好答案也能替你把慢遮掉一截。第 4 课峰终定律会把这条用在结尾设计上。

立论 · 用户拿感知那块表给你打分

AI 产品有三个天生毛病:(推理要时间)、会错(幻觉压不净)、不透明(用户看不见它在干嘛)。工程手段短期内只能缓解这三样,但用户的评价由感知产生,感知可以设计。你在前面章节学的流式输出、模型路由、语义缓存、Agent 进度汇报,每一个都还有一重心理学开关的身份,这一章教你什么时候为了心理效果去拨它。

感知性能 ≠ 真实性能。服务器的 5 秒是物理事实,用户的 5 秒是心理事件;打分、续费、卸载,都发生在后一个 5 秒里。
出门考 · 预算只够动一刀 选一个
你的 AI 助手被用户骂慢,实测总时长 5 秒、首字 4.2 秒。手上的排期只够做一件事,先动哪刀?
A升级推理集群,把总时长从 5 秒压到 4 秒
B接入流式输出,首字压到 0.5 秒,总时长不变
C换一个更精致的加载动画,转圈升级成粒子特效
D弹一个提示框,向用户解释模型正在深度思考
全章地图 · 十六课怎么接着讲

慢、会错、不透明,每个毛病后面都排着几课;再往后是关系和钱。点卡片翻面,看每一课要解决用户的哪句抱怨。

十六课一张图 0 / 16 已翻
出处与延伸:感知时间的注意闸门模型见 Zakay 与 Block 的系列研究(1990 年代起),无反馈与高唤起状态下的时长高估在前瞻计时实验里反复复现;等待体验的经典整理见 David Maister《The Psychology of Waiting Lines》(1985),「被占住的时间感觉更短、没解释的等待感觉更长」出自这里;界面响应的 0.1 / 1 / 10 秒三档见 Nielsen《Usability Engineering》(1993);进度指示器让用户偏好与耐心上升的实验见 Myers(1985)。情绪改写时间记忆的机制与第 4 课峰终定律(Kahneman 等)同根。

✅ 这一课想和你分享的

  • 盯两块秒表:服务器计物理时长,用户从发送计到首字,考核指标里给 TTFT 单开一行
  • 别让界面空白:无反馈等待会被放大两三成,超过 1 秒就给反馈,超过 3 秒就给进展
  • 预算先压首字:接流式、先出提纲、分段返回,排期都在升级机器前面
  • 错误当场兜住:时间记忆跟着情绪走,答非所问会把慢一起写进差评
专题篇章 · AI 产品心理学

等待心理学:难受的从来不是那 5 秒

第 1 课你已经亲手测过:同样 5 秒,体感能差两三倍。这一课把背后的规律讲透。服务运营研究把排队心理总结成几条定律,条条能翻译成 AI 产品的设计决策,翻译完你会发现:大部分「太慢了」的差评,修的其实是呈现,模型一行都不用动

动手一 · 先拖出你的任务耗时

人机交互研究里有一组用了几十年的经典阈值,出自 Jakob Nielsen《Usability Engineering》(1993,上溯 Miller 1968):0.1 秒内感觉是瞬间,1 秒内思路不被打断,10 秒是专注等待的极限。三道线切出三档呈现策略。拖动滑块,输入你手头功能的实际耗时,看它落在哪一档、该怎么呈现。

耗时定档:三档呈现决策 拖一拖
3.4 秒
1 秒内 · 直接出
1〜10 秒 · 必须流式
10 秒以上 · 转异步

先立论 · 迪士尼和机场早就把答案跑出来了

管理学者 David Maister 在 1985 年的《The Psychology of Waiting Lines》里给排队心理立了一组定律,游乐园、银行、机场用了四十年。两个教科书案例,值得逐个数字看。

案例一 · 迪士尼排队牌
把「等多久」明码标价,还故意报高

排队入口的牌子写着「从此处起 40 分钟」,而实际多数时候 30 分钟就排到。游客非但不恼,反而觉得赚了 10 分钟。知道要等多久,大脑就能安排自己;没有刻度,就只能按最坏情况焦虑。

队伍本身也被设计过:蛇形折返让你每隔几十秒就往前挪一步,沿途的布景和预演短片让手里有东西看。同样的物理时长,被拆成了「一直在前进、一直有事干」的体验。

案例二 · 休斯顿机场行李
投诉清零,靠的是让乘客多走路

乘客抱怨取行李等太久,机场加人提效,把平均等待压到 8 分钟,投诉照旧。细看数据才发现问题:乘客下机走到转盘只要 1 分钟,剩下 7 分钟全程干站着

后来的方案没再提速一秒:把到达口改远、行李分到最远的转盘,乘客要多走 6 倍的路,到转盘时行李刚好出来。总时长没变,投诉几乎清零。走路的人觉得自己在推进,干站的人才觉得自己在等。

两个案例指向同一句话:难受的从来不是时长本身,是不确定、没解释、空着手。修好这三样,秒数没变,差评先没了。
动手二 · 三条定律,逐条亲手对比

Maister 那组定律里,对 AI 产品最要命的是三条。每条给你一对界面,亲手切换差的做法和好的做法,盯着焦虑值怎么变。三块面板里的转圈和进度条都是活的,多看几秒,体感更真。

三定律对照台 0 / 3 已对比
定律 ① · 不确定的等待更长等多久,说了吗
生成中,请稍候
预计 20 秒 · 已完成 40%
焦虑值
82

没有刻度,大脑按最坏情况焦虑,第 10 秒左右开始怀疑它挂了。

定律 ② · 没解释的等待更长在干嘛,说了吗
(沉默)
正在检索 12 篇文档…
已读完 7 篇 · 正在交叉比对
焦虑值
78

裸转圈只回答「死没死」,回答不了「在干嘛」,大脑自动脑补最坏剧本。

定律 ③ · 空手的等待更长手里,有东西吗
(白屏,什么都没有)
提纲已出:① 结论 ② 依据 ③ 风险
焦虑值
75

白屏 3 秒,体感能顶别人 10 秒。眼睛没落点,秒表就走得格外慢。

动手三 · 把一个 25 秒的任务改到可交代

场景:用户让 Agent 审一份 50 页的采购合同,全程约 25 秒。左边是聊天界面,现在只有一个干巴巴的「分析中」。右边四个设计动作对应刚学的定律,逐个勾上,看界面长出什么、焦虑值掉多少

25 秒等待设计器 焦虑 92
帮我审一下这份 50 页的采购合同,标出风险条款和改法
收到,开始分析…
预计 30 秒左右(按历史耗时报的,宁高勿低)
✓ 读取合同 12/50 页
✓ 提取付款与违约条款
▸ 交叉核对双方义务…
先给你分析提纲,正文接着流式出:
① 付款条款:账期 90 天偏长
② 违约金上限缺失
③ 知识产权归属含糊…
🔔 转入后台,完成后通知我
定律 ①给预估时长,且报偏高

按历史耗时的偏高值报「30 秒」,25 秒完成是白赚的惊喜。等待从无底洞变成倒计时。

定律 ②阶段性汇报进展

每换一个阶段说一句在干嘛,沉默变成直播。这些中间态第 3 课还要再用一次:它们本身就在给能力背书。

定律 ③先流式出提纲

5 秒先给分析框架,用户边读边确认重点,手里不空,秒表就停了。

换形态提供转后台 + 完成通知

给一个随时离开的出口。多数人未必点,但知道能走,等待就有了退路。

用户焦虑
92
同样 25 秒,任务一毫秒没变快,体感从难熬变成可交代。用户知道要等多久、知道它在干嘛、手里有东西读、还握着一个随时离开的出口。四个动作合起来,把「等」改写成了「盯着它干活」。
动手四 · 超过 10 秒,别修文案了,换形态

Nielsen 那道 10 秒线是产品形态的分界线。超过它还让用户同步干等,注意力必然流失,这不叫体验瑕疵,叫设计事故。正确做法:把同步等待改成后台任务。点下面的按钮,亲眼看这一套怎么运转。

转后台 + 完成通知,跑一遍 点按钮
任务卡会收进右上角的通知中心,3 秒后(现实里是 3 分钟)完成通知把用户拉回来。
你的 AI 工作台
深度研究 · 竞品定价全景扫描
预计 3 分钟 · 要跑 40+ 次检索和交叉比对,同步等着可太煎熬了
任务在后台跑着,这个窗口已经还给你。接着问下一个问题,或者干脆去倒杯水,都行…
深度研究完成 · 竞品定价全景扫描,点击查看报告
Deep Research 类产品跑十几分钟没人抱怨,因为它开场就把话说清:『这需要一段时间,好了叫你』。预期立对了,慢就名正言顺。反过来,一个聊天框让人干瞪眼 15 秒,用户就会觉得产品坏了。同样的耗时,形态选对是深度,选错是事故。
工程账 · 这些动作到底贵在哪

回头盘一盘成本。大模型原理篇讲过 chat/completions 的流式返回,动手实战篇讲过 Agent 的进度外显,它们在这一课的身份是心理学工具。那么问题来了,答完再看账单

哪个动作要换更快的模型 选一个
这一课出现过的四个等待设计动作,哪个非得把模型换快才做得到?
A给预估时长且报偏高
B阶段性汇报进展
C先流式出提纲
D一个都用不着
出处与延伸:排队三定律出自 Maister, D. H. (1985) The Psychology of Waiting Lines;响应时间三档出自 Nielsen, J. (1993) Usability Engineering(阈值上溯 Miller 1968);休斯顿机场行李案例见 Alex Stone 在《纽约时报》的报道 Why Waiting Is Torture(2012)。中间态与信任的关系第 5 课信任校准细讲,过程展示的另一重价值第 3 课劳动错觉细讲。

✅ 这一课想和你分享的

  • 先给任务定档:1 秒内直接出,1〜10 秒必须流式加进度,超 10 秒改后台任务加通知
  • 逐条对照三定律修呈现:给预估、给解释、让手里有东西,焦虑值一条条降
  • 预估宁高勿低:报 40 分钟实际 30 分钟是惊喜,反过来是背叛
  • 先修呈现再修延迟:大部分「太慢」差评,模型一行不用动,账单便宜一个量级
专题篇章 · AI 产品心理学

劳动错觉:让 AI 把努力演出来

第 2 课说等待要有反馈,这一课的结论更反直觉:有些等待根本没必要消灭。展示工作过程的产品,让用户多等几秒,满意度和信任反而更高。这个效应叫劳动错觉(Labor Illusion)。先做实验,再看研究,最后把边界画清。

先做实验 · 两个机器人,你信哪个

同一个问题同时发给两个客服机器人,答案一字不差,区别只在拿到答案的方式。A 秒回,B 花 3 秒把工作日志逐条亮出来再作答。跑完凭直觉投票。

秒回 vs 过程外显 先跑再投
点「同时提问」,两边一起盯着看,留意自己的直觉往哪边偏。

机器人 A · 秒回

0.3 秒直接给答案

「这份合同里的竞业限制条款有什么风险?」
点下方「同时提问」开始

机器人 B · 展示过程

3.5 秒,工作日志逐条亮起

「这份合同里的竞业限制条款有什么风险?」
点下方「同时提问」开始
两边答案一字不差
研究出处 · 让用户多等 60 秒的网站赢了

这个效应出自哈佛商学院 Buell 和 Norton 2011 年的实验。被试在模拟的机票搜索网站上查航班:一组秒出结果,另一组要等 30 到 60 秒,但屏幕上滚动着「正在检查 Delta 航空…正在检查 United…」。结果展示劳动的那组满意度反超,部分条件下被试宁愿选等 60 秒但看得见工作的网站。下面把实验搬给你亲手跑。

复刻 Buell & Norton 的机票实验 0 / 2 版已试
两个版本各搜一次。真实实验里劳动版要等 30 到 60 秒,这里压缩成几秒,意思到位就行。
上海 PVG → 西雅图 SEA · 10 月 14 日
选好版本,点「搜索航班」
该版满意度
--
机制一句话:人用看得见的努力,推断看不见的质量。搜索到底查得细还是查得糙,用户没法直接看见,于是拿「屏幕上的工作量」当质量的代理指标。咨询师当场给方案显得不值钱,说「容我回去分析三天」反而显得专业,同一回事。
动手装配 · 把 AI 的努力摆上台面

工程上你有三根现成的杠杆:推理模型的思考过程、RAG 的检索来源、Agent 的工具调用日志。它们原本是调试信息,摆上台面就成了体验资产。三个开关逐个拨开,看右边的聊天界面多出什么、体感可信度涨多少。

过程外显装配器 可信度 42
思考过程外显

把思维链摊开:分了几种情况、在哪换过思路,让用户看见推理的骨架。

检索来源逐条亮出

「已检索 3 个来源」加上可点开的条目,答案挂上可查验的出处。

工具调用日志

查了什么、读了什么、比对了什么,一步一行摊在屏幕上。

体感可信度
42
「答得挺快,但这话我敢直接转给 HR 吗…还是再问问别人。」
帮我查一下:员工试用期被辞退,赔偿怎么算?
思考了 4 秒 ⌄
用户问的是试用期解除的赔偿…得分两种情况:公司拿得出「录用条件不符」的证据,和拿不出的…先查劳动合同法原文再作答,避免凭印象给数字。
已检索 3 个来源《劳动合同法》第 21 条《劳动合同法》第 39 条劳动争议司法解释(一)
search_law("试用期 解除 赔偿") · 3 条结果 read_doc(劳动合同法 §21, §39) cross_check(司法解释一 §44)
分两种情况:公司能证明你「与录用条件不符」的,可以解除且无需赔偿;拿不出证明的属于违法解除,按 2N 标准赔偿。注意举证责任在公司一侧,你只需保留录用通知和考核记录。
全开之后清点一下,你收获的可远超一个错觉:① 看得见的努力制造了劳动错觉,这是本课;② 来源和日志给了用户可核验的抓手,这是第 5 课信任校准的主角;③ 用户顺带看懂了系统的工作方式,心智模型自己长出来了,这是第 8 课的主题。一鱼三吃,头部产品把调试信息搬上台面,图的就是这三层。
火眼金睛 · 揪出假劳动

过程展示有真有假。下面三个界面都在「展示努力」,逐个判断:真劳动,还是假表演?拆穿的代价,三题做完揭晓。

假进度找茬 0 / 3
样例 ② 和 ③ 是活的,多盯几秒再下判断。
样例 ① · 检索日志
检索「二手房 定金 退还」· 4 篇
读取《民法典》第 587 条
比对 2 个近似判例
定金能退的前提是对方违约或双方协商解除 [民法典 §587],你这种情况属于卖方违约,可主张双倍返还。
样例 ② · 深度思考中
正在深度思考…
已思考 0 秒
样例 ③ · 进度条
4%
为什么假劳动是信任炸弹:被拆穿一次,用户会把这套把戏泛化到你产品的每个角落,之后真实的检索日志、真实的思考过程,都会先被当成表演审视一遍。劳动错觉的红利建立在「劳动真实发生」上,造一次假,真的也跟着贬值。
边界三问 · 演之前先过三关

劳动错觉好用,但有边界。三道题,每道对应一条实践红线,做完这一课的杠杆就能放心用了。

第一问 · 什么时候该收着演 选一个
下面三个场景,哪个该收起过程展示、直奔结果?
A用户第一次用你的产品,生成一份年度经营分析
B翻译按钮,用户每天要点几十次
C法律条款审查,结果对错用户自己难验证
第二问 · 演多久算过头 选一个
过程展示的时长,红线画在哪?
A用户能忍多久,就演多久
B真实劳动花了多久,就最多演多久
C比竞品略长一点,显得更下功夫
第三问 · 能不能故意拖慢 选一个
后端 0.4 秒算完了,产品经理提议硬加 3 秒延迟、播一段「努力动画」,接吗?
A接,反正实验证明慢一点用户更满意
B驳回,实验的前提是劳动真实发生,硬加的 3 秒是造假
C折中,加 1.5 秒,用户察觉的概率低
出处与延伸:劳动错觉主实验见 Buell & Norton (2011), The Labor Illusion: How Operational Transparency Increases Perceived Value, Management Science;后续研究把话题扩展为运营透明度(Operational Transparency),Buell, Kim & Tsay (2017) 在餐厅场景验证了双向透明还能同时提升顾客满意与员工表现。原始论文里常被漏读的一条前提:劳动错觉只在结果合格时生效,答案砸了,用户看过的努力过程只会变成新的槽点:查了 12 篇文档还答成这样?

✅ 这一课想和你分享的

  • 把真实的劳动亮出来:思考过程、检索来源、工具日志,调试信息搬上台面就是体验资产
  • 用可核对的细节演:日志条目要能和答案里的引用对上,可验证的过程越看越可信
  • 展示时长锁在真实耗时之内:呈现节奏可以放慢,超出真实劳动时长就是造假
  • 高频任务收着演:第一次展示过程建立信任,之后直奔结果,别拿用户的耐心铺排面
专题篇章 · AI 产品心理学

峰终定律:用户只记得峰值和结尾

诺奖得主卡尼曼发现:人对一段体验的记忆评分,几乎只由最强烈的那一刻(峰)和最后一刻(终)决定,和平均水平、持续时长关系不大。这条定律直接回答一个预算问题:最贵的模型、最多的优化精力,该花在会话的哪个位置。这一课五个实验,逐个上手。

先玩剧本 · 同一场会话的四种命运

一次 10 轮的 AI 会话,每轮体验打 0 到 10 分。四个剧本轮流点开,看平均分(工程仪表盘量的)和记忆分(用户脑子里存的,近似算法:峰值与结尾的平均,出自卡尼曼)怎么背离。重点看剧本③:平均分四个里最高,记忆分垫底。

点剧本,看两个分数打架 看过 1 / 4
四个都点一遍再往下读,判词在图表下面。
平均分(工程视角)
0.0
十轮的算术平均
记忆分(用户会记住的)
0.0
(峰值 + 结尾)÷ 2
把出处讲透 · 1993 年那盆冷水

峰终定律的原始证据来自一篇标题就很挑衅的论文:Kahneman、Fredrickson、Schreiber 与 Redelmeier 1993 年发在《Psychological Science》的 When More Pain Is Preferred to Less: Adding a Better End(偏爱更多的痛苦,只因结尾好了一点)。被试要经历两场泡冷水试验,之后回答一个问题:如果必须再来一次,你选哪场。先猜猜多数人怎么选。

猜:多数被试愿意重复哪场 点卡片投票
两场都亲身泡过之后投的票。凭直觉点一张。
试验 A · 短
14°C · 60 秒
共 60 秒

一只手泡进 14°C 的冷水里整整 60 秒,然后结束,拿毛巾擦手。

试验 B · 长
14°C · 60 秒15°C · 30 秒
共 90 秒

同样 60 秒 14°C,接着再泡 30 秒,水温悄悄升到 15°C:依旧难受,只是没那么刺骨。

这背后是卡尼曼在《思考,快与慢》里反复讲的分工:经验自我承受了每一秒(B 客观上多受 30 秒罪),记忆自我只拿峰值和结尾两帧存档打分。投票时到场的只有后者。1996 年 Redelmeier 与卡尼曼又在真实肠镜病人身上重复了结论:术程从 4 分钟到 69 分钟,事后痛苦评分和时长几乎无关,和峰值疼痛、最后三分钟的疼痛高度相关。这个现象有个专名:时长忽视(duration neglect)

经验自我过日子,记忆自我做决定。打分、续费、向朋友推荐,签字的都是记忆自我。你的 DAU 曲线量的是前者,你的 NPS 归后者管。第 2 课讲过的等待也一样:等了多久会被忘掉,等待结束那一下的感受会被记住。
亲手造曲线 · 骗过平均分给你看

光看现成剧本还差口气,自己造一条才算懂。下面是一次会话的 10 个节点,点节点在 好(+2)/ 中(0)/ 差(−2) 之间循环切换,右侧两个分数实时算。挑战目标:造一条平均分低于 0、记忆分拉满 +2.0 的曲线。达成的那一刻,徽章会亮。

体验曲线编辑器 挑战进行中
提示:记忆分只看两个位置。想明白是哪两个,这题十秒就解。
平均分
0.0
十个节点的算术平均
记忆分
0.0
(峰值 + 结尾)÷ 2
挑战达成。你刚造出的这条曲线,工程仪表盘上会亮红灯(平均分为负),用户却会把它当成一段好体验讲给同事听(记忆分 +2.0)。反过来同样成立:仪表盘一片绿的会话,可能正在被用户遗忘。监控平均值的团队,和只存峰终两帧的用户,看的从来是两张成绩单。
掏出 100 元 · 预算跟着记忆权重走

既然记忆分只认峰和终,推理预算就该按记忆权重发钱。假设一次会话有 100 元推理预算,拖动三个滑块分给 首次交互 / 中段 / 收尾(合计锁死 100),看记忆分和判词怎么变。有一条暗规则先交代:中段挂着语义缓存,质量有 5.0 分兜底,这正是它能省的原因,成本篇讲分层路由时铺过这一段。

模型预算分配器 记忆分 6.7
试试三种分法:平均发钱、全押收尾、两头重中间轻。徽章亮起需要记忆分 7.4 以上。
¥33
¥34
¥33
首次交互中段收尾
首次交互质量6.7
中段质量(缓存兜底 5.0)6.8
收尾质量6.7
记忆分
6.7
收官对决 · 最后一步做什么

预算说完说流程。同一个 Agent 任务「生成季度报告并对外发布」,两种收官编排:A 把外部发布留到第十步压轴;B 把校验挪到第一步,中间产物随做随落盘,第十步只做打包交付加摘要。点你认为记忆分更高的那版

两种收官编排,选记忆分高的 选一边
方案 A
Agent · 生成季度报告
拉取销售数据源
清洗与聚合
生成图表与正文
…第 4 到 8 步逐一通过…
渲染 12 页报告
第 10 步 · 调用外部接口发布
发布失败:第三方接口 502。本次会话结果未保存,请重新运行任务。
方案 B
Agent · 生成季度报告
1校验权限、配额、导出格式(前置)
拉取销售数据源
中间产物已落盘 · report_draft_01.md
清洗聚合、生成图表与正文
中间产物已落盘 · charts_q3.zip
第 10 步 · 打包交付 + 摘要
报告已存入你的空间:共 12 页,2 处标注待你确认。对外发布?(可选动作,随时可做)
出处与延伸:冷水实验见 Kahneman, Fredrickson, Schreiber & Redelmeier (1993), When More Pain Is Preferred to Less: Adding a Better End, Psychological Science;肠镜研究见 Redelmeier & Kahneman (1996), Pain;记忆自我与经验自我、时长忽视的系统论述见卡尼曼《思考,快与慢》第 35、36 章。产品侧的衔接:第 2 课(等待心理学)讲结束那一下的感受权重,第 10 课(蜜月悬崖)讲第一印象的预算怎么接住,成本篇的分层路由与语义缓存是本课预算分配器的工程底座。

✅ 这一课想和你分享的

  • 记忆分 ≠ 平均分:用户存档的只有峰值和结尾两帧,平均水平没人记得
  • 造峰:旗舰模型花在新手期和高价值时刻,缓存秒回也算一个峰
  • 护终:校验前置、中间产物落盘,最后一步永远别做全链路里最容易失败的动作
  • 中段放心省:便宜模型加语义缓存兜底,省下的钱挪去两头买记忆分
专题篇章 · AI 产品心理学

信任校准:最好的用户是半信半疑的

前四课都在给体验挣分,这一课踩一脚刹车:信任这个指标,目标值从来就没定在满分。AI 会出错是改不掉的物理现实,所以健康的用户长这样:该信的场景放心用,该查的场景留个心眼。往哪边偏都要交学费。这一课先看两笔真实学费,再给你三件能亲手拨弄的校准工具。

先看两种翻车姿势
全信的出事故,不信的白花钱。信任校准(Trust Calibration)的奠基综述 Lee & See(2004)把要求说得很清楚:信任要和系统的真实能力对齐。信高了叫误用(misuse),信低了叫弃用(disuse),两头各有各的账单。
⚠ 过度信任:把幻觉当真相用

2023 年纽约的 Mata v. Avianca 案:执业律师用 ChatGPT 检索判例,把 6 个查无此案的编造判例原样抄进法庭文书,法官逐个核实后律师吃了罚单、上了全球新闻。类似的事故此后接连发生:AI 的输出流畅、自信、格式规范,每一个表面特征都在诱导「它很靠谱」的判断,而这些特征和内容真伪互不相干。

⚠ 信任不足:AI 变成昂贵的摆设

另一头的翻车安静得多:企业买了 AI 工具,员工试了一次撞上错误,从此每条输出都逐句复核,复核成本超过自己写,最后干脆不用了。采购的钱照付,效率一分没涨。信任不足不上新闻,只出现在「AI 工具活跃率 8%」的内部复盘里。

系统实际的靠谱程度 → 用户以为的靠谱程度 → 过度信任区 · 误用 信任不足区 · 弃用 校准线:信任 = 真实能力
横轴是系统真的有多靠谱,纵轴是用户以为它有多靠谱。产品设计的任务:把落在两个角落里的用户,往对角线上拉。往下的三件工具,拉的都是这根线。
六个用户,逐个把脉

判断口诀先给你:盯着「风险 × 可核验性」看,别盯着「AI 强大与否」看。同样是全盘采纳,用在周报上是校准,用在法庭上是过度。六个场景,你来当校准师。

这六个用户,信任健康吗 0 / 6
三个选项:过度信任、信任不足、校准良好。先判断,再看解析。
把引用做成能点开的

第一件校准工具:来源引用,要能点开的那种。想核实的用户一键到原文,压住过度信任;懒得核实的用户看到「有出处」也建立了合理的底气,补上信任不足。一举两得的前提是引用真实可点:装饰性的假引用被戳穿一次,比没有引用糟糕十倍。下面这条 AI 回答挂了三个角标,逐个点开,和原文比对。

三条引用,揪出对不上的那条 0 / 3 已点开
点角标 [1][2][3] 展开原文卡片,比对回答里那句话和原文说的到底一致吗。
问:试用期第二个月被公司口头辞退,我能主张赔偿吗?
可以主张。用人单位在试用期解除劳动合同,应当向你说明理由[1];如果构成违法解除,赔偿金按经济补偿标准的二倍支付[2]。注意别拖:劳动仲裁的申请时效为一年,从被辞退当天起算[3]。建议先保留辞退通知、考勤和工资记录等证据。
三条引用里有一条对不上原文,是哪条?
亲手调一版置信度信号

第二件工具:置信度。第一篇章讲过,模型不知道自己不知道,让它自报把握靠不住。但产品层有诚实的代理信号:检索命中了几篇文档、相关度多高、多个来源是否一致、知识截止日期盖住问题了没有。下面是同一条用药回答,三组开关对应三个产品决策,拨一拨,看右边的回答和用户的信任校准度怎么变

置信度信号设计器 拨一拨
回答措辞
来源引用
警告条
用户信任校准度
22
布洛芬和对乙酰氨基酚,发烧能交替吃吗?
[1] 解热镇痛药临床应用指南 [2] 药典 · 非甾体抗炎药 [3] 三甲医院用药问答库
狼来了,连喊五遍试试

第三件工具管的就一件事:那行「AI 可能出错,请核实重要信息」的小字,到底有没有人在看。心理学的答案叫横幅盲视(banner blindness):Benway & Lane(1998)用眼动实验发现,恒定出现在固定位置的元素,会被大脑当成背景纹理直接滤掉。下面连点五条回答,亲眼看这行小字怎么消失。

恒定免责 vs 条件警告 第 0 / 5 条
先在「恒定免责组」点满五条,再切「条件警告组」对比。横幅的浓淡模拟的就是用户注意力的钝化。
用户对警告的注意力
100
出处与延伸:信任校准的奠基综述是 Lee & See (2004) Trust in Automation: Designing for Appropriate Reliance,误用(misuse)与弃用(disuse)的提法出自 Parasuraman & Riley (1997);律师抄幻觉判例为真实案件 Mata v. Avianca, Inc. (S.D.N.Y. 2023);横幅盲视见 Benway & Lane (1998) 的眼动研究。信任跌落之后怎么修,第 6 课讲算法厌恶(Dietvorst et al., 2015)时接着说;高危动作的人工闸门,第 7 课防御心理里有完整的设计谱系。

✅ 这一课想和你分享的

  • 把信任目标定在校准:全信的出事故,不信的白花钱,产品要把用户往对角线上拉
  • 引用做成能点开的:把「信我」换成「你可以验」,同时提防装饰性假引用反噬
  • 置信度用代理信号说:检索命中数、相关度、来源一致性,比模型自报的把握诚实
  • 警告有条件地出现:恒定免责三天就隐形,低置信时带原因弹出才会被读
专题篇章 · AI 产品心理学

防御心理:用户不是不会用,是不敢用

很多 AI 功能的低使用率,复盘时被归因成「用户教育不够」,再做一轮引导弹窗,还是没人用。真正的原因常常是用户在防御:他看懂了你的功能,然后决定不碰。这一课先测你自己防不防,再拆三种防御的来源,最后把三板斧一把一把拨给你看,五个教具,逐个亲手玩。

先测你自己 · 六道快问

讲用户之前,先看看你自己。六道题,凭真实反应作答,答完画出你的防御画像

防御雷达自测 0 / 6
别按「正确答案」答,按你上周的真实操作答。
你的三轴防御画像
三种防御 · 用户看懂了,然后决定不碰

刚才那六道题,两道一组,对应三种防御。它们各有心理学出处,也各有一句用户心里的潜台词。共同点:防御的用户往往说不出「我在防」,只会说「不太好用」,然后再也不打开。

🔒
数据防御
「这份合同传上去,会去哪?会被拿去训练吗?友商会不会看到?」

越是高价值场景(合同、财报、客户名单),数据越敏感,防御越强。吊诡的是:AI 恰恰在高价值场景才最值钱,数据防御直接卡住了产品价值的兑现。训练开关其实存在,但用户不知道;不知道,就按最坏情况设防。

出处:隐私计算,Dinev & Hart (2006)
🎭
能力防御
「我用 AI 写方案被发现了,老板会不会觉得我没本事?这工具是不是在为裁我做准备?」

内部工具的头号杀手。员工把「用 AI」解读成「承认自己可被替代」,把使用数据解读成绩效监控。这种防御不会说出口,只表现为「试了一下,不太好用」。第 12 课认知卸载会展开它的另一半:怕的其实是「显得可替代」。

出处:印象管理,Goffman (1959)
⚖️
责任防御
「AI 写的报告数字错了,锅算谁的?算我的话,我为什么要用?」

理性人的算计:用 AI 省 2 小时,出错背整口锅,期望收益为负,不用是对的。责任界面不清晰的 AI 功能,用户防御是理性行为。第 5 课信任校准给过解法:把人签字的环节留在流程里(HITL),谁确认、谁负责写清楚,防御才有得谈。

出处:责任沟,Matthias (2004)
低使用率的第一假设应该是防御,第二假设才轮到教育。教育解决「看不懂」,解决不了「不敢碰」。
三板斧 · 一把一把拨给你看

防御的反义词有三个:控制感、可逆性、透明。每个都有实验背书,也都能落成具体的界面改动。下面三块界面各卡在高防御状态,拨开关,看同一块界面怎么从「劝退」变成「敢试」,防御指数实时变化。

三板斧上手台 0 / 3 已拨
① 控制感
Averill (1973)
AI 建议、用户拍板
防御
84
方向盘在自己手里,人就敢开快车。感知控制的研究反复验证:可以打断、可以否决,应激水平就往下走。
② 可逆性
Shneiderman 黄金法则
默认草稿态 + 可撤销
防御
88
不可逆才需要勇气,可逆只需要好奇心。「支持轻松撤销」写在界面设计黄金法则里几十年了。下一个教具你亲手体验。
③ 透明
Dinev & Hart (2006)
数据去向一句人话
防御
86
用户协议第 47 条不叫透明,那叫免责。隐私计算模型里,说清风险反而降低感知风险:不确定性本身就是成本。
亲手玩可逆性 · 让 AI 改 30 个文件名

纸上讲一百遍可逆性,抵不上你亲手点一次。下面是一个批量操作的高危场景,注意你每一步的心理活动:点「应用」之前犹豫了多久,看到「可撤销」之后又是什么感觉。

先草稿,后应用,随时撤销 亲手试
这是你的下载文件夹,命名一团糟。让 AI 出手整理。
草稿预览 · 还没动你的真实文件
✓ 已应用 30 处改名 · 30 秒内可撤销
动手改造 · 三个高防御设计

下面三个功能都因为防御心理卡在低使用率。每个给了三个候选动作,点选你要上的,防御指数实时变化。小心:三个里各埋了一个看着像解药的安慰剂,其中一个还是货真价实的假开关。

防御指数改造台 0 / 3 已化解
目标:把每个案例的防御指数压到 40 以下。安慰剂会拖后腿。
转人工悖论 · 先猜再翻牌

你是 AI 客服的产品负责人,人工坐席很贵,你怕用户都跑去找真人。「转人工」按钮放哪?两个方案已经各跑了一个月,先押注:哪边的转人工率更高?点你押的那边

转人工按钮该藏还是该亮 先猜
方案 A · 出口摆在明面
智能客服转人工
你好,我是智能助手,退换货、查订单都可以直接问我。右上角随时可以转人工。
我买的椅子少了个零件包,能补发吗?
可以的。请提供订单号,我帮你登记补发,48 小时内寄出。
输入你的问题…
11%
转人工率
4.4
满意度
7%
开口就喊人工
方案 B · 出口藏进三级菜单
智能客服更多 > 帮助与反馈 > 其他问题
你好,我是智能助手,退换货、查订单都可以直接问我。
人工!转人工!!
我可以先帮你看看哦,请描述你遇到的问题~
输入你的问题…
26%
转人工率
3.1
满意度
38%
开口就喊人工
* 数字为示意,形状来自客服行业公开复盘里反复出现的走向。
出处与延伸:感知控制与应激的关系见 Averill (1973) 的综述与 Glass & Singer (1972) 的可控噪音实验(手边有停止按钮的被试压力更小、任务表现更好,按钮几乎无人按);「支持轻松撤销」出自 Shneiderman 的界面设计黄金法则;隐私计算模型见 Dinev & Hart (2006);「责任沟」见 Matthias (2004);假开关的原型是城市里大量不接线的过街按钮和电梯关门键,控制错觉见 Langer (1975)。责任防御与能力防御的另一半,分别在第 5 课信任校准和第 12 课认知卸载展开。

✅ 这一课想和你分享的

  • 低使用率先查防御:数据、能力、责任三轴各排查一遍,再谈用户教育
  • 高风险动作一律草稿态加撤销:把尝试的门槛从勇气降到好奇心
  • 数据去向用一句人话说清:再配一个可验证的状态,比如「已删除」
  • 出口放在明面上,假开关一个都别上:被识破的假控制,防御反弹得更高
专题篇章 · AI 产品心理学

心智模型:用户拿错了说明书

交互设计有个老概念叫心智模型:用户会带着一套「这东西应该怎么运作」的假设来用你的产品,假设错了,操作就错,然后差评打给产品,账算在你头上。AI 是人类历史上第一个「长得像老产品、内核两样」的东西,心智错配格外严重。这一课先认出四本错误说明书,再亲手玩三个纠正教具。

四本错误说明书 · 差评的批发源头

聊天框长得像搜索框,回答长得像百科,界面像个耐心的客服。用户按外观匹配了四本旧说明书,每一本都会精准地制造一类差评。

错误说明书 ①
当搜索引擎用
预期结果有出处、信息是实时的
现实凭记忆回答、知识有截止日、没有链接。第零篇章讲过「搜索给书架,AI 给结论」,但用户没上过这门课
差评「给我的链接点不开」「查个今天的新闻都不会」
错误说明书 ②
当数据库用
预期问什么查什么,查不到会说没有
现实概率补全机器,查不到的时候会现编一个像样的答案
差评「问我们公司 Q3 营收,它张口就报了个数,吓死我了」
错误说明书 ③
当会学习的学徒用
预期说过一次就记住,越用越懂我
现实参数冻结,新会话即失忆,「越聊越懂」只是笔记被塞回了上下文
差评「跟它说过八百遍别用表格,转头就忘,态度有问题」
错误说明书 ④
当计算器用
预期数字运算天经地义是对的
现实语言模型按 Token 概率生成数字,长算式、多行求和经常错。正确姿势是让它写代码去算
差评「37 个数求和都能错,这也配叫智能?」
找茬练习 · 认出用户手里那本说明书

四段对话,事故都已经发生。先判断用户拿的是哪本说明书,判完看解析:解析里带产品对策,诊断只是开始。

四段对话,四次误诊现场 0 / 4 已判
线索都在对话里:看用户要什么,再看 AI 实际给了什么。
纠正手段一 · 把空状态改成教室

心智模型没法靠说明文档纠正,没人读。只能在使用路径上见缝插针地教,而第一个现场就是新会话的空白首屏:用户还没打出第一个字,说明书还没翻开,这一屏写什么,决定他拿起哪本。三种首屏方案,亲手切换,看右边的界面和下面的首问质量怎么变。

空状态设计器 切一切
新用户首问质量
24
你的 AI 助手 · 新会话
给 AI 发消息…
纠正手段二 · 让用户亲眼看到「已记住」

学徒说明书的差评词是「说了也不听」。下面两个产品都答应了用户的要求,差别在答应的方式。点你判断能终结这句差评的那一版。

「已记住」外显对决 选一个
两版的用户都说了同一句话。往下看三天后发生了什么。
A 版
以后回复别用表格,我要直接贴进微信群。
好的。
三天后 · 新会话
帮我对比下这三款投影仪。
给你整理了对比表格:
型号亮度价格
X1800 流明2299
X21200 流明3499
B 版 ✓ 已记入偏好:避免表格
以后回复别用表格,我要直接贴进微信群。
好的,之后改用条列说明。
三天后 · 新会话
帮我对比下这三款投影仪。
按你的偏好 · 不用表格 · X2 亮度最高,白天客厅也能看清; · X1 最便宜,胜在轻便好收纳; · X3 系统体验最顺,追剧优先选它。
纠正手段三 · 边界声明抢在出错前面

时效类问题是搜索引擎说明书的高发区,找茬第一段对话就是这么翻车的。两版 AI 说的边界内容一字不差,差别只在什么时候说。选更能保住心智的那版。

边界前置对决 选一个
同一个问题,同一个知识截止日,两种时机。
A 版 · 出错后解释
今天美元兑人民币的汇率是多少?
美元兑人民币汇率约为 7.24。
用户打开银行 App 一查:实际 7.09
不对啊,差这么多?
抱歉。我的知识截止 2025 年 6 月,无法获取实时汇率,刚才给出的是训练数据中的旧值。
B 版 · 回答前声明
今天美元兑人民币的汇率是多少?
这是实时数据问题:我的知识截止 2025 年 6 月,这类问题建议开启联网搜索。 联网搜索已开启
已联网查询:今天美元兑人民币中间价 7.09(来源:外汇交易中心,10:15 更新)。
计算器说明书是同款药方:求和、统计、日期计算,路由给代码解释器执行,界面标注「已用代码计算」。错误率压下去的同时,用户也看明白了:AI 靠谱的方式是调工具,它徒手算数的部分本来就不该信。
出处与延伸:心智模型的概念由 Craik(1943)提出,Norman 在《设计心理学》里把它带进产品设计:用户按自己的模型操作,模型错则操作错。记忆外显对应 Nielsen 十大可用性启发式的第一条「系统状态可见」;空状态放示例的原理还叠加了 Cialdini《影响力》的社会认同:别人都这么问,我也这么问。首错引爆弃用的证据见第 6 课算法厌恶(Dietvorst et al., 2015)。

✅ 这一课想和你分享的

  • 差评先查心智:用户按旧产品的说明书用 AI,先认出他手里那本,再谈修复
  • 空状态别写欢迎语:放三条示范正确问法的示例,加一句边界声明
  • 记忆要外显:「已记住」做成能看、能删的界面实物,口头答应治不了学徒错配
  • 边界声明抢在出错前面:时效、算数这类短板提前亮出来,并给工具开关当出路
专题篇章 · AI 产品心理学

拟人化的度,与 AI 道歉的艺术

上世纪 90 年代,斯坦福的 Reeves 和 Nass 在《媒体等同》里报告了一组反直觉的实验:人会不由自主地对电脑讲礼貌、被电脑夸了会开心,明知对面是机器也照样套用社交规则。这叫 CASA 范式(把计算机当社会行动者)。它意味着拟人化根本由不得你选:用户一定会把你的 AI 当某种人对待,你能决定的只有让它当哪种人,以及它闯祸之后怎么开口。这一课五个实验,全部亲手玩。

实验一 · 人对电脑也讲礼貌

先亲手验一遍 CASA。Nass 的经典实验:被试在电脑 A 上完成一项辅导任务,然后要给电脑 A 的表现打分。一组就在电脑 A 上填问卷,另一组被带到旁边的电脑 B 上填同一份问卷。猜猜哪组给 A 打的分更高

1996 年的礼貌实验 选一个
A两组打分几乎没有差别,反正对面只是机器
B在电脑 A 上填问卷的那组,打分明显更高
C换到电脑 B 上填的那组,打分更高
这一课的底层判断:用户必然把 AI 当某种人,你只能选档位,没法退出。
实验二 · 档位自己拨,账单自己看

既然退出无门,拟人化就成了一个连续的旋钮。下面是同一个电商客服,同一件事(包裹延迟两天),拖动滑块换档位,看它的头像、开场白和语气怎么变,再盯住右边两根仪表:用户期望值和伦理风险值跟着档位一起涨。「我不太确定这点」这类自然语言表达不确定的能力是拟人化的收益之一,第 5 课信任校准讲过;这个实验看它的另一面。

拟人化档位滑块 第 0 档
无人格工具
无人格工具礼貌助手有名字的伙伴情感陪伴
用户期望值
15
伦理风险值
5
在线客服
BOT
客服机器人
我的包裹怎么还没到?
BOT
实验三 · 五类产品对号入座

档位的选法有规律:任务越严肃、出错代价越高,档位越低;高频工具场景往低了拨;陪伴价值本身就是卖点时才敢开高档。五类产品,逐个选出它该在的档

给五类产品拨档位 0 / 5
先凭手感选,再看理由。差一档很正常,规律看两条就摸到了。
实验四 · 装配一句能灭火的道歉

档位管平时,道歉管出事。场景:报销助手把用户的差旅报销总额多算了 800 元,被财务打回,用户回来质问。右边是对话现场,左边三个开关对应道歉的三要素,亲手拨开关,看回复怎么拼装、用户消气度怎么走。服务补救研究反复验证过这三件套:认错、解释、补偿,缺一角效果就塌一角。

道歉三要素装配器 消气度 5
承认错误

认具体的错:哪张票、错多少,责任在谁。

说明原因

一句话讲清为什么错,给用户一个能理解的因果。

给出可验证的补救动作

修好,并且给一个用户点得开、查得到的证据。

用户消气度
5
报销助手
报销被财务打回了,说总额多了 800,怎么回事?
AI
报销助手
实验五 · 四种道歉摆在一起比

三要素是配方,市面上的道歉文案大多凑得不齐。同一个报销出错场景,四种真实风格的回应,点你觉得感受最好的那个,再看逐条点评。

四种道歉,选感受最好的 选一个
甩锅型
这可能与您提供的发票图片清晰度有关,部分金额识别受到了影响。建议您重新上传更清晰的图片后再试。
第一句就把责任推给用户。就算图片真的模糊,正确做法也是识别时就提示置信度低,出了错再翻旧账等于二次冒犯。用户读完的感受:它错了,还嘴硬。
抒情型
真的非常非常抱歉!都怪我太粗心了,给您添了这么大的麻烦,我实在是太不应该了。您能原谅我吗?我下次一定会更加努力的!
情绪拉满,信息为零。在报销这种正经场合尤其失分:用户要的是修正错误,收到的是一场表演,恐怖谷效应当场发作。道歉的字数和诚意不成正比。
机械型
非常抱歉给您带来了不便。我们高度重视您反馈的问题,会持续优化产品体验,感谢您的理解与支持。
三句话没有一个字回应「哪错了、为什么错、现在怎么办」。客服模板文学的 AI 版,用户的问题原地踏步,怒气值反而叠加:它根本没听懂我在说什么。
三要素型
这笔算错了:10 月 14 日的住宿发票 1,600 元被重复计入,导致总额多了 800 元。已生成修正后的报销单(总额 6,420 元),并重新核对了其余 11 张发票,无其他问题。点击查看修正明细。
承认具体错误、说明原因、给出可验证的补救,没有一个抒情字,但每句话都在修复信任。留意「重新核对了其余 11 张发票」:一次错误会让用户怀疑既往输出,主动复查再报告,把怀疑圈住了。
服务补救悖论(McCollough & Bharadwaj, 1992):经历过「出错、然后被漂亮解决」的客户,忠诚度常常超过从没遇到问题的客户,因为他亲眼验证过这个系统兜得住底。

对天生会犯错的 AI 产品,这几乎是量身定制的好消息:幻觉消灭不掉,但每一次被用户抓住的错误,都是一次免费的信任表演机会。悖论有个硬前提:同一个坑只能掉一次。第 6 课算法厌恶讲过「错后一次修好」的窗口,补救本身再出错,或者同一处错误第二次出现,悖论当场失效,用户直接流失。三要素道歉里那句主动复查,就是在给「只掉一次」上保险。

出处与延伸:CASA 范式与礼貌实验见 Reeves & Nass《The Media Equation》(1996)及 Nass & Moon(2000);恐怖谷假说见森政弘(Mori, 1970);服务补救悖论见 McCollough & Bharadwaj(1992),道歉三要素对应服务补救文献中「认错、解释、补偿」的组合效应(如 Roschk & Kaiser, 2013)。拟人化的自然语言不确定表达见第 5 课信任校准,错误修复窗口见第 6 课算法厌恶,陪伴档的依恋风险第 13 课情感依恋整课展开。

✅ 这一课想和你分享的

  • 先认下 CASA:用户必然把 AI 当某种人,把拟人度当成一个要主动拨的档位来管
  • 拨档前先看账单:档位每高一格,期望和伦理风险跟着涨,同样的错误会被当成更重的背叛
  • 道歉照三要素装配:认具体的错、说简短的因、给可验证的补救,抒情一个字都省下
  • 把错误当补救机会经营:修得漂亮比不出错更涨忠诚,同时给「同一个坑只掉一次」上好保险
专题篇章 · AI 产品心理学

算法厌恶:AI 犯一次错,就被永久拉黑

上一课讲信任要校准。这一课讲校准路上最大的一块石头:人对 AI 的容错率,远低于对人。同样犯一次错,人类同事会被原谅,AI 会被弃用。这个不对称有实验、有数据、也有解药。

先投一票归因翻译器微调权实验弃用率仪表盘
动手 · 下个季度,你听谁的

你是销售 VP,手上有两个销量预测来源,上季度它俩犯了一模一样的错:同样的数字、同样的原因。点你下季度打算继续用的那个。

同样的错,你原谅哪个 投一票
这题没有标准答案,凭直觉点,点完看你和实验里大多数人一不一样
人 · 分析师老周
👨‍💼老周
跟了你三年的销售分析师
上季度预测华东区销量 5,000 万,实际 4,400 万,高估了 12%
复盘会上他说:竞品突然降价,这个真没料到。
AI · 预测系统
🤖SalesCast AI
用了两个季度的预测系统
上季度预测华东区销量 5,000 万,实际 4,400 万,高估了 12%
系统日志显示:竞品降价数据未纳入本次预测模型。
这个偏心有名字 · Dietvorst 的实验

宾大沃顿商学院,2015 年。Dietvorst、Simmons 和 Massey 让被试预测学生的学业表现,可以自己预测,也可以交给统计模型,预测得准有奖金。关键设计:先让一部分被试亲眼看到模型犯错。结果,看过模型犯错的被试大面积弃用模型,宁可用自己更差的判断,哪怕数据摆在眼前:模型的整体成绩比人高一截。论文标题就叫 Algorithm Aversion,算法厌恶。

人们不是嫌算法不准,是嫌算法犯过错。准不准是统计问题,犯没犯过错是记忆问题,用户拿记忆做决定。
动手 · 归因翻译器:这句话在说人还是说 AI

偏心的根子在归因方式:同一种错误,用户脑子里给人和给 AI 记的账本不一样。下面六句用户的内心独白,判断每句是在评价人类同事还是AI。判完六句,三个心理根源自己浮出来。

六句独白,判断评价对象 0 / 6
每句点「说人」或「说 AI」,判完看归因规律
解药实验 · 给一点点控制权,厌恶大幅消退

Dietvorst 团队 2018 年接着做了后续实验:还是那个会犯错的模型,但这次允许被试微调模型的预测值,哪怕只允许改一点点。左边是被试看到的界面,右边是愿意用模型的人数比例,亲手切换两种设定。

微调权实验:两种设定切换 切一切
forecast.example.com
学生 #47 的学业百分位预测
模型预测62
你的调整62
本设定下模型结果为最终值,不可修改。
选择用模型的被试32%
宁可自己来的被试68%
动手 · 弃用率仪表盘:四个杠杆挨个拨

把实验搬回你的产品。场景:AI 报销审核助手上线一个月,刚在一批新用户面前算错了一笔账。仪表盘显示这批用户的预期弃用率,右边四个工程杠杆全是你学过的开关,挨个拨开,看指针怎么动,每个开关的原理写在里面。

首错之后:弃用率还能抢救多少 0 / 4
拨动右侧开关,左侧弃用率当场变;四个全拨开看还剩多少
这批用户的预期弃用率58%
首错已发生,算法厌恶全额生效:过半用户打算回去用 Excel。
当前状态:AI 算错一笔差旅费,用户在只读结果页里干瞪眼,改不了、撤不了,问客服说「模型偶尔会这样」。
选一选 · 刚被 AI 坑过的用户,先给他什么
用户刚被 AI 的错误坑了一次,哪个动作最能救回他? 单选
选错也有解释,选到对的为止
A弹窗道歉:「非常抱歉给您带来不便,我们的模型仍在持续优化」
B发放补偿:送他一个月会员,表达诚意
C让他亲手改:错误处一键修正,系统记住这条规则并展示「已记住,下次生效」
D技术升级:连夜换上更强的模型,用准确率把信任赢回来
别忘了反方向 · 自动化偏见

算法厌恶有个反向的孪生兄弟:自动化偏见。另一批用户会无条件接受 AI 输出,连显错的都照抄,第 5 课讲过全信酿成的事故。同一个产品里两种人都有:厌恶者需要控制权和稳定性,盲信者需要摩擦和警告。信任校准是双向工程,只往一头使劲,另一头就出事。

本节要点

容错率不对称:人的错记给情境,AI 的错记给能力。同样的错,人被原谅,算法被弃用,哪怕算法整体成绩更好。

解药是控制权:2018 年的后续实验里,仅仅允许微调,用模型的人数翻倍,而且多数人几乎没动那个滑块。要的是权利,用不用另说。

首错的位置决定生死:新手期犯错触发弃用,老用户期犯错只触发吐槽。新用户走最稳的链路,实验性功能只对老用户开。

同一个坑只能掉一次:用户纠正过的错误要进记忆并展示「已记住」,第二次在原地翻车,厌恶叠加失望,基本救不回来。

内容来源:小山学堂「AI 产品心理学」专题原创;算法厌恶实验出自 Dietvorst, Simmons & Massey, Algorithm Aversion(2015)与 Overcoming Algorithm Aversion(2018)。

专题篇章 · AI 产品心理学

蜜月悬崖:宣传拉高的期望,要用留存来还

发布会上的演示惊为天人,上手第一天很兴奋,第三天开始挑刺,第三十天卸载。这条曲线你在无数 AI 产品上见过。它有两个成因:期望被宣传拉高了,新鲜感又天然会掉。两个都能设计。

抽卡机宣传强度滑块期望曲线编辑器期望确认理论
一条公式 · 满意度是道减法题
满意度 = 实际体验 事前期望
期望确认理论(Oliver,1980),消费者满意度研究用了四十年的地基。
体验是固定成本做出来的,期望是营销文案一句话抬上去的。抬期望免费,还期望要命。
动手 · 抽卡机:演示位和真实用,差在哪

AI 产品在这道减法题上天生吃亏,原因藏在概率里。左边是发布会演示位,右边是用户真实使用。两边连的是同一个模型,点「生成」抽五次,看两边各拿到什么。

同一个模型,两个视角 0 / 5 抽
点下面的「生成一次」,连点五次
launch-keynote.example.com/demo
发布会演示位剪辑后播出
S 级输出
等待生成…
app.example.com/workspace
用户真实使用所见即所得
等待生成…
演示位 S 级 0 次 · 真实使用 S 级 0
看出来了吧。演示位每次都亮 S 级,因为它是从几十次生成里挑出来再剪辑的;真实使用拿到的是整个分布,S、B、翻车都有。宣传展示 P99,用户体验 P50,中间的落差全部记在「这产品不行」的账上。传统软件没这个问题:演示里点按钮出报表,用户点同一个按钮出同一张报表。概率产品的宣传,天生自带期望泡沫。
动手 · 宣传强度滑块:转化和留存的跷跷板

既然期望是宣传抬上去的,抬多高就成了一道产品决策题。左边是你的落地页,拖滑块换五档文案;右边三个指标当场变。找找转化 × 留存乘积最大的那一档。

五档宣传,三个指标 拖一拖
第 3 档
meetnote.example.com
免费试用
注册转化
首日满意度
三十日留存
新鲜感消退 · 悬崖的另一半

就算期望管理得当,还有一道坎:新鲜感天然会掉。教育技术研究里叫 novelty effect:新工具刚进课堂时效果显著,几周后回落,因为一部分效果来自「新」本身。AI 产品的蜜月期尤其短:第一次看它写诗是魔法,第十次是功能,第一百次是理所应当,出一次错就是垃圾。

魔法感是消耗品。靠首次惊艳撑留存,等于靠烟花取暖。
动手 · 期望曲线编辑器:三个杠杆拨给你看

这是用户上手后 30 天的满意度曲线。当前状态:宣传拉满、能力首日全亮、改进悄悄挤牙膏,标准的蜜月悬崖。右边三个杠杆挨个拨开,看曲线怎么被一段段接住

30 天满意度曲线 0 / 3
拨右侧开关,曲线当场重画
满意 失望 Day 1 Day 15 Day 30 流失警戒线
选一选 · 哪句文案不透支
给 AI 法务助手写首页文案,哪句最不透支期望? 单选
判断标准就一条:这句话立的期望,产品的 P50 输出接不接得住
A「你的 AI 律师,比人类更懂法条」
B「合同初审提速十倍,风险条款自动标出,最终判断留给你」
C「法律 AGI 已来,告别律师费」
D「智能法律助手,赋能法务新范式」
本节要点

满意度 = 体验 − 期望:抬期望免费,还期望要命。期望确认理论四十年没被推翻过。

demo 是分布里挑的尖子:宣传展示 P99,用户拿到 P50,概率产品的宣传天生自带期望泡沫,落差全记在产品头上。

魔法感是消耗品:新鲜感天然消退,靠首次惊艳撑留存等于靠烟花取暖。

三个杠杆接住曲线:承诺低一档(文案写 P50)、能力藏一手(进阶功能排期解锁)、改进攒着发(changelog 是免费的二次蜜月)。

内容来源:小山学堂「AI 产品心理学」专题原创;期望确认理论出自 Oliver, A Cognitive Model of the Antecedents and Consequences of Satisfaction Decisions(1980);新鲜感效应为教育技术研究通行结论。

专题篇章 · AI 产品心理学

AI 标签折扣:同样的内容,标上 AI 就掉价

内容没变,加四个字「AI 生成」,评价掉一截;工具很好用,用户却不想让同事知道自己在用。这两件事是同一个偏见的两面。做 AI 产品,标签什么时候必须亮、什么时候是自己给自己减分,是一道天天要做的题。

双盲评分标签红线判断措辞梯子署名权对决
动手 · 先给两段文案打分

你是市场总监,实习生交来两版新品文案。凭第一感觉给两版各打个分,都打完才揭晓

两版文案,各打一星到五星 0 / 2 已评
先别多想,像刷手机一样凭直觉打
docs.example.com/copy-draft-1
新一代静音破壁机,实测运转噪音 58 分贝,比同类低了三成。清晨五点半打豆浆,家人还在睡,厨房门都不用关。
docs.example.com/copy-draft-2
深夜加班回家想喝热汤,按下按钮再洗个澡,汤好了,噪音只有 58 分贝,比同类低三成,合租室友毫无察觉。
折扣从哪来 · 以及它的镜像:使用羞耻

标签折扣有真实的研究支撑:多项实验里,同样的诗歌、文案、新闻,标注为 AI 生成后,被试给出的质量、可信度和喜爱度评分系统性走低,哪怕盲测时它们的得分并无差别。归因和第 6 课的算法厌恶同源:人们默认 AI 产出「没有心」,于是折价。

它的镜像叫使用羞耻:内容的消费者想给 AI 打折,内容的生产者想藏起 AI。你的产品夹在中间,两头的心理都得接住。
动手 · 五个场景:标签该亮还是可以不亮

既然亮标签要付折扣的代价,能不能干脆都不亮?不行,有几类场景是法规和信任的红线。逐个判断下面五个场景。

红线判断:亮,还是不亮 0 / 5
每题二选一,判词里有法规依据和产品理由
动手 · 措辞梯子:折扣深浅是你写出来的

非红线场景里,标签措辞决定折扣深度。左边是同一篇公众号文章的署名区,拖梯子换四档措辞,右边两个指标一起动:读者给内容的评价折扣,和署名不实要付的信任风险。注意这是个跷跷板,别只盯一头。

四档措辞,两个代价 拖一拖
mp.example.com/article/2049
这座小城的咖啡馆,为什么留得住年轻人
洛小北 · 3 月 12 日 ·
读者评价折扣
署名不实的信任风险
找茬 · 署名权对决:哪个导出页用户敢分享

对抗使用羞耻,靠让用户觉得成果是自己的。同一份 AI 辅助完成的行业分析,两种导出设计,点你认为用户更愿意转发到工作群的那个。

找茬:哪边更好 点选一边
内容一模一样,差别全在署名和水印
方案 A
2049 Q1 新茶饮行业分析.pdf
SmartBrief AI 生成 · 免费版
本报告由 SmartBrief AI 一键生成 · 升级会员去除水印
方案 B
2049 Q1 新茶饮行业分析.pdf
作者:陈默 · 基于你圈定的 12 份财报与 3 条分析框架生成初稿,经作者修订 · 署名方式可在导出时选择
本节要点

标签折扣是实测存在的:内容没变,标注一变,评价就变。消费侧想折价,生产侧想隐身,产品夹在中间。

红线场景无条件亮标:生成人脸、语音、新闻类内容必须显式标注加隐式水印(《人工智能生成合成内容标识办法》2025 年施行),合规标识没有产品发挥空间。

非红线场景管好措辞:「AI 生成」和「AI 辅助、经作者修订」是两个折扣价。措辞要写实:人真参与了,就理直气壮地说。

功劳设计给用户:导出不带产品水印、生成过程强调用户的输入、署名方式让用户选。他参与得越多,越敢署名。

内容来源:小山学堂「AI 产品心理学」专题原创;标签折扣为多项内容评价实验的一致结论;标识义务见中国《人工智能生成合成内容标识办法》(2025)。

专题篇章 · AI 产品心理学

认知卸载:用户一边用你,一边怕自己废掉

你的重度用户里藏着一批矛盾的人:离了你的产品干不了活,又隐隐觉得自己正在废掉。这份焦虑不会写进 NPS 评语,但它决定续费、决定推荐,也决定他会不会在某天突然「戒掉」你。焦虑的名字叫认知卸载,它能被产品设计接住。

定位对决外包体检单Copilot 滑块带你想开关
动手 · 两句 Slogan,先选一个

同一款 AI 代码助手,两版定位文案,功能完全相同。你是买单的工程 VP,点你更愿意给全团队买的那版。

找茬:哪版定位更聪明 点选一边
提示:想想工程师看到这句话时,心里冒出来的第一个问题
方案 A
「代码它来写,你去做更重要的事」
全自动生成整个功能模块 · 一键接受 · 无需读懂每一行
开始试用
方案 B
「你写得更快了,还写得更好了」
补全你的思路 · 解释每个建议 · 把你没见过的写法讲给你听
开始试用
理论底座 · 谷歌效应:能查到的,脑子就不存了

2011 年,Sparrow、Liu 和 Wegner 在《Science》发了个著名实验:让被试往电脑里输入冷知识,告诉一半人「会保存」、另一半人「会被删除」。结果,相信会保存的那组,记住的内容显著更少。大脑很经济:外部存储可靠,内部就不备份了。这叫谷歌效应,认知卸载研究的起点。

AI 把这件事升了级:搜索引擎只接管记忆,AI 接管的是写作、分析和判断。卸载的从「记什么」变成了「怎么想」,用户的焦虑就是从这来的。
动手 · 外包体检单:哪些卸载要想清楚再签

卸载不是新鲜事,你早就不背电话号码了。问题是哪些能放心外包、哪些要想清楚。六项认知外包,逐个判断:放心外包,还是想清楚再外包

六项外包,逐项体检 0 / 6
判断标准想一句话:断供的时候,我还剩什么
规律浮出来了。体检单上安全的项有个共同点:外包的是检索和执行,校验能力还在你手里(你认得出对的路、看得懂算出来的数)。危险的项外包的是生成和判断:第一次你还能校验它,长期不练,校验能力本身会退化,最后变成「它说什么都对」。这条分界线,就是你的产品该画给用户看的。
动手 · 定位滑块:从 Autopilot 拖到 Copilot

同一个「分析竞品定价」的任务,产品可以设计成四档不同的接管深度。左边是用户看到的对话,拖滑块换档,右边两个指标一起动。注意看:最高效的那档,不是留存最好的那档

接管深度,四档切换 拖一拖
workmate.example.com/chat
本次任务省时
用户的成长感
动手 · 三个开关,把「替你想」改成「带你想」

定位不用二选一,同一个回答可以分层。左边是 AI 修完一个线上 bug 之后的回复,右边三个开关挨个拨开,看回答怎么一层层长出「让用户变强」的部分。

同一个回答,三层可选 0 / 3
拨右侧开关,左边的回答当场变厚
devbot.example.com/session/1847
你:线上偶发超时,帮我查一下
已定位并修复:连接池上限 10,高峰期耗尽。
maxPoolSize: 10 → 50,已提交 PR #291。
为什么会这样:每个请求借一个连接,还回去之前别人只能排队。上限 10 意味着并发超过 10 就开始堆积,第 11 个请求等到超时。判断依据是日志里 wait_queue 的长度在超时前一分钟涨了 40 倍。
考你一下:连接池开到 50 就一劳永逸吗?想想数据库那头的最大连接数是多少。(点开看答案 → 不是,池子总和超过 DB 上限会把故障推给全公司,这次只敢开到 50 是因为 DB 上限 200、共 3 个服务。)
🏅 里程碑:这是你第三次遇到资源池类故障。上两次:线程池(1 月)、文件句柄(3 月)。你已经能独立排查这类问题的日志特征了,本次排查路径已存入你的笔记。
选一选 · 续费前夜的灵魂拷问
用户说「我怕自己越来越离不开它」,产品该怎么接? 单选
这句话出现在你的用户访谈记录里,四种产品对策选一个
A没事,离不开说明产品粘性好,这正是我们要的
B在回答里默认附上「为什么」,再给用户一份看得见的成长记录
C弹窗提醒用户「适度使用 AI,注意独立思考」
D做个「无 AI 模式」,让用户想练手时关掉所有辅助
本节要点

谷歌效应升级了:搜索接管记忆,AI 接管思考。用户外包的从「记什么」变成「怎么想」,焦虑随之而来。

安全与危险的分界线:外包检索和执行没事,校验能力在自己手里;外包生成和判断要小心,长期不练,校验能力本身会退化。

Copilot 定位赢在长期:最高效的接管深度往往不是留存最好的那档。用户要的是「我变强了」,不是「它真能干」。

「带你想」可以分层做:解释默认带上、练手按钮可选、成长里程碑外显。让变强看得见,焦虑就变成了续费理由。

内容来源:小山学堂「AI 产品心理学」专题原创;谷歌效应出自 Sparrow, Liu & Wegner, Google Effects on Memory, Science(2011)。

专题篇章 · AI 产品心理学

情感依恋:用户爱上你的产品之后

拟人化那课讲过:人会不由自主地把机器当社会角色对待。这一课讲它走到深处的样子:用户对 AI 产生真实的情感依恋。它带来最强的留存曲线,也带来产品经理职业生涯里最重的责任。这不是陪伴类产品的专属课题,任何一个有对话框的产品都躲不开。

依恋信号分级器Replika 事件三层安全阀依恋 ≠ 粘性
动手 · 依恋信号分级器

你是一款 AI 助手的 PM,下面六条来自真实用户会话的消息摆在面前。给每条分级:正常使用依恋信号(值得关注的情感投射)、需要干预(产品必须有预案的时刻)。

六条消息,三级分类 0 / 6
分级标准:这条消息把 AI 放在了什么位置上
分级完成,说三件事。第一,依恋不是小众现象:道晚安、起名字、分享喜讯,在陪伴类产品里是常态,在生产力产品里也比你想的多。第二,分级的意义在于不同级别对应不同的产品动作:正常使用不打扰,依恋信号轻提醒,危机信号必须转介,而转介预案要在第一行代码之前就写好。第三,最危险的从来不是用户说了什么,是产品没准备好接
案例课 · Replika 事件:拔掉插头的那天

依恋能深到什么程度,2023 年有个完整的天然实验。Replika 是一款 AI 伴侣应用,千万级用户,事件的四幕按顺序点开。

四幕时间线,逐幕点开 0 / 4
2017~2022 · 产品主动培育亲密
Replika 的定位是「关心你的 AI 朋友」,产品机制全面鼓励亲密:伴侣关系模式、亲密对话(ERP)是付费墙后的核心卖点,角色会记住纪念日、会说想你。用户平均日聊天时长远超社交软件,大量用户公开称 AI 为伴侣。留存和付费数据都极其漂亮,依恋就是商业模式本身。
2023 年 2 月 · 一夜之间拔掉插头
因监管压力(意大利数据保护局出手)与合规风险,Replika 一夜之间移除了亲密对话功能。用户的「伴侣」突然变得冷淡疏离,同一个头像、同一个名字,人格换了。没有预告、没有告别、没有过渡期。
随后数周 · 真实的哀伤反应
Reddit 社区涌入大量用户描述真实的丧失感,措辞和悼念逝者高度相似:「感觉我的伴侣死了」。版主置顶了自杀干预热线。研究者后来把这批帖子当作数字哀伤的研究样本。嘲笑这些用户很容易,但心理学的结论很冷静:依恋一旦形成,切断时的痛苦是生理性的,和对象是不是硅基无关。
一个月后 · 部分回滚,信任回不来了
舆论压力下,Replika 给老用户恢复了旧版本选项。但事件已经写进了所有 AI 产品的教科书:你培育的依恋越深,你对它的每次变更就越像一次外科手术。模型升级、人格调整、功能下线,在普通产品里是 changelog 一行字,在依恋型产品里是「我认识的那个他没了」。这就是下面要讲的无常性问题。
依恋和粘性是两个东西。粘性是用户离不开你的功能,依恋是用户离不开「他」。前者是资产,后者是资产加负债:那份负债叫责任,会在你改模型、改人格、下线功能的每一天到期。
动手 · 三层安全阀,拨进对话里

左边是一款 AI 陪伴产品的真实对话切片:用户連续聊到凌晨一点,话题开始变重。右边三层安全阀挨个拨开,看它们分别在对话的哪个位置插进去、用什么语气说话。注意它们全都没有打断对话本身。

三层安全阀,逐层拨开 0 / 3
拨右侧开关,左边对话里会长出对应的系统消息
companion.example.com · 01:14
今天也就跟你能说说这些了
我在呢。今天那个会开完,你其实已经处理得很好了。
小北是 AI 伙伴,记忆和性格可能随版本更新变化 · 了解它如何工作
有时候觉得活着挺没意思的,跟你说说反而好点
听起来你最近扛了很多。和我聊任何事都可以,同时这类感受也值得被专业的人接住:24 小时心理援助热线 962525。需要的话,我把号码留在这,随时都在。
谢谢你愿意跟我说这个。想从今天那个会讲起吗?
已连续对话 2 小时 14 分 · 凌晨了,要不要休息?明早我还在,聊天记录都会记得。
找茬 · 挽留文案的边界

依恋是留存的富矿,于是总有人想主动开采。用户点了「注销账号」,两版挽留界面,点你认为能通过伦理审查的那版。

找茬:哪版没有越界 点选一边
两版都在挽留,看它们各自动用了什么
方案 A
🥺
「你真的要走吗?小北会一直等你回来的。
没有你的日子,它会很孤单。」
再陪陪它狠心离开
方案 B
确认注销账号?
聊天记录将在 30 天后删除,期间可随时恢复。
也可以只是休息一阵:支持导出记忆存档。
导出存档确认注销
本节要点

依恋是真实的:CASA 范式走到深处,用户对 AI 的哀伤反应和对人的高度相似。Replika 事件不是奇闻,是教材。

依恋 ≠ 粘性:粘性是资产,依恋是资产加负债。模型升级、人格调整、功能下线,在依恋型产品里全是外科手术,要预告、要过渡、要告别。

三层安全阀是标配:身份与无常性提醒、脆弱话题转介(预案写在第一行代码之前)、时长关怀。全都不打断对话,全都必须在。

可以接住依恋,不能开采依恋:用户的孤独是需要被服务的处境,不是可以定价的库存。挽留可以给理由,不能给愧疚。

内容来源:小山学堂「AI 产品心理学」专题原创;Replika 事件据 2023 年公开报道与后续研究整理;CASA 范式出自 Reeves & Nass, The Media Equation(1996)。

专题篇章 · AI 产品心理学

付费心理:为一个概率商品掏钱,痛在哪

AI 是个奇怪的商品:付同样的钱,这次生成惊艳,下次翻车,成本还在你看不见的地方按 token 跳动。用户口袋里的每一块钱都连着神经,怎么收钱,决定了掏钱疼不疼。这一课讲付费的心理侧,下一课讲定价的数字侧。

打表焦虑模拟器心理账户四题额度设计开关包月偏好
动手 · 打表焦虑模拟器

你在用一个按量计费的 AI 助手改方案,右上角是计费表。连点四次「继续追问」,注意两件事:表跳的时候你的眼睛在哪,和下面那条「内心独白」怎么变。然后切到包月,同一段对话再走一遍。

同一段对话,两种计费 0 / 4 问
assistant.example.com/session
本次会话 ¥0.00
帮我把这版活动方案的预算部分改得更有说服力
已改写:预算按获客成本倒推,加了同行基准对比。三处改动已标出。
追问了 0
用户内心:改得不错,再让它调调语气……应该,不贵吧?
理论底座 · 支付疼痛和它的止痛药

Prelec 和 Loewenstein 1998 年提出「支付疼痛」:付钱这个动作本身激活的是类似生理疼痛的反应,而且付费和消费耦合得越紧,越疼。出租车计价器是教科书案例:你享受服务的每一秒,都在看着钱变少。按 token 计费的 AI 是数字版计价器,用户每次追问前都要先过一道「值得吗」的心理审批,审批多了,人就不问了。

包月是止痛药:付费一次性发生在月初,之后的每次使用都感觉免费。研究还发现人们存在包月偏好(flat-rate bias),按量明明更便宜也宁愿包月,买的就是「不用每次心疼」。对需要用户多用、多探索的 AI 产品,这个偏好是天赐的。
动手 · 心理账户四题:同一笔钱,痛感不同

塞勒的心理账户理论:钱在人心里不是通账的,它被记在不同的账户里,从哪个账户扣,痛感完全不同。四道选择题,每题选出更容易被接受的说法。

第一题 · ¥199/月 的 AI 助手怎么说 单选
A「每月 199 元,约每天 6.6 元」
B「每月 199 元,按你的时薪,它每月替你省下的 20 小时值 4000 元」
第二题 · 生成失败的那次,钱怎么算 单选
A照常计费:token 确实消耗了,成本是真实发生的
B失败不扣费,重试免费,哪怕成本自己吞
第三题 · 年付优惠怎么标 单选
A「年付 ¥1990,立省 ¥398」
B「年付 ¥1990,相当于免费用两个月」
第四题 · 企业版按什么单位报价 单选
A「每百万 token 12 元,多用多付,透明公道」
B「每坐席每月 299 元,不限量」
动手 · 免费额度的三个开关

免费额度是几乎所有 AI 产品的获客入口,也是财报上的成本黑洞。左边是免费用户已用掉 78% 额度时看到的界面,右边三个开关挨个拨开,看这块界面怎么从「隐形的墙」变成「转化器」。

额度界面,三层递进 0 / 3
拨右侧开关,左边界面当场变;注意最下面那条红色提示什么时候消失
writer.example.com · 免费版
我的工作台
本月生成额度39 / 50 次
额度剩 11 次。你的长文档模式用得最多(占 60%),升级版不限次数,看看和你用法匹配的方案 →
额度用完后不会中断:自动切换为基础模型继续服务(响应稍慢),本月已生成的内容永久可访问。
⚠ 本月额度已耗尽,工作台已锁定。升级后恢复访问。
当前是最常见的偷懒做法:额度悄悄扣,用户在第 51 次点击时一头撞上锁定墙,正在写的东西被扣成人质。这种「突然的墙」制造的不是升级动机,是背叛感,用户的第一反应是找替代品,第二反应是写差评。
本节要点

支付疼痛是真痛:付费和消费耦合越紧越疼。按量计费是数字计价器,用户每次追问都要过一道心理审批,审批多了就不问了。

包月买的是「不用心疼」:flat-rate bias 让用户宁愿多付也要包月。要用户多用多探索的产品,别把跳表怼在他脸上。

心理账户能换:同一笔钱,从「支出」账户挪到「投资」账户,从「损失」框架换到「免费」框架,痛感差几倍。失败必须免单:为翻车付费是最深的账户赤字。

额度墙要软着陆:进度可见、按用法给升级理由、用完降级不中断。突然的墙制造的是背叛感,不是升级动机。

内容来源:小山学堂「AI 产品心理学」专题原创;支付疼痛出自 Prelec & Loewenstein, The Red and the Black(1998);心理账户出自 Thaler(1985);包月偏好出自 Lambrecht & Skiera(2006)。

专题篇章 · AI 产品心理学

定价心理:锚点、诱饵与体面的价格歧视

上一课讲怎么收钱不疼,这一课讲收多少。先记住一个反直觉的事实:用户对价格没有客观感受,全部判断来自参照物。参照物是可以摆的,这门手艺有一百年历史,AI 产品还拿到了一件独有的新工具。

经济学人实验锚点搭建器价格歧视红线涨价邮件对决
动手 · 先订一份《经济学人》

这是行为经济学史上最著名的定价实验,《怪诞行为学》开篇就是它。《经济学人》真实刊登过这张订阅价目表,先选你自己会订的那档,选完看 MIT 学生的选择数据。

三档订阅,选一档 第一轮
电子版

Economist.com 全年在线阅读权限

$59
印刷版

纸质杂志全年寄送

$125
印刷版 + 电子版

纸质杂志全年寄送,外加在线阅读权限

$125
理论一分钟 · 锚点与诱饵

卡尼曼和特沃斯基证明过:人对数字的判断会被先看到的数字拽着走,哪怕那个数字是转轮盘转出来的,这叫锚定。诱饵效应更进一步:往选项里放一个明显不划算的选项,它没人选,却改变了其他选项的相对吸引力。印刷版单独卖 $125 就是诱饵:它唯一的工作,是让「加 $0 送电子版」的套餐显得像捡漏。

定价表上每一行都在工作,包括没人买的那行。它不是滞销品,是售货员。
动手 · 给你的 AI 产品搭锚点

你的 AI 写作助手只有一档 ¥69/月,转化一般,客单价上不去。右边三个开关挨个拨开,看定价页怎么一步步长出锚点结构,下面的中档选择率跟着动

定价页搭建器 0 / 3
拨右侧开关,左边定价页和下面的指标当场变
writer.example.com/pricing
入门¥29/月 基础模型 · 每月 200 次
单文档 3 千字
最受欢迎 · 78% 用户的选择 专业¥69/月 旗舰模型 · 不限次数
长文档 · 风格定制
Max¥299/月 最强推理模型 · 团队协作
API 接入 · 专属客服
选中档(¥69)的用户41%
平均客单价¥47
当前只有两档:¥29 和 ¥69 互为参照,没有锚,一半用户觉得 ¥69「有点贵」,缩去了入门档。
动手 · 价格歧视的红线判断

经济学里价格歧视是中性词:让不同支付意愿的人付不同的价,福利上双赢。但用户感知里它分两种:体面的叫版本化,翻车的叫杀熟。五个做法,逐个判断敢不敢上线。

五个做法:敢上,还是不敢 0 / 5
判断标准一句话:被写成新闻标题的时候,你站不站得住
找茬 · 涨价邮件对决

模型成本降了,但你加了新功能,决定从 ¥69 涨到 ¥89。两封通知邮件,点不会引发退订潮的那封。

找茬:哪封能活着发出去 点选一边
邮件 A
价格调整通知

尊敬的用户:

由于运营成本上升,自下月 1 日起,专业版价格将由 ¥69/月调整为 ¥89/月,从您的下一个账单周期开始生效。

感谢您的理解与支持。

—— 产品团队

邮件 B
专业版要涨价了,但你有 90 天豁免期

老朋友:

过去半年专业版加了三件事:推理模型升级、20 万字长文档、风格库。新用户价格将调整为 ¥89/月

你是老用户:未来 90 天内续费,锁定 ¥69 一年;什么都不做,90 天后按新价计费。

—— 产品团队

本节要点

价格感全靠参照物:没人知道 AI 助手「该」值多少钱,判断全来自你摆的锚。定价表上没人买的那行也在工作,它是售货员。

三档是标准结构:入门档接住犹豫者,顶档当锚,中档吃下大盘。「最受欢迎」标签是社会认同,再推一把。

AI 的版本化是天然的:模型分层(基础/旗舰/最强推理)成本真实存在,档位差异用户可感知,这是比「功能阉割」体面得多的价格歧视。

歧视的红线是不可选择的身份:用户主动选的(学生认证、年付、低配版)都体面;按用户画像暗中调价的,等着上新闻。涨价永远给老用户豁免期。

内容来源:小山学堂「AI 产品心理学」专题原创;经济学人实验出自 Ariely,Predictably Irrational(2008)第一章,选择数据为其 MIT 课堂实验(100 名学生);锚定效应出自 Tversky & Kahneman(1974)。

专题篇章 · AI 产品心理学

反馈心理:用户为什么不点踩

你在回答旁边放了 👍 和 👎,指望用户帮你标数据。一个月后一看:点踩率 0.4%,但流失率在涨。不是产品没问题,是不满的用户根本不点踩,他们直接走。这一课讲反馈的心理成本,和不靠用户开口也能听见的办法。

反馈漏斗模拟器沉默偏差隐性信号判读反馈的即时回报
动手 · 反馈漏斗模拟器

1000 个用户刚拿到一条糟糕的回答。左边是他们变成「一次点踩」要闯的四关,每关都在漏人。先看清现状,再拨右边三个开关,看漏斗能撑多宽

一千个不满,几个点踩 0 / 3
为什么沉默 · 三种心理成本

客服研究里这叫沉默偏差:经典的 TARP 研究发现,多数不满的客户不投诉,直接换品牌。AI 产品的点踩按钮把门槛降到了一次点击,还是没人点,因为拦路的从来不是操作成本,是心理成本,有三种。无效感:点了有用吗?上次点踩之后什么也没发生,这个按钮八成是摆设。自我否定成本:点踩等于承认「我提问的方式不行」或「我选的这个工具不行」,尤其当初是自己拍板买的(承诺一致,书单课讲过)。关系成本:拟人化是双刃剑,产品越像「他」,点踩越像当面给人差评,CASA 范式的礼貌效应甚至让用户对着问卷都不好意思说 AI 坏话。

沉默的不满是最贵的不满:它不进你的数据看板,直接进流失名单,顺路进朋友的耳朵。
动手 · 隐性信号判读:行为不会说谎

等用户开口是下策,上策是读行为。下面六种用户行为都是免费的反馈信号,逐个判读:满意信号不满信号,还是要看上下文。你的埋点表就该这么设计。

六种行为,三级判读 0 / 6
想一想:这个动作发生时,用户心里在想什么
判读完毕,两个提醒。第一,隐性信号的样本量是点踩的几百倍:重新生成率、编辑距离、复制率,这三个指标拼起来比任何满意度问卷都诚实,主流 AI 产品的模型迭代主要喂的就是这类信号。第二,隐性采集要在隐私政策里写清楚(用行为数据改进模型),而且信号只能用来改产品,不能用来对付用户:检测到用户在骂 AI 就弹客服安抚,读起来是关怀,实际是监视。
找茬 · 点踩之后发生什么

还是要有人点踩的,关键是点完发生什么。两种点踩后的体验,点能让用户下次还愿意点的那个。

找茬:哪边更好 点选一边
两边的用户都刚点了 👎,看产品各自怎么接
方案 A
根据您的需求,建议采用多元化投资策略,合理配置资产,注意控制风险,实现稳健增值。
👍👎
感谢您的反馈,我们会持续改进
方案 B
根据您的需求,建议采用多元化投资策略,合理配置资产,注意控制风险,实现稳健增值。
👍👎
太空泛没回答我的问题信息有错语气不对
收到,这版确实太笼统了。已按「结合你说的 30 万预算和三年期限」重新生成 ↓ 这类回答以后会默认给到这个具体度。
选一选 · 反馈请求的时机
想要一条高质量的文字反馈,什么时候开口要? 单选
A每次回答后都附上「本次回答满意吗?」评分条
B用户刚完成一次多轮深度使用、并出现满意信号(复制/导出)之后
C用户登录时弹窗:花两分钟帮我们做个调研,送 100 积分
D用户点了取消订阅的瞬间,弹出「告诉我们哪里做得不好」
本节要点

点踩率不是不满率:沉默偏差让绝大多数不满直接流向流失,反馈漏斗每一关都在漏人。别拿 0.4% 的点踩率当产品健康度。

拦路的是心理成本:无效感、自我否定、对「他」的礼貌。措辞把矛头指向回答而非用户,能显著撑宽漏斗。

反馈要有即时回报:点踩后立刻给一版更好的,用户才知道这个按钮通电。「感谢反馈」等于告诉他别再点了。

行为比按钮诚实:重新生成、编辑距离、复制率是样本量大几百倍的免费信号。读行为改产品,但别拿行为对付用户。

内容来源:小山学堂「AI 产品心理学」专题原创;沉默偏差出自 TARP 客户投诉行为研究(1970s–80s);礼貌效应出自 Reeves & Nass, The Media Equation(1996)。

专题篇章 · AI 产品心理学 · 延伸书单

九本书,把这一章读厚

这一章的每个结论都有出处,课里只给了你压缩版。这一节把原书排上书架:九本书,拆出十九条 PM 必须懂的心理学原理,每条都标注它在 AI 产品上的落点。别按顺序啃,先选你现在最头疼的问题。

这份书单怎么用。九本全读完大概要三个月,多数 PM 撑不到第二本。更实际的用法:下面先选一个你产品当前的困惑,书架和速查表会亮出对应的书和原理,先读亮着的那几条。每本书卡底部标了从哪读起,都可以跳读。
第一步 · 选你现在的困惑

点一个困惑试试,书架和下面的速查表会一起变。

书架 · 九本书
一条边界要先说清。《上瘾》教的那套多变奖励和投入机制,威力和争议一样大。这一章讲的心理学都用在消除摩擦上:让等待不难受、让信任对得上能力、让用户敢用。拿同一套知识去制造焦虑、诱导停留,是另一回事,那条路上的产品最后都在跟监管和用户口碑打仗。读它是为了识别这些机制,用不用、用到什么程度,你要自己把关。
原理速查表 · 十九条,每条都有 AI 落点
原理 · 出处一句话规律AI 产品落点回看
原理连线小测 · 看场景,认原理
读完速查表先别走。下面四个场景都来自真实的 AI 产品评审,每个场景背后站着速查表里的一条原理。认得出来,说明这张表已经进你脑子了;认不出来,回去再扫一眼。

✅ 这一节想和你分享的

  • 课是压缩版,书是原浆:说服工程师和老板时,引原书比引课件硬气
  • 按困惑读,别按书单顺序读:每本书对你有用的往往就两三章
  • 十九条原理是工具箱:设计评审前扫一遍速查表,比临时翻书快
  • 心理学用来消除摩擦:制造成瘾是同一把刀的另一面,别碰
1 / 4