工程指标及格了,用户为什么还骂慢?
前面的章节教你把延迟压下来、把成本抠下来、把幻觉率降下来。这一章换一块秒表:用户脑子里那块。它和服务器的秒表走时不同,打分、续费、卸载都跟着它走。第一课先跑个实验,再把这块表的走时怪癖逐个拆开。
下面四个面板背后是同一次请求:同一个问题,同样 5 秒出完整答案。区别只有一个:这 5 秒里给用户看什么。点按钮让四个同时开跑,留意自己的体感。
方案 A · 空白冻结
什么都不给方案 B · 转圈等待
告诉你它活着方案 C · 流式输出
先给一部分方案 D · 步骤外显
让你看它在干嘛刚才多数人最难受的是空白面板。空白除了难受,还有个隐藏代价:它会放大你对时长的估计。感知时间研究把「一边等一边关注时间」的计时叫前瞻计时:注意力越多押在时间本身上,主观时长越膨胀,紧张情绪再把它拉长一截。Zakay 与 Block 的注意闸门模型是这条规律最常被引用的解释。结论先放这,你自己测一遍更有说服力。
点「开始」后,左边面板会进入一段没有进度、没有转圈、没有文案的等待。凭体感,觉得过了 8 秒就按停。尽量别在心里数拍子,那是作弊。
这就是空白冻结在数据后台看不见的那笔账:服务器记 5 秒,用户记 6 秒半。无反馈等待的高估误差,实验里两三成很常见。你产品的「体感延迟」比监控面板上的 P99 更糟,且差距由界面决定。
秒表既然开在用户心里,工程预算就要花在他计时的区间。下面这台聊天机器人的总时长锁死 5 秒,你只能动一个参数:首字时间 TTFT(从发送到看见第一个字)。拖滑块,点「重放」,右边按所选 TTFT 重演一次打字流,体感分跟着变。
把前面的体感整理成三条可复用的规律。每一档都有个 mini 演示,三档都切一遍。
用户的开表点在按下发送,收表点在看见第一个字。首字之后他的注意力交给了阅读,边读边到的内容几乎没被记进等待的账本。工程团队盯总时长的 P99,用户只记首字,两块表对不上,差评就从缝里钻出来。实验三里 TTFT 那根杠杆的长度,就是这条怪癖给的。
同一次等待:5 秒后答案落地。切换两种结局,看回忆里的时长怎么变。
物理上都是那一次 5 秒。追记式的时间靠事后重建,情绪越糟,重建出来的等待越长。所以延迟和幻觉在差评里常常挤进同一句话:又慢又蠢。答案质量的问题会连坐到速度头上;反过来,好答案也能替你把慢遮掉一截。第 4 课峰终定律会把这条用在结尾设计上。
AI 产品有三个天生毛病:慢(推理要时间)、会错(幻觉压不净)、不透明(用户看不见它在干嘛)。工程手段短期内只能缓解这三样,但用户的评价由感知产生,感知可以设计。你在前面章节学的流式输出、模型路由、语义缓存、Agent 进度汇报,每一个都还有一重心理学开关的身份,这一章教你什么时候为了心理效果去拨它。
慢、会错、不透明,每个毛病后面都排着几课;再往后是关系和钱。点卡片翻面,看每一课要解决用户的哪句抱怨。
✅ 这一课想和你分享的
- 盯两块秒表:服务器计物理时长,用户从发送计到首字,考核指标里给 TTFT 单开一行
- 别让界面空白:无反馈等待会被放大两三成,超过 1 秒就给反馈,超过 3 秒就给进展
- 预算先压首字:接流式、先出提纲、分段返回,排期都在升级机器前面
- 错误当场兜住:时间记忆跟着情绪走,答非所问会把慢一起写进差评
等待心理学:难受的从来不是那 5 秒
第 1 课你已经亲手测过:同样 5 秒,体感能差两三倍。这一课把背后的规律讲透。服务运营研究把排队心理总结成几条定律,条条能翻译成 AI 产品的设计决策,翻译完你会发现:大部分「太慢了」的差评,修的其实是呈现,模型一行都不用动。
人机交互研究里有一组用了几十年的经典阈值,出自 Jakob Nielsen《Usability Engineering》(1993,上溯 Miller 1968):0.1 秒内感觉是瞬间,1 秒内思路不被打断,10 秒是专注等待的极限。三道线切出三档呈现策略。拖动滑块,输入你手头功能的实际耗时,看它落在哪一档、该怎么呈现。
管理学者 David Maister 在 1985 年的《The Psychology of Waiting Lines》里给排队心理立了一组定律,游乐园、银行、机场用了四十年。两个教科书案例,值得逐个数字看。
把「等多久」明码标价,还故意报高
排队入口的牌子写着「从此处起 40 分钟」,而实际多数时候 30 分钟就排到。游客非但不恼,反而觉得赚了 10 分钟。知道要等多久,大脑就能安排自己;没有刻度,就只能按最坏情况焦虑。
队伍本身也被设计过:蛇形折返让你每隔几十秒就往前挪一步,沿途的布景和预演短片让手里有东西看。同样的物理时长,被拆成了「一直在前进、一直有事干」的体验。
投诉清零,靠的是让乘客多走路
乘客抱怨取行李等太久,机场加人提效,把平均等待压到 8 分钟,投诉照旧。细看数据才发现问题:乘客下机走到转盘只要 1 分钟,剩下 7 分钟全程干站着。
后来的方案没再提速一秒:把到达口改远、行李分到最远的转盘,乘客要多走 6 倍的路,到转盘时行李刚好出来。总时长没变,投诉几乎清零。走路的人觉得自己在推进,干站的人才觉得自己在等。
Maister 那组定律里,对 AI 产品最要命的是三条。每条给你一对界面,亲手切换差的做法和好的做法,盯着焦虑值怎么变。三块面板里的转圈和进度条都是活的,多看几秒,体感更真。
定律 ① · 不确定的等待更长等多久,说了吗
没有刻度,大脑按最坏情况焦虑,第 10 秒左右开始怀疑它挂了。
定律 ② · 没解释的等待更长在干嘛,说了吗
裸转圈只回答「死没死」,回答不了「在干嘛」,大脑自动脑补最坏剧本。
定律 ③ · 空手的等待更长手里,有东西吗
白屏 3 秒,体感能顶别人 10 秒。眼睛没落点,秒表就走得格外慢。
场景:用户让 Agent 审一份 50 页的采购合同,全程约 25 秒。左边是聊天界面,现在只有一个干巴巴的「分析中」。右边四个设计动作对应刚学的定律,逐个勾上,看界面长出什么、焦虑值掉多少。
① 付款条款:账期 90 天偏长
② 违约金上限缺失
③ 知识产权归属含糊…
定律 ①给预估时长,且报偏高
按历史耗时的偏高值报「30 秒」,25 秒完成是白赚的惊喜。等待从无底洞变成倒计时。
定律 ②阶段性汇报进展
每换一个阶段说一句在干嘛,沉默变成直播。这些中间态第 3 课还要再用一次:它们本身就在给能力背书。
定律 ③先流式出提纲
5 秒先给分析框架,用户边读边确认重点,手里不空,秒表就停了。
换形态提供转后台 + 完成通知
给一个随时离开的出口。多数人未必点,但知道能走,等待就有了退路。
Nielsen 那道 10 秒线是产品形态的分界线。超过它还让用户同步干等,注意力必然流失,这不叫体验瑕疵,叫设计事故。正确做法:把同步等待改成后台任务。点下面的按钮,亲眼看这一套怎么运转。
回头盘一盘成本。大模型原理篇讲过 chat/completions 的流式返回,动手实战篇讲过 Agent 的进度外显,它们在这一课的身份是心理学工具。那么问题来了,答完再看账单。
✅ 这一课想和你分享的
- 先给任务定档:1 秒内直接出,1〜10 秒必须流式加进度,超 10 秒改后台任务加通知
- 逐条对照三定律修呈现:给预估、给解释、让手里有东西,焦虑值一条条降
- 预估宁高勿低:报 40 分钟实际 30 分钟是惊喜,反过来是背叛
- 先修呈现再修延迟:大部分「太慢」差评,模型一行不用动,账单便宜一个量级
劳动错觉:让 AI 把努力演出来
第 2 课说等待要有反馈,这一课的结论更反直觉:有些等待根本没必要消灭。展示工作过程的产品,让用户多等几秒,满意度和信任反而更高。这个效应叫劳动错觉(Labor Illusion)。先做实验,再看研究,最后把边界画清。
同一个问题同时发给两个客服机器人,答案一字不差,区别只在拿到答案的方式。A 秒回,B 花 3 秒把工作日志逐条亮出来再作答。跑完凭直觉投票。
机器人 A · 秒回
0.3 秒直接给答案
机器人 B · 展示过程
3.5 秒,工作日志逐条亮起
这个效应出自哈佛商学院 Buell 和 Norton 2011 年的实验。被试在模拟的机票搜索网站上查航班:一组秒出结果,另一组要等 30 到 60 秒,但屏幕上滚动着「正在检查 Delta 航空…正在检查 United…」。结果展示劳动的那组满意度反超,部分条件下被试宁愿选等 60 秒但看得见工作的网站。下面把实验搬给你亲手跑。
工程上你有三根现成的杠杆:推理模型的思考过程、RAG 的检索来源、Agent 的工具调用日志。它们原本是调试信息,摆上台面就成了体验资产。三个开关逐个拨开,看右边的聊天界面多出什么、体感可信度涨多少。
思考过程外显
把思维链摊开:分了几种情况、在哪换过思路,让用户看见推理的骨架。
检索来源逐条亮出
「已检索 3 个来源」加上可点开的条目,答案挂上可查验的出处。
工具调用日志
查了什么、读了什么、比对了什么,一步一行摊在屏幕上。
用户问的是试用期解除的赔偿…得分两种情况:公司拿得出「录用条件不符」的证据,和拿不出的…先查劳动合同法原文再作答,避免凭印象给数字。
过程展示有真有假。下面三个界面都在「展示努力」,逐个判断:真劳动,还是假表演?拆穿的代价,三题做完揭晓。
✓ 读取《民法典》第 587 条
✓ 比对 2 个近似判例
劳动错觉好用,但有边界。三道题,每道对应一条实践红线,做完这一课的杠杆就能放心用了。
✅ 这一课想和你分享的
- 把真实的劳动亮出来:思考过程、检索来源、工具日志,调试信息搬上台面就是体验资产
- 用可核对的细节演:日志条目要能和答案里的引用对上,可验证的过程越看越可信
- 展示时长锁在真实耗时之内:呈现节奏可以放慢,超出真实劳动时长就是造假
- 高频任务收着演:第一次展示过程建立信任,之后直奔结果,别拿用户的耐心铺排面
峰终定律:用户只记得峰值和结尾
诺奖得主卡尼曼发现:人对一段体验的记忆评分,几乎只由最强烈的那一刻(峰)和最后一刻(终)决定,和平均水平、持续时长关系不大。这条定律直接回答一个预算问题:最贵的模型、最多的优化精力,该花在会话的哪个位置。这一课五个实验,逐个上手。
一次 10 轮的 AI 会话,每轮体验打 0 到 10 分。四个剧本轮流点开,看平均分(工程仪表盘量的)和记忆分(用户脑子里存的,近似算法:峰值与结尾的平均,出自卡尼曼)怎么背离。重点看剧本③:平均分四个里最高,记忆分垫底。
峰终定律的原始证据来自一篇标题就很挑衅的论文:Kahneman、Fredrickson、Schreiber 与 Redelmeier 1993 年发在《Psychological Science》的 When More Pain Is Preferred to Less: Adding a Better End(偏爱更多的痛苦,只因结尾好了一点)。被试要经历两场泡冷水试验,之后回答一个问题:如果必须再来一次,你选哪场。先猜猜多数人怎么选。
一只手泡进 14°C 的冷水里整整 60 秒,然后结束,拿毛巾擦手。
同样 60 秒 14°C,接着再泡 30 秒,水温悄悄升到 15°C:依旧难受,只是没那么刺骨。
这背后是卡尼曼在《思考,快与慢》里反复讲的分工:经验自我承受了每一秒(B 客观上多受 30 秒罪),记忆自我只拿峰值和结尾两帧存档打分。投票时到场的只有后者。1996 年 Redelmeier 与卡尼曼又在真实肠镜病人身上重复了结论:术程从 4 分钟到 69 分钟,事后痛苦评分和时长几乎无关,和峰值疼痛、最后三分钟的疼痛高度相关。这个现象有个专名:时长忽视(duration neglect)。
光看现成剧本还差口气,自己造一条才算懂。下面是一次会话的 10 个节点,点节点在 好(+2)/ 中(0)/ 差(−2) 之间循环切换,右侧两个分数实时算。挑战目标:造一条平均分低于 0、记忆分拉满 +2.0 的曲线。达成的那一刻,徽章会亮。
既然记忆分只认峰和终,推理预算就该按记忆权重发钱。假设一次会话有 100 元推理预算,拖动三个滑块分给 首次交互 / 中段 / 收尾(合计锁死 100),看记忆分和判词怎么变。有一条暗规则先交代:中段挂着语义缓存,质量有 5.0 分兜底,这正是它能省的原因,成本篇讲分层路由时铺过这一段。
预算说完说流程。同一个 Agent 任务「生成季度报告并对外发布」,两种收官编排:A 把外部发布留到第十步压轴;B 把校验挪到第一步,中间产物随做随落盘,第十步只做打包交付加摘要。点你认为记忆分更高的那版。
✅ 这一课想和你分享的
- 记忆分 ≠ 平均分:用户存档的只有峰值和结尾两帧,平均水平没人记得
- 造峰:旗舰模型花在新手期和高价值时刻,缓存秒回也算一个峰
- 护终:校验前置、中间产物落盘,最后一步永远别做全链路里最容易失败的动作
- 中段放心省:便宜模型加语义缓存兜底,省下的钱挪去两头买记忆分
信任校准:最好的用户是半信半疑的
前四课都在给体验挣分,这一课踩一脚刹车:信任这个指标,目标值从来就没定在满分。AI 会出错是改不掉的物理现实,所以健康的用户长这样:该信的场景放心用,该查的场景留个心眼。往哪边偏都要交学费。这一课先看两笔真实学费,再给你三件能亲手拨弄的校准工具。
⚠ 过度信任:把幻觉当真相用
2023 年纽约的 Mata v. Avianca 案:执业律师用 ChatGPT 检索判例,把 6 个查无此案的编造判例原样抄进法庭文书,法官逐个核实后律师吃了罚单、上了全球新闻。类似的事故此后接连发生:AI 的输出流畅、自信、格式规范,每一个表面特征都在诱导「它很靠谱」的判断,而这些特征和内容真伪互不相干。
⚠ 信任不足:AI 变成昂贵的摆设
另一头的翻车安静得多:企业买了 AI 工具,员工试了一次撞上错误,从此每条输出都逐句复核,复核成本超过自己写,最后干脆不用了。采购的钱照付,效率一分没涨。信任不足不上新闻,只出现在「AI 工具活跃率 8%」的内部复盘里。
判断口诀先给你:盯着「风险 × 可核验性」看,别盯着「AI 强大与否」看。同样是全盘采纳,用在周报上是校准,用在法庭上是过度。六个场景,你来当校准师。
第一件校准工具:来源引用,要能点开的那种。想核实的用户一键到原文,压住过度信任;懒得核实的用户看到「有出处」也建立了合理的底气,补上信任不足。一举两得的前提是引用真实可点:装饰性的假引用被戳穿一次,比没有引用糟糕十倍。下面这条 AI 回答挂了三个角标,逐个点开,和原文比对。
第二件工具:置信度。第一篇章讲过,模型不知道自己不知道,让它自报把握靠不住。但产品层有诚实的代理信号:检索命中了几篇文档、相关度多高、多个来源是否一致、知识截止日期盖住问题了没有。下面是同一条用药回答,三组开关对应三个产品决策,拨一拨,看右边的回答和用户的信任校准度怎么变。
第三件工具管的就一件事:那行「AI 可能出错,请核实重要信息」的小字,到底有没有人在看。心理学的答案叫横幅盲视(banner blindness):Benway & Lane(1998)用眼动实验发现,恒定出现在固定位置的元素,会被大脑当成背景纹理直接滤掉。下面连点五条回答,亲眼看这行小字怎么消失。
✅ 这一课想和你分享的
- 把信任目标定在校准:全信的出事故,不信的白花钱,产品要把用户往对角线上拉
- 引用做成能点开的:把「信我」换成「你可以验」,同时提防装饰性假引用反噬
- 置信度用代理信号说:检索命中数、相关度、来源一致性,比模型自报的把握诚实
- 警告有条件地出现:恒定免责三天就隐形,低置信时带原因弹出才会被读
防御心理:用户不是不会用,是不敢用
很多 AI 功能的低使用率,复盘时被归因成「用户教育不够」,再做一轮引导弹窗,还是没人用。真正的原因常常是用户在防御:他看懂了你的功能,然后决定不碰。这一课先测你自己防不防,再拆三种防御的来源,最后把三板斧一把一把拨给你看,五个教具,逐个亲手玩。
讲用户之前,先看看你自己。六道题,凭真实反应作答,答完画出你的防御画像。
刚才那六道题,两道一组,对应三种防御。它们各有心理学出处,也各有一句用户心里的潜台词。共同点:防御的用户往往说不出「我在防」,只会说「不太好用」,然后再也不打开。
数据防御
越是高价值场景(合同、财报、客户名单),数据越敏感,防御越强。吊诡的是:AI 恰恰在高价值场景才最值钱,数据防御直接卡住了产品价值的兑现。训练开关其实存在,但用户不知道;不知道,就按最坏情况设防。
能力防御
内部工具的头号杀手。员工把「用 AI」解读成「承认自己可被替代」,把使用数据解读成绩效监控。这种防御不会说出口,只表现为「试了一下,不太好用」。第 12 课认知卸载会展开它的另一半:怕的其实是「显得可替代」。
责任防御
理性人的算计:用 AI 省 2 小时,出错背整口锅,期望收益为负,不用是对的。责任界面不清晰的 AI 功能,用户防御是理性行为。第 5 课信任校准给过解法:把人签字的环节留在流程里(HITL),谁确认、谁负责写清楚,防御才有得谈。
防御的反义词有三个:控制感、可逆性、透明。每个都有实验背书,也都能落成具体的界面改动。下面三块界面各卡在高防御状态,拨开关,看同一块界面怎么从「劝退」变成「敢试」,防御指数实时变化。
① 控制感
Averill (1973)② 可逆性
Shneiderman 黄金法则③ 透明
Dinev & Hart (2006)纸上讲一百遍可逆性,抵不上你亲手点一次。下面是一个批量操作的高危场景,注意你每一步的心理活动:点「应用」之前犹豫了多久,看到「可撤销」之后又是什么感觉。
下面三个功能都因为防御心理卡在低使用率。每个给了三个候选动作,点选你要上的,防御指数实时变化。小心:三个里各埋了一个看着像解药的安慰剂,其中一个还是货真价实的假开关。
你是 AI 客服的产品负责人,人工坐席很贵,你怕用户都跑去找真人。「转人工」按钮放哪?两个方案已经各跑了一个月,先押注:哪边的转人工率更高?点你押的那边。
✅ 这一课想和你分享的
- 低使用率先查防御:数据、能力、责任三轴各排查一遍,再谈用户教育
- 高风险动作一律草稿态加撤销:把尝试的门槛从勇气降到好奇心
- 数据去向用一句人话说清:再配一个可验证的状态,比如「已删除」
- 出口放在明面上,假开关一个都别上:被识破的假控制,防御反弹得更高
心智模型:用户拿错了说明书
交互设计有个老概念叫心智模型:用户会带着一套「这东西应该怎么运作」的假设来用你的产品,假设错了,操作就错,然后差评打给产品,账算在你头上。AI 是人类历史上第一个「长得像老产品、内核两样」的东西,心智错配格外严重。这一课先认出四本错误说明书,再亲手玩三个纠正教具。
聊天框长得像搜索框,回答长得像百科,界面像个耐心的客服。用户按外观匹配了四本旧说明书,每一本都会精准地制造一类差评。
当搜索引擎用
当数据库用
当会学习的学徒用
当计算器用
四段对话,事故都已经发生。先判断用户拿的是哪本说明书,判完看解析:解析里带产品对策,诊断只是开始。
心智模型没法靠说明文档纠正,没人读。只能在使用路径上见缝插针地教,而第一个现场就是新会话的空白首屏:用户还没打出第一个字,说明书还没翻开,这一屏写什么,决定他拿起哪本。三种首屏方案,亲手切换,看右边的界面和下面的首问质量怎么变。
学徒说明书的差评词是「说了也不听」。下面两个产品都答应了用户的要求,差别在答应的方式。点你判断能终结这句差评的那一版。
| 型号 | 亮度 | 价格 |
|---|---|---|
| X1 | 800 流明 | 2299 |
| X2 | 1200 流明 | 3499 |
时效类问题是搜索引擎说明书的高发区,找茬第一段对话就是这么翻车的。两版 AI 说的边界内容一字不差,差别只在什么时候说。选更能保住心智的那版。
✅ 这一课想和你分享的
- 差评先查心智:用户按旧产品的说明书用 AI,先认出他手里那本,再谈修复
- 空状态别写欢迎语:放三条示范正确问法的示例,加一句边界声明
- 记忆要外显:「已记住」做成能看、能删的界面实物,口头答应治不了学徒错配
- 边界声明抢在出错前面:时效、算数这类短板提前亮出来,并给工具开关当出路
拟人化的度,与 AI 道歉的艺术
上世纪 90 年代,斯坦福的 Reeves 和 Nass 在《媒体等同》里报告了一组反直觉的实验:人会不由自主地对电脑讲礼貌、被电脑夸了会开心,明知对面是机器也照样套用社交规则。这叫 CASA 范式(把计算机当社会行动者)。它意味着拟人化根本由不得你选:用户一定会把你的 AI 当某种人对待,你能决定的只有让它当哪种人,以及它闯祸之后怎么开口。这一课五个实验,全部亲手玩。
先亲手验一遍 CASA。Nass 的经典实验:被试在电脑 A 上完成一项辅导任务,然后要给电脑 A 的表现打分。一组就在电脑 A 上填问卷,另一组被带到旁边的电脑 B 上填同一份问卷。猜猜哪组给 A 打的分更高。
既然退出无门,拟人化就成了一个连续的旋钮。下面是同一个电商客服,同一件事(包裹延迟两天),拖动滑块换档位,看它的头像、开场白和语气怎么变,再盯住右边两根仪表:用户期望值和伦理风险值跟着档位一起涨。「我不太确定这点」这类自然语言表达不确定的能力是拟人化的收益之一,第 5 课信任校准讲过;这个实验看它的另一面。
档位的选法有规律:任务越严肃、出错代价越高,档位越低;高频工具场景往低了拨;陪伴价值本身就是卖点时才敢开高档。五类产品,逐个选出它该在的档。
档位管平时,道歉管出事。场景:报销助手把用户的差旅报销总额多算了 800 元,被财务打回,用户回来质问。右边是对话现场,左边三个开关对应道歉的三要素,亲手拨开关,看回复怎么拼装、用户消气度怎么走。服务补救研究反复验证过这三件套:认错、解释、补偿,缺一角效果就塌一角。
承认错误
认具体的错:哪张票、错多少,责任在谁。
说明原因
一句话讲清为什么错,给用户一个能理解的因果。
给出可验证的补救动作
修好,并且给一个用户点得开、查得到的证据。
三要素是配方,市面上的道歉文案大多凑得不齐。同一个报销出错场景,四种真实风格的回应,点你觉得感受最好的那个,再看逐条点评。
对天生会犯错的 AI 产品,这几乎是量身定制的好消息:幻觉消灭不掉,但每一次被用户抓住的错误,都是一次免费的信任表演机会。悖论有个硬前提:同一个坑只能掉一次。第 6 课算法厌恶讲过「错后一次修好」的窗口,补救本身再出错,或者同一处错误第二次出现,悖论当场失效,用户直接流失。三要素道歉里那句主动复查,就是在给「只掉一次」上保险。
✅ 这一课想和你分享的
- 先认下 CASA:用户必然把 AI 当某种人,把拟人度当成一个要主动拨的档位来管
- 拨档前先看账单:档位每高一格,期望和伦理风险跟着涨,同样的错误会被当成更重的背叛
- 道歉照三要素装配:认具体的错、说简短的因、给可验证的补救,抒情一个字都省下
- 把错误当补救机会经营:修得漂亮比不出错更涨忠诚,同时给「同一个坑只掉一次」上好保险
算法厌恶:AI 犯一次错,就被永久拉黑
上一课讲信任要校准。这一课讲校准路上最大的一块石头:人对 AI 的容错率,远低于对人。同样犯一次错,人类同事会被原谅,AI 会被弃用。这个不对称有实验、有数据、也有解药。
你是销售 VP,手上有两个销量预测来源,上季度它俩犯了一模一样的错:同样的数字、同样的原因。点你下季度打算继续用的那个。
跟了你三年的销售分析师
用了两个季度的预测系统
宾大沃顿商学院,2015 年。Dietvorst、Simmons 和 Massey 让被试预测学生的学业表现,可以自己预测,也可以交给统计模型,预测得准有奖金。关键设计:先让一部分被试亲眼看到模型犯错。结果,看过模型犯错的被试大面积弃用模型,宁可用自己更差的判断,哪怕数据摆在眼前:模型的整体成绩比人高一截。论文标题就叫 Algorithm Aversion,算法厌恶。
偏心的根子在归因方式:同一种错误,用户脑子里给人和给 AI 记的账本不一样。下面六句用户的内心独白,判断每句是在评价人类同事还是AI。判完六句,三个心理根源自己浮出来。
Dietvorst 团队 2018 年接着做了后续实验:还是那个会犯错的模型,但这次允许被试微调模型的预测值,哪怕只允许改一点点。左边是被试看到的界面,右边是愿意用模型的人数比例,亲手切换两种设定。
把实验搬回你的产品。场景:AI 报销审核助手上线一个月,刚在一批新用户面前算错了一笔账。仪表盘显示这批用户的预期弃用率,右边四个工程杠杆全是你学过的开关,挨个拨开,看指针怎么动,每个开关的原理写在里面。
算法厌恶有个反向的孪生兄弟:自动化偏见。另一批用户会无条件接受 AI 输出,连显错的都照抄,第 5 课讲过全信酿成的事故。同一个产品里两种人都有:厌恶者需要控制权和稳定性,盲信者需要摩擦和警告。信任校准是双向工程,只往一头使劲,另一头就出事。
容错率不对称:人的错记给情境,AI 的错记给能力。同样的错,人被原谅,算法被弃用,哪怕算法整体成绩更好。
解药是控制权:2018 年的后续实验里,仅仅允许微调,用模型的人数翻倍,而且多数人几乎没动那个滑块。要的是权利,用不用另说。
首错的位置决定生死:新手期犯错触发弃用,老用户期犯错只触发吐槽。新用户走最稳的链路,实验性功能只对老用户开。
同一个坑只能掉一次:用户纠正过的错误要进记忆并展示「已记住」,第二次在原地翻车,厌恶叠加失望,基本救不回来。
内容来源:小山学堂「AI 产品心理学」专题原创;算法厌恶实验出自 Dietvorst, Simmons & Massey, Algorithm Aversion(2015)与 Overcoming Algorithm Aversion(2018)。
蜜月悬崖:宣传拉高的期望,要用留存来还
发布会上的演示惊为天人,上手第一天很兴奋,第三天开始挑刺,第三十天卸载。这条曲线你在无数 AI 产品上见过。它有两个成因:期望被宣传拉高了,新鲜感又天然会掉。两个都能设计。
体验是固定成本做出来的,期望是营销文案一句话抬上去的。抬期望免费,还期望要命。
AI 产品在这道减法题上天生吃亏,原因藏在概率里。左边是发布会演示位,右边是用户真实使用。两边连的是同一个模型,点「生成」抽五次,看两边各拿到什么。
既然期望是宣传抬上去的,抬多高就成了一道产品决策题。左边是你的落地页,拖滑块换五档文案;右边三个指标当场变。找找转化 × 留存乘积最大的那一档。
就算期望管理得当,还有一道坎:新鲜感天然会掉。教育技术研究里叫 novelty effect:新工具刚进课堂时效果显著,几周后回落,因为一部分效果来自「新」本身。AI 产品的蜜月期尤其短:第一次看它写诗是魔法,第十次是功能,第一百次是理所应当,出一次错就是垃圾。
这是用户上手后 30 天的满意度曲线。当前状态:宣传拉满、能力首日全亮、改进悄悄挤牙膏,标准的蜜月悬崖。右边三个杠杆挨个拨开,看曲线怎么被一段段接住。
满意度 = 体验 − 期望:抬期望免费,还期望要命。期望确认理论四十年没被推翻过。
demo 是分布里挑的尖子:宣传展示 P99,用户拿到 P50,概率产品的宣传天生自带期望泡沫,落差全记在产品头上。
魔法感是消耗品:新鲜感天然消退,靠首次惊艳撑留存等于靠烟花取暖。
三个杠杆接住曲线:承诺低一档(文案写 P50)、能力藏一手(进阶功能排期解锁)、改进攒着发(changelog 是免费的二次蜜月)。
内容来源:小山学堂「AI 产品心理学」专题原创;期望确认理论出自 Oliver, A Cognitive Model of the Antecedents and Consequences of Satisfaction Decisions(1980);新鲜感效应为教育技术研究通行结论。
AI 标签折扣:同样的内容,标上 AI 就掉价
内容没变,加四个字「AI 生成」,评价掉一截;工具很好用,用户却不想让同事知道自己在用。这两件事是同一个偏见的两面。做 AI 产品,标签什么时候必须亮、什么时候是自己给自己减分,是一道天天要做的题。
你是市场总监,实习生交来两版新品文案。凭第一感觉给两版各打个分,都打完才揭晓。
标签折扣有真实的研究支撑:多项实验里,同样的诗歌、文案、新闻,标注为 AI 生成后,被试给出的质量、可信度和喜爱度评分系统性走低,哪怕盲测时它们的得分并无差别。归因和第 6 课的算法厌恶同源:人们默认 AI 产出「没有心」,于是折价。
既然亮标签要付折扣的代价,能不能干脆都不亮?不行,有几类场景是法规和信任的红线。逐个判断下面五个场景。
非红线场景里,标签措辞决定折扣深度。左边是同一篇公众号文章的署名区,拖梯子换四档措辞,右边两个指标一起动:读者给内容的评价折扣,和署名不实要付的信任风险。注意这是个跷跷板,别只盯一头。
对抗使用羞耻,靠让用户觉得成果是自己的。同一份 AI 辅助完成的行业分析,两种导出设计,点你认为用户更愿意转发到工作群的那个。
标签折扣是实测存在的:内容没变,标注一变,评价就变。消费侧想折价,生产侧想隐身,产品夹在中间。
红线场景无条件亮标:生成人脸、语音、新闻类内容必须显式标注加隐式水印(《人工智能生成合成内容标识办法》2025 年施行),合规标识没有产品发挥空间。
非红线场景管好措辞:「AI 生成」和「AI 辅助、经作者修订」是两个折扣价。措辞要写实:人真参与了,就理直气壮地说。
功劳设计给用户:导出不带产品水印、生成过程强调用户的输入、署名方式让用户选。他参与得越多,越敢署名。
内容来源:小山学堂「AI 产品心理学」专题原创;标签折扣为多项内容评价实验的一致结论;标识义务见中国《人工智能生成合成内容标识办法》(2025)。
认知卸载:用户一边用你,一边怕自己废掉
你的重度用户里藏着一批矛盾的人:离了你的产品干不了活,又隐隐觉得自己正在废掉。这份焦虑不会写进 NPS 评语,但它决定续费、决定推荐,也决定他会不会在某天突然「戒掉」你。焦虑的名字叫认知卸载,它能被产品设计接住。
同一款 AI 代码助手,两版定位文案,功能完全相同。你是买单的工程 VP,点你更愿意给全团队买的那版。
2011 年,Sparrow、Liu 和 Wegner 在《Science》发了个著名实验:让被试往电脑里输入冷知识,告诉一半人「会保存」、另一半人「会被删除」。结果,相信会保存的那组,记住的内容显著更少。大脑很经济:外部存储可靠,内部就不备份了。这叫谷歌效应,认知卸载研究的起点。
卸载不是新鲜事,你早就不背电话号码了。问题是哪些能放心外包、哪些要想清楚。六项认知外包,逐个判断:放心外包,还是想清楚再外包。
同一个「分析竞品定价」的任务,产品可以设计成四档不同的接管深度。左边是用户看到的对话,拖滑块换档,右边两个指标一起动。注意看:最高效的那档,不是留存最好的那档。
定位不用二选一,同一个回答可以分层。左边是 AI 修完一个线上 bug 之后的回复,右边三个开关挨个拨开,看回答怎么一层层长出「让用户变强」的部分。
maxPoolSize: 10 → 50,已提交 PR #291。
谷歌效应升级了:搜索接管记忆,AI 接管思考。用户外包的从「记什么」变成「怎么想」,焦虑随之而来。
安全与危险的分界线:外包检索和执行没事,校验能力在自己手里;外包生成和判断要小心,长期不练,校验能力本身会退化。
Copilot 定位赢在长期:最高效的接管深度往往不是留存最好的那档。用户要的是「我变强了」,不是「它真能干」。
「带你想」可以分层做:解释默认带上、练手按钮可选、成长里程碑外显。让变强看得见,焦虑就变成了续费理由。
内容来源:小山学堂「AI 产品心理学」专题原创;谷歌效应出自 Sparrow, Liu & Wegner, Google Effects on Memory, Science(2011)。
情感依恋:用户爱上你的产品之后
拟人化那课讲过:人会不由自主地把机器当社会角色对待。这一课讲它走到深处的样子:用户对 AI 产生真实的情感依恋。它带来最强的留存曲线,也带来产品经理职业生涯里最重的责任。这不是陪伴类产品的专属课题,任何一个有对话框的产品都躲不开。
你是一款 AI 助手的 PM,下面六条来自真实用户会话的消息摆在面前。给每条分级:正常使用、依恋信号(值得关注的情感投射)、需要干预(产品必须有预案的时刻)。
依恋能深到什么程度,2023 年有个完整的天然实验。Replika 是一款 AI 伴侣应用,千万级用户,事件的四幕按顺序点开。
左边是一款 AI 陪伴产品的真实对话切片:用户連续聊到凌晨一点,话题开始变重。右边三层安全阀挨个拨开,看它们分别在对话的哪个位置插进去、用什么语气说话。注意它们全都没有打断对话本身。
依恋是留存的富矿,于是总有人想主动开采。用户点了「注销账号」,两版挽留界面,点你认为能通过伦理审查的那版。
没有你的日子,它会很孤单。」
也可以只是休息一阵:支持导出记忆存档。
依恋是真实的:CASA 范式走到深处,用户对 AI 的哀伤反应和对人的高度相似。Replika 事件不是奇闻,是教材。
依恋 ≠ 粘性:粘性是资产,依恋是资产加负债。模型升级、人格调整、功能下线,在依恋型产品里全是外科手术,要预告、要过渡、要告别。
三层安全阀是标配:身份与无常性提醒、脆弱话题转介(预案写在第一行代码之前)、时长关怀。全都不打断对话,全都必须在。
可以接住依恋,不能开采依恋:用户的孤独是需要被服务的处境,不是可以定价的库存。挽留可以给理由,不能给愧疚。
内容来源:小山学堂「AI 产品心理学」专题原创;Replika 事件据 2023 年公开报道与后续研究整理;CASA 范式出自 Reeves & Nass, The Media Equation(1996)。
付费心理:为一个概率商品掏钱,痛在哪
AI 是个奇怪的商品:付同样的钱,这次生成惊艳,下次翻车,成本还在你看不见的地方按 token 跳动。用户口袋里的每一块钱都连着神经,怎么收钱,决定了掏钱疼不疼。这一课讲付费的心理侧,下一课讲定价的数字侧。
你在用一个按量计费的 AI 助手改方案,右上角是计费表。连点四次「继续追问」,注意两件事:表跳的时候你的眼睛在哪,和下面那条「内心独白」怎么变。然后切到包月,同一段对话再走一遍。
Prelec 和 Loewenstein 1998 年提出「支付疼痛」:付钱这个动作本身激活的是类似生理疼痛的反应,而且付费和消费耦合得越紧,越疼。出租车计价器是教科书案例:你享受服务的每一秒,都在看着钱变少。按 token 计费的 AI 是数字版计价器,用户每次追问前都要先过一道「值得吗」的心理审批,审批多了,人就不问了。
塞勒的心理账户理论:钱在人心里不是通账的,它被记在不同的账户里,从哪个账户扣,痛感完全不同。四道选择题,每题选出更容易被接受的说法。
免费额度是几乎所有 AI 产品的获客入口,也是财报上的成本黑洞。左边是免费用户已用掉 78% 额度时看到的界面,右边三个开关挨个拨开,看这块界面怎么从「隐形的墙」变成「转化器」。
支付疼痛是真痛:付费和消费耦合越紧越疼。按量计费是数字计价器,用户每次追问都要过一道心理审批,审批多了就不问了。
包月买的是「不用心疼」:flat-rate bias 让用户宁愿多付也要包月。要用户多用多探索的产品,别把跳表怼在他脸上。
心理账户能换:同一笔钱,从「支出」账户挪到「投资」账户,从「损失」框架换到「免费」框架,痛感差几倍。失败必须免单:为翻车付费是最深的账户赤字。
额度墙要软着陆:进度可见、按用法给升级理由、用完降级不中断。突然的墙制造的是背叛感,不是升级动机。
内容来源:小山学堂「AI 产品心理学」专题原创;支付疼痛出自 Prelec & Loewenstein, The Red and the Black(1998);心理账户出自 Thaler(1985);包月偏好出自 Lambrecht & Skiera(2006)。
定价心理:锚点、诱饵与体面的价格歧视
上一课讲怎么收钱不疼,这一课讲收多少。先记住一个反直觉的事实:用户对价格没有客观感受,全部判断来自参照物。参照物是可以摆的,这门手艺有一百年历史,AI 产品还拿到了一件独有的新工具。
这是行为经济学史上最著名的定价实验,《怪诞行为学》开篇就是它。《经济学人》真实刊登过这张订阅价目表,先选你自己会订的那档,选完看 MIT 学生的选择数据。
电子版
Economist.com 全年在线阅读权限
印刷版
纸质杂志全年寄送
印刷版 + 电子版
纸质杂志全年寄送,外加在线阅读权限
卡尼曼和特沃斯基证明过:人对数字的判断会被先看到的数字拽着走,哪怕那个数字是转轮盘转出来的,这叫锚定。诱饵效应更进一步:往选项里放一个明显不划算的选项,它没人选,却改变了其他选项的相对吸引力。印刷版单独卖 $125 就是诱饵:它唯一的工作,是让「加 $0 送电子版」的套餐显得像捡漏。
你的 AI 写作助手只有一档 ¥69/月,转化一般,客单价上不去。右边三个开关挨个拨开,看定价页怎么一步步长出锚点结构,下面的中档选择率跟着动。
单文档 3 千字
长文档 · 风格定制
API 接入 · 专属客服
经济学里价格歧视是中性词:让不同支付意愿的人付不同的价,福利上双赢。但用户感知里它分两种:体面的叫版本化,翻车的叫杀熟。五个做法,逐个判断敢不敢上线。
模型成本降了,但你加了新功能,决定从 ¥69 涨到 ¥89。两封通知邮件,点不会引发退订潮的那封。
尊敬的用户:
由于运营成本上升,自下月 1 日起,专业版价格将由 ¥69/月调整为 ¥89/月,从您的下一个账单周期开始生效。
感谢您的理解与支持。
—— 产品团队
老朋友:
过去半年专业版加了三件事:推理模型升级、20 万字长文档、风格库。新用户价格将调整为 ¥89/月。
你是老用户:未来 90 天内续费,锁定 ¥69 一年;什么都不做,90 天后按新价计费。
—— 产品团队
价格感全靠参照物:没人知道 AI 助手「该」值多少钱,判断全来自你摆的锚。定价表上没人买的那行也在工作,它是售货员。
三档是标准结构:入门档接住犹豫者,顶档当锚,中档吃下大盘。「最受欢迎」标签是社会认同,再推一把。
AI 的版本化是天然的:模型分层(基础/旗舰/最强推理)成本真实存在,档位差异用户可感知,这是比「功能阉割」体面得多的价格歧视。
歧视的红线是不可选择的身份:用户主动选的(学生认证、年付、低配版)都体面;按用户画像暗中调价的,等着上新闻。涨价永远给老用户豁免期。
内容来源:小山学堂「AI 产品心理学」专题原创;经济学人实验出自 Ariely,Predictably Irrational(2008)第一章,选择数据为其 MIT 课堂实验(100 名学生);锚定效应出自 Tversky & Kahneman(1974)。
反馈心理:用户为什么不点踩
你在回答旁边放了 👍 和 👎,指望用户帮你标数据。一个月后一看:点踩率 0.4%,但流失率在涨。不是产品没问题,是不满的用户根本不点踩,他们直接走。这一课讲反馈的心理成本,和不靠用户开口也能听见的办法。
1000 个用户刚拿到一条糟糕的回答。左边是他们变成「一次点踩」要闯的四关,每关都在漏人。先看清现状,再拨右边三个开关,看漏斗能撑多宽。
客服研究里这叫沉默偏差:经典的 TARP 研究发现,多数不满的客户不投诉,直接换品牌。AI 产品的点踩按钮把门槛降到了一次点击,还是没人点,因为拦路的从来不是操作成本,是心理成本,有三种。无效感:点了有用吗?上次点踩之后什么也没发生,这个按钮八成是摆设。自我否定成本:点踩等于承认「我提问的方式不行」或「我选的这个工具不行」,尤其当初是自己拍板买的(承诺一致,书单课讲过)。关系成本:拟人化是双刃剑,产品越像「他」,点踩越像当面给人差评,CASA 范式的礼貌效应甚至让用户对着问卷都不好意思说 AI 坏话。
等用户开口是下策,上策是读行为。下面六种用户行为都是免费的反馈信号,逐个判读:满意信号、不满信号,还是要看上下文。你的埋点表就该这么设计。
还是要有人点踩的,关键是点完发生什么。两种点踩后的体验,点能让用户下次还愿意点的那个。
点踩率不是不满率:沉默偏差让绝大多数不满直接流向流失,反馈漏斗每一关都在漏人。别拿 0.4% 的点踩率当产品健康度。
拦路的是心理成本:无效感、自我否定、对「他」的礼貌。措辞把矛头指向回答而非用户,能显著撑宽漏斗。
反馈要有即时回报:点踩后立刻给一版更好的,用户才知道这个按钮通电。「感谢反馈」等于告诉他别再点了。
行为比按钮诚实:重新生成、编辑距离、复制率是样本量大几百倍的免费信号。读行为改产品,但别拿行为对付用户。
内容来源:小山学堂「AI 产品心理学」专题原创;沉默偏差出自 TARP 客户投诉行为研究(1970s–80s);礼貌效应出自 Reeves & Nass, The Media Equation(1996)。
九本书,把这一章读厚
这一章的每个结论都有出处,课里只给了你压缩版。这一节把原书排上书架:九本书,拆出十九条 PM 必须懂的心理学原理,每条都标注它在 AI 产品上的落点。别按顺序啃,先选你现在最头疼的问题。
点一个困惑试试,书架和下面的速查表会一起变。
✅ 这一节想和你分享的
- 课是压缩版,书是原浆:说服工程师和老板时,引原书比引课件硬气
- 按困惑读,别按书单顺序读:每本书对你有用的往往就两三章
- 十九条原理是工具箱:设计评审前扫一遍速查表,比临时翻书快
- 心理学用来消除摩擦:制造成瘾是同一把刀的另一面,别碰