『我训了个模型』到底训了什么?
饭局上总有人举着酒杯说「我最近训了个模型」。这句话的水分可以从零到百分之九十九,这一页帮你听出他到底干了什么,顺便学会三句能让全桌安静的追问。
在 AI 圈,训练指的是改变模型本身的参数,成本从几十万到上亿。而绝大多数人说的「训了个模型」,实际是写了段提示词,或者挂了个知识库,那是五分钟和五千万的区别。
大模型里面装着几百亿到上万亿个参数。参数说白了就是一大堆数字,你可以把它们想象成调音台上密密麻麻的旋钮——模型的每一分本事,全都存在这些旋钮拧到了哪个位置上。
训练就是把这几百亿个旋钮一个个拧对,而办法笨得出奇:遮住后半句,让模型猜下一个词。比如给它「今天天气真」,它蒙了个「香」,原文却是「好」——猜错了,就把参与这次判断的旋钮各自拧回来一丁点。一次只挪极小一格,然后换下一句,再来一遍。这个动作要重复上万亿次。冲刷完,旋钮的位置里就沉淀下了「天气后面更可能跟『好』,不太可能跟『香』」这件事。所谓「学会」,全部内容就是这个。
这件事费电、费卡、费钱,跟供一个孩子读完二十年书差不多,属于重资产工程。
而你平时对 AI 说「你是一位资深编辑,帮我润色」,或者给它上传一份公司资料,这些操作一个参数都没动。打个比方:前者是重新培养一个大学生,后者是给现成的大学生递一张便签、发一本手册。便签很有用,但你不能说自己「培养了一个大学生」。
所以下次听到「训了个模型」,第一反应可以是:他动没动参数?动了多少?下面这把梯子帮你把所有情况分成四层。
从下往上,每爬一层,成本和门槛都指数级上升。点击每一层,展开看它的耗时、成本和门槛。饭局上九成的「训了个模型」,都发生在最下面两层。
改提示词
挂知识库(RAG)
微调
从头预训练
来玩个小测:下面五句都是社交场合的高频发言。你来猜猜,每句话说的事大概率发生在哪一层。点选项揭晓答案。
分不清对方在哪一层?不用猜,直接问。这三个问题分别卡住成本、数据、底座三个要害,答不上来的人自己会往下滑层。
「花了多少算力?」
训练是真金白银烧出来的。L3 起步就要租显卡,L4 要烧掉数千万到上亿。说不出成本量级的「训练」,多半没发生过。
「多少条数据?跑了几轮?」
别问「数据从哪来」——挂知识库和微调都会答「公司文档、业务数据」,这一问听不出差别。要问的是量级:几百份文档丢进检索库是 L2,几千上万条标好的问答对、还得跑上几轮才是 L3。说得出条数和轮数的,才是真动了参数。
「底座是什么模型?」
L1 到 L3 都站在别人的底座上,这毫不丢人,但值得说清楚。含糊其辞说「核心技术不便透露」的,可以默认是 L1。
✅ 这一页想和你分享的
- 训练 = 改模型参数:写提示词、挂知识库都没动参数,严格说都算「用模型」
- 四层梯子:改提示词、挂知识库、微调、从头预训练,每上一层,门槛指数级上升
- 听到「训了个模型」先问成本和数据:答不上来的,自己会往下滑层
- 改提示词毫不丢人:九成需求它就够了,丢人的是站在 L1 说自己在 L4
AI 圈黑话翻译器
发布会、朋友圈、新闻稿里的 AI 话术,水分普遍不小。这一页把最常见的八句拿出来逐句翻译成人话,每句配一个含金量档位。看完你会发现:话术并不高深,只是没人给你翻译过。
同一个词在 AI 圈能指完全不同的东西:「自研」可以指从零造大脑,也可以指接了个 API。这一页把常见话术翻译成人话,再给你三个当场问出底细的追问。
下面八张卡片,正面是你在发布会和朋友圈见过的原话,点一下翻个面,看看人话版本。每张卡配一个含金量档位:
提前剧透一句:这组卡里「足金」很少见。这不怪本页选卡偏心,现实中它就是这么少见。
翻译只是第一步。真想知道对方有几斤几两,把下面三个问题记熟,哪个场合都能用。放心问,这三个问题很礼貌,只是答案藏不住。
「模型底座是什么?」
这个问题能问出他站在谁的肩膀上。用开源模型、接商业 API 都是正常操作,但答案决定了「自研」这个词该打几折。支支吾吾的,折扣自动加大。
「训练数据从哪来、花了多少算力?」
这个问题能问出他有没有真的训练过。真做过训练的人,对数据规模和算力开销如数家珍;没做过的人,这两个数字一个都答不上来。
「离开那家的 API,产品还能跑吗?」
这个问题能问出产品的独立性。答「能,换个底座就行」说明工程扎实;答「跑不了」也不丢人,但「核心技术全自研」的说法就该收回去了。
✅ 这一页想和你分享的
- 听宣传抓三件事:模型底座、训练数据、成本量级,三个都含糊的可以直接换台
- 壳不丢人,吹牛才丢人:好产品大多是厚壳,要警惕的是薄壳配大词
- 口号不含信息量:「深度赋能」「All in」这类词,听到时自动静音即可
- 追问三连随身带:底座、数据、独立性,三个礼貌问题就够用了
『开源模型』等于免费吗?
新闻里说某模型「开源了」,评论区一片欢呼「免费用上顶级 AI」。先别急着欢呼,AI 圈的「开源」和你理解的免费,中间隔着好几层意思,这一页把它们一层层剥开。
多数「开源模型」只公开了权重,也就是练好的大脑本体;训练数据和训练方法通常不给。下载不要钱,但跑起来要显卡要电费,拿去赚钱还要看许可证。
软件圈的开源,给的是源代码:你能看到每一行怎么写的,能自己改、自己编译,整个制作过程摊开在你面前。菜谱、食材、火候,全套公开。
AI 圈的「开源模型」大多没这么慷慨。它给你的是权重:几百 GB 的数字,是那锅汤炖好之后的成品。汤你随便喝,但配方(训练数据)和炖法(训练方法)通常保密。所以圈内更严谨的叫法是「开放权重」,只是新闻标题懒得区分。
另外别忘了许可证。开源模型附带一份使用协议,有的随便商用,有的限制用途或用户规模。自己玩基本没事,拿去赚钱前务必读一遍,这一步很多人跳过,跳过的代价可能是律师函。
判断一个模型开得有多彻底,看三样东西就够了:权重、数据、方法。点下面两个按钮,看看两种典型情况分别亮几盏灯。
模型权重
训练数据
训练方法
还有一个常见误会:新闻里刷榜的「满血版」,和你在自己电脑上跑起来的那个,多半是两回事。厂商通常会把大模型「蒸馏」成小模型:让大的当老师,教出一个小的,能力保留一部分,体积缩小几十倍。点下面的按钮看对比。
满血版
蒸馏版
「免费下载」和「免费运行」是两件事。模型文件本身不要钱,但它跑起来要占显存:模型越大,需要的显卡越贵,大到一定程度,一张卡装不下,得好几张一起上。电费也是持续开销,虽然家用规模不至于心疼,但服务器规模就是一笔正经账单了。
✅ 这一页想和你分享的
- 开源多半只是开权重:汤给你了,配方和炖法保密,严谨叫法是「开放权重」
- 免费下载和免费运行是两件事:跑起来要显卡要电费,模型越大账单越厚
- 本地跑的多半是蒸馏小号:新闻里的满血版住在机房里,别拿榜单成绩要求小号
- 商用先看许可证:自己玩随意,赚钱前把使用协议读一遍
『跑分第一』的模型,为什么用起来不行?
刷到「新模型霸榜」的新闻,兴冲冲换过去,结果写个周报还没原来的顺手。你没用错,榜单也没造假,只是榜单测的和你要的,从来就没对齐过。
榜单测的是考试,你要的是干活。题库会被刷、考纲未必含你的场景,跑分当参考就好。选模型最靠谱的办法是拿自己的活儿去试。
下面是两个虚构的模型:A 跑分 95,B 跑分 88,按榜单选肯定选 A。但是别急,点下面三个真实任务,看看它们各自的表现。
模型 A
95 分模型 B
88 分刷榜
榜单题库在网上流传久了,难免混进模型的训练数据。相当于考前背了答案:分数很好看,能力没那么多。这在圈内有个体面的说法,叫「数据污染」。
过拟合考试
厂商知道大家看榜,就专门朝着考点优化。就像应试教育里的做题家:卷面成绩顶尖,日常交流和动手能力反而可能被牺牲掉。
考纲不含你的场景
榜单考数学、考代码、考知识问答,但不考「懂你们行业」,也不考「安慰人」。你最在意的那门课,考纲里可能压根没有。
也有相对可信的榜:真人盲测投票类。做法是把两个模型的回答摆在一起,隐藏名字,让大量真实用户投票选哪个更好。这种榜没有固定题库可背,考官是活人,刷起来难度大得多。
但它也只是「相对」可信:投票的人未必和你干同一行,大众觉得好的回答风格,未必适合你的场景。想看国产模型在各种真实场景里的实际表现,可以移步国产模型怎么选那一页。
最靠谱的评测机构是你自己。方法很土,但极其有效:从自己的工作里攒 10 个真实问题,存成一个文档。每次想换模型,把 10 道题跑一遍,好不好用一目了然。
私人题库的攒法(示例)
- 挑最常干的活:周报、方案、邮件,选你每周都要做的 3 件
- 挑最专业的活:带上行业黑话和内部语境的问题,考它懂不懂你这行
- 挑翻过车的活:以前 AI 答砸过的问题,最能试出新模型的成色
- 留一道送分题再留一道刁钻题:送分题都答不好的直接淘汰,刁钻题用来拉开差距
- 答案好坏你说了算:你比任何榜单都清楚,什么样的输出算「能交差」
✅ 这一页想和你分享的
- 跑分是入学考试,你要的是试用期表现:两件事相关,但相关得有限
- 高分可能是背过题:题库会泄漏进训练数据,考点会被针对性优化
- 真人盲测投票的榜相对可信:没有固定题库,考官是活人
- 建一套自己的十题小考卷:换模型跑一遍,五分钟出结论,比追新闻管用
AI 越聊越懂我,是它在学习吗?
用了一阵子 AI,你可能有过这种感觉:它记得你住哪、爱吃什么,越聊越贴心,像在慢慢了解你。它真的在学习进化吗?答案有点意外:它一个字都没学进去。
没有在学习。对话改变不了模型本身,它的大脑在出厂那一刻就冻结了。所谓越来越懂你,是产品把你的信息记在一个「小本本」上,每次对话开始前悄悄塞回给它看。像一位记性欠佳的老朋友,每次见你之前先翻一遍笔记。
大模型的一生分成两个阶段:训练和聊天。训练像上学,要读海量资料、反复调整脑子里的参数;聊天像毕业后上班,只负责用学到的东西干活。关键在于:上岗那天起,它脑子里的参数就定型了。你跟它聊一万句,这些参数一个都不会动。想看这两个阶段的详细拆解,本站有一节训练与使用的深入版课程。
「它越来越懂我」这件事,很多人脑中的画面和实际发生的画面差得很远。点下面三个按钮,逐个看看。
刚才「实际发生的画面」里那个小本本,就是各家产品宣传的「记忆功能」。它是模型外面挂的一个记事本:你聊天时提到的关键信息(住哪、吃什么、做什么工作)被摘出来存好,每次新对话开始前,产品把这些条目贴进对话的最前面,模型读到了,回答自然显得懂你。这些贴进去的内容占用的空间,就是常说的上下文窗口。
这里有两件事常被混成一件,得分开说。换个产品,记忆确实带不走:小本本存在 A 产品的服务器上,B 产品看不到,你在一边积累多年的「默契」,换个应用直接清零。所以重要的个人偏好,建议你自己也存一份文档,走到哪贴到哪。
但在同一个产品里新开对话,它并不会失忆——小本本挂在你的账号上,不是挂在某一个对话里。豆包、ChatGPT 这类默认开着记忆功能的产品,你新开一个对话,它照样知道你吃素。真正会丢的,是这个对话里聊过、却没被摘进小本本的那些细节:刚才那段长文档、上一轮的具体措辞、你临时改的口径。失忆的是模型,不是产品。
单独训练贵到离谱
训练一次大模型要动用成千上万块专用芯片连跑数周,成本按「亿」的量级算。给几亿用户每人单独练一个专属模型,没有公司付得起这个账。
小本本便宜又够用
相比之下,给每个用户配一个记事本,成本几乎可以忽略。效果上你感觉不出差别:它照样记得你住广州、吃素、养了一只猫。
冻结反而更安全
如果每个人都能靠聊天改写模型,有人教它好话,也会有人教它坏话。参数冻结让它对所有人保持同一个水准,这是特性,也是保护。
✅ 这一页想和你分享的
- 模型参数出厂即冻结:聊再多,也改变不了它的大脑
- 「记忆」是外挂小本本:产品把你的信息存好,每次对话前塞回给它看
- 觉得它越来越懂你:该夸的是产品设计,模型只是照着念
- 小本本挂在账号上:同一产品新开对话照样记得你,换个产品才会清零
- 重要偏好自己留一份:自备一份文档,走到哪贴到哪
AI 检测器说「这是 AI 写的」,可信吗?
交了论文被判「AI 生成率过高」,认真写的报告被同事怀疑是机器代笔… 这种检测结果到底值几分信任?先别急着喊冤,玩一局小游戏,你马上就有答案。
不可信,接近玄学。AI 就是照着人类的好文章学出来的,写得工整流畅的人类文字经常被冤枉;目前没有任何检测器能可靠地区分两者。检测分数当参考都勉强,当证据万万不行。
下面有六段文字,有人写的,也有 AI 生成的。你的任务有点特别:猜一猜检测器会怎么判。猜完每一段,我们会揭晓检测器的判决、真实作者,以及它有没有判错。
检测器的思路是找「AI 味」:用词是否太规范、句子是否太通顺、结构是否太整齐。问题来了:AI 当年就是照着人类的好文章学写作的。通顺、规范、结构清楚,这些恰恰是认真写作的人一直在追求的东西。让检测器找「AI 特征」,等于让它找「好学生特征」,结果就是认真写字的人集体中枪。
更尴尬的是反方向:把 AI 生成的文字改几个词、加两个错别字、掺点口语,检测分数立刻大跳水。一个正着抓冤枉好人、反着抓轻易被骗的工具,你说它抓住的到底是什么?说到底它只认表面特征,认不出作者。
检测器不可靠,但被它冤枉的麻烦是真实的。与其事后争辩,平时留好这三样东西,关键时刻拿得出手。
草稿和修改记录
在线文档大多自带编辑历史:什么时候写了哪段、改了几轮,全有时间戳。一篇真人写的文章,历史记录是一点点长出来的,装不出来。
创作过程录屏
重要的稿子(毕业论文、求职作品),写作时顺手开个录屏。占点硬盘空间,换一份没人能反驳的证据,划算。
过程材料留底
大纲、参考资料截图、和同学讨论的聊天记录,都是创作路径的脚印。AI 一秒出稿,脚印可伪造不了这么全。
如果你是拿着检测报告做决定的人,请记住一件事:主流检测工具的官方说明里,都写着结果仅供参考、存在误判可能。工具自己都不敢打包票的事,使用工具的人更不该拿它一票否决一个学生或候选人。
✅ 这一页想和你分享的
- 检测分当不了证据:误判是常态,冤枉认真写作的人尤其多
- 写得越工整越危险:AI 学的就是人类范文,好文章的特征两边重合
- 平时留好过程:编辑历史、录屏、草稿,关键时刻自证清白
- 工具自己都标注了「仅供参考」:别替它把话说满
「提示词秘籍」值得买吗?
「独家万能模板,限时特价」「学完 AI 副业月入过万」… 刷到过这类广告吗?掏钱之前,我们把一张典型的宣传单逐条拆开,给每个卖点盖个章。
大概率不值。真正有用的骨架半页纸就讲完了,本站免费教过;剩下的功夫在你自己的活儿上多用多改。几百块的秘籍,卖的主要是焦虑。
下面是一张仿制的宣传单,六个卖点都是市面上的常见话术。逐条点击,我们给每一条盖上分类章,并附一句点评。章一共四种,含金量依次递减。
拆归拆,知识付费这件事没有原罪。有体系的课程、有人带练的服务、垂直行业的深度整理,都可能物有所值。掏钱之前,用这三条标准过一遍。
可试听
敢让你先看内容再掏钱的,通常对质量有底气。只给目录和喜报截图、正文全靠想象的,先按住钱包。
可退款
有明确的退款条款,说明卖家把风险分担了一部分。「虚拟商品概不退换」加高价,两个信号叠在一起要警惕。
承诺不夸张
靠谱的课讲方法、讲练习、讲适用范围;只要出现收入承诺,直接关页面。能稳定月入过万的人,很少靠卖这个赚钱。
好消息是,这门手艺的入门是免费的,进阶靠的是你自己的场景。两步就够:
第一步,学骨架。本站零基础入门篇免费讲过提示词的基本骨架(背景、要求、限制),还有让 AI 先反问你再动手的技巧。两页读完,市面上大半「秘籍」的核心内容你就有了。
第二步,在自己的活儿上磨。挑一件你每周都要做的事(周报、方案、邮件),用骨架写一版提示词,结果不满意就改,改三轮存下来。三个月后你手里那套「专属模板」,任何秘籍都卖不了你,因为它长在你的工作里。
✅ 这一页想和你分享的
- 骨架免费半页纸:背景、要求、限制,本站零基础入门篇教过
- 模板的价值是省时间:标价该看它帮你省了多少小时
- 见到收入承诺直接关页面:这是最省事的避坑口诀
- 真功夫来自你自己的场景:在每周的活儿上改三轮,胜过买十本秘籍
同一个问题,为什么每次答案不一样?
昨天问它给奶茶店起名,回了三个文艺范;今天原封不动再问一遍,画风全变。它是记性差,还是在敷衍你?都没有。点几下按钮,你就能亲眼看到它的每个字是怎么来的。
因为 AI 生成每个字的时候都在掷骰子:从几个高概率的候选词里挑一个。这是有意的设计,让回答自然不死板。需要稳定输出的场合,可以把随机性调低。
下面是一个固定的问题,一个字都不改。点「再问一次」,看看三次回答能差出多远。
AI 写句子的方式是接话茬:每次只决定下一个字。它先给所有候选字打分,分高的中签机会大,分低的机会小,然后抽一个。抽完这个字,再为下一个字重新抽签。一句话几十个字,就是几十次抽签,两次回答一模一样才是小概率事件。
口说无凭,下面就是某一个位置的真实场景:AI 已经写出「店名建议:茉莉奶」,正在决定下一个字。四个候选字的概率条摆在这里,你来替它掷这一次骰子。多掷几次,注意右侧的中签统计。
你可能会问:直接每次都选分数最高的字,答案稳定,多好?试过,效果很糟。永远选最高分,回答会变成死板的复读机:你问十次奶茶店起名,它答十次「茉莉奶茶」;写出来的文案千篇一律,起名、写诗、想创意这类任务直接废掉。允许它抽中第二名、第三名的词,路子一下就宽了,语言也更像活人说话。
创意任务 · 欢迎随机
起名、写文案、头脑风暴,随机性就是灵感来源。多问几次,等于免费多请了几位同事,挑最好的那版就行。
严肃任务 · 调低随机
合同条款、代码、数据处理,答案漂移会出事。很多产品可以调低随机性(常见叫「温度」参数),调到最低时接近每次都选最高分。想深入了解,看温度参数的进阶课。
还有一个实用提醒:随机性也意味着单次回答的可靠度有限。涉及重要事实时,同一个问题换着方式多问几次,答案一致的部分可信度更高,来回变的部分就要去权威来源核实。答案不一致和撒谎是两回事,但对你来说,处理方式一样:都要核实。
✅ 这一页想和你分享的
- 随机是特性:答案不一样说明骰子在正常工作,故障另说
- 每个字都是一次抽签:概率高的常中签,概率低的也有机会
- 创意任务欢迎随机,严肃任务调低温度:按场合用它
- 重要事实多问几次交叉验证:一致的更可信,不一致的去核实
AI 客服为什么那么蠢?
你可能也纳闷过:同一个时代,聊天 AI 已经聪明得像个靠谱同事,可点开购物软件的客服,对面那位还在一本正经地装傻。这事其实说得通,看完你就知道它蠢在哪、怎么治。
你平时聊的智能助手和商家的客服机器人,多半没用同一个脑子。客服要省钱、怕说错话要赔、还有大量老式关键词机器人在冒充新 AI,蠢得各有各的原因。
同一句话:「我上周买的鞋开胶了,想换货但发票丢了」。发给聊天 AI 和发给商家客服机器人,待遇差多少?点下面切换对比。
刚才那位客服机器人,很可能只是在你的话里扫到了「发票」两个字,然后掏出它库存里唯一相关的答案。它蠢,通常出于下面三个原因,而且都挺现实。
省钱
客服每天要接的消息量大得吓人,每一条都要花钱处理。很多商家算完账,选了便宜的小模型或者干脆沿用旧系统。你享受到的聪明程度,和商家愿意付的账单直接挂钩。
护栏锁死
AI 聊天时随口说一句「可以给您全额退款」,商家可能就真得赔。所以很多客服 AI 被规定只准念审核过的稿子,超纲一律装没听见。对商家来说,宁可蠢,不能错。
冒充
还有一大批客服,压根就是上一代的关键词机器人:在你的话里找关键词,命中哪条答哪条。这两年它们纷纷贴上了「AI 智能客服」的标签继续营业,锅却让新 AI 背了。
知道了原理,对付它就有办法了。客服系统里通常留着几条「升级通道」,命中了就会把你转给真人。
这两年,接了大模型的新一代客服确实在变多。分辨方法很简单:换个说法再问一遍。把「发票丢了能换货吗」换成「购物小票找不着了,还能给我换吗」,老式机器人立刻露馅,接了大模型的客服能稳稳接住。
✅ 这一页想和你分享的
- 客服蠢多半有原因:老系统冒充、小模型省钱,和你聊天用的 AI 常常压根是两套东西
- 护栏是商家怕赔:只准念稿的客服,蠢是被规定出来的
- 召唤人工有技巧:直接说「人工」「投诉」,或者把诉求描述得足够具体
- 判断新旧看一招:换个说法它还接得住,才是真的接了大模型
- 别拿客服体验给 AI 下结论:那可能只是商家账本的形状
Siri 和 ChatGPT 是一种东西吗?
都叫 AI 助手,一个陪了我们十几年,敬业地重复着「抱歉,我没听懂」;一个横空出世,什么都能聊。它们看起来是同行,用的却是两代技术。这一页带你看清差在哪。
老一代语音助手靠命令匹配,只听得懂预先设计好的几百种说法;ChatGPT 这类生成式 AI 什么说法都能接住。前者像电话客服的按键菜单,后者像真人接线员。
来一句稍微复杂点的指令,看看它在两种助手的脑子里分别走了一条什么路。点下面切换播放。
刚才那条老路径,问题出在第二步:去命令库里找匹配。这条技术路线有一个绕不开的天花板:人类的说法无穷无尽,命令库里的条目却是工程师一条条写进去的。「叫我起床」「设个闹钟」「明早喊我」…每一种说法都得有人预先想到、预先登记,漏了哪种,助手就听不懂哪种。
这就是为什么这些年语音助手看起来在原地踏步:工程师再加十倍,也穷举不完人类的说话方式。路线的天花板,加人是顶不破的。它和 ChatGPT 的差距是代差,就像按键电话和智能手机,给按键电话换个铃声,它还是按键电话。
按键菜单:老助手
「查话费请按 1,办业务请按 2」。选项预先定好,你只能在菜单里挑。想说点菜单外的事?它只会礼貌地重播一遍菜单。
真人接线员:生成式 AI
你怎么说都行,绕着弯说、带着条件说、说一半改主意都行。它理解你的意思,再决定怎么办。想知道它为什么能接住任何话茬,可以看这一课讲的接话原理。
好消息是,这两年各家的语音助手陆续开始「换脑子」:把老的命令匹配系统换成大模型,或者两套并用。你可能已经注意到,手机上的助手忽然能多聊几句了。这波升级还在进行中,不同设备、不同地区的进度差别很大,所以你家里可能同时住着新旧两代助手。
音箱要卖得便宜、答得飞快,跑大模型又费算力又慢半拍,所以很多音箱还留着老脑子,这和客服机器人装傻是同一本账。
✅ 这一页想和你分享的
- 代差在技术路线:命令匹配和生成式理解是两代技术,账号升级、换个铃声都救不了
- 一个好记的比喻:老助手是电话按键菜单,生成式 AI 是真人接线员
- 十年没进步的原因:说法无穷、命令有限,加十倍工程师也穷举不完
- 音箱还蠢的原因:多半是没换脑子,或者舍不得算力
- 一招判断新旧:换个说法它还接得住吗