Token 是什么?为什么 AI 按它收费?
账单上写着「按 Token 计费」,新闻里动不动「百万 Token」,这颗「Token」到底是个什么东西?这一页带你亲手把一句话切开看看。
Token 是 AI 读写文字的最小单位,大约是一小块词。AI 每读一颗、每写一颗都要消耗算力,所以按颗收费,逻辑和出租车按里程计价一样:跑多远,付多少。
下面有几句现成的话,点一句试试。你会看到它被切成一颗颗彩色的小块,每一块就是一颗 Token,下方的计数器和账单会实时跟着跳。
出租车按里程计价,因为车每跑一公里都实打实地烧油。AI 同理:每读一颗、每吐一颗 Token,机房里的显卡都在做一轮运算、耗一份电。按颗数收费,是最贴近真实成本的计法。而且要注意,账单是两头一起算的:
你发给它的(输入)
你打的每一个字、贴进去的每一段资料,它都要一颗颗读进去。读,也要钱。
它回给你的(输出)
它写的每一个字也是一颗颗算出来的。写,同样要钱,而且单价通常更贵,因为「写」比「读」费劲。
用上面的分词器对比一下中文句和英文句:中文常常一到两个字就要占一颗 Token,英文一个不短的单词往往只占一颗。所以表达同样的意思,中文消耗的 Token 数常常更多。这和模型「认字」的习惯有关:它对英文见得多、切得熟,对汉字只能切得更碎。
✅ 这一页想和你分享的
- Token 是计费的颗粒:AI 读写文字的最小单位,大约一小块词
- 输入输出都算钱:你发的要钱,它回的也要钱,后者通常更贵
- 同样的意思,中文往往更费:汉字被切得更碎,颗数更多
- 提示词写得精炼,就是在直接省钱:每省一颗都是真金白银
为什么聊久了它会「忘事」?
第 1 轮明明说过的事,第 20 轮它答得像完全没听过。它没坏,也没敷衍你,只是那句话已经不在它眼前了。
AI 没有无限的记性。它每次回答,只能看见「工作台」上放得下的最近内容;台面(术语叫「上下文窗口」)满了,最早的话就被挤掉。被挤掉的那部分,再也参与不了这次回答。
想象 AI 面前有一张桌子。你们每聊一轮,就往桌上放一张纸条,写着这一轮说了什么。AI 回答你时,只低头看桌上现有的纸条。桌子就那么大,纸条放满之后,每来一张新的,最旧的那张就被推下桌。掉在地上的纸条,它看不见,也捡不回来。
台面大小 = 上下文窗口
不同模型的台面有大有小,但都有边界。放满就是放满了,加钱也变不出第九个格子。
一张纸条 = 一轮对话
你说的和它回的都要占台面,长篇大论、大段粘贴的资料占得更多,台面满得更快。
下面是一场模拟对话。你在第 1 轮告诉过它「我对花生过敏」。往右拖动滑块增加对话轮数,看着台面慢慢放满,再看看那张关键纸条掉下去之后,它推荐的晚饭变成了什么。
重要信息,隔段时间重讲一遍
过敏、预算、格式要求这类关键设定,聊了十几轮之后不妨再说一次,等于把纸条重新放回台面最上层。
台面满了,直接开一个新对话
最直接的一招,也最常被忘掉:新对话就是一张空台面,之前挤掉的东西不再占地方。短任务重开就完事;长任务别裸开,先让它总结当前进展,把摘要贴进新对话再接着干。
发现它忘了,别跟它吵
它翻不回去掉在地上的纸条。直接把关键信息重新发一遍,比连问三句「你忘了吗」有用得多。
✅ 这一页想和你分享的
- 忘事是容量问题:它没坏,是台面满了,最早的话被挤掉了
- 每次回答只看窗口内的内容:掉出去的部分等于没说过
- 重要设定要重申:隔段时间重讲一遍,把纸条放回台面
- 台面满了就重开:短任务直接开新对话,长任务先要一份摘要带走
「推理模型」「深度思考」是什么?
很多 AI 应用里都藏着一个「深度思考」开关。打开它,回答变慢了、账单变贵了,换来的到底是什么?
推理模型会先在草稿纸上一步步演算,再交答案。慢一点,也贵一点,但复杂问题错得更少。要提醒的是:简单问题也开深度思考,属于高射炮打蚊子。
普通模式像抢答:题目一出,凭第一反应张口就说。深度思考像考试里的大题:先在草稿纸上列条件、试几种解法,发现不对就划掉重来,最后才把答案誊到答题卡上。所谓「思考」,就是多写了几页草稿。草稿也是一个字一个字生成的,所以更慢,也更花钱。
来一道排座位的小逻辑题,点下面两个按钮,看两种模式各自怎么答。建议先看「秒答模式」,再看「深度思考模式」。
判断标准一句话:答案需要一步步推出来的,值得开;查一下或一眼能看出的,不值得。下面四道题,你来判一判,点了就知道对没对。
✅ 这一页想和你分享的
- 推理模型 = 先打草稿再交卷:把演算过程写出来,再给答案
- 更慢也更贵:换来的是复杂问题上明显更稳
- 复杂开、简单关:高射炮别拿来打蚊子
- 所谓「思考」并不神秘:就是多生成了几页草稿文字
参数越多越聪明吗?
发布会上动不动「千亿参数」「万亿参数」,数字一个比一个吓人。这个「参数」到底是什么?数字大,就一定更聪明吗?
参数像大脑里旋钮的数量:旋钮多的,通常见识更广。但聪明程度还取决于训练数据的质量和训练方法;日常任务里,小模型常常反而更划算。
训练一个模型,就像调一台带海量旋钮的机器:每喂一批资料,就把一些旋钮拧一点点,让它的回答更像样。等训练结束,这几十亿、几千亿个旋钮的位置,合起来就存下了它学到的一切。所以参数量可以粗略理解成:这台机器有多少个可以拧的旋钮,也就是它能装下多少见识。
拖动滑块换档位,看看每个量级的模型大概像什么、跑起来要什么设备。数字只看量级就好,别纠结精确值。
旋钮多有旋钮多的代价:更慢、更贵、更挑设备。下面三种场景里,小模型经常打赢大块头。
小模型赢在速度
参数少,算得快。实时字幕、输入法联想这类要秒回的场景,大模型再有学问也等不起。
小模型赢在成本
同样一件事,小模型的电费和算力开销低一大截。量大的活儿,一年下来省出的钱很可观。
小模型赢在专精
比如客服系统里判断用户是想退货还是查物流,一个调教好的小模型又快又准,性价比碾压大块头。
选模型像选车:跑长途拉重货,上卡车;市区买个菜,一辆小电驴就够了。先想清楚任务有多难,再决定用多大吨位的模型,账单和体验都会舒服很多。
✅ 这一页想和你分享的
- 参数是容量指标:旋钮越多,能装下的见识越多
- 数据质量和训练方法同样关键:旋钮多,拧得不好也白搭
- 选模型看任务定吨位:日常活儿,小模型常常更划算
- 新闻里的参数竞赛听听就好:干得好不好才是你的事
为什么有的 AI「看不懂」图片?
你可能遇到过:给 AI 发照片,它回「抱歉,请用文字描述」。也见过能把照片里的菜谱都认出来的。同样是 AI,差在哪?
因为「会说话」和「会看」是两套独立的本事。语言模型天生只认文字;想让它看图,得额外给它装一双「眼睛」——装了的叫多模态模型,没装的就只能对图片说抱歉。
「抱歉,我无法查看图片。你可以描述一下图片内容,我来帮你分析。」
「一只橘猫趴在飘窗上晒太阳,右前爪压着一个毛线球。看它的体型……这位可能需要控制一下饮食了 😄」
第一步:把图切碎
「眼睛」(视觉编码器)把图片切成许多小方块,每块转译成模型认识的「词」——一张图就变成了一段特殊的「文字」。
第二步:当话来接
转译完成后,图片对模型来说就和一段话没区别了,照常「接话茬」。所以看图能力的本质,还是那台接话机器。
为什么不都装上?
装眼睛要用海量「图 + 文」配对数据重新训练,成本高、模型更大更贵。很多场景根本用不到看图,纯文本模型反而更快更便宜。
✅ 这一页想和你分享的
- 会说话 ≠ 会看:看图需要额外的「眼睛」(视觉编码器)
- 眼睛的原理:把图切碎、转译成「特殊的文字」,然后照常接话茬
- 不装眼睛不是落后:更快更便宜,很多场景够用
- 看图和画图是两回事:全能应用背后是多个模型在分工
微调是什么?和「喂资料」有什么区别?
老板说「把公司资料喂给 AI」,供应商说「给你们微调一个专属模型」,听着像一回事,报价能差出几百倍。这一页用「上课」和「开卷考试」两个比方,帮你把这笔账算清楚。
微调是送 AI 重新上课,把知识练进它身体里;喂资料(也叫知识库、RAG)是让它开卷考试,随用随查。多数公司真正需要的,其实是后者。
同一个目标:让 AI 会回答你公司的问题。左边走「微调」这条路,右边走「喂资料」这条路。点下面的按钮,看两条路各要经历什么。
注意一个关键差别:微调改变的是模型本身,像把知识练成了肌肉记忆;喂资料完全没动模型,只是考试时允许它翻书。所以资料一更新,开卷这边换本书就行,上课那边就得重新读一遍。
道理懂了,落到具体事上怎么选?下面四个是企业里最常见的场景,点一个试试,看推荐方案和理由。
| 🏫 微调(上课) | 📚 知识库(开卷) | |
|---|---|---|
| 生效速度 | 几天到几周 | 当天就能用 |
| 成本量级 | 几万到几十万起步,还要专人伺候 | 低一到两个量级,普通团队就能搭 |
| 知识更新 | 资料变了要重新训练一遍 | 换个文件就行,随换随用 |
| 各自适合 | 改风格、改口吻、学专业「语感」 | 会变的知识:制度、价格、文档问答 |
给你一个省钱的顺序:先试提示词,再挂知识库,最后才考虑微调。很多「必须微调」的需求,认真写一段提示词就解决了;再不够,挂上知识库让它开卷;两样都试过还差口气,那才轮到花大钱送它上课。顺便提醒:饭局上有人说「我们训了个模型」,多数时候他做的只是前两步,这一页帮你听懂他到底干了啥。
✅ 这一页想和你分享的
- 微调 = 上课:知识练进模型身体里,周期以周计、花费以万计
- 知识库 = 开卷考试:资料放书架随用随查,当天生效,换文件就更新
- 知识常更新就开卷,改性格、改风格、学专业语感才需要上课
- 省钱顺序:先试提示词,再挂知识库,都不够再考虑微调
企业都在建的「知识库」是什么?
开会总听到「我们要建知识库」「接一下 RAG」,听着像什么大工程。其实它就是给 AI 配了一个随用随查的书架:考试可以开卷了,还得把翻到的那页指给你看。
把公司文件切成小块、建好索引,AI 回答前先去里面找出相关的几段,塞进对话里再作答。它拿着你的资料说话,出处也能标给你看。
整个知识库的运转就三步。点「下一步」逐步推进,每一步都用刚才那个书架的比方。
同样问一句「我们的差旅报销上限是多少」,切换下面两个按钮,看 AI 的回答差在哪里。
有人会问:干嘛这么麻烦,把公司几百份文件一股脑发给 AI 得了。两个原因:
台面装不下
AI 一次能「看在眼里」的内容有限,像一张大小固定的工作台,几百份文件根本摊不开。这个台面叫上下文窗口,这一页讲了它为什么会「忘事」。
按字数收费
AI 读进去的每个字都按 Token 计费,每次提问都附上全部文件,等于每次都把整个图书馆搬一遍,钱包先受不了。Token 怎么收费看这页。
所以知识库的思路很聪明:书都留在架上,每次只把最相关的几页带上考场。省钱,还装得下。
知识库让 AI 拿着资料说话,但它分辨真伪的能力有限:书架上的文件过时了,它照着旧文件答;两份文件互相矛盾,它可能各抄一半。它保证的是「有据可查」,管不了「据是否靠谱」。所以建知识库,一半功夫要花在整理文件上:删掉过时的、合并矛盾的,书架干净,答案才干净。
✅ 这一页想和你分享的
- 知识库 = 开卷考试的书架:切块、建索引、考试时翻着答,就这三步
- 能标出处:答案来自哪份文件一目了然,点开原文就能核对
- 文件质量决定答案质量:书架上放了过时或矛盾的资料,AI 也照答
- 与训练无关:整个过程不改模型本身,换文件当天生效
GPT、LLM、AIGC…这些缩写怎么分?
新闻里一句话能塞四五个缩写,个个都眼熟,个个都说不清。别慌,这一页用一局配对小游戏加一张关系图,帮你把它们各归各位。
AI 是最大的圈,LLM 是其中管文字的大模型,GPT 是造 LLM 的一种主流做法(同时被 OpenAI 用作产品名),AIGC 说的是「用 AI 生成内容」这件事本身。
规则很简单:先点左边一个缩写,再点右边它对应的人话解释。配对成功两边一起变绿锁定,配错了会抖一下。全部配完有奖励。
GPT 原本是一串技术术语的缩写(生成式预训练变换器),指造大模型的一种主流做法;后来 OpenAI 把自家产品直接命名为 GPT 系列,ChatGPT 更是火遍全球。于是新闻里的「GPT」有了两个意思:说技术时指那种做法,说产品时指 OpenAI 家的模型。就像「席梦思」原本是一个床垫品牌,用的人多了,大家把这类床垫都叫席梦思。听到 GPT 时看一眼上下文,就能分清它指哪个。
AI 圈造词速度很快,但好消息是:新缩写多半是上面这几个的组合或变体。遇到生词先问一句「它归哪个圈」:
是一种模型?
归到 LLM 那一层。比如 VLM(视觉语言模型)就是看得懂图的 LLM,落在「多模态」能力上。
是一种应用形态?
归到 Agent 那一层。各种「智能体」「数字员工」,多半是Agent 换了个营销说法。
是一种行为或能力?
归到 AIGC 或多模态那一类。「AI 写作」「AI 绘画」「文生视频」,说的都是拿工具干活这件事。
✅ 这一页想和你分享的
- 一张嵌套图记住层级:AI ⊃ NLP ⊃ LLM ⊃ GPT,一圈套一圈
- GPT 有双重身份:既是造模型的做法,又是 OpenAI 的产品名
- AIGC 是行为,LLM 是工具:一个说「干什么」,一个说「用什么干」
- 新缩写先问归哪个圈:是模型、是应用形态,还是一种行为能力
英伟达为什么那么值钱?
一家「卖显卡的」,市值能排进全球最前列,很多人第一反应是看不懂。看懂它只需要两个画面:一场淘金潮,和一场算术比赛。
AI 训练要同时做海量的简单算术,显卡天生擅长人海战术;全世界都在抢算力,英伟达是这轮淘金潮里最大的卖铲人。
当年淘金热有个经典观察:冲进金矿的人未必挖到金子,在路口卖铲子和牛仔裤的人先发了财。今天的 AI 就是新一轮淘金潮:
淘金的人
全世界的公司都冲进来训模型、做应用,都想挖到自己的金子。谁能挖到,现在还说不准。
铲子
挖金子得先有工具。AI 的工具是算力,主要就是一排排装满显卡的机房。没铲子,再好的想法也开不了工。
卖铲人
不管谁最后挖到金子,铲子人人都得买。英伟达卖的就是这把铲子,而且几乎是独一家,想买还得排队。
训练一个大模型,光算力开销就在几十万到上亿的量级,这些钱大头流向了同一家公司。淘金的人越多、越疯狂,卖铲人越值钱。
那为什么非要显卡?电脑里原本的处理器(CPU)也很强啊。因为两者的强法不一样:CPU 像一位博士,什么难题都会,但一次专注做一道;显卡(GPU)像一万名小学生,每人只会简单算术,但能同时开工。AI 训练要算的恰好是海量的简单乘加,正对小学生的胃口。点下面开赛,亲眼看看。
造出性能接近的芯片,别家未必做不到。难追的是另一样东西:多年积累的软件工具链和生态。全世界的 AI 开发者写程序,用的那套工具默认长在英伟达的地基上;换一家的芯片,等于让所有人搬家重装修,光有房子没人愿意来。硬件可以砸钱造,生态只能靠时间长。这就是它的护城河。
关系很直接:算力贵,是所有 AI 服务收费的根源。你每次和 AI 对话,按 Token 计的费里摊着显卡的折旧和机房的电费;生成一张图贵几十倍,也是因为图要算的量比文字大得多。理解了铲子有多贵,就理解了账单为什么长那样。
✅ 这一页想和你分享的
- 显卡赢在并行:一万名小学生同时算简单题,完胜一位博士逐题精算
- 卖铲人逻辑:淘金的人未必赚钱,铲子人人都得买
- 生态是护城河:开发者都在它的工具链上盖房,搬家成本太高
- 算力成本最终摊进你的账单:每次对话、每张图,都有铲子的折旧