零基础入门 · 小白三千问

Token 是什么?为什么 AI 按它收费?

账单上写着「按 Token 计费」,新闻里动不动「百万 Token」,这颗「Token」到底是个什么东西?这一页带你亲手把一句话切开看看。

一句话回答

Token 是 AI 读写文字的最小单位,大约是一小块词。AI 每读一颗、每写一颗都要消耗算力,所以按颗收费,逻辑和出租车按里程计价一样:跑多远,付多少。

亲手切一句话

下面有几句现成的话,点一句试试。你会看到它被切成一颗颗彩色的小块,每一块就是一颗 Token,下方的计数器和账单会实时跟着跳。

点上面任意一句,看它被切成一颗颗 Token
0
字符数
0
Token 数
0 厘
这句话的读取费(演示)
切分是 GPT-4o 家族分词表(o200k)的真实结果,换别的模型切法会不同。注意它不按人的语感来:「今天天气」会被切成「今 | 天天 | 气」。账单按演示费率「每千颗 Token 约 2 厘钱」估算,只用来感受量级。
为什么要按 Token 收费

出租车按里程计价,因为车每跑一公里都实打实地烧油。AI 同理:每读一颗、每吐一颗 Token,机房里的显卡都在做一轮运算、耗一份电。按颗数收费,是最贴近真实成本的计法。而且要注意,账单是两头一起算的

你发给它的(输入)

你打的每一个字、贴进去的每一段资料,它都要一颗颗读进去。读,也要钱。

它回给你的(输出)

它写的每一个字也是一颗颗算出来的。写,同样要钱,而且单价通常更贵,因为「写」比「读」费劲。

所以贴一大段没用的资料让它读,或者放任它写一堆车轱辘话,两头都在烧钱。提示词工程那一页讲过:提示词里的废话,最后都会被一颗一颗放大成账单。
中文更费,还是英文更费

用上面的分词器对比一下中文句和英文句:中文常常一到两个字就要占一颗 Token,英文一个不短的单词往往只占一颗。所以表达同样的意思,中文消耗的 Token 数常常更多。这和模型「认字」的习惯有关:它对英文见得多、切得熟,对汉字只能切得更碎。

常见误区:字数不等于 Token 数。数字、符号、生僻词会被切得特别碎,「#2049」这样一个编号就占了三颗;「今天天气真不错」七个字只要五颗。别拿字数直接估账单,量级会差不少。

✅ 这一页想和你分享的

  • Token 是计费的颗粒:AI 读写文字的最小单位,大约一小块词
  • 输入输出都算钱:你发的要钱,它回的也要钱,后者通常更贵
  • 同样的意思,中文往往更费:汉字被切得更碎,颗数更多
  • 提示词写得精炼,就是在直接省钱:每省一颗都是真金白银
零基础入门 · 小白三千问

为什么聊久了它会「忘事」?

第 1 轮明明说过的事,第 20 轮它答得像完全没听过。它没坏,也没敷衍你,只是那句话已经不在它眼前了。

一句话回答

AI 没有无限的记性。它每次回答,只能看见「工作台」上放得下的最近内容;台面(术语叫「上下文窗口」)满了,最早的话就被挤掉。被挤掉的那部分,再也参与不了这次回答

先看一个类比 · 一张放纸条的工作台

想象 AI 面前有一张桌子。你们每聊一轮,就往桌上放一张纸条,写着这一轮说了什么。AI 回答你时,只低头看桌上现有的纸条。桌子就那么大,纸条放满之后,每来一张新的,最旧的那张就被推下桌。掉在地上的纸条,它看不见,也捡不回来。

台面大小 = 上下文窗口

不同模型的台面有大有小,但都有边界。放满就是放满了,加钱也变不出第九个格子。

一张纸条 = 一轮对话

你说的和它回的都要占台面,长篇大论、大段粘贴的资料占得更多,台面满得更快。

亲手试试 · 把台面聊满

下面是一场模拟对话。你在第 1 轮告诉过它「我对花生过敏」。往右拖动滑块增加对话轮数,看着台面慢慢放满,再看看那张关键纸条掉下去之后,它推荐的晚饭变成了什么。

对话轮数 第 1 轮
工作台(这个演示里只放得下 8 张纸条) 已放 1 / 8
你现在问:「晚饭想吃面,帮我推荐一碗?」
知道了原理 · 该怎么办
📌

重要信息,隔段时间重讲一遍

过敏、预算、格式要求这类关键设定,聊了十几轮之后不妨再说一次,等于把纸条重新放回台面最上层

🧾

台面满了,直接开一个新对话

最直接的一招,也最常被忘掉:新对话就是一张空台面,之前挤掉的东西不再占地方。短任务重开就完事;长任务别裸开,先让它总结当前进展,把摘要贴进新对话再接着干。

🔍

发现它忘了,别跟它吵

它翻不回去掉在地上的纸条。直接把关键信息重新发一遍,比连问三句「你忘了吗」有用得多。

想知道台面大小怎么衡量、不同模型的窗口差多少、为什么窗口大了还会「记不牢」,Harness 核心篇有一节上下文窗口的深入版等着你。

✅ 这一页想和你分享的

  • 忘事是容量问题:它没坏,是台面满了,最早的话被挤掉了
  • 每次回答只看窗口内的内容:掉出去的部分等于没说过
  • 重要设定要重申:隔段时间重讲一遍,把纸条放回台面
  • 台面满了就重开:短任务直接开新对话,长任务先要一份摘要带走
零基础入门 · 小白三千问

「推理模型」「深度思考」是什么?

很多 AI 应用里都藏着一个「深度思考」开关。打开它,回答变慢了、账单变贵了,换来的到底是什么?

一句话回答

推理模型会先在草稿纸上一步步演算,再交答案。慢一点,也贵一点,但复杂问题错得更少。要提醒的是:简单问题也开深度思考,属于高射炮打蚊子

「先想后答」是什么意思

普通模式像抢答:题目一出,凭第一反应张口就说。深度思考像考试里的大题:先在草稿纸上列条件、试几种解法,发现不对就划掉重来,最后才把答案誊到答题卡上。所谓「思考」,就是多写了几页草稿。草稿也是一个字一个字生成的,所以更慢,也更花钱。

同一道题 · 两种答法

来一道排座位的小逻辑题,点下面两个按钮,看两种模式各自怎么答。建议先看「秒答模式」,再看「深度思考模式」。

题目:家庭聚餐,一排 5 个座位。要求:① 爷爷怕吵,要坐最边上;② 两个小孩(小明、小乐)不能挨着;③ 妈妈要坐在小明旁边帮忙夹菜;④ 爸爸负责倒茶,要坐正中间。怎么排?
耗时
费用
哪些问题值得开深度思考

判断标准一句话:答案需要一步步推出来的,值得开;查一下或一眼能看出的,不值得。下面四道题,你来判一判,点了就知道对没对。

一个省钱的小习惯:默认用普通模式。遇到它答错了,或者你自己都觉得「这题有点绕」的时候,再打开深度思考重问一次,性价比最高。

✅ 这一页想和你分享的

  • 推理模型 = 先打草稿再交卷:把演算过程写出来,再给答案
  • 更慢也更贵:换来的是复杂问题上明显更稳
  • 复杂开、简单关:高射炮别拿来打蚊子
  • 所谓「思考」并不神秘:就是多生成了几页草稿文字
零基础入门 · 小白三千问

参数越多越聪明吗?

发布会上动不动「千亿参数」「万亿参数」,数字一个比一个吓人。这个「参数」到底是什么?数字大,就一定更聪明吗?

一句话回答

参数像大脑里旋钮的数量:旋钮多的,通常见识更广。但聪明程度还取决于训练数据的质量和训练方法;日常任务里,小模型常常反而更划算。

参数到底是什么

训练一个模型,就像调一台带海量旋钮的机器:每喂一批资料,就把一些旋钮拧一点点,让它的回答更像样。等训练结束,这几十亿、几千亿个旋钮的位置,合起来就存下了它学到的一切。所以参数量可以粗略理解成:这台机器有多少个可以拧的旋钮,也就是它能装下多少见识。

拖一拖 · 从 10 亿档到万亿档

拖动滑块换档位,看看每个量级的模型大概像什么、跑起来要什么设备。数字只看量级就好,别纠结精确值。

10 亿级百亿级千亿级万亿级
旋钮数量(示意,按量级画的,真画等比例这条页面装不下)
📚 它像什么
🖥️ 跑起来需要
🧰 适合干什么
大就一定好吗 · 三个反例

旋钮多有旋钮多的代价:更慢、更贵、更挑设备。下面三种场景里,小模型经常打赢大块头。

小模型赢在速度

参数少,算得快。实时字幕、输入法联想这类要秒回的场景,大模型再有学问也等不起。

💰

小模型赢在成本

同样一件事,小模型的电费和算力开销低一大截。量大的活儿,一年下来省出的钱很可观。

🎯

小模型赢在专精

比如客服系统里判断用户是想退货还是查物流,一个调教好的小模型又快又准,性价比碾压大块头。

怎么选 · 看任务定吨位

选模型像选车:跑长途拉重货,上卡车;市区买个菜,一辆小电驴就够了。先想清楚任务有多难,再决定用多大吨位的模型,账单和体验都会舒服很多。

新闻里的「参数竞赛」听听就好:厂商爱报大数字,但你真正要关心的只有一件事:这个任务它干得好不好、划不划算。想看看国产模型都有哪些量级和特长,可以翻翻国产模型那一页。

✅ 这一页想和你分享的

  • 参数是容量指标:旋钮越多,能装下的见识越多
  • 数据质量和训练方法同样关键:旋钮多,拧得不好也白搭
  • 选模型看任务定吨位:日常活儿,小模型常常更划算
  • 新闻里的参数竞赛听听就好:干得好不好才是你的事
零基础入门 · 小白三千问

为什么有的 AI「看不懂」图片?

你可能遇到过:给 AI 发照片,它回「抱歉,请用文字描述」。也见过能把照片里的菜谱都认出来的。同样是 AI,差在哪?

一句话回答

因为「会说话」和「会看」是两套独立的本事。语言模型天生只认文字;想让它看图,得额外给它装一双「眼睛」——装了的叫多模态模型,没装的就只能对图片说抱歉。

小实验 · 给两个模型各发一张猫的照片
模型 A · 纯文本模型(没装眼睛)
🖼️ 猫咪照片.jpg
「抱歉,我无法查看图片。你可以描述一下图片内容,我来帮你分析。」
模型 B · 多模态模型(装了眼睛)
🖼️ 猫咪照片.jpg
「一只橘猫趴在飘窗上晒太阳,右前爪压着一个毛线球。看它的体型……这位可能需要控制一下饮食了 😄」
原理 · 「眼睛」是怎么装上去的
✂️

第一步:把图切碎

「眼睛」(视觉编码器)把图片切成许多小方块,每块转译成模型认识的「词」——一张图就变成了一段特殊的「文字」

🔤

第二步:当话来接

转译完成后,图片对模型来说就和一段话没区别了,照常「接话茬」。所以看图能力的本质,还是那台接话机器。

🏋️

为什么不都装上?

装眼睛要用海量「图 + 文」配对数据重新训练,成本高、模型更大更贵。很多场景根本用不到看图,纯文本模型反而更快更便宜。

顺带说清一个常见的混淆:「看懂图」和「画出图」也是两回事。能看图的模型不一定能生成图片——前者是「眼睛」,后者是完全不同的「画手」(下一页就讲它为什么那么贵)。你用的 AI 应用如果既能看又能画,那是它在幕后同时接了好几个不同的模型。

✅ 这一页想和你分享的

  • 会说话 ≠ 会看:看图需要额外的「眼睛」(视觉编码器)
  • 眼睛的原理:把图切碎、转译成「特殊的文字」,然后照常接话茬
  • 不装眼睛不是落后:更快更便宜,很多场景够用
  • 看图和画图是两回事:全能应用背后是多个模型在分工
零基础入门 · 小白三千问

微调是什么?和「喂资料」有什么区别?

老板说「把公司资料喂给 AI」,供应商说「给你们微调一个专属模型」,听着像一回事,报价能差出几百倍。这一页用「上课」和「开卷考试」两个比方,帮你把这笔账算清楚。

一句话回答

微调是送 AI 重新上课,把知识练进它身体里;喂资料(也叫知识库、RAG)是让它开卷考试,随用随查。多数公司真正需要的,其实是后者

看个演示 · 上课 vs 开卷,并排比一比

同一个目标:让 AI 会回答你公司的问题。左边走「微调」这条路,右边走「喂资料」这条路。点下面的按钮,看两条路各要经历什么。

🏫微调:送去重新上课
周期以周计 · 花费以万计
📚喂资料:开卷考试
当天生效 · 花费小得多
一句话总结:改「性格」才需要上课,查「知识」开卷就够了。

注意一个关键差别:微调改变的是模型本身,像把知识练成了肌肉记忆;喂资料完全没动模型,只是考试时允许它翻书。所以资料一更新,开卷这边换本书就行,上课那边就得重新读一遍。

对号入座 · 你的场景该选哪个

道理懂了,落到具体事上怎么选?下面四个是企业里最常见的场景,点一个试试,看推荐方案和理由。

一张表看懂两条路
🏫 微调(上课)📚 知识库(开卷)
生效速度几天到几周当天就能用
成本量级几万到几十万起步,还要专人伺候低一到两个量级,普通团队就能搭
知识更新资料变了要重新训练一遍换个文件就行,随换随用
各自适合改风格、改口吻、学专业「语感」会变的知识:制度、价格、文档问答
那到底该怎么选

给你一个省钱的顺序:先试提示词,再挂知识库,最后才考虑微调。很多「必须微调」的需求,认真写一段提示词就解决了;再不够,挂上知识库让它开卷;两样都试过还差口气,那才轮到花大钱送它上课。顺便提醒:饭局上有人说「我们训了个模型」,多数时候他做的只是前两步,这一页帮你听懂他到底干了啥。

还有一个实用信号:如果你的需求里有「查」这个字,例如查制度、查价格、查文档,那基本就是知识库的活。想看知识库内部到底怎么运转,可以接着读企业都在建的「知识库」是什么。

✅ 这一页想和你分享的

  • 微调 = 上课:知识练进模型身体里,周期以周计、花费以万计
  • 知识库 = 开卷考试:资料放书架随用随查,当天生效,换文件就更新
  • 知识常更新就开卷,改性格、改风格、学专业语感才需要上课
  • 省钱顺序:先试提示词,再挂知识库,都不够再考虑微调
零基础入门 · 小白三千问

企业都在建的「知识库」是什么?

开会总听到「我们要建知识库」「接一下 RAG」,听着像什么大工程。其实它就是给 AI 配了一个随用随查的书架:考试可以开卷了,还得把翻到的那页指给你看。

一句话回答

把公司文件切成小块、建好索引,AI 回答前先去里面找出相关的几段,塞进对话里再作答。它拿着你的资料说话,出处也能标给你看。

看个演示 · 三步看懂知识库

整个知识库的运转就三步。点「下一步」逐步推进,每一步都用刚才那个书架的比方。

📄收集文件:制度手册、产品文档、会议纪要,都是普通的公司文件。
✂️切成小块:长文件切成一段一段的「卡片」,一块讲一件事。
🗂️放上书架并建索引:每块卡片都登记好「讲的是什么」,方便日后按意思查找。
报销制度 · 第1段报销制度 · 第2段考勤规定 · 第1段产品手册 · 第4段休假制度 · 第2段会议纪要 · 第7段
🙋有人提问:「我们的差旅报销上限是多少?」
🔍先查书架:按「意思相近」去找,命中了两张卡片(下面变绿的)。
报销制度 · 第1段报销制度 · 第2段考勤规定 · 第1段产品手册 · 第4段休假制度 · 第2段会议纪要 · 第7段
📌注意:这一步只是「翻书」,AI 还没开口
📄把找到的两段塞进对话,和问题拼在一起交给 AI。
💬AI 照着资料作答:答案来自你的文件,可以少猜、少编。
🔖顺手标出处:「来源:差旅费管理办法.pdf」,你点开原文就能核对。
同一个问题 · 有没有知识库差多少

同样问一句「我们的差旅报销上限是多少」,切换下面两个按钮,看 AI 的回答差在哪里。

为什么不直接把全部文件喂给它

有人会问:干嘛这么麻烦,把公司几百份文件一股脑发给 AI 得了。两个原因:

🪑

台面装不下

AI 一次能「看在眼里」的内容有限,像一张大小固定的工作台,几百份文件根本摊不开。这个台面叫上下文窗口,这一页讲了它为什么会「忘事」。

💸

按字数收费

AI 读进去的每个字都按 Token 计费,每次提问都附上全部文件,等于每次都把整个图书馆搬一遍,钱包先受不了。Token 怎么收费看这页。

所以知识库的思路很聪明:书都留在架上,每次只把最相关的几页带上考场。省钱,还装得下。

知识库的软肋

知识库让 AI 拿着资料说话,但它分辨真伪的能力有限:书架上的文件过时了,它照着旧文件答;两份文件互相矛盾,它可能各抄一半。它保证的是「有据可查」,管不了「据是否靠谱」。所以建知识库,一半功夫要花在整理文件上:删掉过时的、合并矛盾的,书架干净,答案才干净。

这一页讲的是零基础版。想看工程上怎么切块、怎么建索引、怎么提高命中率,课程正篇有深入版:用 RAG 缓解幻觉。

✅ 这一页想和你分享的

  • 知识库 = 开卷考试的书架:切块、建索引、考试时翻着答,就这三步
  • 能标出处:答案来自哪份文件一目了然,点开原文就能核对
  • 文件质量决定答案质量:书架上放了过时或矛盾的资料,AI 也照答
  • 与训练无关:整个过程不改模型本身,换文件当天生效
零基础入门 · 小白三千问

GPT、LLM、AIGC…这些缩写怎么分?

新闻里一句话能塞四五个缩写,个个都眼熟,个个都说不清。别慌,这一页用一局配对小游戏加一张关系图,帮你把它们各归各位。

一句话回答

AI 是最大的圈,LLM 是其中管文字的大模型,GPT 是造 LLM 的一种主流做法(同时被 OpenAI 用作产品名),AIGC 说的是「用 AI 生成内容」这件事本身

玩个游戏 · 缩写配对

规则很简单:先点左边一个缩写,再点右边它对应的人话解释。配对成功两边一起变绿锁定,配错了会抖一下。全部配完有奖励。

已配对 0 / 8
全部配对成功!奖励一张「谁包含谁」的关系图,就在下面。
AI · 人工智能(最大的圈)
NLP · 教机器懂人话的领域
LLM · 管文字的大模型
GPT · 造 LLM 的一种主流做法
AIGC:拿这些工具去「生成内容」的行为,写文、画图、做视频都算
Agent:给 LLM 装上手脚的应用形态,会自己拆任务、动手干活
AGI:终极目标,什么活都能干的通用人工智能,目前尚未实现
多模态:长在模型身上的能力,文字、图片、声音都能看懂
GPT 为什么既是技术名,又是产品名

GPT 原本是一串技术术语的缩写(生成式预训练变换器),指造大模型的一种主流做法;后来 OpenAI 把自家产品直接命名为 GPT 系列,ChatGPT 更是火遍全球。于是新闻里的「GPT」有了两个意思:说技术时指那种做法,说产品时指 OpenAI 家的模型。就像「席梦思」原本是一个床垫品牌,用的人多了,大家把这类床垫都叫席梦思。听到 GPT 时看一眼上下文,就能分清它指哪个。

下次听到新缩写怎么办

AI 圈造词速度很快,但好消息是:新缩写多半是上面这几个的组合或变体。遇到生词先问一句「它归哪个圈」:

🧠

是一种模型?

归到 LLM 那一层。比如 VLM(视觉语言模型)就是看得懂图的 LLM,落在「多模态」能力上。

🛠️

是一种应用形态?

归到 Agent 那一层。各种「智能体」「数字员工」,多半是Agent 换了个营销说法。

🎨

是一种行为或能力?

归到 AIGC 或多模态那一类。「AI 写作」「AI 绘画」「文生视频」,说的都是拿工具干活这件事。

分清了缩写,下一步是分清它们怎么协作:模型是发动机,Agent 是装好方向盘的车,应用是你坐进去的整台车。展开讲的版本在模型、Agent、应用是什么关系。

✅ 这一页想和你分享的

  • 一张嵌套图记住层级:AI ⊃ NLP ⊃ LLM ⊃ GPT,一圈套一圈
  • GPT 有双重身份:既是造模型的做法,又是 OpenAI 的产品名
  • AIGC 是行为,LLM 是工具:一个说「干什么」,一个说「用什么干」
  • 新缩写先问归哪个圈:是模型、是应用形态,还是一种行为能力
零基础入门 · 小白三千问

英伟达为什么那么值钱?

一家「卖显卡的」,市值能排进全球最前列,很多人第一反应是看不懂。看懂它只需要两个画面:一场淘金潮,和一场算术比赛

一句话回答

AI 训练要同时做海量的简单算术,显卡天生擅长人海战术;全世界都在抢算力,英伟达是这轮淘金潮里最大的卖铲人

打个比方 · 淘金潮与卖铲人

当年淘金热有个经典观察:冲进金矿的人未必挖到金子,在路口卖铲子和牛仔裤的人先发了财。今天的 AI 就是新一轮淘金潮:

⛏️

淘金的人

全世界的公司都冲进来训模型、做应用,都想挖到自己的金子。谁能挖到,现在还说不准。

🛒

铲子

挖金子得先有工具。AI 的工具是算力,主要就是一排排装满显卡的机房。没铲子,再好的想法也开不了工。

💰

卖铲人

不管谁最后挖到金子,铲子人人都得买。英伟达卖的就是这把铲子,而且几乎是独一家,想买还得排队。

训练一个大模型,光算力开销就在几十万到上亿的量级,这些钱大头流向了同一家公司。淘金的人越多、越疯狂,卖铲人越值钱。

来场比赛 · 一位博士 vs 一万名小学生

那为什么非要显卡?电脑里原本的处理器(CPU)也很强啊。因为两者的强法不一样:CPU 像一位博士,什么难题都会,但一次专注做一道;显卡(GPU)像一万名小学生,每人只会简单算术,但能同时开工。AI 训练要算的恰好是海量的简单乘加,正对小学生的胃口。点下面开赛,亲眼看看。

🎓CPU · 一位博士
逐题精算,一次只做一道
剩余题目:24
一道道磨,终于算完了
🧒GPU · 一万名小学生
题目简单,全员同时开工
剩余题目:24
唰,一眨眼全算完了
题目简单但数量巨大时,一万名同时开工的小学生完胜一位博士。AI 训练要算的,正是这种题,而且是天文数字的量。
为什么别家追不上

造出性能接近的芯片,别家未必做不到。难追的是另一样东西:多年积累的软件工具链和生态。全世界的 AI 开发者写程序,用的那套工具默认长在英伟达的地基上;换一家的芯片,等于让所有人搬家重装修,光有房子没人愿意来。硬件可以砸钱造,生态只能靠时间长。这就是它的护城河。

这和你有什么关系

关系很直接:算力贵,是所有 AI 服务收费的根源。你每次和 AI 对话,按 Token 计的费里摊着显卡的折旧和机房的电费;生成一张图贵几十倍,也是因为图要算的量比文字大得多。理解了铲子有多贵,就理解了账单为什么长那样。

顺带解释一个新闻高频词:公司之间比拼「算力储备」「囤了多少张卡」,说的就是谁家铲子多。铲子多,训练快、服务稳,招开发者也容易,这是 AI 时代新的家底。

✅ 这一页想和你分享的

  • 显卡赢在并行:一万名小学生同时算简单题,完胜一位博士逐题精算
  • 卖铲人逻辑:淘金的人未必赚钱,铲子人人都得买
  • 生态是护城河:开发者都在它的工具链上盖房,搬家成本太高
  • 算力成本最终摊进你的账单:每次对话、每张图,都有铲子的折旧
1 / 4