权重是什么?一个模型的全部本事
新闻里天天说「某某模型开源了」。开源的到底是什么东西?是代码吗?其实主要是一个文件:权重。搞清楚它是什么,后面所有关于开源的争论你都能自己判断。
这一章的例子基本都取自 Qwen,先说清楚为什么。
- 尺寸铺得最全。Ollama 官方库里 Qwen3.5 一代从 0.8B 一直排到 122B,中间有 2B、4B、9B、27B、35B。本章后面每讲到一档设备,都能对应上一个真能下载下来的文件,不用换品牌凑数。
- 别人拿它当底座。DeepSeek-R1 放出的六个蒸馏版里有四个用的是 Qwen 底座——这是第三方的选择,不是自家宣传。
- 它自己就是个反面教材。Qwen2.5 时期的 3B 和 72B 用过非标准许可证,正好拿来讲「开源」这两个字有多不可靠,这一节在第二节。
中文社区里有人管它叫「源神」,开源之神。这是网友的戏称,不是评价标准,也不代表它每一项都最强。本章拿它举例是因为素材齐、方便动手,不是因为它最好。你学完这一章要拿到的是判断标准,不是一个品牌名——同一套标准套到任何一家身上都应该照样能用。
模型内部没有规则、没有知识库、没有 if-else。有的只是一个巨大的数字表格。下面这些格子里的每个数,就是一个权重,颜色深浅表示它的绝对值大小。
上面是 36 个数。一个 Qwen3-8B 模型有 80 亿个这样的数。训练的全部意义,就是把这几十亿个数从随机值一点点调整到合适的值。调完了,参数冻结,模型就定型了。
每个权重占多少字节,取决于存储精度。模型发布时通常用 FP16,也就是每个数占 2 个字节。所以文件体积有一个很好记的估算:
80 亿参数 × 2 字节 = 160 亿字节 ≈ 16 GB
公式记住了,但它到底意味着什么,拖一下就知道了。下面这个滑块从 0.5B 拖到 2.4 万亿,你可以顺手切换存储精度,看同一个模型的文件是怎么胀大和缩小的。
下面用一组真实的模型对比一下。这里选 Qwen 系列做尺子,是因为它的尺寸谱系目前最完整,从 0.6B 一直到 2.4T 都有公开型号,同一个系列内部比较不会掺进架构差异的干扰。
存储体积和运行时占用是两码事。文件 16 GB,不代表 16 GB 显存就能跑起来。模型运行时还要额外开销一块地方存放对话的中间状态,也就是Harness 核心篇讲过的 KV Cache。算下来通常要在参数量的基础上多留三到五成。
这一章最后有一页交互工具,你可以直接选自己的显卡或者 Mac 型号,看能跑哪些模型。这里先记住结论:看文件大小估显存,会低估。
把上面的事情串起来,权重的意义就清楚了。它不只是一个文件,它是控制权。
反过来说,只提供 API 的模型,你租的是使用权。价格、可用性、什么时候下线,都由对方决定。这个区别在做技术选型时会直接变成风险,也是下一节要拆的东西:各家嘴里的「开源」,含义差得非常远。