模型官网

https://huggingface.co/

可用模型

Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive

一、模型名就是一串按顺序拼起来的信息

下载本地模型的时候,很多人只扫一眼名字里最大的那个数字就点下载,下完才发现装不下,或者跑起来卡。名字里那串东西其实是有顺序的,按顺序读一遍,大概就知道它有多大、会不会聊天、被压得多狠、你这台机器能不能扛。

通常会遇上四段:

  • 厂商和系列:Qwen、Llama、DeepSeek、Mistral、Gemma。管的是语言底子和许可证,跟能不能装没关系。

  • 规模:7B、70B、8x7B、30B-A3B 这类。它直接决定吃多少显存,是第一道关。

  • 功能版本:Base、Instruct、Chat、Thinking、Code、VL。决定它是只会往下接字,还是能对话、会推理、会写代码、看得懂图。

  • 格式和量化:GGUF、Q4_K_M、GPTQ、AWQ、FP16、INT8。决定它按什么精度存、拿什么工具打开,是第二道关。

拿 Qwen3-30B-A3B-Instruct-Q4_K_M.gguf 举例:Qwen3 是系列,30B-A3B 是规模和架构,Instruct 是版本,Q4_K_M 是量化,.gguf 是文件格式。下面挨个说。

二、7B、8x7B、A3B:规模到底怎么看

2.1 稠密模型

7B、13B、32B、70B 这种只有一个数字的,是传统稠密模型。B 是 Billion,7B 就是 70 亿参数。它每个词的计算都要动用全部参数,所以显存和算力都跟这个数字成正比,参数越大越吃硬件。一句话:参数有多少,每次就用多少。

2.2 MoE:名字里通常有两个数字

MoE(Mixture of Experts,混合专家)这几年很火。它的做法是把一个大网络拆成很多个专家小网络,每个词进来时由一个小路由器挑出最合适的一两个专家干活,剩下的这轮不参与。这样模型总量可以很大,但每次只动用一小部分。

由此带来两个特别容易看混的数字:

  • 总参数(Total):整个模型一共多少参数,决定要占多少内存或显存。

  • 激活参数(Active):每个词真正参与计算的那部分,决定跑起来多快、算力花多少。

命名上,有的写 8x7B(8 个专家、每个 7B),有的写 30B-A3B(总数 30B、每次激活约 3B)。名字里带 x,或者带 A…B,基本就能认定是 MoE。

2.3 装的时候看总参数,跑的时候看激活参数

  • 内存和显存,按总参数算。所有专家的权重都得先装进去,路由器才知道该喊谁。

  • 速度和算力,按激活参数算。每个词只算被选中的那几个专家,速度接近同等级的小模型。

Qwen3-30B-A3B 就是典型:占着 30B 的内存,跑出 3B 的速度。

模型

总参数(占内存)

激活参数(决定速度)

类型

Llama-3.1-8B

约 8B

约 8B(全部)

稠密

Mixtral 8x7B

约 47B

约 13B

MoE

DeepSeek-V3

约 671B

约 37B

MoE

Qwen3-30B-A3B

约 30B

约 3B

MoE

Qwen3-235B-A22B

约 235B

约 22B

MoE

MoE 的激活参数常常只有总参数的十分之一左右,性价比就在这;但能不能装下,看的永远是左边那一列。

三、Base、Instruct、Chat 这些版本后缀是什么

同一套参数,后期训练不一样,长出来的能力也不一样。名字里跟的那几个英文词就在说这件事,选错了可能会出现能装、但不好好对话的尴尬。

后缀

含义

什么时候用它

Base / 空

只做过预训练,本质是文字接龙,不听指令

当微调底座,普通用户基本不用

Instruct

做过指令微调,能听懂并执行要求

最常用的默认选择,问答、任务都行

Chat

面向多轮对话优化过

做聊天助手、客服

Thinking / Reason

带思维链,先想再答

数学、逻辑、复杂推理

Code / Coder

针对代码专门训练

写代码、补全、改 bug

VL / Vision

多模态,能看图

图片理解、图文问答

SFT / DPO / RLHF

标了所用的对齐方式

对偏好、安全有要求时参考

普通本地部署,认准 Instruct 或 Chat 就行;要推理挑 Thinking,写代码挑 Code,处理图片挑 VL。

四、GGUF、GPTQ、AWQ:为什么一个模型有好几个文件

下载页经常并排躺着十几个文件,大小能差好几倍,差别就在量化。量化就是把参数精度从高位压到低位,换来更小的体积,代价是掉一点质量。文件名里的格式后缀,说的就是它用哪种压缩和加载方式。

格式后缀

含义

典型场景

GGUF

llama.cpp 系单文件格式,权重和分词器都打包在一起

CPU/GPU 混合、Ollama、LM Studio,最主流

GPTQ

面向 GPU 的 4-bit 量化

NVIDIA 显卡、显存紧张

AWQ

激活感知量化,4-bit 精度较好

GPU 部署,想兼顾质量与速度

EXL2

ExLlamaV2 专用,可按层设不同位宽

高端 GPU、追求速度

FP16 / BF16

16 位浮点原始精度,不压缩

显存够、要最高质量

INT8 / FP8

8 位整数或浮点,近似无损

H100 这类硬件上的高效部署

int4 / 4bit

泛指 4 位量化

通用低显存场景

多数人的情况:普通电脑、笔记本或苹果芯片,选 GGUF;NVIDIA 显卡上想省显存,选 GPTQ 或 AWQ。

五、Q4_K_M、IQ4_XS 这种量化名怎么拆

GGUF 文件名里那串看着像乱码的东西,其实有严格规则。拿最常见的 Q4_K_M 说:

  • Q:Quantized,量化过的意思,相对的是 F16、BF16 那种原始精度。

  • 4:基础位宽,数字越小文件越小、掉的质量越多,常见 Q2 到 Q8。

  • K:k-quant 家族,一种分块的混合精度方案,敏感的张量给更高位宽。

  • M / S / L:同一档位下的大小,S 偏小、M 均衡、L 偏大。

后来多了基于重要性矩阵的 IQ 系列,会对每个权重的重要性做校准,在很低的位宽下尽量保住质量。写法是 IQ 加位宽加大小,后缀 XXS、XS、S 表示压缩有多狠,XXS 最狠也最小,XS 次之,S 相对最稳。

量化名

大致位宽 (bpw)

特点 / 建议

Q8_0

约 8.5

几乎无损,显存够就选

Q6_K

约 6.6

质量很高,比 Q8 小

Q5_K_M

约 5.5

质量接近 Q6,略省空间

Q4_K_M

约 4.8

最常用,质量和体积最均衡

Q4_K_S

约 4.3

比 M 更小,质量略降

IQ4_XS

约 4.5

约等于 Q4_K_M 的质量,但更小

Q3_K_M/L

约 3.5 到 4.3

再小一档,质量开始明显下滑

IQ2 / Q2_K

约 2 到 3

极限压缩,只求能跑

还有两个标记会遇到:UD,是 Unsloth Dynamic 那种动态量化;另外同一个量化名被不同人传上来,内容可能略有出入。拿不准就看实际文件大小和社区口碑。

六、算一下,你的机器能不能装

其实就把三个数加起来:权重内存、KV 缓存、运行时开销,再和你手头的内存或显存比一比。

6.1 权重内存先估一下

权重占用(GB)约等于 参数量(B)乘以 每参数位宽(bit)再除以 8。几个常用值:

  • FP16 / BF16:约 2 GB / 每 10 亿参数

  • INT8 / FP8:约 1 GB / 每 10 亿参数

  • 4-bit(如 Q4_K_M):约 0.5 到 0.6 GB / 每 10 亿参数

  • Q6_K:约 0.8 GB,Q5_K:约 0.7 GB(每 10 亿参数)

举个例子,8B 模型 Q4_K_M 量化后权重约 4.5 到 5 GB,8 GB 显卡塞得下;同样 8B 走 FP16 要 16 GB,好多卡就装不下了。

6.2 KV 缓存别忘算

处理长文本时,模型会把读过的内容缓存下来,这就是 KV 缓存。上下文从 4K 拉到 128K,它可能从 1 GB 涨到几十 GB。所以装得下权重,不等于能开满上下文。省内存的办法是给缓存也做量化,比如把 K/V 压到 8-bit,多数工具都支持。

6.3 留点余量

经验上至少留 15% 到 25% 给 KV 缓存、计算缓冲和运行时本身。显存 12 GB,模型权重最好别超过 9 到 10 GB。

6.4 MoE 这里要特别说一句

还是那两条:内存和显存按总参数算,Qwen3-30B-A3B 要按 30B 占,不是 3B;速度和算力按激活参数算,体感接近 3B,很轻快。所以 MoE 的取舍是:得腾出更大的内存才装得下,但一旦装下,响应速度比同规模稠密模型快得多。

你的内存/显存

舒服能跑的规模(参考)

说明

8 GB

3B 到 8B 的 Q4

轻量对话、摘要够用

12 到 16 GB

8B 到 14B 的 Q4/Q5

通用本地助手的甜点区

24 GB

32B 稠密,或 30B-A3B 这类 MoE 的 Q4

MoE 在这里速度优势明显

48 GB 及以上

70B 的 Q4,或更大的 MoE

能上更高质量的模型

多卡 / 大统一内存

更大的 MoE(如 235B-A22B 要上百 GB)

按总参数评估内存

这只是经验参考,实际还要看上下文多长、是不是多模态、系统自己占多少,余量留宽点。

七、速查:看名字判断能不能装

  1. 看规模。7B、70B、30B-A3B 这类数字,带 x 或 A…B 就是 MoE;MoE 内存按总参数算,速度按激活参数算。

  2. 看版本。Base 别选,普通用 Instruct 或 Chat,推理 Thinking,代码 Code,图片 VL。

  3. 看格式。本地 CPU 或混合跑选 GGUF;NVIDIA 显卡省显存选 GPTQ 或 AWQ;显存足又要最高质量选 FP16。

  4. 看量化。Q4_K_M 是默认甜点;装不下就往 Q3_K、IQ4_XS 降;显存富余可以上 Q5_K_M、Q6_K、Q8_0。

  5. 算内存。权重约等于 参数量(B) 乘 位宽 再除以 8,加上 KV 缓存和 15% 到 25% 余量,和你的内存或显存比一比。

这五步连起来,能不能装、跑得快不快、会不会聊天,基本就有数了。装不下就降一档量化或者换更小的规模;装得下但嫌慢,优先考虑 MoE;要长上下文或者多模态,余量留宽些。