模型官网
可用模型
Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
一、模型名就是一串按顺序拼起来的信息
下载本地模型的时候,很多人只扫一眼名字里最大的那个数字就点下载,下完才发现装不下,或者跑起来卡。名字里那串东西其实是有顺序的,按顺序读一遍,大概就知道它有多大、会不会聊天、被压得多狠、你这台机器能不能扛。
通常会遇上四段:
厂商和系列:Qwen、Llama、DeepSeek、Mistral、Gemma。管的是语言底子和许可证,跟能不能装没关系。
规模:7B、70B、8x7B、30B-A3B 这类。它直接决定吃多少显存,是第一道关。
功能版本:Base、Instruct、Chat、Thinking、Code、VL。决定它是只会往下接字,还是能对话、会推理、会写代码、看得懂图。
格式和量化:GGUF、Q4_K_M、GPTQ、AWQ、FP16、INT8。决定它按什么精度存、拿什么工具打开,是第二道关。
拿 Qwen3-30B-A3B-Instruct-Q4_K_M.gguf 举例:Qwen3 是系列,30B-A3B 是规模和架构,Instruct 是版本,Q4_K_M 是量化,.gguf 是文件格式。下面挨个说。
二、7B、8x7B、A3B:规模到底怎么看
2.1 稠密模型
7B、13B、32B、70B 这种只有一个数字的,是传统稠密模型。B 是 Billion,7B 就是 70 亿参数。它每个词的计算都要动用全部参数,所以显存和算力都跟这个数字成正比,参数越大越吃硬件。一句话:参数有多少,每次就用多少。
2.2 MoE:名字里通常有两个数字
MoE(Mixture of Experts,混合专家)这几年很火。它的做法是把一个大网络拆成很多个专家小网络,每个词进来时由一个小路由器挑出最合适的一两个专家干活,剩下的这轮不参与。这样模型总量可以很大,但每次只动用一小部分。
由此带来两个特别容易看混的数字:
总参数(Total):整个模型一共多少参数,决定要占多少内存或显存。
激活参数(Active):每个词真正参与计算的那部分,决定跑起来多快、算力花多少。
命名上,有的写 8x7B(8 个专家、每个 7B),有的写 30B-A3B(总数 30B、每次激活约 3B)。名字里带 x,或者带 A…B,基本就能认定是 MoE。
2.3 装的时候看总参数,跑的时候看激活参数
内存和显存,按总参数算。所有专家的权重都得先装进去,路由器才知道该喊谁。
速度和算力,按激活参数算。每个词只算被选中的那几个专家,速度接近同等级的小模型。
Qwen3-30B-A3B 就是典型:占着 30B 的内存,跑出 3B 的速度。
MoE 的激活参数常常只有总参数的十分之一左右,性价比就在这;但能不能装下,看的永远是左边那一列。
三、Base、Instruct、Chat 这些版本后缀是什么
同一套参数,后期训练不一样,长出来的能力也不一样。名字里跟的那几个英文词就在说这件事,选错了可能会出现能装、但不好好对话的尴尬。
普通本地部署,认准 Instruct 或 Chat 就行;要推理挑 Thinking,写代码挑 Code,处理图片挑 VL。
四、GGUF、GPTQ、AWQ:为什么一个模型有好几个文件
下载页经常并排躺着十几个文件,大小能差好几倍,差别就在量化。量化就是把参数精度从高位压到低位,换来更小的体积,代价是掉一点质量。文件名里的格式后缀,说的就是它用哪种压缩和加载方式。
多数人的情况:普通电脑、笔记本或苹果芯片,选 GGUF;NVIDIA 显卡上想省显存,选 GPTQ 或 AWQ。
五、Q4_K_M、IQ4_XS 这种量化名怎么拆
GGUF 文件名里那串看着像乱码的东西,其实有严格规则。拿最常见的 Q4_K_M 说:
Q:Quantized,量化过的意思,相对的是 F16、BF16 那种原始精度。
4:基础位宽,数字越小文件越小、掉的质量越多,常见 Q2 到 Q8。
K:k-quant 家族,一种分块的混合精度方案,敏感的张量给更高位宽。
M / S / L:同一档位下的大小,S 偏小、M 均衡、L 偏大。
后来多了基于重要性矩阵的 IQ 系列,会对每个权重的重要性做校准,在很低的位宽下尽量保住质量。写法是 IQ 加位宽加大小,后缀 XXS、XS、S 表示压缩有多狠,XXS 最狠也最小,XS 次之,S 相对最稳。
还有两个标记会遇到:UD,是 Unsloth Dynamic 那种动态量化;另外同一个量化名被不同人传上来,内容可能略有出入。拿不准就看实际文件大小和社区口碑。
六、算一下,你的机器能不能装
其实就把三个数加起来:权重内存、KV 缓存、运行时开销,再和你手头的内存或显存比一比。
6.1 权重内存先估一下
权重占用(GB)约等于 参数量(B)乘以 每参数位宽(bit)再除以 8。几个常用值:
FP16 / BF16:约 2 GB / 每 10 亿参数
INT8 / FP8:约 1 GB / 每 10 亿参数
4-bit(如 Q4_K_M):约 0.5 到 0.6 GB / 每 10 亿参数
Q6_K:约 0.8 GB,Q5_K:约 0.7 GB(每 10 亿参数)
举个例子,8B 模型 Q4_K_M 量化后权重约 4.5 到 5 GB,8 GB 显卡塞得下;同样 8B 走 FP16 要 16 GB,好多卡就装不下了。
6.2 KV 缓存别忘算
处理长文本时,模型会把读过的内容缓存下来,这就是 KV 缓存。上下文从 4K 拉到 128K,它可能从 1 GB 涨到几十 GB。所以装得下权重,不等于能开满上下文。省内存的办法是给缓存也做量化,比如把 K/V 压到 8-bit,多数工具都支持。
6.3 留点余量
经验上至少留 15% 到 25% 给 KV 缓存、计算缓冲和运行时本身。显存 12 GB,模型权重最好别超过 9 到 10 GB。
6.4 MoE 这里要特别说一句
还是那两条:内存和显存按总参数算,Qwen3-30B-A3B 要按 30B 占,不是 3B;速度和算力按激活参数算,体感接近 3B,很轻快。所以 MoE 的取舍是:得腾出更大的内存才装得下,但一旦装下,响应速度比同规模稠密模型快得多。
这只是经验参考,实际还要看上下文多长、是不是多模态、系统自己占多少,余量留宽点。
七、速查:看名字判断能不能装
看规模。7B、70B、30B-A3B 这类数字,带 x 或 A…B 就是 MoE;MoE 内存按总参数算,速度按激活参数算。
看版本。Base 别选,普通用 Instruct 或 Chat,推理 Thinking,代码 Code,图片 VL。
看格式。本地 CPU 或混合跑选 GGUF;NVIDIA 显卡省显存选 GPTQ 或 AWQ;显存足又要最高质量选 FP16。
看量化。Q4_K_M 是默认甜点;装不下就往 Q3_K、IQ4_XS 降;显存富余可以上 Q5_K_M、Q6_K、Q8_0。
算内存。权重约等于 参数量(B) 乘 位宽 再除以 8,加上 KV 缓存和 15% 到 25% 余量,和你的内存或显存比一比。
这五步连起来,能不能装、跑得快不快、会不会聊天,基本就有数了。装不下就降一档量化或者换更小的规模;装得下但嫌慢,优先考虑 MoE;要长上下文或者多模态,余量留宽些。