1. 先定义“可获取权重”,再谈模型比较
本页使用“可获取权重”,不笼统称为“完全开源”。权重可下载、代码可见、许可证允许研究或商用是 3 个不同命题,各模型的许可证和第三方组件条款也不相同。Hugging Face 上有文件并不代表使用权一致,部署前仍要阅读对应模型卡与 LICENSE。
| 事实层 | 本页采用的证据 |
|---|---|
| 架构规格 | 官方 config、模型卡、技术报告。 |
| 可运行性 | 官方列出的 engine 与可执行 recipe。 |
| 上下文 | 官方 native/extended context 声明。 |
| Agent 能力 | 工具接口、公开 harness 与模型卡说明。 |
| 速度 | 明确硬件、精度、batch 与基线的测量。 |
2. 三本账:total、active 和动态状态
MoE 模型的总参数决定静态权重需要放在哪里,active parameters 近似描述 1 个 token 实际经过多少专家计算,KV cache 或线性注意力递推状态决定并发长请求的动态容量。三者不能互相替代。
2.8T total 的 Kimi K3 仍需让全部权重在设备或分层内存中可访问,单次路由等效选择 896 个 experts 中的 16 个。397B / 17B 的 Qwen3.5 仍要为 397B 权重做放置;GLM-5.2 则按 753B total 规划静态容量。
3. 2026 官方规格总表
| 模型 | Total / active | 上下文 | 核心序列结构 | 官方模态 |
|---|---|---|---|---|
| Qwen3.5-397B-A17B | 397B / 17B | 262,144 native;可扩到 1,010,000 | Gated DeltaNet 与 Gated Attention 混合;MoE | 统一 vision-language,独立 vision encoder |
| Kimi K3 | 2.8T;16-of-896 experts | 1M | 3× KDA + 1× Gated MLA;AttnRes;Stable LatentMoE | 原生视觉;API 已上线 |
| MiniMax M3 | 约 428B / 约 23B | 1M | MiniMax Sparse Attention;MoE | 原生文本、图像、视频 |
| DeepSeek-V4-Pro | 1.6T / 49B | 1M | CSA + HCA、局部/压缩路径;MoE | 文本 |
| DeepSeek-V4-Flash | 284B / 13B | 1M | 同代压缩长上下文;MoE | 同上 |
| GLM-5.2 | 753B total | 1M | IndexShare 稀疏注意力;MoE 路线 | 文本 |
| Gemma 4 26B-A4B | 26B / 4B | 256K | MoE + 自回归 MTP | 文本、图像;视频按帧 |
| Gemma 4 31B / 12B / E2B-E4B | dense 或设备侧变体 | 128K 或 256K | dense/PLE/统一 encoder-free 变体 | 全家族图像;部分变体支持音频 |
MiniMax 对参数量使用“约 428B/约 23B”;Hugging Face 文件统计约为 427B,两者属于计数口径差异,因此表中沿用官方约数。
逐家详解:Qwen3.5 → 3.7 · Kimi K2 → K3、SWE-1.7 与 Composer · MiniMax M1 → M3 · DeepSeek-V4 专题 / DeepSeek 完整演进 · GLM-5 → 5.2 · Gemma 4 与 DiffusionGemma。
4. Qwen3.5:线性注意力与全注意力按层混合
Qwen3.5-397B-A17B 是 60 层 causal language model with vision encoder。官方 hidden layout 为 15 组,每组先放 3 个 Gated DeltaNet → MoE,再放 1 个 Gated Attention → MoE。因此 45 层使用递推/线性注意力路线,15 层保留显式 attention;它不是“全模型都没有 KV”。
模型有 512 个 experts,每 token 选择 10 个 routed experts,并有 1 个 shared expert;官方汇总为 397B total、17B activated。Gated Attention 使用 32 个 query heads 和 2 个 KV heads,显著压低保留全注意力层的 KV 宽度;Gated DeltaNet 则维护递推状态。模型还训练了多步 MTP。
5. Qwen3.5 的部署含义
混合序列结构产生 2 类动态状态:全注意力层要分页、量化和迁移 KV;DeltaNet 层维护固定形状的 recurrent state。runtime 必须理解这 2 类 state 的边界,不能只按普通 Transformer 的每层 K/V 估算显存。
- 静态权重按 MoE expert parallel、tensor parallel 或分层内存放置。
- 视觉输入先经 vision encoder,再与文本 token 进入早期融合训练过的语言主干。
- 全注意力层的 KV 随 context 增长;DeltaNet state 不按 token 数线性保留完整历史。
- MoE router 产生跨 rank dispatch/combine;MTP 增加 draft/verify 路径。
- 官方列出 Transformers、vLLM、SGLang、KTransformers 等兼容入口,但生产效率仍取决于具体版本是否实现混合 state 和 kernel。
6. Kimi K3:把 Kimi Linear 的 KDA 扩展到 2.8T 主干
KDA 的公开起点是 Kimi Linear:它用 48B total / 3B active 模型验证 3:1 KDA/MLA 混合架构,并开放 checkpoint、KDA kernel 与 vLLM 实现。K3 把这条结构线扩展到 2.8T;官方模型仓库列出 93 层中的 69 KDA + 24 Gated MLA。KDA 维护 delta-style state,Gated MLA 周期性保留显式 attention,Attention Residuals 再组合更早 block 的输出。它们共同改变长上下文状态的类型,不能沿用 K2.6 的“只有压缩 MLA KV”账本。
MoE 侧扩大到 896 experts,1 次路由等效激活 16 个,并使用 Stable LatentMoE。这里披露的是 expert 数和路由稀疏度,不是 active parameter 总数。原生视觉与 1M context 会让媒体 prefill、KDA state、MLA cache、prefix reuse 和会话迁移同时进入服务账本。
K3 从 SFT 开始做 QAT,目标是 MXFP4 weights + MXFP8 activations。官方仓库已发布模型配置与权重入口,并建议使用 64 张以上加速卡组成的 supernode;部署时需要同时核算 896 experts 的放置、16-expert 路由、KDA state、Gated MLA cache、量化 scale、视觉前端和通信 workspace。
7. Kimi 的 Agent 能力是模型与运行时共同结果
K2.6 曾公开最多 300 个 sub-agents、4,000 个协调步骤;K3 又强调长程 coding、知识工作和视觉在环。它们都是模型加 orchestrator、工具、上下文管理、并发限制与失败恢复的系统结果,不表示 1 次 forward 中存在数百个“专家代理”。MoE experts 与 Agent workers 是不同层级。
K3 托管推理使用 Mooncake disaggregation,官方报告 coding workload 的 cache hit rate 超过 90%。这说明长程 Agent 成本与 prefix/cache 设计紧密相关,但它仍是 Moonshot 生产 trace 的厂商口径。Kimi Code 文档还明确:切换 model 或 reasoning effort 会使 cache 失效并触发重新 prefill。
8. MiniMax M3:同时做 expert sparsity 与 attention sparsity
MiniMax M3 官方模型卡给出约 428B total、约 23B active、1M context。它从预训练第 1 步混合文本、图像和视频数据,并以 MiniMax Sparse Attention(MSA)替代 1M 长度下的 dense GQA 路径。MoE 稀疏降低每 token 的 expert 计算,MSA 稀疏降低每个 query 访问的 KV blocks;二者分别作用于 MLP 与 attention。
MSA 论文在 109B MoE research model 上报告 1M 时 attention compute 降低 28.4×,H800 prefill/decoding wall-clock 分别 14.2×/7.6×。M3 模型卡另以 M2 为基线报告 9× prefill、15× decode 和每 token compute 约 \(\frac{1}{20}\)。基线、模型与实验设置不同,这 2 组数字不能拼成同一个加速结论。
9. MiniMax M3 的多模态与本地部署边界
M3 的官方接口覆盖 image/video input、coding、cowork 和 desktop-computer use,并提供 enabled、adaptive、disabled 3 种 thinking 模式。模态能力来自训练与 processor;桌面操作仍需要外部截图采集、坐标/动作 schema、执行器、权限控制和观测回写。
模型卡列出 SGLang、vLLM、Transformers、KTransformers 与 Unsloth。模型能够加载,不代表在 1M context 下达到官方效率;还要确认 engine 是否启用 MSA kernel,而非静默回退到低效实现。MSA 已公开 GPU kernel 仓库,可用于核对实际执行路径。
10. DeepSeek、GLM 与 Gemma 放在同一坐标系
DeepSeek-V4 用共享 K/V、c4a/c128a 压缩路径、局部窗口和稀疏 indexer 同时降低 1M 的 attention FLOPs 与 KV;Pro/Flash 分别是 1.6T/49B active 与 284B/13B active。它的系统复杂度集中在异构 cache page、压缩边界、FP4/FP8 mixed weights 和 expert communication。完整版本关系见 DeepSeek V3、R1、V4 与 OCR 演进。
GLM-5.2 的官方模型卡给出 753B 和 1M,但 active parameters 未重新公开。IndexShare 让每四个 sparse-attention layers 共享轻量 indexer,MTP 跨预测步共享参数;部署材料进一步讨论 LayerSplit、CPU cache 和 RDMA 生命周期。
Gemma 4 的规模明显较小,覆盖 E2B/E4B、12B、26B-A4B 与 31B,context 为 128K/256K。它更适合单机或设备侧资源范围,并提供统一多模态变体和专用 4 层 MTP drafter;“规模小”不等于在 Agent 或长上下文上自动优于更大模型。
11. Attention 结构决定哪种状态进入数据中心
| 路线 | 代表 | 动态状态 | 主要系统难点 |
|---|---|---|---|
| 混合线性 + 全 attention | Qwen3.5 | recurrent state + 少量层 KV | 异构 state、专用 kernel、checkpoint/runtime 一致性。 |
| KDA + 周期性 Gated MLA | Kimi K3 | delta-style state + latent cache | 2 类状态、AttnRes 依赖、视觉 token、1M session 与 cache identity。 |
| block sparse | MiniMax M3 | 完整 K/V 存储 + 稀疏 block 访问 | index/top-k、gather 局部性、热门 block 负载。 |
| 压缩 + 稀疏 + window | DeepSeek-V4 | 多种压缩 cache 与局部 cache | 异构分页、因果边界、PD transfer。 |
| 跨层共享 index | GLM-5.2 | 层级 KV + index cache | 共享索引生命周期与长 session 调度。 |
| 标准 AR + MTP | Gemma 4 | KV + draft/verify 临时状态 | 设备内存、接受率与 multimodal preprocessing。 |
block-sparse attention 通常仍要存储历史 K/V,只减少访问和计算;linear attention 才可能用固定递推状态替代完整历史。压缩 attention 则介于两者之间。不能把 FLOPs 降低自动翻译成同等比例的 KV 容量下降。
12. Multimodal 的隐藏成本
“支持图像/视频”至少增加 processor、视觉 encoder 或投影器、视觉 token 数和预处理队列。Qwen3.5 使用独立 vision encoder;Kimi K3 采用原生视觉路线;MiniMax M3 从训练第 1 步进行 native mixed-modality training。Gemma 4 12B 则采用 encoder-free 路线,把 image patches 与 waveform chunks 经轻量投影送入统一主干。
VLM 服务需要按视觉 token 或预处理成本做 admission control,单看文本 token 不够。即使 context 都是 256K,一段视频与纯文本的 TTFT、显存峰值和 cache reuse 模式也可能完全不同。
13. Agentic 不等于 1 个 benchmark 分数
Agent request 的状态包括系统 prompt、工具 schema、模型 reasoning、tool calls、tool results、外部文件和失败重试。模型决定“下一步动作”,orchestrator 决定并发、权限、超时、上下文折叠、重放和恢复。任何 Agent 比较都应把 2 层分开。
Qwen3.5-Plus 的 built-in tools、Kimi 的 Agent Swarm、MiniMax 的 desktop operation、GLM/DeepSeek 的 coding benchmark 都包含 checkpoint 之外的系统条件。部署自有模型时,这些组件需要重新实现和验证。
14. 静态权重容量下界:先算得下,再谈跑得快
| 模型 | BF16 理论下界 | 8-bit 理论下界 | 4-bit 理论下界 |
|---|---|---|---|
| Qwen3.5 397B | 794 GB | 397 GB | 198.5 GB |
| Kimi K3 2.8T | 约 5.6 TB | 约 2.8 TB | 约 1.4 TB |
| MiniMax M3 428B | 约 856 GB | 约 428 GB | 约 214 GB |
| DeepSeek-V4 Pro 1.6T | 约 3.2 TB | 约 1.6 TB | 约 800 GB |
| GLM-5.2 753B | 约 1.506 TB | 约 753 GB | 约 376.5 GB |
这是参数量乘字节数的十进制数学下界,不含 scale、metadata、embedding/vision 口径差异、对齐、通信 buffer、activation、状态 cache、CUDA graph 和碎片。DeepSeek-V4 的官方 checkpoint 是 mixed FP4/FP8,不能直接套用“全 4-bit”。K3 虽以 MXFP4 weights + MXFP8 activations 为 QAT 目标,也必须等真实 tensor index 和 engine 后测量;官方给出的 64+ accelerator supernode 是系统建议,不是简单容量除法。
15. 模型放几张卡:正确的计算顺序
- 读取确切 checkpoint 的 tensor index,统计每种 dtype、量化 scale 和非语言模块。
- 选择 tensor/pipeline/expert parallel,确定哪些权重复制、哪些分片。
- 为目标最大 context 和并发计算 KV/recurrent/index state,而不是把所有 HBM 给权重。
- 预留 kernel workspace、MoE dispatch、NCCL、CUDA graph、视觉 encoder 和采样 buffer。
- 用最坏长度和实际模态做峰值测量;OOM 时先区分权重、动态 cache 或碎片。
- 再决定是否 CPU/SSD offload、PD separation、layer split 或增加副本。
卡数还受带宽而非容量约束。即使 4-bit 权重勉强放下,跨 PCIe 读取专家或每 token 做低带宽 CPU offload 也可能不可用。官方没有给统一最低卡数的模型,本页不会用简单除法冒充推荐部署。
16. 按工作负载选择,而不是选“总冠军”
| 需求 | 优先验证 | 为什么 |
|---|---|---|
| 1M 仓库/长 session,关注 cache 效率 | Kimi K3 API、DeepSeek-V4、GLM-5.2、MiniMax M3、Qwen3.5 extended | 采用不同递推、稀疏、压缩或混合机制;K3 当前只能测托管 API。 |
| 图像/视频 Agent | Kimi K3 API、MiniMax M3、Qwen3.5 | 都有视觉入口,但开放权重、视频、本地 processor 与 runtime 支持边界不同。 |
| 设备侧、单机较小模型 | Gemma 4 E2B/E4B/12B/26B-A4B | 官方提供更小规模和量化内存表。 |
| 自建多 Agent 编排 | 先比较 tool-call reliability 与成本,再比较规模 | orchestrator、context management 和失败恢复会主导结果。 |
| 高并发 decode | 测 active FLOPs、权重带宽、MTP 接受率和 EP all-to-all | 上下文上限和单项 benchmark 不代表服务吞吐。 |
同一模型也可能需要多种 deployment pool:短请求走高 batch decode,长 context 走专用 prefill/KV 节点,多模态走带视觉前端的队列,Agent 请求按 session 和 tool lifecycle 路由。
17. 横向比较需要统一的口径
- 分别记录 native、extended 与托管 API 默认 context。
- MiniMax 的 MSA 数字、Kimi 与 Qwen 的 Agent 数字按各自模型、基线和 harness 保存。
- checkpoint 与官方 API 的 built-in tools、视频处理、context folding 和安全策略分开评测。
- total/active 参数预算以具体 tensor index、vision encoder、embedding 与 shared experts 的计数方式为准。
- 固定 engine release 或 commit 后复测,避免把版本变化混入模型比较。
18. 可复现对比清单
- 固定模型 revision、processor/tokenizer、chat template、engine 和 kernel commit。
- 记录 total weight bytes、每 rank 常驻权重、KV/state bytes per token/session 和峰值 HBM。
- 使用同一文本/图像/视频输入、相同输出预算、相同工具与相同上下文管理。
- 分别报告 TTFT、TPOT、吞吐、端到端成功率、GPU-hours、网络 bytes 和失败类型。
- MoE 记录 expert load、all-to-all 时间;sparse attention 记录 top-k/index/gather;linear attention 记录 recurrent state。
- Agent 测试公开 orchestrator 配置、并发数、工具版本、超时、重试、裁剪和摘要规则。
- 对 8K、128K、256K、1M 分档,不用 1 个平均长度掩盖长尾。
19. 一手来源
| 来源 | 本页使用内容 |
|---|---|
| Qwen3.5-397B-A17B 官方模型卡 | 397B/17B、60 层 hybrid layout、MoE、上下文、视觉、MTP、engine 与托管版边界。 |
| Kimi Linear / 官方仓库 | KDA、3:1 KDA/MLA、48B-A3B、1M context、开放权重与 kernel。 |
| Kimi K3 官方发布 | 2.8T、KDA、AttnRes、16-of-896 Stable LatentMoE、1M、QAT、推理基础设施与权重发布时间。 |
| Kimi K3 官方仓库 | 93 层中的 69 KDA + 24 Gated MLA、开放模型配置与推理入口。 |
| Kimi Code 模型文档 | kimi-k3、1M、reasoning effort 与 cache 失效规则。 |
| Kimi K2.6 官方模型卡 | 用于区分上一代 1T/32B、MLA、MoonViT、256K 与 K3 的结构断点。 |
| MiniMax M3 官方模型卡 | 约 428B/23B、1M、原生多模态、MSA、thinking modes 和 engine。 |
| MiniMax M3 官方发布 | 2026-06-01 发布、图像/视频、Agent 和 MSA 定位。 |
| MiniMax Sparse Attention | Index/Main Branch、109B 实验、FLOPs 与 H800 wall-clock 数字。 |
| DeepSeek-V4 Technical Report | Pro/Flash 参数、active、1M 与压缩 attention。 |
| DeepSeek-V4-Pro 官方模型卡 | checkpoint、混合精度和部署入口。 |
| GLM-5.2 官方发布;官方模型卡 | 753B、1M、IndexShare、MTP 与 active 未重新披露的边界。 |
| Gemma 4 官方模型卡 | 家族规模、context、模态、内存与 MTP 入口。 |