1. 先定义“可获取权重”,再谈模型比较

本页使用“可获取权重”,不笼统称为“完全开源”。权重可下载、代码可见、许可证允许研究或商用是 3 个不同命题,各模型的许可证和第三方组件条款也不相同。Hugging Face 上有文件并不代表使用权一致,部署前仍要阅读对应模型卡与 LICENSE。

事实层本页采用的证据
架构规格官方 config、模型卡、技术报告。
可运行性官方列出的 engine 与可执行 recipe。
上下文官方 native/extended context 声明。
Agent 能力工具接口、公开 harness 与模型卡说明。
速度明确硬件、精度、batch 与基线的测量。

2. 三本账:total、active 和动态状态

MoE 模型的总参数决定静态权重需要放在哪里,active parameters 近似描述 1 个 token 实际经过多少专家计算,KV cache 或线性注意力递推状态决定并发长请求的动态容量。三者不能互相替代。

静态权重理论下界: \[ \mathrm{bytes\_weight} \approx \frac{\mathrm{total\_params} \times \mathrm{bits}}{8} \] MoE 单 token 计算:与 active experts、attention、shared layers 共同相关 标准 attention 动态状态: \[ \mathrm{KV\ bytes} \propto \mathrm{layers} \times \mathrm{tokens} \times \mathrm{KV\ width} \times \mathrm{precision} \] 线性/递推 attention:state 可不随 tokens 增长,但通常随 head/state dimensions 增长

2.8T total 的 Kimi K3 仍需让全部权重在设备或分层内存中可访问,单次路由等效选择 896 个 experts 中的 16 个。397B / 17B 的 Qwen3.5 仍要为 397B 权重做放置;GLM-5.2 则按 753B total 规划静态容量。

3. 2026 官方规格总表

模型Total / active上下文核心序列结构官方模态
Qwen3.5-397B-A17B397B / 17B262,144 native;可扩到 1,010,000Gated DeltaNet 与 Gated Attention 混合;MoE统一 vision-language,独立 vision encoder
Kimi K32.8T;16-of-896 experts1M3× KDA + 1× Gated MLA;AttnRes;Stable LatentMoE原生视觉;API 已上线
MiniMax M3约 428B / 约 23B1MMiniMax Sparse Attention;MoE原生文本、图像、视频
DeepSeek-V4-Pro1.6T / 49B1MCSA + HCA、局部/压缩路径;MoE文本
DeepSeek-V4-Flash284B / 13B1M同代压缩长上下文;MoE同上
GLM-5.2753B total1MIndexShare 稀疏注意力;MoE 路线文本
Gemma 4 26B-A4B26B / 4B256KMoE + 自回归 MTP文本、图像;视频按帧
Gemma 4 31B / 12B / E2B-E4Bdense 或设备侧变体128K 或 256Kdense/PLE/统一 encoder-free 变体全家族图像;部分变体支持音频

MiniMax 对参数量使用“约 428B/约 23B”;Hugging Face 文件统计约为 427B,两者属于计数口径差异,因此表中沿用官方约数。

逐家详解:Qwen3.5 → 3.7 · Kimi K2 → K3、SWE-1.7 与 Composer · MiniMax M1 → M3 · DeepSeek-V4 专题 / DeepSeek 完整演进 · GLM-5 → 5.2 · Gemma 4 与 DiffusionGemma

4. Qwen3.5:线性注意力与全注意力按层混合

Qwen3.5-397B-A17B 是 60 层 causal language model with vision encoder。官方 hidden layout 为 15 组,每组先放 3 个 Gated DeltaNet → MoE,再放 1 个 Gated Attention → MoE。因此 45 层使用递推/线性注意力路线,15 层保留显式 attention;它不是“全模型都没有 KV”。

模型有 512 个 experts,每 token 选择 10 个 routed experts,并有 1 个 shared expert;官方汇总为 397B total、17B activated。Gated Attention 使用 32 个 query heads 和 2 个 KV heads,显著压低保留全注意力层的 KV 宽度;Gated DeltaNet 则维护递推状态。模型还训练了多步 MTP。

上下文边界:开源 checkpoint 的 native context 为 262,144,可扩展到 1,010,000。托管的 Qwen3.5-Plus 对应此模型并默认提供 1M、内建工具和 adaptive tool use;这些生产功能不能自动视为本地 checkpoint 自带。

5. Qwen3.5 的部署含义

混合序列结构产生 2 类动态状态:全注意力层要分页、量化和迁移 KV;DeltaNet 层维护固定形状的 recurrent state。runtime 必须理解这 2 类 state 的边界,不能只按普通 Transformer 的每层 K/V 估算显存。

  1. 静态权重按 MoE expert parallel、tensor parallel 或分层内存放置。
  2. 视觉输入先经 vision encoder,再与文本 token 进入早期融合训练过的语言主干。
  3. 全注意力层的 KV 随 context 增长;DeltaNet state 不按 token 数线性保留完整历史。
  4. MoE router 产生跨 rank dispatch/combine;MTP 增加 draft/verify 路径。
  5. 官方列出 Transformers、vLLM、SGLang、KTransformers 等兼容入口,但生产效率仍取决于具体版本是否实现混合 state 和 kernel。

6. Kimi K3:把 Kimi Linear 的 KDA 扩展到 2.8T 主干

KDA 的公开起点是 Kimi Linear:它用 48B total / 3B active 模型验证 3:1 KDA/MLA 混合架构,并开放 checkpoint、KDA kernel 与 vLLM 实现。K3 把这条结构线扩展到 2.8T;官方模型仓库列出 93 层中的 69 KDA + 24 Gated MLA。KDA 维护 delta-style state,Gated MLA 周期性保留显式 attention,Attention Residuals 再组合更早 block 的输出。它们共同改变长上下文状态的类型,不能沿用 K2.6 的“只有压缩 MLA KV”账本。

Kimi K3 官方 KDA、Gated MLA、Stable LatentMoE 与 Attention Residuals 架构图
官方结构图:Kimi K3 发布页。右侧是重复的 3× KDA + 1× Gated MLA 模式与跨 block AttnRes,左侧展开 Stable LatentMoE 与 KDA;精确层数由官方模型仓库核验。

MoE 侧扩大到 896 experts,1 次路由等效激活 16 个,并使用 Stable LatentMoE。这里披露的是 expert 数和路由稀疏度,不是 active parameter 总数。原生视觉与 1M context 会让媒体 prefill、KDA state、MLA cache、prefix reuse 和会话迁移同时进入服务账本。

K3 从 SFT 开始做 QAT,目标是 MXFP4 weights + MXFP8 activations。官方仓库已发布模型配置与权重入口,并建议使用 64 张以上加速卡组成的 supernode;部署时需要同时核算 896 experts 的放置、16-expert 路由、KDA state、Gated MLA cache、量化 scale、视觉前端和通信 workspace。

7. Kimi 的 Agent 能力是模型与运行时共同结果

K2.6 曾公开最多 300 个 sub-agents、4,000 个协调步骤;K3 又强调长程 coding、知识工作和视觉在环。它们都是模型加 orchestrator、工具、上下文管理、并发限制与失败恢复的系统结果,不表示 1 次 forward 中存在数百个“专家代理”。MoE experts 与 Agent workers 是不同层级。

K3 托管推理使用 Mooncake disaggregation,官方报告 coding workload 的 cache hit rate 超过 90%。这说明长程 Agent 成本与 prefix/cache 设计紧密相关,但它仍是 Moonshot 生产 trace 的厂商口径。Kimi Code 文档还明确:切换 model 或 reasoning effort 会使 cache 失效并触发重新 prefill。

8. MiniMax M3:同时做 expert sparsity 与 attention sparsity

MiniMax M3 官方模型卡给出约 428B total、约 23B active、1M context。它从预训练第 1 步混合文本、图像和视频数据,并以 MiniMax Sparse Attention(MSA)替代 1M 长度下的 dense GQA 路径。MoE 稀疏降低每 token 的 expert 计算,MSA 稀疏降低每个 query 访问的 KV blocks;二者分别作用于 MLP 与 attention。

MSA 论文在 109B MoE research model 上报告 1M 时 attention compute 降低 28.4×,H800 prefill/decoding wall-clock 分别 14.2×/7.6×。M3 模型卡另以 M2 为基线报告 9× prefill、15× decode 和每 token compute 约 \(\frac{1}{20}\)。基线、模型与实验设置不同,这 2 组数字不能拼成同一个加速结论。

9. MiniMax M3 的多模态与本地部署边界

M3 的官方接口覆盖 image/video input、coding、cowork 和 desktop-computer use,并提供 enabledadaptivedisabled 3 种 thinking 模式。模态能力来自训练与 processor;桌面操作仍需要外部截图采集、坐标/动作 schema、执行器、权限控制和观测回写。

模型卡列出 SGLang、vLLM、Transformers、KTransformers 与 Unsloth。模型能够加载,不代表在 1M context 下达到官方效率;还要确认 engine 是否启用 MSA kernel,而非静默回退到低效实现。MSA 已公开 GPU kernel 仓库,可用于核对实际执行路径。

10. DeepSeek、GLM 与 Gemma 放在同一坐标系

DeepSeek-V4 用共享 K/V、c4a/c128a 压缩路径、局部窗口和稀疏 indexer 同时降低 1M 的 attention FLOPs 与 KV;Pro/Flash 分别是 1.6T/49B active 与 284B/13B active。它的系统复杂度集中在异构 cache page、压缩边界、FP4/FP8 mixed weights 和 expert communication。完整版本关系见 DeepSeek V3、R1、V4 与 OCR 演进

GLM-5.2 的官方模型卡给出 753B 和 1M,但 active parameters 未重新公开。IndexShare 让每四个 sparse-attention layers 共享轻量 indexer,MTP 跨预测步共享参数;部署材料进一步讨论 LayerSplit、CPU cache 和 RDMA 生命周期。

Gemma 4 的规模明显较小,覆盖 E2B/E4B、12B、26B-A4B 与 31B,context 为 128K/256K。它更适合单机或设备侧资源范围,并提供统一多模态变体和专用 4 层 MTP drafter;“规模小”不等于在 Agent 或长上下文上自动优于更大模型。

11. Attention 结构决定哪种状态进入数据中心

路线代表动态状态主要系统难点
混合线性 + 全 attentionQwen3.5recurrent state + 少量层 KV异构 state、专用 kernel、checkpoint/runtime 一致性。
KDA + 周期性 Gated MLAKimi K3delta-style state + latent cache2 类状态、AttnRes 依赖、视觉 token、1M session 与 cache identity。
block sparseMiniMax M3完整 K/V 存储 + 稀疏 block 访问index/top-k、gather 局部性、热门 block 负载。
压缩 + 稀疏 + windowDeepSeek-V4多种压缩 cache 与局部 cache异构分页、因果边界、PD transfer。
跨层共享 indexGLM-5.2层级 KV + index cache共享索引生命周期与长 session 调度。
标准 AR + MTPGemma 4KV + draft/verify 临时状态设备内存、接受率与 multimodal preprocessing。

block-sparse attention 通常仍要存储历史 K/V,只减少访问和计算;linear attention 才可能用固定递推状态替代完整历史。压缩 attention 则介于两者之间。不能把 FLOPs 降低自动翻译成同等比例的 KV 容量下降。

12. Multimodal 的隐藏成本

“支持图像/视频”至少增加 processor、视觉 encoder 或投影器、视觉 token 数和预处理队列。Qwen3.5 使用独立 vision encoder;Kimi K3 采用原生视觉路线;MiniMax M3 从训练第 1 步进行 native mixed-modality training。Gemma 4 12B 则采用 encoder-free 路线,把 image patches 与 waveform chunks 经轻量投影送入统一主干。

\[ \begin{aligned} \mathrm{TTFT} &= \mathrm{upload/decode\ media} + \mathrm{resize/sample/patch} + \mathrm{vision/audio\ frontend} \\ &\quad + \mathrm{multimodal\ prefill} + \mathrm{scheduler\ wait} \end{aligned} \] 视频成本还随帧数、分辨率和采样策略增长。

VLM 服务需要按视觉 token 或预处理成本做 admission control,单看文本 token 不够。即使 context 都是 256K,一段视频与纯文本的 TTFT、显存峰值和 cache reuse 模式也可能完全不同。

13. Agentic 不等于 1 个 benchmark 分数

Agent request 的状态包括系统 prompt、工具 schema、模型 reasoning、tool calls、tool results、外部文件和失败重试。模型决定“下一步动作”,orchestrator 决定并发、权限、超时、上下文折叠、重放和恢复。任何 Agent 比较都应把 2 层分开。

Qwen3.5-Plus 的 built-in tools、Kimi 的 Agent Swarm、MiniMax 的 desktop operation、GLM/DeepSeek 的 coding benchmark 都包含 checkpoint 之外的系统条件。部署自有模型时,这些组件需要重新实现和验证。

14. 静态权重容量下界:先算得下,再谈跑得快

模型BF16 理论下界8-bit 理论下界4-bit 理论下界
Qwen3.5 397B794 GB397 GB198.5 GB
Kimi K3 2.8T约 5.6 TB约 2.8 TB约 1.4 TB
MiniMax M3 428B约 856 GB约 428 GB约 214 GB
DeepSeek-V4 Pro 1.6T约 3.2 TB约 1.6 TB约 800 GB
GLM-5.2 753B约 1.506 TB约 753 GB约 376.5 GB

这是参数量乘字节数的十进制数学下界,不含 scale、metadata、embedding/vision 口径差异、对齐、通信 buffer、activation、状态 cache、CUDA graph 和碎片。DeepSeek-V4 的官方 checkpoint 是 mixed FP4/FP8,不能直接套用“全 4-bit”。K3 虽以 MXFP4 weights + MXFP8 activations 为 QAT 目标,也必须等真实 tensor index 和 engine 后测量;官方给出的 64+ accelerator supernode 是系统建议,不是简单容量除法。

15. 模型放几张卡:正确的计算顺序

  1. 读取确切 checkpoint 的 tensor index,统计每种 dtype、量化 scale 和非语言模块。
  2. 选择 tensor/pipeline/expert parallel,确定哪些权重复制、哪些分片。
  3. 为目标最大 context 和并发计算 KV/recurrent/index state,而不是把所有 HBM 给权重。
  4. 预留 kernel workspace、MoE dispatch、NCCL、CUDA graph、视觉 encoder 和采样 buffer。
  5. 用最坏长度和实际模态做峰值测量;OOM 时先区分权重、动态 cache 或碎片。
  6. 再决定是否 CPU/SSD offload、PD separation、layer split 或增加副本。

卡数还受带宽而非容量约束。即使 4-bit 权重勉强放下,跨 PCIe 读取专家或每 token 做低带宽 CPU offload 也可能不可用。官方没有给统一最低卡数的模型,本页不会用简单除法冒充推荐部署。

16. 按工作负载选择,而不是选“总冠军”

需求优先验证为什么
1M 仓库/长 session,关注 cache 效率Kimi K3 API、DeepSeek-V4、GLM-5.2、MiniMax M3、Qwen3.5 extended采用不同递推、稀疏、压缩或混合机制;K3 当前只能测托管 API。
图像/视频 AgentKimi K3 API、MiniMax M3、Qwen3.5都有视觉入口,但开放权重、视频、本地 processor 与 runtime 支持边界不同。
设备侧、单机较小模型Gemma 4 E2B/E4B/12B/26B-A4B官方提供更小规模和量化内存表。
自建多 Agent 编排先比较 tool-call reliability 与成本,再比较规模orchestrator、context management 和失败恢复会主导结果。
高并发 decode测 active FLOPs、权重带宽、MTP 接受率和 EP all-to-all上下文上限和单项 benchmark 不代表服务吞吐。

同一模型也可能需要多种 deployment pool:短请求走高 batch decode,长 context 走专用 prefill/KV 节点,多模态走带视觉前端的队列,Agent 请求按 session 和 tool lifecycle 路由。

17. 横向比较需要统一的口径

  • 分别记录 native、extended 与托管 API 默认 context。
  • MiniMax 的 MSA 数字、Kimi 与 Qwen 的 Agent 数字按各自模型、基线和 harness 保存。
  • checkpoint 与官方 API 的 built-in tools、视频处理、context folding 和安全策略分开评测。
  • total/active 参数预算以具体 tensor index、vision encoder、embedding 与 shared experts 的计数方式为准。
  • 固定 engine release 或 commit 后复测,避免把版本变化混入模型比较。

18. 可复现对比清单

  1. 固定模型 revision、processor/tokenizer、chat template、engine 和 kernel commit。
  2. 记录 total weight bytes、每 rank 常驻权重、KV/state bytes per token/session 和峰值 HBM。
  3. 使用同一文本/图像/视频输入、相同输出预算、相同工具与相同上下文管理。
  4. 分别报告 TTFT、TPOT、吞吐、端到端成功率、GPU-hours、网络 bytes 和失败类型。
  5. MoE 记录 expert load、all-to-all 时间;sparse attention 记录 top-k/index/gather;linear attention 记录 recurrent state。
  6. Agent 测试公开 orchestrator 配置、并发数、工具版本、超时、重试、裁剪和摘要规则。
  7. 对 8K、128K、256K、1M 分档,不用 1 个平均长度掩盖长尾。
最终原则:只有在同一个请求生命周期、同一硬件约束和同一 SLO 下,模型比较才会变成部署决策;否则只是不同发布页数字的拼贴。

19. 一手来源

来源本页使用内容
Qwen3.5-397B-A17B 官方模型卡397B/17B、60 层 hybrid layout、MoE、上下文、视觉、MTP、engine 与托管版边界。
Kimi Linear / 官方仓库KDA、3:1 KDA/MLA、48B-A3B、1M context、开放权重与 kernel。
Kimi K3 官方发布2.8T、KDA、AttnRes、16-of-896 Stable LatentMoE、1M、QAT、推理基础设施与权重发布时间。
Kimi K3 官方仓库93 层中的 69 KDA + 24 Gated MLA、开放模型配置与推理入口。
Kimi Code 模型文档kimi-k3、1M、reasoning effort 与 cache 失效规则。
Kimi K2.6 官方模型卡用于区分上一代 1T/32B、MLA、MoonViT、256K 与 K3 的结构断点。
MiniMax M3 官方模型卡约 428B/23B、1M、原生多模态、MSA、thinking modes 和 engine。
MiniMax M3 官方发布2026-06-01 发布、图像/视频、Agent 和 MSA 定位。
MiniMax Sparse AttentionIndex/Main Branch、109B 实验、FLOPs 与 H800 wall-clock 数字。
DeepSeek-V4 Technical ReportPro/Flash 参数、active、1M 与压缩 attention。
DeepSeek-V4-Pro 官方模型卡checkpoint、混合精度和部署入口。
GLM-5.2 官方发布官方模型卡753B、1M、IndexShare、MTP 与 active 未重新披露的边界。
Gemma 4 官方模型卡家族规模、context、模态、内存与 MTP 入口。