Omni Inference · verified 2026-08-07
从 any-to-any 模型图到可研究的推理系统
这条资料线把媒体 encoder、AR Thinker、Talker、codec、vocoder、DiT 与 VAE 放回同一张执行图,再沿着源码解释两套 Omni runtime 如何调度、传状态、组批、恢复和部署。
边界:vLLM-Omni 有独立论文;SGLang-Omni 当前以官方代码、文档、release、博客和 issue 为证据。仓库里存在 backend 或模块,不等于所有模型和硬件组合已经完成端到端验证。
阅读顺序
01Omni serving 到底是什么先区分普通多模态输入、生成模型 pipeline、实时双工与真正的异构阶段图。打开
02模型图、模态状态与输出 codec用 Qwen3-Omni、BAGEL、Transfusion、Moshi 等工作负载确定 runtime 必须保存和搬运的状态。打开
032023–2026 Omni serving 论文谱系从 PagedAttention、PD/EPD 到 graph runtime、Diffusion、流式视频与双工语音。打开
04vLLM-Omni 架构与源码请求路径AsyncOmni、Orchestrator、StagePool、stage engine 与输出路由。打开
05vLLM-Omni 调度、缓存、Diffusion 与 Connector逐 stage batching、KV/hidden state、async chunk、并行与跨节点数据面。打开
06vLLM-Omni 论文、部署与实验边界完整拆解论文、Qwen3 配方、支持矩阵、性能口径与未验证部分。打开
07SGLang-Omni 架构与源码请求路径API、Client、Coordinator、Stage、Scheduler 与 terminal 聚合。打开
08SGLang-Omni 调度、缓存、通信与部署OmniScheduler、媒体 cache、CUDA IPC/SHM/Mooncake、Qwen 与 Ming 路径。打开
09vLLM-Omni 与 SGLang-Omni:逐层比较同一组工作负载下比较抽象、执行、状态、数据面、平台与证据等级。打开
10状态、背压、多租户与故障语义把 queue、credit、abort、session state、租户隔离和 liveness owner 写成系统不变量。打开
11可复现评测与容量实验固定版本、模型、硬件、输入分布和 SLO,避免把两套仓库的演示数字直接横比。打开
12系统研究议题与实验路线DAG-aware scheduling、跨阶段背压、统一状态、拓扑放置、故障恢复和公平性。打开