通过将13天的内核/调度器日志逐层映射到7层OSI模型,定位每项优化对W8A8基线3.22倍端到端吞吐提升的贡献。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @alexdolbunQ4 2026 · @alexdolbun 及"OSS AI智能体蜂群乐团指挥": > @Zai_org 的 GLM-5.3,出自唐杰教授 @jietang —— 清华计算机系教授、https://t.co/9CEidd6Wvs 创始人(港交所:https://t.co/jeEzCJFB29)—— 显然是在 @finkd 先生与 @alexandr_wang 先生推动的 $META AIRA₃、以及由 @JensenHuang 先生旗下 $NVDA 支持的"NVIDIA Kaggle Nemotron 模型推理挑战赛"之后的一次重大飞跃——Meta 的 AIRA₃ 多智能体并行处理或 dApp dDojo 环境系统在该赛事中从约 4,000 支参赛人类队伍中脱颖而出,取得第8名金牌成绩。该系统在蜂群配置下评估时,融合了包括 GPT 5.5、Claude 4.8 以及 Meta 自研 Muse Spark 在内的前沿模型…… https://t.co/xBDj2QGolY ……截图确认了基础设施智能体(Infra Agent)的循环逻辑。接下来我将提取帖子的其余部分,以及实际的内核 PR、权重文件,以及 DeepEP/Mooncake 路径,以便逐层绘制完整技术栈。 本文并非 RSI 宣言,而是一份历时13天的内核/调度器工作日志,记录了一个混合 KDA+DSA MoE 系统的演进过程——控制平面由 GLM-5.3 编写,数据平面则受制于尚不成熟的中国加速器内核。核心价值体现在三处:(1)逐日的性能倍率曲线;(2)Python/C++/RDMA 的衔接缝隙;(3)已吸收相关补丁的开源项目。 **该推理栈的 OSI 映射** 将集群视为一台7层机器。他们公开的每一个缺陷都对应某个具体层级,这正是可提炼的部分。 | OSI层 | 本系统中的对应实体 | 实际推动3.22×的因素 | |---|---|---| | L1 物理层 | 超10万枚中国加速器,紧耦合 HBM + HBM 带宽,多模态 + 1M 上下文 | 以下所有层均是对"片外字节/秒不足"的应对反应 | | L2 链路层 | GPU-Direct RDMA,PCIe 拓扑 → NIC 亲和性(Mooncake 自动探测) | 无 SM 占用的 KV 搬移,计算 SM 专用于 GEMM/KDA | | L3 网络层 | DeepEP 专家并行调度/合并(节点内 vs 节点间);Mooncake TE 批量读写 | 专家 token 与 KV/状态走同一网卡上的两张独立数据平面 | | L4 传输层 | Mooncake Transfer Engine +(SGLang 配方中的)NIXL;Python GIL 作为控制平面的进程本地互斥锁 | 此处发现了20% → <1% 的缺陷 | | L5 会话层 | EPD = 编码/预填充/解码分离。会话状态 = 分页 DSA KV + KDA 循环状态 | PD 不是"单纯的 KV"——混合模型会传输第二个张量 | | L6 表示层 | W8A8 权重,INT8/FP8/BF16 KV,Triton 上的 tf32 与 tf32x3 https://t.co/E6jZ8cW2mF, 层分割,IndexPool | 数值格式即协议 | | L7 应用层 | SGLang 路由器 + 基础设施智能体 + 密集反馈驱动框架 | 智能体生效的前提是 L6/L4 输出局部预言机信号 | 若要将某句话复制到蜂群指挥器中,请使用以下表述:Flash 的 EPD 交接内容为(DSA 分页 KV,KDA SSM 状态)。缺少任何一项,解码过程将悄然出错。SGLang 自身的使用手册已明确指出,PD"同时搬移分页 DSA KV 与 KDA 循环状态"。 **图1才是真正的论文核心** 从截图中的图表来看,相对于 W8A8 基线的端到端增益如下: | 天数 | 变更内容 | 倍率 | |---|---|---| | T+0 | W8A8 基线 | 1.00 | | T+1 | 异步调度 | 1.21 | | T+2 | 排序内核 | 1.42 | | T+3 | 分层缓存 | 1.41 | | T+4 | 层分割 | 1.97 | | T+5 | 上下文并行 | 2.49 | | T+6–8 | KV 传输重叠 + 混合精度缓存量化 + 分块 MQA | 2.67 | | T+9 | 预填充反量化内核 | 2.85 | | T+10 | 融合激活 + 量化 | 3.01 | | T+11–13 发布 | 线性注意力路径 | 3.22 |