DeepSeek V4.1-Flash 将模型容量与活跃计算分离,利用稀疏 Engram 内存和分层存储,为在本地运行超大模型提供了可行蓝图。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @TeksEdgeDeepSeek-V4.1-Flash 或许正在向我们展示本地 AI 架构的发展方向。 与 Qwen3.8-Flash-Next 类似,它再次表明模型容量正在与活跃计算逐渐解耦。 🎯 它可能是未来规模大得多的 AI 模型在本地运行的架构蓝图。 DeepSeek 全新的 V4.1 将模型拆分为不同类型的内存与计算单元,具体包括…… 🧠 552B 骨干网络 📚 196B Engram 记忆 ⚡ 输入时每个 token 仅激活 8B 参数 🚀 输出时每个 token 仅激活 16B 参数 其中 196B Engram 尤为值得关注。 它并不像普通模型权重那样全部参与矩阵运算,而是通过基于 token 的查找方式进行稀疏访问。 对于本地 AI 而言,此类架构暗示了一种可能的内存层次结构…… 🎮 加速器/统一内存 → 热计算 💾 主机/统一内存 → 常驻权重 💽 SSD → 稀疏查找表 / 冷参数 社区在 256GB M3 Ultra 上进行了一次 2-bit MLX 构建,保留了…… 🧠 160.9 GiB 骨干网络于内存中 💽 57.2 GiB Engram 查找表于 SSD 中 ……短文本生成速度约为 8.8–9.5 tps。 ⚠️ 这是非常实验性的测试,并非生产基准测试,也不是官方 MLX 版本。 …… DeepSeek 同时还攻克了本地 AI 的另一个瓶颈——KV 缓存。 V4.1 Flash 的全局 KV 缓存仅为 890 字节/token。 在 1M token 的情况下,全局 KV 约为 890MB。 活跃计算量小。 廉价内存容量大。 SSD 承载知识存储。 KV 缓存极小。 VRAM 可能正在成为本地 AI 内存层次结构中的众多层级之一。 👀🔥