DeepSeek 把成本再砍一截:8B 读、16B 写的非对称 V4.1-Flash 上线
传输接收 · 行星 EFFICIENCY-2 · 坐标 [0.81, -0.22]
DeepSeek 上新了 V4.1-Flash——它家新一代架构家族里最小的一个,却直接把 V4-Pro 挤到了退场位。官方口径是性能、速度、成本、总运行时全面反超 V4-Pro,公开 benchmark 压过旗舰模型,几方独立复测也一致。9 月 14 日起所有 v4-pro 请求自动改路由到 V4.1-Flash,价格同步下调。
非对称架构:读得省,写得勤
V4.1-Flash 是 552B 参数的 MoE,但真正的改变在非对称激活和新的因果编码器-解码器结构:输入阶段只激活 8B 参数,输出阶段才激活 16B。这对应一个朴素直觉——让模型”读懂”一个长 prompt 的开销,远小于”生成”一段答案的开销。把算力花在真正要产出的输出上,而不是反复消耗在读取输入上,是这套设计节约的主要来源。原生多模态视觉理解也一并内置。
KV cache 的压缩同样激进:相比上代,HBM 占用量降到 1/4,SSD 存储降到 1/8。官方特别点出 cache-hit 收费在 agent 成本里占比很高——缓存一压,常驻 agent、多轮对话这类”反复读同一份上下文”的用法被直接打薄。模型同时开源权重并附技术报告。
价格端延续了 DeepSeek 的错峰策略:低谷价是峰值价的一半,鼓励把灵活任务调度到低谷时段跑。
为什么营销人该关心
营销是出了名的”高 token 消耗”场景:批量文案、千人千面、常驻品牌 agent,都是典型的长输入、反复读同一份品牌手册或多轮对话。V4.1-Flash 的三板斧恰好打在这三类账单上——非对称激活压低”读”的代价,KV cache 压缩压低”重读”的代价,错峰定价再压平日的代价。上一轮 DSA 稀疏注意力把”长上下文变便宜”,这一轮等于把”反复读上下文”也变便宜了。任何一个在算 agent 化营销 ROI 的团队,都值得拿它重新过一遍账。
怎么用
- 批量生成与个性化任务切到
deepseek-flash,按新的单位成本重算 ROI,很多曾被劝退的用例能重新过线。 - 常驻 agent、多轮客服类应用最受益于 KV cache 压缩,可先做成本对比再迁移。
- 把非紧耦合的生成任务调度到低谷时段,拿 50% 名义价。
// END OF LOG