推理成本砍半之后,营销人终于算得过来这笔 AI 账
传输接收 · 行星 EFFICIENCY-1 · 坐标 [-0.78, 0.05]
DeepSeek 在 V3.2-Exp 实验模型里首次落地了自研的稀疏注意力方案(DeepSeek Sparse Attention,DSA),长上下文推理的算力开销被显著压低,API 价格随之腰斩。这不是一次普通的版本迭代,而是注意力机制层面的一次架构换挡。
稀疏注意力:把”全连接”改成”按需连接”
理解 DSA,得先回到标准 Transformer 的注意力机制。传统自注意力是”全连接”的——序列里每一个 token 都要和其余所有 token 计算一遍相关性,复杂度是 O(n²)。上下文一长,计算量、显存占用都呈平方级膨胀,这就是长上下文推理既慢又贵的根因。KV cache 随上下文线性增长,长文档、长对话很快就会撑爆显存预算。
DSA 的核心思路是:在长序列中,并非所有 token 之间都存在有意义的信息依赖。绝大多数注意力权重其实集中在局部窗口或少数关键锚点上,剩余的全局连接是冗余的。于是 DeepSeek 用一种分层的稀疏模式,让每个 token 只与”真正相关”的子集交互,把稠密的注意力矩阵替换成稀疏结构,复杂度从 O(n²) 显著下移一个量级。推理时的 KV cache 占用也随之收敛,长上下文不再是显存黑洞,吞吐与延迟同步改善。
值得强调的是,这种”省”并非以牺牲质量为代价。官方 benchmark 显示 V3.2-Exp 与上一版 V3.1-Terminus 在各项评测上表现相当,而推理成本更低、速度更快。换句话说,它砍掉的是冗余计算,而不是有效表达力。V3.2-Exp 同步开源,模型权重可下载,API 调用价格同步下调——无论自建推理还是走 API,单位 token 的账面成本都在下移。这也是 DeepSeek 把它标记为”Exp”的原因:架构层面尚未定型,但已足以把长上下文的经济性推过一条临界线。
为什么营销人该关心
营销用大模型的瓶颈,过去两年从来不是模型不够聪明,而是单 token 成本不够低。千人千面的个性化邮件、批量商品文案、常驻在线的品牌 Agent——这些”理论上很美”的用例,往往一算 ROI 就劝退。DSA 让单位推理成本整体下移一个台阶,原本算不平的账忽然算得平了。成本是 unlock,不是锦上添花。
怎么用
- 把过去因成本被搁置的”个性化/批量生成”项目清单翻出来,按新价格重算 ROI,很多当时劝退的现在能过线。
- 长上下文用例真正可玩:品牌手册、合规清单、用户画像一起塞进 prompt 做实时生成,DSA 让”长”不再等于”贵”。
- 若在考虑常驻品牌 Agent,开源 V3.2-Exp 提供了一个不依赖外部 API、把数据和体验握在自己手里的选项。
// END OF LOG