涨价浪潮下,DeepSeek推动AI“价格战”:百万Token输入0.25元
2026-04-26 12:44 澎湃新闻
其中,昇腾950通过融合kernel和多流并行技术降低Attention计算和访存开销,大幅提升推理性能,结合多种量化算法,实现了高吞吐、低时延的DeepSeek V4模型推理部署。昇腾A3超节点系列产品也全面适配,同时为便于用户快速微调,提供了基于昇腾A3超节点的训练参考实现。
据DeepSeek的技术论文披露,DeepSeek V4的核心创新叫做"混合注意力架构",由两种机制交替叠加构成:CSA(压缩稀疏注意力)和HCA(重度压缩注意力)。两种机制交替出现在模型的不同层:CSA处理精细的中程信息,HCA处理粗粒度的超长程信息。同时,每个注意力层还保留了一个"滑动窗口注意力分支",专门负责最近128个token的近邻局部信息,弥补压缩机制容易丢失局部细节的缺陷。
在100万token的超长上下文场景下,与上一代V3.2相比:V4-Pro的推理计算量(FLOPs)只需27%,KV缓存(模型的"工作记忆")只需10%;V4-Flash更极端,推理计算量降至10%,KV缓存降至7%。(澎湃新闻)
责编:马洪震




