返回首页 >

KimiK3火了,月之暗面回应争议:并非蒸馏复刻现有模型,国产AI不该被贴上低价标签

2026-07-22 09:50   每日经济新闻

  此前发布时,Kimi也提到架构层面变化带来的效率提升。据介绍,Kimi K3基于Kimi Delta Attention(KDA)混合线性注意力机制和Attention Residuals(AttnRes)注意力残差技术构建。MoE(混合专家)层面,模型在896个专家中激活16个。而上述结构性改进让Kimi K3 相比K2的整体扩展效率提升约2.5倍。

  本次黄震昕进一步披露了支撑K3的三项关键技术。其中,Moon Clip是一种全新二阶优化器,由Kimi首次应用于大模型训练。“当前全球可用训练数据基本见底,这项技术能让20T训练数据跑出40T的训练效果,同等性能下训练成本、算力功耗直接减半。”Kimi Linear Tension是其自研线性注意力机制,用于解决传统线性注意力处理超长任务时性能衰减的痛点。“行业存在AI摩尔定律,AI可执行任务时长每7个月翻1倍;这套机制让上下文窗口扩大10倍,训练成本仅同步扩大10倍。”

  今年3月发布技术报告时已引起过一次关注的Attention Residuals(注意力残差),这项技术优化了模型多层网络间信息传递与复用逻辑,它让2.8万亿超大参数模型既能稳定完成训练,又能让推理效率同步提升25%。

  今年以来,月之暗面创始人杨植麟曾多次在公开演讲中提及Kimi构建规模化策略Token(词元)效率、长上下文、Agent(智能体)集群,在有限资源下实现智能最大化。而从当前Kimi技术迭代方向来看,团队仍坚定不移地走既定路线,专注编程、金融、法律、科学研究等生产力场景。

猜你喜欢

热点新闻

{$loop_num=0}