← 文章 / AI技术
Hacker News 3小时前 · 2026-07-29 06:00:26 · 2 阅读

Kimi K3 架构概览与笔记:2.8T 参数开放权重大模型

昨天发布的Kimi K3大模型(开放权重)架构图,附带一些观察和思考。

  1. 没错,看起来确实比较复杂,但本质上就是去年发布的Kimi Linear模型的规模化生产版本(参数量从48B扩展到2.8T;K3是目前最大的开放权重模型)。

  2. 相比Kimi Linear,新增的组件是LatentMoE。下图已经太拥挤了所以没画进去,但它本质上和Nemotron 3 Ultra里的LatentMoE一样(感兴趣的话可以在我的LLM架构画廊里找到)。它的思路和多头潜在注意力类似,都是对大型线性层进行压缩(降维投影)。

  3. Kimi K3的整体趋势(与Nemotron 3、DeepSeek V4等类似)也是朝着更好的推理效率发展。也就是说,很多组件都被替换成了效率优化版本。例如:MoE → LatentMoE,常规注意力 → 多头潜在注意力和Kimi Delta注意力。(我的画廊里也有简短教程和文章,想了解细节可以去看)。

  • 有一个组件变更并非效率优化,那就是注意力残差。与 DeepSeek V4 通过 mHC(流形约束超连接)改进残差路径不同,注意力残差同样旨在优化残差路径,但实现方式略有不同。具体来说,mHC 让残差路径变宽,而注意力残差(Kimi Linear 中已包含)则跨层连接残差;连接本身使用注意力分数作为重要/贡献权重。根据报告,这种方法能持续改善验证损失和下游性能(幅度不大),同时训练成本增加约 4%,推理成本增加约 2%。

  • 有趣的是,Kimi K3 完全去掉了所有 RoPE 层,全面改用 NoPE(无位置嵌入)。(同样继承自 Kimi Linear。)在其他架构中,最近的趋势是在局部注意力层(如 滑动窗口注意力)使用 RoPE,在全局层使用 NoPE。虽然也有少数架构完全采用 NoPE,但据我所知,这是首个达到前沿水平的模型。

  • Kimi K3 现在原生支持多模态,这非常棒!

  • 技术报告中还有其他有趣的训练细节,但架构方面目前就这些。总体而言,这是一次非常出色的发布。

    Kimi K3 架构组合图,包含 Kimi Delta Attention、门控多头潜在注意力、注意力残差、LatentMoE 以及基准测试对比

    图 1. Kimi K3 架构及发布时的基准测试对比。更多详情请参阅架构画廊中的 K3

    来源:我的 Substack 笔记网站版本。

    原始来源: Hacker News

    评论 (0)