模型
Kimi K3 技术报告发布:百万 token 上下文与 2.5 倍效率提升
发布时间:
信源:X:Rohan Paul (@rohanpaul_ai)
分享XFacebook微博
Kimi K3 发布技术报告,这是一款 2.8T MoE 模型,原生支持视觉理解与百万 token 上下文窗口。其架构和训练方案相比 Kimi K2 将整体扩展效率提升了约 2.5 倍,通过 Kimi Delta Attention、NoPE、跨深度注意力残差及 896 专家 MoE 等设计实现。模型权重、技术报告及配套高性能内核与基础设施已开源。
阅读原文 (在新窗口打开)
资讯动态数据由 AI HOT 聚合提供
相关资讯同类最新动态
· X:Artificial Analysis (@ArtificialAnlys)
· X:Rohan Paul (@rohanpaul_ai)
· The Decoder:AI News(RSS)
· X:Kim (@kimmonismus)