EN 提交工具
教程

Kimi K3 能构建什么:二十类可复现的能力实验

约 16 分钟读完

判断 Kimi K3 值不值得用,不需要从夸张的发布叙事开始。 先把它当成一个需要测量的新工具。 官方资料给出了模型规模、上下文和产品入口,但这些规格只说明测试边界,不说明你的任务一定能完成。 排行榜可以用来挑候选模型,不能代替本地任务验收。前端、研究、工具调用和长上下文要分开测。 真正有用的问题不是「它排第几」,而是「在哪类任务、什么环境和什么验收标准下,它能稳定交付」。 下面把 20 类常见演示改成实验题。

判断 Kimi K3 值不值得用,不需要从夸张的发布叙事开始。

先把它当成一个需要测量的新工具。

官方资料给出了模型规模、上下文和产品入口,但这些规格只说明测试边界,不说明你的任务一定能完成。

排行榜可以用来挑候选模型,不能代替本地任务验收。前端、研究、工具调用和长上下文要分开测。

真正有用的问题不是「它排第几」,而是「在哪类任务、什么环境和什么验收标准下,它能稳定交付」。

下面把 20 类常见演示改成实验题。每一项都要保存提示、依赖版本、运行日志、失败次数、人工修复和最终测试;没有记录,就不把展示当成能力证明。

先约定同一条规则:所有「能做」都只代表待验证命题。通过一次也不等于稳定复现,换提示、工具或依赖后要重新验收。

开始前先固定测试环境

新手先记录模型入口、日期、地区、工具权限、依赖版本和预算,再运行第一条提示。

Kimi K3 是来自 Moonshot AI 的大型语言模型,Moonshot AI 是一家由前谷歌研究员杨志林创立、阿里巴巴支持的北京实验室。它于 七 月推出 16 , 2026 ,有两种版本:一种是用于聊天和代理工作的 Max 版本,另一种是为大规模并行任务构建的 Swarm 版本。

该 2.8 兆参数数量听起来不可能运行,如果不是因为 K3 是一个专家混合模型,那确实不可能。想象一栋建筑, 896 专家而不是一个巨大的大脑。对于任何特定任务,它只唤醒 16 最合适的专家,大约占 1.8 总数,其余的保持休眠。因此,它携带了一个 2.8 -万亿参数模型,同时实际运行成本却低得多。纸面上庞大,实际操作中却精简。这就是让下面一切变得负担得起的诀窍。

再加上三点:一个一百万标记的上下文窗口,因此整个代码库或一堆长文档可以一次性存入它的记忆中;原生多模态输入,因此它可以直接读取图像和视频,而不需要通过附加组件;以及始终开启的推理模式,Moonshot 称之为「思考模式」,这样它默认就能处理问题。最后一点是把双刃剑,我们稍后会回到这一点。

规格记清楚以后,进入下面这组可复现测试。

部分 1 :游戏与 3 D 世界(它战胜一切的地方)

这是让 K3 赢得第一竞技场位置的类别。「描述一个」之间的墙 3 「D 东西」和「拥有一个可用的 3 D 东西」现在合并为一个提示。

实验 1:浏览器游戏:验证交互、碰撞和失败状态

不是像游戏一样的演示。可玩的场景具有击打反应、冲击反馈以及真实物理表现。有人使用视觉效果和基于浏览器的方式创建了战斗竞技场 3 使用抓钩机械的D城市遍历、自上而下的赛车游戏以及单一提示生成的僵尸射击游戏。K3在这里的独特之处在于,它处理了通常会出问题的二十个小细节:碰撞响应、动量、镜头感。

实验 2:交互式 3D 产品:验证材质、控制和性能

一只具有正确光泽和光线反应的手表。一台你可以拆开的相机。一个机械物体,被建模为数十个独立部件,能够通过点击组装和拆卸。这与以往每一个「AI构建的」不同 3 D 事物"的尝试是材质的准确性:粗糙度、金属感和真实的阴影,而不是平坦的塑料。

实验 3:物理模拟:验证公式、边界条件和数值稳定性

垂坠的布料。一个在自己重量下会塌陷的结构。两辆车辆在空中碰撞并传递动量,看起来真实而非预设剧本。具有真实波动动力学的海洋表面。让 K3 计算物理并注释数学公式以便你验证,它就会做到。

实验 4:着色器与 WebGPU:验证兼容性和帧率

真正困难的图形内容。一个具有引力透镜效应的黑洞,会扭曲其背后的星空。拥有成千上万粒子的粒子系统。随着你的移动而生成的程序化地形。这些工作过去需要一个以编写GLSL为生的人来完成,而K3会先草拟,然后按照你设定的质量标准进行改进。诀窍是大声说出标准,「这应该看起来像一个演示场作品,而不是教程」,因为K3对标准的响应远比对指令的响应更好。

部分 2 :真实产品和界面

超越视觉装饰,K3 的前端优势转化为可交付的产品工作。

实验 5:落地页:验证视觉层级、响应式布局和可访问性

给它一个产品和一种美学(「野兽派」,「温暖的编辑风格」,「干净的金融科技风格」),它就会生成具有真实排版层次和布局意图的页面,而不是那种普通的 AI 模板风格。明确设定标准,它就能达到。

实验 6:全栈脚手架:验证前后端、数据和认证是否真正连通

描述产品、技术栈和功能,K3 将前端、后端、数据库模式以及认证层组合在一起,像整体连接的系统一样,而不是断开的片段。这不是一个玩具;它是一个可以从中强化的起始代码库,这正是其长期设计的目的。将完整的规格一次性提供给它,让它分阶段构建。

实验 7:实时协作:验证多客户端同步、重连和冲突处理

这是较弱的模型悄悄伪装的地方。实时状态必须在客户端之间同步,而不仅仅是保存到数据库中,而且这些错误只会在打开两个浏览器时出现。K3 处理 WebSocket 层、重连和多客户端同步,并且你可以强制它来验证工作。

实验 8:数据仪表板:验证计算、筛选和图表是否忠于数据

给它一个 CSV 文件和一个问题,它就能一次性创建一个交互式仪表板、图表、筛选器等。它在图表和数据推理方面是其文档化的优点之一,因此它不仅仅是绘制数据,还会对数据所显示的内容进行推理。

部分 3 : 严肃工程(长远视野的超级力量)

K3 是为在大型代码库中进行持续编码而构建的。如果你以写软件为生,这就是关键部分。

实验 9:全仓库任务:用可衡量目标验证长任务表现

使用 K3 的最强方法。不要给它一项任务,而是给它一个结果,让它工作直到数字变化。

实验 10:长上下文代码库:比较完整仓库与精选文件的效果

一百万令牌的窗口并不是炫耀的规格。你可以加载一个真正的代码库,并提出架构级别的问题、编写文档,或者追踪跨越几十个文件的错误,因为模型实际上可以看到整个内容,而不是猜测你没有粘贴的部分。这是K3与窗口较小的模型之间最大的实际差异:它对你的系统进行推理,而不是对其中的片段进行推理。不过,有一点值得注意,一个紧凑的 200 重要文件的 K 通常胜过臃肿的 900 整个 monorepo 的 K,因为它的长期实力来自专注,而不是数量。

实验 11:代码迁移:验证行为一致性和边缘情况

K3 在多语言软件工程方面处于最先进的水平,因此将服务从一种语言移植到另一种语言,或从一个框架迁移到其后续版本,完全在其能力范围之内,包括那些通常会被忽略的无聊边缘情况。因为它能够掌握整个项目的上下文,所以它可以在迁移过程中保持行为的一致性,而不是逐文件地翻译并悄悄改变代码的功能。

实验 12:长时会话:验证停止条件、预算和检查点

K3 可以长时间运行,基本无需监控,但只有在目标是可检查的情况下才能运行良好。「改进代码」会让它偏离方向。「让这个测试通过」或「达到这个基准」则给它一个可以持之以恒追求的具体目标。给长周期任务时,总是给它一个数字,而不是一种感觉。

部分 4 :代理、工具和研究

K3 在工具使用和网络研究基准中接近顶部,这使它成为一个操作员,而不仅仅是一个写作者。

实验 13:终端与浏览器协作:验证工具权限和错误恢复

它驱动 shell、浏览器和 API 调用而不会崩溃,这是每个真正代理任务所需要的连接组织。将它指向一个需要查询信息并据此行动的目标时,它会自己连接各个步骤,而不是在每个分叉点停下来问你该做什么。

实验 14:联网研究:验证原始来源、引用和交叉核对

K3 在浏览基准测试中处于领先地位。给它一个研究问题,它会搜索、阅读原始来源、交叉引用,并在以前浏览十个标签页所需的时间内返回结构化且带有引用的内容。

实验 15:并行任务:验证拆分、合并和重复结果

K3 有两种形式,Swarm 变体是为大规模并行处理而构建的:将一个大批量的任务同时分发给许多子代理,然后合并结果,而不是一次处理一个项目。

实验 16:多文档综合:验证覆盖率、冲突和可追溯性

将其指向一个PDF文件夹或一个大型研究语料库,然后请求一个综合输出、文献综述、比较表或摘要,它会处理整个集合并返回汇总结果,而不是十五个单独的摘要。

部分 5 :多模态与高效操作

K3 原生读取文本、图像和视频,这解锁了不同类别的工作。

实验 17:截图到代码:验证视觉接近度、交互和响应式布局

向它展示一个设计稿或界面截图,它就能编写出能够重现该界面的前端代码。原生视觉加上其前端能力,使它成为本列表中对任何构建用户界面的人最立刻有用的工具之一。

实验 18:图表与数学:验证数值提取、计算和单位

给它一张图表、一个图示或一张拍摄的数学题,它不仅描述图像,还会进行推理,提取数字,并对其进行处理,当任务需要实际计算时会借助 Python。被记录为其最先进的领域之一。

实验 19:视频输入:验证时间顺序、事件识别和证据定位

因为多模态输入包括视频,你可以直接提供视频片段作为上下文,而不是先进行转录,并让它推理屏幕上实际发生了什么。

实验 20:开放权重:验证许可、硬件、部署和维护成本

最大的权力举措是大多数人误解的那个。七月 27 ,K3 的完整权重在宽松许可下开放。对于一个认真的团队来说,这意味着在自己的硬件上自托管,在自己的数据上进行微调,仔细检查它的具体行为,并且不依赖任何 API 持续在线或条款保持有利。这种独立性,在一个接近前沿的模型上,才是实际重塑市场的部分。

在你深入之前的两个诚实警告

因为没有附加细则的超能力清单会让人浪费金钱并受伤。

不要把 K3 当作所有事情的默认选择。它的推理功能总是开启的。它会对每个请求都进行深入思考,这对于上面提到的二十件事情来说很棒,但对于格式化列表或重命名变量则显得荒谬。早期测试者看到它在本应该花费不到一分钱的任务上消耗了数千个推理代币。把琐碎的工作交给更小、更快的模型,把 K3 留给那些需要强大算力的任务。这是新用户最常犯的最昂贵的错误。

关于成本有一个相反的细微差别:K3 的 API 价格为 $3 每一百万输入令牌和 $15 每百万输出的成本属于中等,不算便宜,但它倾向于使用更少的输出令牌来完成实际工作,而不是像那些价格更高却啰嗦的模型一样得出相同答案。因此,评判它的诚实方式是按每完成任务的成本,而不是按每个令牌的成本。在它所针对的工作上,总费用通常比标价显示的要低。在琐碎的工作上,始终开启的思考会完全抹去这种优势,这也正是为什么路由很重要。

「开放权重」并不意味着「可以在你的笔记本上运行」。当权重在七月发布时 27 ,你不能在你的MacBook上下载K3。即使经过高度压缩,它的体积也远超过一TB,并且运行需要几十块加速芯片。开放权重是对能够自行托管的组织和能够进行微调的研究人员的礼物,而不是为你的游戏PC准备的私人模型。对于几乎所有人来说,「使用K3」意味着使用应用程序或API,而这是完全没问题的。

今天如何尝试

→ 聊天:kimi.com,即刻在线,这是运行上面每个提示的零设置方式。

→ API:与 OpenAI-SDK 兼容,因此从 OpenAI 或 Anthropic 设置切换只需更改基础 URL 和模型字符串,而无需重写。

→ 在你的代码库中:按照 kimi.com 上的官方说明安装 Kimi Code CLI,打开你的项目,并让它通过直接文件访问进行计划、编辑和测试。

→ 权重:完整开放版本计划于七月发布 27 ,这是从你租用的服务变成任何拥有硬件的人都可以拥有的东西的日期。

为什么这比基准测试更重要

先从提示中退后一步,因为背景才是真正的故事。

Moonshot 建立了 2.8 在美国对你通常需要训练如此规模模型的芯片实施了三年不断升级的出口管制下,他们依然开发出了万亿参数级的前沿模型。他们不是依靠原始计算能力,而是通过架构上的巧思实现的。随后,他们没有永远把它锁在 API 后,而是宣布会免费开放模型权重。这次发布的时间正好在上海世界人工智能大会前,这并非巧合。

有趣的问题从来不是「中国产能赶上了吗」。而是当一个自由开放的模式进入同一级别时,封闭而昂贵的前沿模型的经济学会发生什么。当前沿级能力不再只是三家公司才能销售的东西,而是任何资源充足的团队都可以获取时,封闭实验室的定价权就会改变。这种压力才是这里真正的事件,比任何单一的基准数值都更重要。

这个问题上也确实存在一个悬而未决的疑问。中国监管机构一直在讨论他们自己的人工智能出口规则,因此 K3 是那边最后一个重量级开源版本,还是众多版本中的第一个,目前尚不清楚。无论哪种情况,这个模型已经发布,并且不会回头。

真正的收获

三年来,这个交易很简单:美国实验室建造前沿技术,而其他人半年前可以得到一个更便宜的副本。Kimi K3打破了这一点。它是有史以来最大的开放模型,在盲测中对于前端代码,它是世界上第一的模型,并且一周后将免费开放。

它不是最便宜的代币,它不会登上每一个排行榜,而且你不会在家里运行它。这些都是真的,但这些都不改变标题:一个在构建事物方面超越封闭旗舰的前沿级模型即将属于每个人。

上面的二十个提示是你的起点。本周真正运行它们的人会知道这个模型能做什么,而其他人还在争论基准表格的时候。

大多数人会看到发布推文却从未打开模型。那些花一个晚上用它进行构建的人,将比整个时间表提前一个月。

测试结束后,只保留能够复现的结论。失败项同样要记录,它们能告诉你模型边界和人工成本。

如何尝试:
→ 聊天和应用:kimi.com
→ API:兼容 OpenAI-SDK
→ 开放权重:预计七月 27

最后把 20 项结果汇总成一张表:通过、部分通过、失败、人工修复时长和每次成本。下一次模型更新时,直接复跑同一套表。

把演示改成一组可复现测试

先选一个很小的项目,记录输入提示、模型入口、依赖版本、耗时、人工干预和最终测试。Kimi 官方平台提供 Kimi K3 API 快速开始文档;价格页按输入、缓存命中输入和输出 token 分别计费,具体金额具有时效性。

Claude Code 支持通过 ANTHROPIC_BASE_URL 把请求路由到代理或网关;设置 ANTHROPIC_API_KEY 后,会使用 API key 而不是已登录订阅。 第三方开发者不应替用户转发 Claude 订阅 OAuth 凭据。 所以接入兼容服务时,使用服务方明确提供的开发者密钥,并为测试设置独立预算和可撤销配置。

还要区分 Kimi API 的基础模型调用与 Kimi 助手的网页浏览功能,不能默认两者拥有相同工具。

建议把原文案例按难度分层:静态页面、带状态的前端、需要后端与数据库的应用、涉及认证或外部 API 的系统。每个案例都用同一份验收表检查功能、错误状态、安全边界和复现成本。这样得到的是实验记录,而不是一串无法核查的展示。