Kimi K2 Thinking模型深度测评:编程、写作与全栈开发能力实测,能否平替Claude Sonnet 4.5? AI超元域 2025-11-15

Kimi K2 Thinking模型概览与市场定位

月之暗面于昨日发布了Kimi K2 Thinking模型(一个支持边思考边使用工具的智能代理模型),该模型发布仅一天便在硅谷引发热议。其训练成本仅为460万美元,远低于OpenAI等巨头高达40亿美元的模型训练成本。在多项基准测试中,Kimi K2 Thinking模型超越了GPT-5和Claude 3.5,这直接挑战了OpenAI在行业中的地位。Kimi K2 Thinking模型是首个原生支持边思考边使用工具的Thinking Agent模型(一种无需人工干预即可自主完成复杂任务的智能代理),它无需人工干预即可自主完成高达300轮的工具调用。

此外,近期Claude切断了对Trade等国产IDE(集成开发环境)的API(应用程序编程接口)服务支持,许多用户也曾遭遇Claude封号的情况。值得庆幸的是,我们可以通过修改Claude Code(一个基于Claude模型的编程开发环境)的环境变量(指定运行环境参数的动态命名值),将Kimi K2 Thinking模型作为Claude 3.5的平替版本来使用。本期视频,我们将在Claude Code中使用Kimi K2 Thinking模型,通过编程开发、数学推理等多个实践案例,全面测评这款模型的综合能力。通过在Claude Code中调用Kimi K2 Thinking模型进行编程开发,我在现有ILS开源项目的基础上实现了新功能,并结合SuperBase(一个开源的后端即服务平台),实现了一个完整的背单词应用,包括前端代码、后端代码以及数据库。

文本生成能力测试:宋词创作对比

在演示之前,我们可以先测试Kimi K2 Thinking模型的文本生成能力,因为在创意写作基准测试中,Kimi K2 Thinking模型的表现也非常出色。我们直接在官方网页版中进行测试,在工具选项中开启“Thinking”模式。随后,我们输入提示词,要求它使用词牌名(中国古代诗词的一种固定格式名称)“长相思”创作一首宋词,以“江南夜雨孤舟夜薄”为意境,要求词风婉约含蓄,并严格按照词牌的格律(诗词的音韵和结构规范)。然后我们直接发送,看它能否生成一首完全遵循“长相思”词牌名的宋词。

为了更好地对比,我们也将同样的提示词发送给DeepSeek,让DeepSeek也创作一首宋词,随后进行对比。这里是Kimi K2 Thinking模型为我们创作的这首宋词,它严格遵循了“长相思”这个词牌的格律。这里是DeepSeek给出的宋词。随后,我们将这两首宋词发送给Gemini,让Gemini评判哪首词写得最好。

接下来,我们看一下Gemini对这两首词的分析:第一首Kimi创作的词胜在情感的层层递进与共鸣;第二首DeepSeek创作的词胜在景物的描写与意境的空灵。Gemini给出的结论是,它更倾向于第一首词,原因是第二首虽然技巧高超,但略显炫技,脱离了情感的朴素根基;而第一首Kimi创作的词情感层层递进,真正做到了情景交融,浑然天成。Kimi K2 Thinking模型创作的这首词,无论格律、押韵还是意境都写得非常不错。

Claude Code中Kimi K2 Thinking模型的配置与使用

接下来,我们就可以在Claude Code中使用Kimi K2 Thinking模型,通过更复杂的任务来测试这款模型的能力。首先,我们需要确保已从Moonshot平台创建好API Key(用于身份验证和授权访问API的密钥)。然后,我们打开终端命令(Windows用户打开CMD),直接使用Export命令来设置Claude Code的base URL。国内用户使用特定命令进行设置,海外用户则使用另一条命令,两者的区别在于域名不同(一个是.cn,一个是.ai)。Windows用户需要将Export改为Set,后面的命令保持一致。

接着,我们再用一条命令来设置Kimi的API Key,将其替换为我们刚才申请的API Key。这些都设置好之后,我们直接输入Cloud来启动Claude Code。然后,我们在输入框中输入斜杠/,再输入model,将模型ID指定为Kimi K2 Thinking Turbo模型,因为这个模型速度更快。大家也可以直接设置为Kimi K2 Thinking模型。当模型ID设置好之后,我们可以通过键盘上的type键来切换是否启用Thinking模式,这里我们选择启用Thinking模式。

编程能力测试:从二次函数到智能体开发

如何科学地评估AI的编程能力?我们可以用一个经典的案例——二次函数可视化,来展示同一个任务在不同复杂度下AI的表现情况。这里我们准备了两个版本的提示词,一个是基础版,一个是进阶版。像这个测试题可以测试大模型的数学推理、Python语法、Main Name API调用以及代码组织能力,因为这些是AI编程的核心基础。

首先,我们先看一下基础版的提示词,要求它使用Main Name可视化这个二次函数,显示函数表达式,绘制函数曲线,标注顶点和零点,并用动画展示函数的绘制过程。我们先用基础版的提示词进行测试,将提示词完整粘贴到Claude Code然后运行。五分钟后,我们再将难度提升到另一个维度。同样是二次函数,但这次要求它在三维空间中展示旋转的泡沫面。这里是完整的提示词,我们将其粘贴到Claude Code并运行。接下来,我们看一下最终的成果,其3D效果并不理想,生成的视频看起来不够美观,未能完全按照我们的提示实现。

接下来,我们可以选择一个开源的智能体框架进行测试。在Claude Code中,我们让Kimi K2 Thinking模型使用这个智能体框架为我们开发一个智能体。下面我们看一下我构建的提示词,要求它使用微软的AutoGen框架(一个用于构建多智能体对话系统的开源框架)开发一个代码优化的智能体系统。这里我们还指定了让它在智能体中使用Kimi的API和模型。功能需求是开发一个智能体,能够接收用户提供的代码片段,分析代码存在的问题,提供优化建议和改进后的代码,并且支持多轮对话。这里我们还要求它选择合适的UI实现易于交互的界面。然后我们将提示词完整地粘贴到Claude Code中,直接运行。

像这个测试题可以测试Kimi K2 Thinking模型的工具调用能力,因为它需要调用Claude Code中的工具来抓取这个智能体的文档以及代码案例,同时还能测试它开发复杂智能体等方面的能力。用时不到一分钟,它就完成了这个智能体的开发,并给出了详细的说明文档。接下来,我们在PyCharm(一个Python集成开发环境)中加载它为我们开发的智能体项目。然后我们就可以执行特定命令来启动带有UI的这个智能体。随后,浏览器中自动打开了这个UI界面。我们直接输入一段Python冒泡算法,让它进行优化。任务运行完成后,这里给出了问题分析,以及完整的优化后的代码。与未优化的代码相比,优化后的代码可以自动定义规则、支持简化并自动优化性能。这是我们通过让它使用微软的AutoGen智能体框架开发一个代码优化智能体所测试的结果。

工具调用能力测试:浏览器自动化与PPT生成

接下来,我们增加难度,在Claude Code中使用Chrome DevTools MCP(一个基于Chrome开发者工具的自动化控制协议)来测试这款模型的工具调用能力。我们看一下这款模型能否轻松自如地通过这个MCP来操作浏览器,执行自动化任务。我们需要在Claude Code中安装这个MCP,我们直接复制这条命令,回到Claude Code,先退出,然后直接粘贴这条命令并执行,这样就安装好了这个MCP。我们再启动Claude Code,再用MCP命令看一下这个MCP是否连接成功,这里提示成功。然后我们就可以输入提示词,让它使用Chrome DevTools MCP访问我的博客,并自动进入前三篇博客,提取每篇博客的标题、日期、正文,然后以JSON的格式输出。这里我们明确了它的输出格式,然后直接运行。

可以看到,它打开了浏览器并访问了我的博客。它点击进入第一篇博客,然后返回博客主页;接着点击进入第二篇博客,再次返回主页;最后进入第三篇博客。它很快执行完成,我们看一下它执行的结果,可以看到这里严格按照JSON格式进行了输出。这样,它就在Claude Code中通过这个MCP完成了浏览器自动化任务,而且执行速度非常快。

接下来,我们再测试一下它能否调用Skills(指模型或智能体可用的特定功能或工具集)为我们生成PPT。这里我们让它列出所有可用的Skills,其中就包含了PPT相关的Skills。然后我们就可以输入提示词,询问它过去12个月内哪些科技股的股价翻了一倍?如果有的话,其中哪些是2020年之前上市的?哪些是2020年之后上市的?最后,我们要求它调用Skill生成PPT。这里它给出了过去一年翻倍的科技股。我们直接打开PPT看一下效果,这是它生成的第一页内容,这里是第二页内容,包括核心发现。这里还给出了2020年前后的对比,以及为什么这个科技公司超预期,最后是未来的展望。可以发现,它生成的这个PPT总体来说比较原始,不是非常美观,可能它没有很好地调用Claude Code中生成PPT的Skill。这是通过Claude Code中的网络搜索功能并调用其Skill生成PPT来分析Kimi K2 Thinking模型的结果。

原生iOS应用与全栈应用开发测试

接下来,我们增加难度,使用一个原生的iOS应用程序,让Kimi K2 Thinking模型在这个源代码应用的基础上为我们添加新功能。这个项目是一款番茄专注应用(一种基于番茄工作法的时间管理工具),由Swift语言(苹果公司开发的用于iOS、macOS等平台的编程语言)编写。由于Swift语言的训练数据相对较少,我们可以更好地测试它用Swift语言为原生iOS应用新增功能是否能够顺利实现。我们可以先运行一下这个项目,看一下它目前具备的功能。它当前只具备25分钟的专注时长。然后我们就可以测试一下,让Kimi K2 Thinking模型为我们新增一个可以自定义时长以及选择时长的功能。

下面我们就可以输入提示词,要求为当前应用添加自定义专注时长功能,预设选项包括25分钟、45分钟、60分钟、90分钟,并且用户可以手动输入任意分钟数。我们直接运行。这里提示它已经为这个应用新增好了我们所需要的功能。接下来我们再测试一下。可以看到,这里它新增了可以选择时长的功能,还可以自定义时长,我们给它自定义一分钟。而且我们还可以选择这里默认的这些时间。通过测试可以发现,它成功为我们新增了我们所需要的功能,而且只用了一轮对话,它就全自动为我们完成了新增这个功能的任务。

接下来我们加大难度,让它开发一个全栈背单词应用(指同时开发前端和后端,能独立运行的完整应用程序)。前端技术栈要求是React(一个用于构建用户界面的JavaScript库)+Chakra UI(一个React组件库),后端技术栈是Node.js(一个JavaScript运行时环境)+Express(一个Node.js Web应用框架)+SuperBase。用到的数据库是SuperBase PostgreSQL(SuperBase提供的基于PostgreSQL的关系型数据库)。下面是SuperBase的相关配置,包括项目URL和所需的API Key。然后这里是关于前端相关的功能,包括单词学习、练习测试、学习进度和底部的导航。后端功能包括单词管理、进度追踪、练习系统、智能算法等,并要求移动端优先。下面这里要求它完整交付前后端代码和环境变量配置示例,还有SuperBase数据库表结构SQL代码以及本地启动说明文档。然后我们直接完整地将提示词粘贴到Claude Code中,直接运行。像这个测试题就可以更好地测试大模型的前端与后端能力。

在等待了大概五分钟左右,这里提示它已经为我们成功完成了这个项目。然后我们就可以按照它给出的一些步骤去操作。为了方便操作,我用VS Code(一个轻量级但功能强大的代码编辑器)打开了它为我们开发好的这个项目。然后我们先执行它给出的第一条命令,直接在终端执行,再执行它给出的前端命令。接着我们在SuperBase中运行这个文件。我们找到这个文件并复制其内容,然后粘贴这段代码并运行。我们可以启动这个应用程序,我们先启动后端,再启动前端。启动后,浏览器中出现了一个错误。然后我们将这个错误发送给Claude Code。

因为这个前端和后端结合的编程测试题难度要比前面我们测试的其他题目大很多,所以当遇到报错的时候,我们就会复制报错并发送给Claude Code,让它修复这些报错。这些错误修复之后,这里成功打开,显示的是单词卡片。我们看一下它能否播放单词的发音。这里可以正常播放单词的发音。然后我们点击看一下中文的解释,点击之后这里就显示了中文的解释。我们再点下一个,再查看解释,可以看到背单词功能是正常的。这里还有这些分类,这里还有等级。我们点击第二个,然后这里我们就可以来练习。我们可以测试一下,这里它出现了第一个选择题,然后我们可以选择一下,这里回答正确,再点下一个。这里也回答正确。然后我们再点击进度,这里查看一下进度,这里会显示这些进度。然后我们再点设置,查看设置,这里是相关的设置。可以看到它基本上我们要求的功能都实现了,只是这个UI界面的文字用的是英文。我们还可以让它去改成中文,为了节省时间,这里就不再演示了。它为我们开发的背单词应用总体来说非常不错。因为这个背单词应用包含了前端技术栈和后端技术栈,并且我们还使用了SuperBase PostgreSQL数据库,所以这个编程测试题对Kimi K2 Thinking模型来说是非常具有挑战性的。

总结与展望

通过我们在Claude Code中进行多方面的测试可以发现,Kimi K2 Thinking模型在编程能力方面确实有了比较大的提升。与Claude系列模型相比,它的编程能力大概处于Claude Opus 4.1与Claude Sonnet 4.5之间。与DeepSeek相比,它的编程能力要强于DeepSeek的最新模型。我们可以在Claude Code中使用Kimi K2 Thinking模型来替代Claude Sonnet 4.5模型,而且Kimi K2 Thinking模型的Token价格(指大型语言模型处理文本时,按最小处理单元计费的价格)远低于Claude Sonnet 4.5模型。

📌 文中提及的人物和组织

关键字: ai-model-evaluation canada large-language-model thinking tool