GLM-4.7 深度评测:开源编程巨擘,Agentic 能力直指顶尖模型 AI超元域 2025-12-23

GLM-4.7:开源编程与智能体任务的新标杆

智普AI近期发布了其最新的开源大型模型 GLM-4.7,这是一款专为编程和智能体任务设计的 MOE(Mixture of Experts)模型。GLM-4.7 在核心编程、Web Coding、工具调用及复杂推理方面取得了显著的性能提升。该模型拥有 35.8B 的参数,并采用了 MIT 开源许可证,允许商业使用。开发者已成功利用 GLM-4.7 从零开发了一个侏罗纪射击游戏,玩家可操控皮卡车上的机枪射击恐龙;同时,也在 Cloud Code 中开发了一款iOS原生背单词App。

官方发布的基准测试结果显示,GLM-4.7 在多项关键领域表现突出:

  • 数学竞赛:得分 95.7,显著领先 GPT-5.1。
  • 综合能力:超越 GPT-3.2 和 Claude 4.5。
  • 科学推理:优于 GPT-3.2 和 Claude 4.5。
  • 复杂推理:领先于 GPT-3.2、Claude 4.5 及 GPT-5.1。
  • 软件工程:紧随 GPT-5.1 和 Claude 4.5 之后,超越 GPT-3.2。
  • 浏览器能力:超越 GPT-3.2 和 GPT-5.1,明显领先 Claude 4.5。

这些测试结果表明,GLM-4.7 展现了强大的综合实力,在多项评测中甚至超越了 Claude 4.5 和 GPT-5.1。本视频将从编程、工具调用及复杂推理等多个维度深入测试 GLM-4.7 的实际表现。

跨领域生成能力演示

GLM-4.7 在前端编程、可视化与游戏开发方面展现了出色的能力。

1. SVG 生成太阳系动画 通过一句简单的提示词,GLM-4.7 成功生成了一个流畅的模拟太阳系动画。该动画精确描绘了八大行星围绕太阳公转的效果,并细腻地展现了行星轨迹以及土星的光环。

2. 前端冒泡排序动画 面对更复杂的挑战,GLM-4.7 被要求使用前端技术创建一个模拟冒泡排序的动画程序。该程序需包含12颗大小、颜色各异的小行星,一艘指挥舰,并通过可视化动画展示排序过程。小行星间的交换具有真实的移动效果,整体画面风格简洁流畅,富有太空感。程序成功实现了排序过程的可视化,并能在运行中显示“正在比较”和“正在交换”的状态,无任何报错。这一测试全面考察了模型在算法理解、前端技术选型、编程实践、动画交互设计及视觉美学等方面的整合能力。

3. 3D 恐龙狩猎游戏开发 为进一步挑战模型的极限,GLM-4.7 被要求使用 HTML5 Canvas 和 GSAP 创建一款 3D 风格的侏罗纪狩猎游戏。游戏需支持玩家操控一辆带有机枪的皮卡车,在充满原始森林、高大植物、起伏地形、岩石、河流及火山景观的侏罗纪环境中追逐恐龙。玩家通过鼠标瞄准,点击射击,皮卡车则通过键盘控制。该测试全面考察了模型在 3D 图形渲染、游戏引擎、架构设计、物理引擎、碰撞检测、AI 行为系统、多模态交互、视觉反馈集成以及复杂代码组织等方面的系统性工程与创意表达能力。生成的游戏效果逼真,玩家可操控皮卡车瞄准射击,不同体型的恐龙有不同的生命值表现,且远处有朦胧的雾气和高大的山脉景观。

4. 数学公式推导可视化 GLM-4.7 还被用于生成一个演示计算圆面积公式推导过程的 HTML 动画。该测试旨在考察模型对数学原理(如极限思想、几何推导)、Canvas 图形与几何变换、复杂动画编排、状态管理及教育可视化设计等方面的深度理解。动画清晰展示了将圆切割成多份并重排为近似长方形的过程,并通过参数调整(如将圆分割为64份)直观地呈现了推导原理,最终给出圆面积公式。即使对数学原理不熟悉的观众,也能通过此动画形象地理解圆面积的计算方法。

5. PPT 生成 模型还被要求根据一个关于 GLM-4.7 模型介绍的链接,直接生成一份 PPT。生成的 PPT 包含了模型介绍、核心特性、基准测试数据(包含截图)、三大思考模式以及模型优势等内容,结构清晰,展现了其在内容组织和格式转换上的实用能力。

Cloud Code 集成与复杂应用开发

GLM-4.7 不仅在 Web 端表现出色,还能通过 Cloud Code 平台进行更复杂的编程任务。

1. Cloud Code 环境配置与浏览器自动化 用户可通过 Zhipu AI 平台(海外)或 Baidu 平台(国内)访问 GLM-4.7。在 Cloud Code 中,通过设置 API URL 和模型 ID 后,即可调用 GLM-4.7。利用 Google 提供的 Puppeteer,GLM-4.7 被用于浏览器自动化任务,如访问用户博客,点击进入前三篇博客并提取内容,然后将提取的内容改写为 ExpoST 格式,并添加表情和标签。此任务运行速度快,改写效果出色。

2. 原生 iOS 背单词 App 开发 作为一项极具挑战性的测试,GLM-4.7 被要求开发一款支持 iOS 17、Swift 5.9、SwiftData 和 SwiftUI 的原生背单词 App。该 App 需包含首页内容、单词卡片正反面翻转(含 3D 翻转动画)、练习测试、学习进度跟踪等功能。模型成功完成了大部分功能开发,并可在 Xcode 中编译运行。用户可通过滑动卡片切换单词,点击翻转查看释义,标记“已掌握”。虽然“设置”功能未完全实现,但其在复杂原生应用开发、手势交互、动画设计、间隔重复算法、多模块架构组织及端到端产品交付能力方面的表现,充分证明了 GLM-4.7 强大的编程实力。

结论

通过多方面的测试,GLM-4.7 在编程能力方面实现了巨大提升。其在生成 SVG、前端交互动画、3D 游戏开发、数学可视化、文档自动化以及原生移动应用开发等领域都展现了卓越的工程实现和跨领域整合能力,使其成为开源社区及商业项目开发中的一个强大新选择。

📌 文中提及的人物和组织

公司/组织: Zhipu AI

产品/模型: GLM-4.7

关键字: ai-model-benchmark coding-assistant agentic-ai open-source-ai generative-ai