GPT-5.2编程能力深度测评:实测UI、算法、重构与全栈开发 AI超元域 2025-12-12

GPT-5.2模型概览与测评方法

OpenAI于今天凌晨发布了最新的GPT-5.2系列模型。官方发布的基准测试得分显示,GPT-5.2甚至超越了Claude Opus 4.5。在Codex(OpenAI推出的代码生成模型)最新版本中,以及OpenAI的浏览器中,都已集成了GPT-5.2模型。本期视频将重点测试这款模型的编程能力,以验证GPT-5.2的编程能力是否有了真正的提升。此前在GPT-5.1发布时,曾进行过一期测评视频,结果显示GPT-5.1的效果并不理想。尽管当时评论区有不少反对声音,但几天后,开发者群体在社区中普遍反映GPT-5.1甚至不如GPT-5.0,这证实了测试案例能真实反映模型能力。因此,本期视频将继续采用多种具有代表性的案例对GPT-5.2进行测试。如果GPT-5.2的编程能力确实很强,那么它肯定能很好地完成测试题;如果编程能力不强,那也不能归咎于测试题难度过高。

官方网页版初步测试:知识库与UI复刻

首先,在ChatGPT(OpenAI开发的聊天机器人)官方网页版中,我们先提问了它的知识库截止日期。它给出的知识库截止日期是2025年8月,这个日期非常新,甚至比Claude Opus 4.5还要新。

接着,我们准备了一张复杂的仪表盘UI截图,用于测试GPT-5.2的前端UI能力。我们输入提示词,要求它用最适合的前端技术百分百复刻这个仪表盘,并指示它直接截取UI截图中的图像,不要使用占位符(placeholder)。由于我们选择的是GPT-5.2 Think模型,整个思考过程耗时5分33秒,等待时间相当长。随后,它给出了完整的代码。打开代码后,我们看到了它复刻的仪表盘UI界面,效果非常不错。原图中的火箭图标也成功复刻了出来。虽然原图左侧侧边栏的图标没有被还原,但它预留了位置。总体而言,它根据UI截图还原的仪表盘效果令人满意。

SVG生成与动画实现能力测试

接下来,我们测试了GPT-5.2的SVG(Scalable Vector Graphics: 一种用于描述二维矢量图形的XML标记语言)生成能力。我们要求它用SVG绘制一猫一狗在草地上一前一后漫步,天空中有太阳、云朵和飞翔的鸟。生成后,画面是静止的。我们追加提示词,要求实现真实的动画效果。然而,它并没有实现真实的猫狗走动以及云朵飘动的效果,只是在画面中添加了一个跳动的虚线。由此看来,GPT-5.2在SVG代码生成能力方面相对较弱。

复杂算法与图形动画测试

随后,我们让GPT-5.2使用Minim(一个用于Python的创意编码库)和Pygame(一个用于Python的跨平台游戏开发库)创建一个可运行的动画,模拟“鹅和鸭子算法”。具体要求是画面中有12只大小不同的鸭子和一只更大的鹅,鸭子排成水平线,鹅用冒泡算法来检查并交换鸭子,使它们从小到大进行排序。这道算法题旨在测试大模型的结构化任务分解、算法逻辑与程序思维、代码生成与模块化编程能力、图形与空间建模能力,以及动画时序与状态管理能力。

直接粘贴提示词并发送后,代码生成完成。按照提示运行后,画面比较简洁。这只鹅看起来不太像鹅,但它正在对鸭子进行冒泡排序。排序过程完全正确,鸭子按照从小到大的顺序排列。然而,画面过于简单,鸭子和鹅的特征区分不明显。

浏览器自动化能力测试

接下来,我们在OpenAI的Atlas浏览器中使用GPT-5.2测试了这款模型的浏览器自动化能力。任务提示词是让它分析特斯拉股票,并将分析结果填入Google Docs(谷歌提供的在线文档编辑工具)中。在Atlas浏览器中选中“全自动模式”,让它全自动执行此任务。

输入提示词并点击发送后,我们开启了倒计时,观察任务完成所需时间。它开始自动化执行,但似乎并没有直接访问我们提供的网站,而是直接生成了代码。随后,它打开了我们告知的网站,进入了特斯拉股票相关的页面,并自动进行了点击。在等待了8分40多秒后,它仍未进行接下来的操作,并且出现了一个严重问题:由于分析消耗了过多的CPU,我的电脑风扇狂转并开始发烫。鉴于已等待近10分钟仍无进展,我们终止了此测试任务。

Codex深度编程测试:3D可视化与智能体重构

我们开始在Codex中进行更深度的测试,确保Codex已升级到0.7.10版本,并选择了GPT-5.2模型。

第一个测试题是使用Minim实现数学公式可视化,要求Minim创建一个三维可视化动画,展现二次函数的立体几何特性。此题目旨在测试GPT-5.2的数学与几何理解能力、3D可视化与空间推理能力、Minim专业工具的掌握能力以及视觉设计与美学能力。

粘贴提示词并发送后,它提示先扫描仓库是否有相关文件,然后开始创建计划并生成代码文件。在等待了大约27分钟后,任务完成。我们查找并打开生成的视频,播放后,画面出现转动,展现了二次函数的动画视频。总体而言,视频效果比较粗糙,并未做到非常精细化。

随后,我们加大了难度。我们让Codex将微软的智能体框架AutoGen(Microsoft开发的用于构建和管理多智能体系统的框架)编写的旅游规划智能体重构为使用谷歌AK(Google AI Agent Kit: 谷歌的AI智能体框架)智能体框架的代码。提示词中,我们先让它阅读谷歌AK的官方文档,然后进行重构,并要求使用MTR(假设这里是某个API名称,原文未明确,此处按音译处理)的API,并提供了MTR相关的官方文档。重构后的智能体需保持原有逻辑和功能,并加入谷歌官方的UI界面。我们还提供了微软AutoGen智能体框架的旅游规划智能体的完整代码。这个测试案例非常实用,因为许多开源智能体项目后来不再维护。此测试题可以测试大模型的信息检索与文档理解能力、代码理解与分析能力、跨框架迁移与重构能力,以及API集成和多任务协调能力。

为了方便演示,我们在PyCharm(一个Python集成开发环境)中使用Codex输入完整的提示词并发送。它开始抓取这些智能体框架的官方文档。等待10多分钟后,它成功完成了将智能体代码从AutoGen框架重构为Google AK框架,并将大模型的API换成了MTR。

运行项目并在浏览器中打开UI界面后,我们输入任务:“规划3天的尼泊尔旅行计划”,然后运行。结果显示,第一个智能体给出了完整的行程,然后是第二个智能体和第三个智能体给出的优化建议。然而,这个运行逻辑并不符合AutoGen智能体框架代码的运行逻辑。AutoGen框架的旅游规划智能体代码的运行逻辑应该是:第一步由制定计划的智能体输出计划;第二步由当地向导输出与当地相关的特色;第三步由语言专家智能体输出与当地语言相关的内容;第四步由最终总结的智能体输出三天的总结。但Codex给出的AK智能体框架代码的运行逻辑不符合AutoGen代码中的逻辑,而且它似乎陷入了死循环,一直在运行。由此看来,在Codex中使用GPT-5.2模型,虽然能够实现将AutoGen代码重构为Google AK框架代码,但它并未保持AutoGen代码中的运行逻辑。

iOS项目重构与全栈平台开发

我们再次加大难度。这是一个原生iOS(苹果公司开发的移动操作系统)项目,该项目曾在使用Cloud Code(假设是某个云端开发环境或工具,原文未明确)中的Claude Opus 4.5一次性完成开发,且没有出现任何报错。我们用这个项目来测试Codex能否对其进行重构。该项目采用了MVVM(Model-View-ViewModel: 一种软件架构模式,用于将用户界面与业务逻辑分离)架构模式。我们使用Codex将其从MVVM架构模式重构为MV+Observable(结合了Model-View模式和响应式编程中的可观察对象概念的架构模式)。

粘贴提示词并运行后,等待8分多钟,它提示已将项目从MVVM重构为MV+Observable。回到Xcode(苹果公司开发的集成开发环境),重新运行项目,确认能否正确运行。项目成功运行,功能正常。在设置中设置主题等功能也正常。通过对比项目仓库中文件的原有代码,可以发现Codex确实将项目代码重构为MV+Observable,它对这个任务的完成效果非常不错。

最后,我们让GPT-5.2开发一个全栈项目:一个现代化的宠物领养平台MVP(Minimum Viable Product: 最小可行产品)。要求前端框架使用Next.js(一个基于React的开源Web开发框架),样式使用Tailwind CSS(一个实用工具优先的CSS框架),后端和数据库使用Supabase(一个开源的Firebase替代品,提供数据库、认证等服务)。核心功能要求包括用户系统、宠物展示、领养流程、宠物发布及其他功能,并提供了详细的数据库设计。UI方面要求响应式布局、现代化简洁的视觉风格、温暖友好的配色、流畅的动画和过渡效果。此任务旨在测试GPT-5.2的全栈开发能力,包括技术栈整合、系统架构设计、数据库建模、前端UI、测试认证安全、复杂业务逻辑处理以及代码质量把控。

粘贴完整的提示词并运行后,它提示需要确认6个问题:优先邮箱登录、宠物类型(猫狗及其他)、年龄展示(以月龄为主)、地区字段(城市字符串)、领养申请表(通用字段),以及仓库是否为空。输入这些信息后发送,它制定好了计划并开始开发,生成了项目代码。

经过几轮错误修复后,我们开始测试项目能否正常运行。配置Supabase的步骤已完成,项目启动成功。打开后,我们看到了宠物领养平台的主界面。然而,主题切换功能没有实现,点击切换后没有任何改变。底部还出现了报错,我们将报错粘贴并发给Codex,让它修复。

我们点击登录和注册功能进行测试。注册账号后,点击登录,提示邮箱未验证。进入邮箱验证链接后,成功登录。登录后有一个小bug,页面仍会显示“登录”。我们询问Codex如何以发布者的身份登录,它给出了设置方式。我们将邮箱替换为自己的邮箱,登录后访问它提供的链接,进入发布界面。输入宠物名称、类型、性别、月龄后点击发布,提示“功能骨架已就绪,下一步拉取当前用户派s”。重新登录后,尝试领养宠物。点击“提交领养申请”后,没有任何响应,可能该功能尚未完全实现。但最基础的注册、登录、发布宠物信息等功能,它还是实现了。

总结

通过本次测试,可以发现GPT-5.2这款最新模型,相比之前被认为最难用的GPT-5.1模型,其编程能力确实有了一定的提升。

📌 文中提及的人物和组织

公司/组织: OpenAI, Google, Microsoft

产品/模型: Claude Opus 4.5, GPT 5.1, Codex, ChatGPT, Next.js