开发者必看!Codex新增Agent Skills!GPT-5.2-Codex三大编程任务实测,结果出乎意料!实战开发iOS App,它真的能取代程序员吗?到底是“生产力核弹”还是“又慢又贵”? AI超元域 2025-12-20

在发布Agent Skills两个月之后,OpenAI现在终于支持Agent Skills了。现在,我们就可以在Codex的最新版中使用Agent Skills。同时,OpenAI官方还发布了GPT-5.2-Codex模型,我们只需要确认Codex已经升级到最新版,然后用斜杠命令加model就可以查看GPT-5.2-Codex模型。我这里选择的它的推理级别选的是high,这里也支持extra-high。通过我一上午的使用,发现GPT-5.2-Codex模型,它最大的缺点就是速度太慢了。像一个简单的任务,它可能需要耗费5分钟,甚至更长时间。本期视频我们将在Codex中测试一下Agent Skills的使用方式以及效果,并且在Codex中重点测试GPT-5.2-Codex模型的编程能力。

Agent Skills 详解

好,视频的开始,我们可以先简单回顾一下Agent Skills。对不了解Agent Skills的用户来说,我们可以先通过讲解一下什么是Skills。Skills的本质就是把人类的专业知识,还有工作流程,用机器可以理解的方式固化下来,让AI agent能够稳定、可控、可复用的来执行任务。这样的话就能将AI从聊天助手变成了可控的工程工具。我们可以将没有使用Skills的AI或者AI Agent理解为一个非常聪明,但没有经过培训的员工,每次布置任务都需要口头讲一遍规范。有了Skills就相当于给员工配备了工作手册,所有流程和规范都写在里面,AI Agent就可以随时翻阅。

比如说我们再让AI写测试的时候,如果没有Skills,每次我们都要告诉AI帮我写测试,要使用test覆盖率达到多少以上,命名规范是怎样的?每个测试都要怎样怎样。然后AI就会按照我们的提示词来写测试。当后续我们再要求AI来写测试的时候,我们还需要重复一遍之前所用到的提示词,这样非常浪费时间。但是有了Skills之后,我们可以将测试做成Skills,也就是将所有的测试规范脚本,还有模板都放入Skills文件中。当给AI配置好这个Skills之后,我们再需要测试的话,直接告诉他,帮我写测试。那么AI就会完全按照这个Skills里的这些测试规范脚本,还有代码自动为我们执行测试。

相比MCP,Agent Skills非常节省token,当启动时只加载Skills的名称和描述,而且可以根据任务自动匹配。而且Skills在执行时才会完整的加载Skills里的所有内容,还有附属资源。所以有了Skills的支持,我们就可以为Codex增加各种技能,以及增加各种知识。

Codex 中使用 Agent Skills

在Codex中使用Agent Skills非常简单。首先我们要确保将Codex升级到了最新版本,然后我们再用命令打开Codex的配置文件。在features这里,我们要将skills设为true。下面这里还给它设置了权限。这些设置好之后,我们直接保存,并且关闭就可以。然后我们再启动Codex,再使用斜杠命令来查看Skills。这里有自带的三个Skills,这个PPTX、还有这个都是我手动安装的。想安装Skills非常简单,我们只需要选择这个install Skill,在后面我们就可以输入Skills的仓库链接。比如说我这里使用roensci的Skills仓库,我们可以进入这个文件的路径,这里面就列出了非常多的Skills。比如说我这里找一个前端设计的Skill,然后直接完整的复制它的链接,再回到Codex,我们直接粘贴这个链接,直接运行就可以,它就会为我们安装。我们刚才选择的这个Skill这里安装成功,我们只需要重新启动一下Codex,就可以看到我们刚才安装的这个前端设计的Skill。然后我们就可以选择这个Skill,在后面我输入了提示“开发一个登录页的UI”。可以看到这里它读取了skill.json文件,这里提示它使用前端设计的Skill完成了登录页的UI。然后我们打开这个页面看一下效果。打开之后,我们就可以看到这个登录页设计的非常不错,非常美观。

PPT 制作测试

下面我们还可以测试一下,让他为我们制作PPT。然后我们输入命令,找到做PPT的这个Skill。我输入的提示词是“把这篇关于介绍Agent Skills的文章,做成8页的PPT, 受众是开发者,风格是极简,深色,语言是中文”。这里是要输出的文件名,这里就是介绍Agent Skills的文章链接,也就是这一篇文章。然后我们直接发送。在等待了几分钟之后,他终于制作完成。然后我们打开这个PPT看一下效果。他确实制作了8页PPT,可以看到他制作的这个PPT效果还是比较不错的,完全符合我们要求的深色极简风格,并且用中文介绍了Agent Skills。

GPT-5.2-Codex 编程能力测试

下面我们就可以在Codex中测试GPT-5.2-Codex的模型。在测试之前,我们可以先看一下官方给出的GPT-5.2-Codex模型的基准测试。在SWE-bench Pro这个基准测试中,GPT-5.2-Codex达到了56.4,超过了GPT-4以及GPT-5.1。在另一个基准测试中,GPT-5.2-Codex也超过了GPT-4以及GPT-5.1 Max。

UI 复刻

好,下面我们开始在Codex中通过几个案例测试一下GPT-5.2-Codex模型,它的真实能力到底怎样?好,下面我们准备一张UI截图,然后让Codex为我们复刻这个UI。然后我们看一下它复刻的UI效果怎么样。然后我们就可以输入提示词,“用最适合的前端技术复刻这个UI页面”。后面我们就跟上这个图像,然后直接运行。在这里可以看到,它调用了前端设计的Skill。在等待了19分45秒之后,它终于为我们完成了这个UI的复刻。UI复刻耗时太久,我们如果用Cloud Code的话,基本上不到一分钟就能复刻完成。然后我们打开看一下它复刻的效果,可以看到它复刻的UI总体还算可以。然后这些表格内容跟原图相比,效果还算可以。它复刻的第二个表格跟原图相比的话,确实非常不错,它基本保持了原图中的这些布局,还有样式。

框架迁移

好,接下来我们再用一个非常简单的智能体框架转换题来测试,让它将Microsoft的智能体框架编写了一个旅游智能体的简单代码重构为Google ADK智能体框架。可以看到这个旅游规划的智能体代码非常少,甚至不到100行。但是我们上次在测试GPT-4的时候,它没有实现,将这个智能体代码重构为Google ADK框架的代码。好,下面我们可以看一下这个提示词,先让它阅读Google ADK的官方文档,然后告诉他将这个旅游规划的智能体代码重构为Google ADK框架的智能体代码,要求保持原有智能体的逻辑和功能,并为重构后的智能体加入UI操作界面。然后下面这里就是刚才我们查看的不到100行的旅游规划的智能体代码。我们直接完整的复制这个提示词,然后粘贴到Codex,并且执行。像这个简单的任务,我们就直接用Web Code的方式,让它直接阅读文档和代码,并且直接进行改写。像这个测试题可以测试GPT-5.2-Codex模型的信息检索与文档理解能力,还有代码理解与分析能力,以及跨框架迁移,还有重构能力,还能测试多任务协调能力。所以这个题目用来测试GPT-5.2-Codex模型还是非常适合的。在等待了9分53秒之后,它终于完成了将旅游规划智能体的框架重构为Google ADK框架。下面我们就按照它给的步骤运行一下这个项目。打开之后,我们看到了这个UI界面,然后再输入框,我们就可以输入任务,让它规划3天的尼泊尔旅行,我们直接发送。下面我们看一下这个智能体的执行步骤,还有结果是否正确?首先是输出的3天的尼泊尔旅行的一个简单计划。第二部分是当地特色,还有深度体验,这个是没问题的。然后第三部分它给出了一个最终的旅行规划。在Microsoft智能体代码中,这里还包含这个当地的语言专家,会给出当地的这些常用语。但GPT-5.2-Codex,它改写后的这个代码就缺少了语言专家这个智能体。所以这个测试题虽然它耗时将近10分钟,但它并没有复刻Microsoft的这个旅行规划智能体所有的执行流程,还有逻辑

iOS App 开发

好,下面我们准备一个更加复杂的开发项目,让它开发一个iOS原生背单词应用。这里给出了应用名称,目标用户,这里是具体的技术要求,而且要遵循MVVM架构模式,并且使用的UserDefaults进行数据持久化,还要实现单词发音功能,还支持深色浅色模式。这里是具体的界面结构,包括首页、练习、还有进度、还有设置。下面这里就是核心的功能,包括单词卡片、还有发音功能、还有收藏等。这个测试题我用来测试Cloud Code,Cloud Code能一次给出完全可以正确运行,而且包含所有功能的代码。在开发之前,我们先用Xcode初始化一个项目。这里我们就选择iOS,选择App,下一步,这里我们就输入项目名称,然后我们选择一个文件夹。然后我们打开终端命令行,切换到刚才的路径,再打开Codex。我们先用init命令,让它来创建agent文件。这样的话,它就能学到我们初始化后的这个项目的这些内容。好,这里运行完成耗时将近2分钟。由于这个测试题目比较复杂,所以在Codex中,我们可以先让它为这个开发任务制定计划。我们直接调出它的计划模式,然后粘贴这个提示词,直接运行,先让它根据我们的开发需求来制定一个完整的计划。好,可以看到这里它调用了制定计划的Skill,它这里只耗时48秒,就完成了计划的制定,这个速度还是非常快的。然后这里他询问是否需要调整细节。第二个就是直接实现。第三个就是保存到这个目录。然后我们这里就让他根据计划直接实现。由于这个项目比较复杂,它开发估计需要非常长的时间,我们直接略过这个开发步骤,直接跳到它开发完成的步骤。这里耗时将近33分钟,终于完成了这个项目的开发。下面我们在Xcode中测试一下这个项目能否正常运行。我们先点击运行,看一下能否正常的编译。好,这里提示报错。然后我们直接先复制一些报错,发给他,让他来修复。这里修复完成,我们再测试一下。好,这里提示编译成功。好,这里又出现了报错,然后我们将报错发送给Codex,Codex这里提示修复完成。然后我们再运行一下,看一下这次能否正常的执行。然后还是出现了报错,我们还是让它来修复。好,这里提示修复完成,我们再运行。这里还是报错,我们还是发送错误给他。然后我们再运行,还是出现报错,我们还是让它继续修复。好,这里修复完成,我们按照它的提示,清空一下模拟器,然后我们重新运行。好,这里终于能正常打开这个App。但是这个界面既然是英文的,它没有用中文的。可以看到这里可以正常做练习。这里终于加载出了单词,可以正常翻转。可以听到能够正常播放声音。

下面我们让Cloud Code分析一下,它开发的这个项目是否遵循了我们提示词中的MVVM架构模式。然后我输入提示词,“检查这个项目是否符合MVVM架构模式”,直接发送Cloud Code。很快输出了回答。我们看一下,他说这个项目部分符合MVVM。然后这里提到了所有代码都在这个文件中,约2000多行。然后我们在Xcode中查看一下。可以看到这个文件中的这些代码真的达到了2000多行。然后这里就是需要改进的地方,应该拆分为多个文件。并且这里给出了典型的MVVM事例。通过Cloud Code分析,我们就发现了这个非常不应该存在的问题。它将2000多行代码都放在了这个文件中,这是非常不应该的

好,通过测试可以发现,GPT-5.2,它确实相比之前的GPT-5.1有了一些提升。好,本期视频就做到这里,欢迎大家点赞、关注和转发,谢谢大家观看。

📌 文中提及的人物和组织

公司/组织: OpenAI

产品/模型: Codex

关键字: ai-agent code llm tool