GPT-5.1模型概述与测试范围
OpenAI于今日凌晨发布了GPT-5.1(OpenAI最新大型语言模型)系列模型,用户可在ChatGPT中直接使用。该模型提供了“即时(Instant)”和“思考(Thinking)”两种模式供选择。我们曾尝试让GPT-5.1通过代码生成模拟冒泡排序(Bubble Sort: 一种简单的排序算法,通过重复遍历列表,比较相邻元素并交换位置,直到列表排序完成)的动画,以实现鸭子从小到大排序的效果。
GPT-5.1是GPT-5的重要升级版本,专注于提升智能对话体验和个性化功能。在简单任务上,其速度比GPT-5提升了两倍;在复杂任务处理深度方面,也提升了两倍。此外,它的幻觉出现概率降低了56%,并具备多项个性化预设选项。其中,GPT-5.1即时模式(GPT-5.1 Instant: 速度优先,适合日常对话)以速度优先,适合日常对话使用。它具有更温暖、更自然的语气,并能根据任务复杂度决定是否需要深度思考,因此适用于日常对话、快速查询和自动化任务。而GPT-5.1思考模式(GPT-5.1 Thinking: 适合深度推理和复杂任务)则适合深度推理和复杂任务。它具备高级推理能力,能动态分配思考时间,对简单任务可快速处理,对复杂任务则进行深度分析,适用于编程、数学、研究和数据分析等场景。用户还可以根据不同场景和个人喜好,深度定制ChatGPT的回答风格。
值得注意的是,本次GPT-5.1更新仅针对ChatGPT中的模型,Codex(OpenAI的编程模型)中的模型目前尚未更新,仍为GPT-5 Codex模型。当尝试通过命令指定使用GPT-5.1模型时,Codex会显示无法正常响应并持续重连。因此,本期视频将重点在ChatGPT网页版中,对GPT-5.1模型的超长文本生成能力、编程能力以及在Atlas浏览器(OpenAI的浏览器,支持Agent Mode)中的浏览器自动化能力进行多方面测试。我们将使用多种具有代表性的题目进行深度测试,并与Claude 3 Sonnet 4.5(Anthropic公司开发的大型语言模型)进行横向对比,以评估两款模型的真实实力。
知识库截止日期对比
在知识库截止日期方面,GPT-5.1的知识库截止到2024年6月,而Claude 3 Sonnet 4.5模型的知识库截止日期是2025年1月。由此可见,Claude 3 Sonnet 4.5在知识库更新程度上优于GPT-5.1。
超长文本生成能力测试
接下来,我们首先测试GPT-5.1的超长文本生成能力。在日常使用中,我们发现GPT-5的长文本输出能力相对较弱,而Claude 3 Sonnet 4.5则表现出极强的长文本输出能力,可一次性生成数万字内容。为此,我们使用相同的提示词,要求两款模型根据指定规则和提供的开源项目仓库,生成一份关于该开源仓库的学习分析报告,并要求生成万字长文。
为确保公平性,Claude 3 Sonnet 4.5和GPT-5.1均开启了“思考模式”。我们将相同的提示词同时发送给ChatGPT和Claude 3 Sonnet 4.5,以观察它们对开源智能体框架学习报告的生成情况。
通过字数统计工具对比两款模型生成的学习报告,GPT-5.1的总字符数为31,000余字,不含空格字符数为25,000余字,中文字符数为6,900字。相比之下,Claude 3 Sonnet 4.5的总字符数为51,000余字,不含空格字符数为39,000余字,中文字符数为12,000余字。通过对比发现,在超长文本生成能力方面,Claude 3 Sonnet 4.5远超GPT-5.1,总字符数多出约2万个,中文字符数多出约5,000字。因此,在需要生成超长文本的场景下,Claude 3 Sonnet 4.5的表现明显优于GPT-5.1。
公众号文章生成能力测试
随后,我们继续测试两款模型的文本生成能力,在刚才的项目分析报告基础上,要求它们撰写一篇1,000字左右的公众号文章,介绍该智能体,内容需涵盖使用方式等,并要求语言风格为人类自然语言。同样的提示词也发送给了Claude 3 Sonnet 4.5。
对比两款模型生成的公众号文章,在不含空格的字数方面,GPT-5.1生成了5,100余字,而Claude 3 Sonnet 4.5生成了2,400余字。中文字符数方面,GPT-5.1为1,600余字,Claude 3 Sonnet 4.5为1,400余字。由此可见,Claude 3 Sonnet 4.5的字数更接近我们要求的1,000字左右。
接着,我们对比文章的风格和质量。为了快速评估,我们将两篇文章提交给Gamut 2.5 Pro(一款AI比较工具)进行比较。比对结果显示,GPT-5.1生成的文章是面向开发者和AI工程师的技术文章及上手指南,而Claude 3 Sonnet 4.5生成的文章则是面向大众、管理者或技术爱好者的科普文。GPT-5.1文章的优点包括结构清晰、技术准确、代码实用、视野开阔且引用规范,但缺点是受众门槛较高。Claude 3 Sonnet 4.5文章的优势在于比喻生动、能抓住痛点、上手简化,缺点是没有进行深入分析,给出的代码也比较简单。总体来看,Claude 3 Sonnet 4.5的文章更为通俗易懂,即使是完全不懂技术的读者也能轻松理解什么是智能体;而GPT-5.1的文章则更适合有技术背景的读者阅读。
诗词创作能力测试
随后,我们加大难度,要求两款AI根据指定的词牌名(中国古代词的一种固定格式)创作一首宋词。我们直接输入提示词,要求它们以“望海潮”(望海潮: 中国古代词的一种固定格式)词牌名,创作一首描绘秋去冬来、慨叹时间流逝的宋词,并严格遵循词牌格律。
在等待了约50秒后,Claude 3 Sonnet 4.5率先完成了宋词创作,而GPT-5.1仍在思考中。我们首先审视Claude 3 Sonnet 4.5按“望海潮”词牌名创作的这首词,其完成度近乎完美。上阙首句“双染苍临,风吹落叶,西窗又见秋蚕”提及了霜、风、落叶等意象;次句“雁阵惊寒,河池凋敝,七七几度平澜”则描绘了南飞大雁和凋零的河野,这些都是经典的秋景意象。接下来的“流水绕空山,叹年华四界,白发升班,往事如烟,浮生若梦奈何天”两句也极富意境,提及了白发和往事如烟。上阙整体表现非常出色。然而,下阙首句“东临春去匆忙,问人间岁月几度循环”中的“春去匆忙”与我们提示词中“秋去冬来”的主题略有不符。次句“病染风霜,心怀旧事茫茫,事路谁安”中的“病染风霜”与上阙的“白发升班”有重叠之嫌。但下阙最后两句“独坐对寒言,听闫林夜想,感慨无边,回首当年盛景,都赋予云烟”写得非常不错。总体而言,这首词意境深远,无论是写景还是慨叹时光流逝,基本符合提示词要求,并严格遵循了“望海潮”词牌格律。
接着,我们审视GPT-5.1创作的“望海潮”。其前两句“双峰渐近,书林欲尽,残阳又坠天涯,寒眼横空,如花待雪,书中远度萍沙”提及了双峰、书林、残阳、寒雁、如花、远钟和萍沙等秋景意象,描绘得相当不错。然而,接下来的“小巷所焉离,新皇府啊,岁序换人家,孤管夜无眠,酒播难留年华”两句中,一句显得较为生硬,特别是“新黄”(刚萌发的竹笋)一词,与我们要求的秋去冬来的意境不符。再看下阙的前两句“清双,亲小创杀,叹流年暗幻,并影天华”,其中“双”字在第一阙中已出现,在此处重复,且此句亦不太通顺。接下来的“一夜飘零,回头进往室,并影天双华”一句与前一句明显重复。最后几句“但常姑贺业遇共天涯,欲把余生豪景都赴一杯霞”中,提及“业余”和“霞”显得非常生硬。综上所述,GPT-5.1创作的这首词虽然遵循了“望海潮”的格律,但总体意境和贴切度不如Claude 3 Sonnet 4.5。
前端开发能力测试
SVG动画生成
接下来,我们测试GPT-5.1的前端(Front-end: 指网站或应用程序中用户可以直接看到和交互的部分)生成能力。首先,我们要求它使用SVG(Scalable Vector Graphics: 可缩放矢量图形,一种基于XML的图像格式,用于在Web上显示二维图形)生成一只在草地上行走、具有真实走路动画效果的猫和狗,它们一前一后,天空中还有云和飞鸟。观察GPT-5.1生成的SVG,其猫狗形象难以辨认,云朵和飞鸟也较为简陋。对比Claude 3 Sonnet 4.5的生成结果,其猫狗形象清晰可辨,云朵飘动,鸟儿翅膀煽动,形象逼真。显然,Claude 3 Sonnet 4.5的生成效果优于GPT-5.1。
UI仪表盘生成
随后,我们对比两款AI的UI(User Interface: 用户界面)生成能力,输入相同的提示词,要求它们创建一个“风箱管理仪表盘”。Claude 3 Sonnet 4.5生成的仪表盘效果非常出色,配色、元素和字体效果均表现优异。反观GPT-5.1生成的页面,其效果明显逊色于Claude 3 Sonnet 4.5,尤其在配色方面使用了深黑色,视觉效果不佳。
页面截图复现
接着,我们提供一张前端页面的截图,要求GPT-5.1复现该页面。首先观察Claude 3 Sonnet 4.5的还原效果,其表现非常出色,由于未提供页面图像,它使用SVG生成了相应图像,配色、布局和页面结构与原图对比,还原度极高。GPT-5.1还原的页面效果也尚可,但其还原的页面背景色不如Claude 3 Sonnet 4.5更贴近原图。
3D魔方游戏开发
随后,我们加大难度,要求两款模型使用Three.js(Three.js: 一个跨浏览器JavaScript库和应用编程接口,用于在Web浏览器中创建和显示动画3D计算机图形)开发一个3D魔方游戏。此题目可综合测试大模型的技术实现能力,包括对Three.js 3D图形库、WebGL(Web Graphics Library: 一种JavaScript API,用于在任何兼容的Web浏览器中渲染交互式2D和3D图形)渲染原理的理解,以及算法设计能力和交互逻辑处理(如鼠标拖拽)。同时,它还能测试大模型的空间思维能力,包括理解3D空间中的旋转、魔方的立体结构和层级关系。因此,这个看似简单的测试题实际上能考察大模型的诸多能力。测试中,GPT-5.1仍在思考,而Claude 3 Sonnet 4.5已完成游戏开发。然而,我们发现通过鼠标拖动魔方并未被打乱,点击“打乱”按钮后魔方也未出现变换,这表明Claude 3 Sonnet 4.5未能真正实现所需功能。GPT-5.1也给出了代码,但打开页面后根本看不到魔方,点击按钮也无响应。在此测试中,GPT-5.1完全未能实现魔方功能。
Python冒泡排序动画生成
随后,我们尝试一个难度更大的测试题:要求两款模型使用Python创建一个可运行的、能模拟冒泡算法的动画。完整的提示词要求画面中有12只大小不同的小鸭子和一只更大的母鸭子,小鸭子排成一条水平线,母鸭子能使用冒泡算法检查并交换小鸭子,使其从小到大排序,并要求显示绘制过程,程序启动后自动展示动画。首先观察Claude 3 Sonnet 4.5的效果,运行后我们看到了动画,鸭子在使用冒泡算法进行排序。虽然它绘制的鸭子比较集中密集,细节难以看清,但确实在对鸭子进行排序,并最终完成了从小到大的排序。尽管鸭子有些过大且集中,不易区分,但它确实实现了鸭子按大小冒泡排序的效果,且未出现报错,表现非常不错。接着,我们测试GPT-5.1给出的代码。运行后,我们看到了动画,但其动画效果较为简陋,鸭子的大小区分不甚明显,相邻两只鸭子难以看出大小差异。不过,它也成功实现了冒泡算法。总体而言,此题目GPT-5.1和Claude 3 Sonnet 4.5都完成得比较不错。
浏览器自动化能力测试
最后,我们在OpenAI的Atlas浏览器中测试GPT-5.1模型的浏览器自动化能力。我们开启代理模式(Agent Mode: 指AI模型在浏览器环境中自主执行任务的能力),让它全自动执行浏览器自动化任务。我们输入提示词,要求它访问我的博客,提取第一篇文章并改写后发布到X平台。我们计时观察其执行速度,因为在之前的GPT-5版本中,网页自动化速度较慢。GPT-5.1打开博客耗时15秒,点击进入博客耗时23秒,开始打开X平台耗时42秒,文章改写完成耗时1分05秒。它并未点击发布,因为这需要人工审核。总体而言,这个速度尚可,比之前版本有所提升。
总结
通过多方面测试,我们发现GPT-5.1在与Claude 3 Sonnet 4.5的对比中,在许多能力方面仍不如后者。但总体而言,GPT-5.1相较于GPT-5.0仍取得了一些进步。