谷歌发布Gemini 3 Flash:OCR能力惊艳,但复杂编码挑战重重 AI超元域 2025-12-18

谷歌在今天凌晨发布了全新的 Gemini 3 Flash(Google推出的最新AI模型)模型。目前,我们可以直接在 Google Studio(一个用于使用Google AI模型的环境)中使用该模型,并且在谷歌推出的AI编程助手,我们也可以直接使用这款模型。在模型列表中,只需下拉即可找到 Gemini 3 Flash

价格与性能

SW benchmark(一个衡量AI模型性能的基准测试)中,Gemini 3 Flash 的得分甚至超越了 GPT-4 Turbo(OpenAI推出的AI模型),这表明其代码能力有了很大的提升。而且在多模态能力方面,这款模型的得分也超过了 GPT-4(OpenAI推出的AI模型)。经过一上午的测试,Gemini 3 Flash 在OCR能力方面以及在视觉理解等方面有了非常大的提升。

然而,在编码能力方面,它并没有像 SW benchmark 中的得分那样超过了 Claude 4.5(Anthropic推出的AI模型)。但从响应速度和模型价格方面来看,这款模型的性价比非常突出。其输入价格每百万token仅为0.5美元,输出价格为3美元。相比之下,GPT-4 Turbo 的输入价格是1.75美元,输出价格是14美元;Claude 4.5 的输入价格是3美元,输出价格是15美元。

在价格方面,Gemini 3 Flash 的价格最低。在任务场景下,1000个 SW benchmark 任务,Gemini 3 Flash 的花费只需85美元,而 Claude 4.5 需450美元。在日常开发迭代场景下(每天100次迭代乘以22个工作日),Gemini 3 Flash 的花费仅需18.7美元,而 Claude 4.5 需99美元。在1轮智能体工作流的场景下,Gemini 3 Flash 的花费仅为0.85美元,而 Claude 4.5 需4.5美元。因此,Gemini 3 Flash 能够大幅度节省token成本,并且可能提高3倍的处理速度。

知识库与音频测试

本期视频将重点测试 Gemini 3 Flash 的视觉能力、OCR能力以及编码能力。在测试之前,我们先询问它所知道的最新信息是几月几号,以便了解其知识库截止日期。它输出的知识截止日期是2025年1月,这个日期在当前系列模型中还是非常新的

下面我们先测试这款模型的音频理解能力。在 Google Studio 中,我们选择了 Gemini 3 Flash 模型,并上传了一个音频文件(上期视频的完整音频)。输入提示词“根据音频文件生成SRT字幕”,然后观察其能否准确地将音频文件转为 SRT(一种字幕文件格式)字幕。

可以看到,它开始输出字幕内容,响应速度非常快,用时不到2分钟即输出完成。它成功识别出了上期视频制作的谷歌编程助手。唯一识别错误的地方是将 Claude Ops 4.5 识别成了3.5,但其他内容,包括提到的技术栈,都识别正确。它输出的内容也符合标准的 SRT 字幕格式。这样看来,它对音频的识别效果还是比较不错的

视觉理解能力

下面我们开始测试这款模型的视觉能力。我们提供了一张钟表的图像,输入的提示词是“图中的时间”。它成功识别出图中的时间是1点50分。这很重要,因为之前测试其他多模态模型时,它们都无法准确识别时钟上的时间。

为了加大难度,我们又提供了一张时钟图像,其中数字“2”被替换成了“十”,“十”被替换成了“2”。理论上显示的时间应为两点整。Gemini 3 Flash 的识别结果是:“这张图像中的时钟比较特殊,数字的排列顺序是打乱的。它识别到时针指向数字2,分针指向数字12。”给出的时间是两点整。通过这道题可以发现,Gemini 3 Flash 确实能够对图像进行推理,它能真正识别出这个数字被替换的时钟的时间。

下面是第二个视觉能力测试题:提供了一个冒泡算法的流程图。输入的提示词是“用代码复刻图中的算法”。它用 Python(一种编程语言)复刻了流程图中的冒泡算法完整步骤。我们复制并运行了它给出的代码,发现代码可以成功对数字进行冒泡排序。这说明这款模型的视觉能力确实相比其他的多模态模型有了非常大的提升

OCR能力实测

下面我们继续加大难度,测试这款模型的 OCR(光学字符识别)能力。我们准备了一张排版复杂、包含繁体字的古书截图。扫描的文字有不清晰的地方,纸张也有破损。

它提取的图像上的内容完全保持了古书中繁体字的内容,并且提取的内容完全正确,没有出现任何错别字,甚至连标点符号都保持了原文。这个测试题没有难住 Gemini 3 Flash 模型。

为了进一步加大难度,我们找了一张非常不清晰的图像进行测试。放大后可以看到很多文字的笔画都没有扫描出来。但是,这张图像并没有难住 Gemini 3 Flash 模型。它提取的封面上的内容完全正确,序言里的内容也完全正确,没有出现任何错误,甚至连最底部的页码也成功识别了出来。

为了加大难度,我们准备了一张手写的处方。处方上的手写文字非常潦草,如果不知道药材名,很难辨认。Gemini 3 Flash 提取的这个手写药方与原图相比是完全正确的,没有任何错误的地方

我们又准备了一张排版非常复杂的模拟报纸截图,并对文字做了扭曲效果。Gemini 3 Flash 提取的结果完全正确,没有任何遗漏的地方,也没有任何出错的地方

编码能力(简单项目)

刚才我们测试的是 Gemini 3 Flash 模型的视觉能力与OCR能力。下面我们开始测试它的编码能力。我们先在 Google Studio 中用几个前端案例进行测试,然后我们会在 Antigravity(一个AI开发平台)中用更复杂的项目测试 Gemini 3 Flash 的复杂编码能力。

Google Studio 中,我们先用第一个测试题:让它使用 P5.js(一个JavaScript库)编写一个龙卷风模拟程序,要求龙卷风由灰色粒子组成,形成旋转的漏斗状,并允许用鼠标移动龙卷风位置。Gemini 3 Flash 给出的代码运行后,我们看到了这个龙卷风的模拟效果,并且可以用鼠标移动。

下面用第二个题目测试:让它生成一个交互式的模拟双摆动力学系统的完整程序,使用 Three.js(一个3D图形库),要求真实模拟两个摆臂和摆球的物理运动,考虑重力、能量守恒、非线性动力学。Gemini 3 Flash 给出的代码运行后,能够完全模拟真实的物理世界中的双摆运动。

我们再加大难度,让它用 PythonPygame(一个游戏开发库)创建一个模拟冒泡算法的动画。要求画面中有12只小鸭子和一只更大的鸭子,排成一条水平线。这只更大的鸭子使用冒泡算法检查并交换小鸭子,让它们从小到大排序。

这个测试题,我们就在 Antigravity 中进行。选择 Gemini 3 Flash 模型,在对话模式下选择 Fast 模式,粘贴提示词后发送。Gemini 3 Flash 给出的代码运行后,弹出了冒泡算法动画。可以看到,这只更大的鸭子对下面的小鸭子进行交换,实现了从小到大排序的动画效果。虽然鸭子看起来不太像,但它实现的动画效果还是不错的

编码能力(复杂项目挑战)

刚才使用的几个测试题都比较简单。下面我们加大难度,让它开发一个原生的 iOS(苹果操作系统)单词应用,要求使用 iOS 17Swift 5.9SwiftUI(Apple UI框架)、SwiftData(Apple数据持久化框架)、还有 Charts(Apple图表库)。

这里是功能详情:首页包含今日学习进度、连续打卡天数、待复习单词数量;单词学习相关功能包括卡片翻转、练习测试、学习进度;还有具体设置。设计要求包括主色调、适配。要求最终交付完整的 Xcode(Apple的集成开发环境)项目,预置500个单词数据,并给出运行说明。

下面我们就用这个测试来检验它的真实编程能力。首先,我们需要打开 Xcode 创建一个项目。项目创建好之后,我们用 Antigravity 打开刚才用 Xcode 创建的项目。在 Antigravity 中,选择 Planning 模式,先让它制定计划,然后再粘贴刚才完整的提示词,点击发送。

可以看到它为我们创建了开发任务。任务创建好后,我们点击执行下一步,也就是进行真正的开发。等待了不到5分钟,它执行完成了任务,并给出了如何运行的说明以及英文版的 read me 文件。

下面我们在 Xcode 中运行一下这个项目,看是否会报错。点击运行后,这里出现了报错,并且给出了详细的报错内容。我们复制报错信息发送给 Gemini 3 Flash 看它能否修复。

同样的测试题,我在 Claude Code Interpreter 中使用 Claude 4.5,它就能一次完成开发,而且不会出现任何报错。而 Antigravity 中的它开发完成之后,运行反而出现报错。

Gemini 3 Flash 修复完后,我们回到 Xcode 重新运行,这里还是报错。我们将报错信息发送给它,它开始修改代码文件。修复完成,我们再回到 Xcode 运行,这里依然报错。我们将报错内容再次发送给它。

如果它修复超过5次以上,项目还是无法正常运行,我们就不再继续测试。因为 Gemini 3 Flash 模型虽然在 SW benchmark 上的得分要超过 Claude 4.5,但经过一早上真实的编程测试,发现这款模型只在代码量极少的前端项目上表现比较不错。但代码量一旦上升,比如我们刚才看到的 iOS 项目,那么这款模型的表现就很不尽如人意了

我们运行一下,看这次能否正常运行。这里还是报错Gemini 3 Flash 模型官方给出的各种测试案例,只是简单的、代码量非常少的前端应用,所以它的表现看上去就非常不错。但项目一旦复杂,代码量一旦达到一定程度,Gemini 3 Flash 的表现就非常差了

在等待了大约5分钟左右,这里终于修复完成,并且对非常多的文件进行了更改。我们回到 Xcode 再次运行,看能否正确运行。这里编译成功,然后这里出现了报错。我们就不再让 Gemini 3 Flash 继续为我们修复这个报错了,因为它已经修复了非常多次,但每一次都能引入新的错误。

就像 GPT-4 Turbo 模型发布的时候,对于代码量极少的前端项目,它们完成得非常好。但是项目一旦复杂,代码量一旦上升,对 Gemini 3 Pro(Gemini的另一个版本)以及 Gemini 3 Flash 就非常具有挑战性了。所以谷歌官方给出的基准测试中,在 SW benchmark 这一项 Gemini 3 Flash 的表现超越了 Claude 4.5 以及 GPT-4 Turbo这个测试还是非常有水分的

但在多模态能力方面,Gemini 3 Flash 模型的表现确实非常不错。所以我们可以根据 Gemini 3 Flash 它真正擅长的方面进行应用,比如说,可以将 Gemini 3 Flash 用于图像理解以及OCR等场景。

本期视频就做到这里,欢迎大家点赞、关注和转发。谢谢大家观看。

📌 文中提及的人物和组织

公司/组织: Google

产品/模型: GPT-4 Turbo, Claude 4.5, GPT-4

关键字: llm multimodal-ai ocr performance