Nano Banana Pro模型概述与核心能力
谷歌于今天凌晨发布了全新的Nano Banana Pro模型(Nano Banana Pro: 谷歌最新发布的图像生成与编辑AI模型)。经过一上午的测试,这款模型表现出乎意料地好,因为它既能生成图像,还能编辑图像。该模型采用了工作室级的创意控制,支持混合多达14张图像,并能保持多达5个人物的一致性和相似度。它能对图像进行局部编辑、相机角度调整、色彩分级和场景照明转换。此外,它支持多种宽高比(Aspect Ratio: 图像的宽度与高度的比例),包括16:9、1:1、9:16、4:3、3:2以及21:9的图像。它支持输出1920x1080像素的图像,还支持输出2K,甚至可以输出4K质量的图像。本期视频将通过多个非常有代表性的案例,为大家测试这款模型所具备的综合能力。
中文书法生成与细节还原
首先,我们来看第一个场景:让它生成中文书法作品。这里使用的提示词(Prompt: 指示AI执行特定任务的文本指令)非常简单:“生成一幅中国传统书法作品,书法的字体用新楷字,书写的内容是念奴娇·赤壁怀古(《念奴娇·赤壁怀古》: 北宋苏轼创作的一首词,描写赤壁之战的历史场景)。”这里只给了它这首词的上阕。这是它生成的效果,可以看到它生成的书法作品一眼看上去几乎发现不了任何缺点,除了它没有完全按照我们给它的这首词的上阕去写。但总体来看,这些汉字没有出错的地方,而且这些光影效果以及各种细节看起来都非常真实。这里还放着毛笔以及砚台。它生成的书法作品,如果里面的文字内容能完全按照提示词中给定的内容,那么它生成的效果就近乎完美了。
菜肴食材智能拆解
下面我们再看一下这个测试。这里给它一份菜肴的图像,然后输入提示词:“根据图中的菜肴生成这道菜所需要的所有食材和调味料,并标注食材和调味料的名称。”我们看一下它生成的效果,然后和原图对比一下。原图上我们提供的是一份土豆烧牛肉(Tǔdòu Shāo Niúròu: 一道常见的家常菜)。它生成的图像上,我们可以放大看一下效果,这里包含牛肉、土豆、葱花、生抽、老抽、料酒、姜片、冰糖、八角。它对土豆烧牛肉的拆解真的非常非常棒,它拆解出来的这些食材、调味料以及辛香料都非常符合土豆烧牛肉所需要的这些调味料。而且这个葱花对应的就是原图上显示的这一撮葱花,不仔细看细节的话,我们甚至无法分辨出这张图像是AI生成的。
图像编辑:取代PS的强大功能
下面我们看一下另一个可以取代PS(Photoshop: Adobe公司开发的一款图像处理软件)的功能。这个最常见的场景就是将图中的路人给PS掉。可以看到原图中这几个路过的游客就被Nano Banana Pro轻松PS掉了。像这个提示词非常简单,我们只需要输入“将图中路过的几位游客去掉”就可以。
电商应用:模特换装与细节生成
下面我们再看一下另一个非常常见的场景,这个场景对于电商领域就非常常见了:将模特的衣服换成准备好的这些衣服。下面我们看一下Nano Banana它生成的效果。可以看到Nano Banana成功给模特戴上了这顶帽子,也就是图中的这顶帽子,然后将模特穿的白色外套成功换成了这个颜色的。我们看一下效果,它实现了将模特穿的黑色的低领内搭换成了这个高领内搭。然后我们就可以看一下这个效果。然后将模特穿的短裙换成了这个长裤。这样我们就可以看到这个效果。在原图中没有拍到模特的脚,但Nano Banana成功将这双鞋也给她穿上了,并且生成了刚才图中没有显示的区域。而且这个提示词也非常简单,我们只需要上传好这两张图像,直接用中文提示词“将图二中的女性的衣服换成图一中的衣服、帽子和鞋子”。然后我们还可以在同一个对话中继续让它修改,比如说再为这个模特新增一个腰带。然后我们这里又上传了一个腰带的图像,然后我们就可以继续输入提示词“为图中的女性增加腰带”。这里就是它增加腰带之后的效果。而且经过两次修改,这个模特的一致性(Consistency: 指在生成或编辑多张图像时,保持人物、物体或风格的连贯性)和我们刚才提供的原图是完全一样的,基本没有任何变化。
社交媒体内容生成:逼真推文案例
下面我们还可以测试一下它的图像生成能力。这里让它生成了Elon Musk(埃隆·马斯克: 特斯拉、SpaceX等公司的创始人)发推文的图像。我们可以先看一下这个提示词:“生成一张马斯克发文夸赞特斯拉自动驾驶升级,然后OpenAI和Google以及安索奥佩克进行跟评并表示祝贺,要求图像的角度是拍摄的手机图像,显示的内容属于真正的英文平台的版本。”然后我们就可以放大这个图像看一下它生成的效果。可以看到它生成的图像非常真实,而且我们放大之后甚至可以看清这个手指上的指纹。在这个位置,我们还可以看到手机的电量以及信号的强弱。而且这里马斯克的头像看起来也非常正式,图中这个手机的光线效果看起来也都非常正式。我们如果不仔细去查看发文的内容的话,很难辨别出这是AI生成的。
室内设计与风格转换
下面我们再看一下另一个案例。这里准备了一个毛坯房的客厅图像,然后输入最简单的提示词:“装修这个客厅,风格为现代简约风。”然后它就生成了这个客厅装修后的风格。我们可以对比一下,可以看到这个光影效果它完全还原了没有装修之前的原图的光影效果。它成功添加了沙发、茶几、绿植,这里还有窗帘,地砖的反光效果实现的也非常不错。
下面我们再看这个案例:提供一张素描,让它改为油画风格。而且我们这里用的提示词极其简单,我们直接输入了几个字:“改为油画风格。”可以看到它改成油画风格之后,这个人物的一致性也保持得非常好,而且就连衣服上的这种格子它都完美地进行了还原。
医疗与教育场景应用
下面我们再看一下另一个比较具有代表性的测试题。在这里我们提供了一张X光片,在这个X光片上这里有一个骨折的位置。然后我们输入了最简单的提示词:“标注出图中骨折的位置。”然后这里它就成功将这个骨折的位置用红色的方框给标注了出来。然后我们可以和原图对比一下,原图中这里是骨折的位置,然后Nano Banana就成功将这个骨折的位置进行了标注。标注之后的X光片这些细节看起来和原图几乎没有任何区别。
下面我们再看一下另一个测试题。这里输入的提示词也非常简单:“根据你的理解生成讲解检索增强生成(RAG: Retrieval-Augmented Generation,一种结合了信息检索和生成模型的技术)的流程图,要求采用手绘风格,图中加入中文注释。”然后这里就是它生成的讲解检索增强生成的效果图。这些图形以及箭头的风格都符合手绘的风格。
下面我们再看一下另一个非常有代表性的题目。这里提供了一个数学题,然后输入提示词,这个提示词就是:“生成解答这道题目的完整过程和步骤,要求用中文生成的内容是在草稿纸上手写的内容。”然后这里就是Nano Banana对这个圆的面积的计算的过程。而且这里它用了手写体,这里给出了完整的步骤:首先已知圆的半径,然后圆的面积的计算公式,这里给出了计算步骤,最后给出了这个答案。可以看到它给的解题过程是非常正确的,而且这里面出现了手写的字体也没有出错的地方,这个效果是非常非常不错的。
下面我们再看一下另一个比较有代表性的题目。我们这里直接提供了一张空白的试卷,然后让它生成试卷上的正确答案,并且直接填在试卷的正确位置,并且要求使用手写体。然后我们就可以看一下这个效果。这是它在原空白试卷上所填写的答案。我们可以放大看一下,虽然它给出的答案不一定正确,但他确实将选项的字母填在了试卷中的正确的位置。在下面这里它甚至成功翻译了原试卷中的这个句子解释,而且它对这个句子的翻译非常正确和恰当。
艺术创作与风格融合
然后我们再看一下这个案例。这个案例我们测试的是提供一张古画,在这张画上是一个钓鱼的人,他正在船上进行钓鱼。然后我们输入的提示词就是:“将钓鱼人从垂钓状态改为重鱼后向船上拉鱼的状态。”然后Nano Banana就为这个人生成了一条鱼。可以看到生成的这个鱼竿效果都保持了和原图中一样的效果,而且生成的这条鱼看起来也微妙微肖。
然后我们再看一下另一个测试题。这个测试题也非常简单:“将图一中的钓鱼艇添加到图二中的河面上。”图一中这是一个非常现代的钓鱼艇,图二是模仿了生成的清明上河图风格的一个图像,它并不是真正的清明上河图。然后我们看一下Nano Banana它生成的效果图。可以看到它这里成功将钓鱼艇添加到了这张古画中的河面上,而且放大之后我们还可以看到这个钓鱼艇所激起的波浪。图中的这些人物以及细节都基本和原图保持了一致。
手写笔记与创意流程图
然后我们再看一下另一个测试题。给它一段文字描述,让它根据下面的描述来生成手绘的笔记页面,页面背景是一张纸质的笔记本单页。然后下面这段内容就让它用手写的效果来显示出来。然后我们看一下最终的效果。这是它生成的大语言模型的推理过程,这里还画出了推理的步骤,而且它是用手写体来写的这些内容。这里还有对画的图的描述。而且在左侧这个位置我们还可以看到它上一页写的字的这些印痕。在这里我们还可以看到这一页纸上的这个污渍。这样看来,它生成的手写笔记的效果真的非常非常不错,如果在右下角没有水印的话,我们很难识别出来它是由AI生成的。
3D手办与搞怪流程图
下一个场景就是前段时间非常火的让Nano Banana生成真人手办(Figurine: 动漫、游戏人物的立体模型)的效果图。然后这里就是我们输入的提示词。然后我们就可以看一下这个效果对比。在左侧就是这个模特,在右侧就是生成的这个手办。然后下面的亚克力板还有反光的效果。这样看来,它生成的手办比上一个版本的Nano Banana效果要更好。
下面我们再看这个案例。输入的提示词是:“制作一张关于如何烤面包的流程图,把它做的尽可能搞怪夸张,越复杂越好。”然后我们就可以看一下它生成的效果。它生成的图像效果还是比较独特的,尤其是这里的烤面包的过程它是用一个喷火的笼对面包进行烤制。然后下面这里对面包进行切片的效果也非常不错,说明这个模型的想象力还是非常丰富的。这里又用投射机将切好的面包投递给这个锅王,这个效果确实非常不错。可以看到整张图充分发挥了这个模型的想象力。
个性化定制与设计原型
然后我们再看一下这个测试题。生成一张生日蛋糕图像,蛋糕上写有“AI超元域频道三岁了”的艺术字,风格为真实照片风格。然后我们看一下它生成的这个风格。放大之后我们可以看到这些细节,而且可以清晰地看到这个字是用巧克力来写的,是没有任何错别字的。可以看到这个光影效果也是非常不错的,还有这些细节。
然后我还测试了为人物换发型的效果。这里输入的提示词非常简单:“将图中人物的发型换成更时尚的男性发型。”然后我们看一下这个效果。原图中这个男性的发型并不是非常好看,比较影响颜值。然后给他换成这个发型之后,这个男性看起来就更加精神了。像这样的话,大家想给自己换发型就可以上传一张自拍照,让Nano Banana为你生成更加时尚的发型,让Tony老师(Tony: 理发师的常见昵称)为你剪出来对应的发型。
我这里还测试了让它生成前端的UI,也就是让它生成一个移动端的个人资料页。它生成的这个移动端用户资料页的效果图还是比较不错的,无论是配色还是布局总体来说比较不错。像这样的话,我们甚至可以用Nano Banana来快速生成项目的原型图。而且我们还可以让它根据我们提供的内容来生成杂志。这里让它根据我提供的我的频道的介绍,让它生成了一个精美的杂志。这是生成的效果,我们可以具体看一下。可以看到这个光影效果非常逼真,这里的眼镜的这些影子看得都非常清晰。这里有咖啡杯,还有笔记本电脑,这上面生成的内容看起来也都比较不错。而且这里面还有与AI相关的这些图像。如果不仔细看这些细节的话,我们很难分辨出这是由AI生成的图像。像这样的话,我们就可以将Nano Banana运用于生成时尚杂志等场景。
总结
通过我们用多个场景进行测试,可以感受到Nano Banana它生成的这些内容已经很难分辨出是由AI来生成的了。而且生成的这些图像质量都非常高,甚至很多细节它都实现的非常完善。而且它对很多场景都支持的非常不错。像这样的话,我们就可以将Nano Banana用于多种场景,从而大幅提升我们在设计和创意方面的效率。