云开体育用家里的毛孩子手脚参考图-开云平台皇马赞助商(中国)官方入口

小某书最新起号形式,还得看 AI(doge)。 这两天打开一看,险些全被各式良好传神的手办图刷屏了: 何况仔细一扒,甭管是 AI 圈、二次元圈照旧骑行圈等等,嗅觉全球一下子都在玩。 so,发生了啥?到底是什么引得全球如斯动作一致? 时期游走在吃瓜第一线的量子位速即去瞧了瞧,遣披发现,这不是最近爆火的图像剪辑模子nano-banana嘛。 这个模子最先在 LMArena 平台匿名出现,其后因生图表露太好倏得爆火,继而引得无数网友算计其包摄。 直到两天之前,谷歌才终于站出来认领了该模子,并默示其真...


云开体育用家里的毛孩子手脚参考图-开云平台皇马赞助商(中国)官方入口

小某书最新起号形式,还得看 AI(doge)。

这两天打开一看,险些全被各式良好传神的手办图刷屏了:

何况仔细一扒,甭管是 AI 圈、二次元圈照旧骑行圈等等,嗅觉全球一下子都在玩。

so,发生了啥?到底是什么引得全球如斯动作一致?

时期游走在吃瓜第一线的量子位速即去瞧了瞧,遣披发现,这不是最近爆火的图像剪辑模子nano-banana嘛。

这个模子最先在 LMArena 平台匿名出现,其后因生图表露太好倏得爆火,继而引得无数网友算计其包摄。

直到两天之前,谷歌才终于站出来认领了该模子,并默示其真身为Gemini 2.5 Flash Image。

而跟着 nano-banana 揭开精巧面纱,国表里网友更是掀翻了一波豪恣试玩的上升,其中手办尤其受到全球的心疼。

是以,怎样用 nano-banana 生成同款手办?请示词该奈何写?

量子位手把手教程这就送上——

实测爆火手办玩法

不卖关子,先望望网上爆火的生成"信得过手办"的请示词。

Use the nano-banana model to create a 1/7 scale model, in a realistic style and environment. Place the figure on a computer desk, using a circular transparent acrylic base without any text.On the computer screen, display the ZBrush modeling process of the figure.Next to the computer screen, place a TAMIYA-style toy packaging box printedwith the original artwork.

(中译轻佻对照版:使用 nano-banana 模子制作一个 1/7 比例的实体模子,作风和环境保合手写实。将模子摆放在电脑桌上,底座为圆形透明亚克力材质,且不带任何翰墨。电脑屏幕上夸耀的是该模子在 ZBrush 中的建模经过。在电脑屏幕傍边,舍弃一个 TAMIYA 作风的玩物包装盒,包装盒上印有原始插画。)

就用这套请示词和Gemini 2.5 Flash,让我们试试水 ~

(PS:支合手中语请示词,但偶尔会出现波折,需要多试几次,建议使用英文。)

以动漫变装为参考图,生成的"手办"效力如实可以。

出乎预感的是,只用了上头的请示词,它竟然可以识别出是艾伦耶格尔(盒子上有他的名字)。

何况即使不是全身像也可以生成,但参考图之外的部位可能会有一些奇怪的场地。

然则一料想是银魂就以为很合理奈何回事。

用家里的毛孩子手脚参考图,真实是让东说念主大喊"购买流畅在那儿"的进程……

猫猫和狗狗都极度可人。

如果能采集 3D 打印作念出来就更好了(真是可以)。

诚然网上的案例还是许多了,但让我们再试试真东说念主效力呢。

亲测,最佳使用全身图。

只好是全身图就能成,包括这种搞怪动作乱飞的。

极度顺应……你知说念的,哪怕不是给我方,谁手里没几张好一又友的怪相片呢?

好意思中不及的是生成的"手办"好像莫得撑合手,但再补充一句就行。

上头的模子飘起来了,给它加个撑合手。

这些玩法也很火

除了手办,nano-banana 还有一些脑洞掀开的玩法也很火。

它可以同期采集 3 张图片进行创作,既然如斯,有网友坚毅到,为什么不试着抵制变装的姿态呢。

还可以采集视频生成模子创作连贯的动画。

不需要太过圆善的动作示例(诚然使用详备示例可能会更精采),洋火东说念主小草图相似可行。

也有网友遴荐突破次元壁,让二次元东说念主物成为真东说念主出面前漫展场面。

这和信得过的 cosplayer 有什么别离?

上述玩法我们也"顺带"实测了一下,请示词放不才面了,一王人望望效力:

让图一和图二的变装摆出图三的姿势,一条手臂搭在对方的肩膀上,另一条手臂比心。

让图一和图二的变装以图三的姿势接触,一个东说念主出拳,一个东说念主用腿踢。

生成一张真东说念主演出这张插画的相片,布景成立为 Comiket。

是生图(指莫得修过的原图)啊,系数是 coser 生图啊!

团队泄漏背后技艺细节

通过以上实测不难发现,nano-banana 如实有点东西。

机不可失,谷歌 AI Studio 认真东说念主 Logan Kilpatrick(最右)最近还采访了这个模式背后的团队。

从左到右永诀是:商讨工程师 Kaushik Shivakumar、商讨工程师 Robert Riachi、小组产物司理 Nicole Brichtova、商讨科学家 Mostafa Dehghani。

略过发轫的产物功能先容和演示重要,我们径直来望望背后的中枢技艺道理。

第一,以文本渲染手脚中枢主义来快速接洽模子性能。

对图像生成模子来说,一个无法灭亡的繁难是怎样进行有用评估。传统的评估步调严重依赖"东说念主类偏好评估",不仅极度主不雅,何况需要消费大宗不菲东说念主力。

为此团队冷落了一个新的替代主义——文本渲染。按照 Robert Riachi 的话来说:

当模子能处理好这种复杂的翰墨结构时,它相似也能学会图像里的其他结构。

Kaushik Shivakumar 进一步解释,之是以使用这个主义,照旧因为一直以来险些扫数模子都无法很好搞定文本渲染的问题。

它为模子考试提供了一个客不雅、可量化且不易饱和的接洽尺度。比较于很快就会涉及瓶颈的其他自动化图像质田主义,文本渲染的难度富余大,约略合手续为模子的改良提供引导。

何况道理的是,这一作念法还带来了预感之外的公正——一些原来并非针对文本渲染的篡改,却不测地提高了该主义的表露。

不外需要提醒,这并非意味着系数消释了东说念主工评估,仅仅探求到考试本钱,文本渲染可以手脚一种更高效、经济且可靠的替代决策。

第二,通过原生多模态与交错式生成,杀青复杂剪辑与情境感知。

团队提到,该模子的中枢上风在于原生多模态。原生多模态意味着图像的宗旨和生成智商被深度整合进了一个模子中,而非两个系统的爽快拼接。

之是以要选定原生多模态,主要方向是在不同模态和智商之间杀青"正向移动"。

就拿之前不息提到的数手指案例来说,明明图片上是 6 只手指,但 AI 可能会基于文本学问硬说成 5 只,而视觉信号约略为模子学习天下学问提供一条捷径。

把柄先容,堪比"一双姐妹"的图像宗旨与生成,其协同作用在"交错式生成"中取得了最充分的体现。

"交错式生成"被视为该模子杀青复杂、多轮剪辑的关键技艺,与传统模子一次性生成一张图片不同,交错式生成是一个一语气的经过——不仅能宗旨面前的文本指示,还能看到并宗旨对话历史中的扫数图片。

Mostafa Dehghani 进一步指出,它为搞定极其复杂的图像生成任务提供了一种全新范式:

如果你的请示词包含了 6 个致使 50 个不同的剪辑条款,传统模子很可能在一次生成中无法知足扫数细节。但诓骗交错式生成,模子可以将这个复杂任务确认为多个法子,在不同的对话轮次中逐个完成剪辑。

第三,该模子的向上离不开对上一代模子的深化反想和对用户反馈的积极反映。

把柄泄漏,团队会径直在� � 等酬酢平台上征集用户反馈,将用户呈报的失败案例系统性整理起来,并将其构建成里面的评估基准。

也即是说,每一个新版块的模子都必须在这些来自信得过天下挑战的测试集上讲解我方。

具体而言,这些也曾出现的 bug 包括:

  



相关资讯