Nano Banana 2.1 来了!21 个真实案例 + 公开提示词,这份 Awesome 合集请收好
开发者 @xianyu110 整理的开源合集 awesome-nano-banana-2.1 已收录 21 条 Nano Banana 2.1(API ID:gemini-nano-banana-2.1,Google Flow 内代号 beluga)案例,每条均要求封面图与作者公开提示词齐全,并提供可筛选、可搜索、一键复制提示词的在线画廊。
开发者 @xianyu110 整理的开源合集 awesome-nano-banana-2.1 已收录 21 条 Nano Banana 2.1(API ID:gemini-nano-banana-2.1,Google Flow 内代号 beluga)案例,每条均要求封面图与作者公开提示词齐全,并提供可筛选、可搜索、一键复制提示词的在线画廊。
宝宝学识屋上线「学中文」栏目,把每个汉字拆成发音、AI 联想图、笔顺动画与测试、AI 词组和成语音频来教。字库收录 2488 个字、两万四千多条成语,含「中」的成语有 173 个。支持按年级、笔画顺序、拼音三种学法,免费免注册,手机电脑均可打开。
研究提出多任务条件生成对抗网络 MT-cGAN,可直接从 qMRI 回波图像合成类 DESS 图像并分割膝关节软骨与半月板。在 361 名受试者共 508 例膝关节 MRI 数据上,其平均 Dice 达 0.84,优于结合迁移学习的 SOTA 条件 GAN(0.82,p<0.001),T1ρ 与 T2 量化变异系数最低,分别为 1.84% 和 1.81%。
LoDEOT 用五维偏移 token 替代高维实例 token 来预测屋顶到轮廓偏移(RFO),在保留高维实例 token 做检测与分割的同时,将实例 token、浓度门控屋顶和框掩码证据映射为五维偏移 token,再经独立二维读出。在 BONAI 数据集上,其 FAP50 达 54.58、mEPE 为 5.23 像素,FAP50 比所评估的端到端基线高出 7.56-16.85 个百分点。
SteadySplats 通过基于历史的空间重采样与时间重要性重采样,在随机渲染中大幅加速图像收敛并保证相机运动下的连贯性;训练阶段的颜色正则项则隐式降低 3DGS 模型沿视线方向的方差。其基于 Vulkan 的渲染器在每像素 1 采样下较此前随机方法提升约 13 dB PSNR,并快速收敛至排序 3DGS,平均 L1 误差低于 10^-4。
VolS-GS 是一个可重光照的 Gaussian Splatting 框架,通过将高斯场景的空间支撑作为可微有限体积传输求解器的域,让光线在物体内部传播,从而建模次表面散射等非局部效应。该框架用小型网络为每个 Gaussian 预测散射与吸收系数,并在三个 OLAT 基准上持续提升新光照与新视角下的重光照质量。
DiDE 是首个面向解耦式 3D 风格化(Disen3D)的免训练框架,可将颜色与纹理独立迁移到生成的 3D 资产上。它利用图像到 3D 模型潜空间中纹理仅占少量风格通道的特性,通过通道划分机制分别处理内容图、纹理参考和颜色参考,并在每个自注意力层无干扰地组合两种风格信号。
TripleFlow 是一个无需训练的视频对象移除框架,通过协调源流、残差流与合成流,将擦除与生成紧密耦合。它复用单次目标预测,由残差流抑制对象、合成流独立重建被遮挡背景,并在每一步将合成背景注入编辑轨迹。在五个基准上,TripleFlow 在重建保真度与时间一致性上均显著优于现有基线,达到新的 SOTA。
研究者提出 MeshOctave,通过二进空间网格分辨率定义尺度,将网格粗化视为体素单元内顶点合并的确定性坍缩,并用 split-and-rewire 逆操作逐面确定八分体子顶点与局部连接,无需序列化即可并行生成。该方法采用尺度条件掩码均匀离散扩散模型学习该操作,在几何保真度与拓扑有效性上大幅超越强基线,并支持自适应分辨率细化与网格细分任务。
研究用 CHASE DB1 全部 28 张图像和两位人类标注,考察视网膜血管分割中阈值选择对评估结果的影响。固定七折协议保持 14 名受试者双眼同折,随机森林与 Extra Trees 对观察者 1 拟合三个随机种子共 42 次。
针对重建 FID(rFID)与生成 FID(gFID)相关性弱甚至为负的问题,研究者提出生成感知重建(GAR),通过向编码器 latent 加噪并经生成模型去噪,构建从重建到生成的连续轨迹。基于该轨迹的诊断指标 GAR-FID 在多种 tokenizer 和规模下与 gFID 强相关,且中间 GAR latent 保留与源图像的配对监督,可用于解码器适配,在不同模型规模上持续提升生成质量。
Tree-VQ 将预训练扁平 VQ 分词器事后转换为支持任意前缀的渐进式表示,保留原有编码器分配和全部学习到的叶向量。该方法把码本组织为平衡二叉层级,按深度优先顺序传输分支决策,使每个额外分支比特精确细化一个 token,传输可在几乎任意载荷位置截断。
研究者提出局部认知不确定性引导主动采样框架 LEADer,用于扩散模型图像修复(DMIR)。该方法在空间域用逐像素不确定性动态调节零空间先验强度,在时间域用不确定性轨迹量化采样稳定性以实现自适应轨迹剪枝,理论证明其满足严格数据一致性且剪枝策略具有确定性误差界。LEADer 可即插即用地集成到多种 DMIR 基线,在提升多个 SOTA 方法性能的同时显著减少采样时间,内存开销可忽略,代码已开源。
研究者提出新任务 RefGC-SR²,在生成后处理阶段复用用户提供的原始高分辨率参考图,同时恢复丢失细节、修正生成伪影并放大输出。为此构建了首个真实场景三元组数据生成流程,并训练出双联图条件生成器来合成配对低质锚点。所提出的频率感知扩散 Transformer 模型能选择性注入参考图细节并去除伪影,在身份保真与高分辨率细节恢复上均优于现有 RefGCR 和 RefSR 基线。
研究团队推出诊断基准 SalArt-VQA,包含 950 张图像和 3,681 道人工编写多选题,用于评估 VLM 对 AI 生成图像中显著伪影的细粒度理解。在 20 个 VLM 上测试发现,最强模型伪影检测召回率达 99.37%,但四类伪影问题全部答对的图像仅占 53.26%。该基准已入选 NeurIPS 2026 E&D Track(Oral)。
一项 arXiv 研究显示,基于扩散 Transformer 的文本到图像模型通常只依赖文本表示中两个简单方面:相邻 token 合并为词表示,以及由文本编码器位置嵌入刻画的词序。研究者构造了仅编码单词含义与顺序、不含完整提示词上下文信息的"位置标记词袋"嵌入,发现其引导生成的视觉质量与文本保真度与完整文本嵌入相当,说明复杂语言结构的解码实际由图像模型自身完成。
Contrastive-SDXL 是一个基于 SDXL-Turbo 并用 LoRA 微调的日转夜增强框架,用于夜间行人检测。它引入由 DINOv2 编码器引导的 patch-wise 语义对比损失和物体一致性损失,生成图像的 FID 为 22.5。用其合成图像训练的检测器相比仅用白天数据的基线漏检率降低 6-7%,接近真实夜间数据训练的效果。
研究者提出物理信息重建框架 RetinaDiff,用于视网膜时序激光散斑对比成像(tLSCI),仅需少量帧即可实现运动鲁棒重建。该方法先用相位相关配准稳定原始散斑序列,再以运动校正后的对比度先验引导条件扩散模型完成逆重建。
MedVAR 是首个通过自回归训练实现全方位医学图像生成的基础模型,在 40 个数据集共 438,905 张切片上训练,覆盖 CT 和 MRI 的六个解剖区域,生成速度比 100 步扩散基线快 12-19 倍。生成质量随模型规模提升,用其生成图像预训练可将七中心肝细胞癌分割 Dice 从 0.615 提升至 0.632。
研究者提出 REPA-G(Representation-Aligned Guidance),一种在推理阶段利用自监督模型对齐表征进行条件控制的框架,无需额外训练即可引导扩散模型去噪过程。该方法支持从单 patch 匹配到全局图像特征 token 的多粒度控制,并可扩展至多概念组合,在 ImageNet 和 COCO 上生成高质量且多样的结果。
研究提出 GaussianBlender,一个前馈式文本驱动 3D 风格化框架,可在推理时即时完成编辑。该方法从空间分组的 3D Gaussian 中学习几何与外观解耦的隐空间,再用潜在扩散模型施加文本条件编辑。评估显示其风格化即时、高保真、保持几何且多视角一致,并超越需逐实例测试时优化的方法。
研究者提出一种引导扩散模型解码器,可生成特征与用户指定特征高度匹配的图像,从而精确分析视觉 DNN 的特征空间。该方法无需训练即可分析不同 DNN,且可在单块商用 GPU 上运行,在 CLIP 图像编码器和 ResNet-50 上的实验验证了其有效性。代码与数据已公开。
研究者发现,被遗忘的扩散模型概念会在 token 嵌入空间中留下可解释的线性残差,据此提出越狱攻击 SubAttack 与防御机制 SubDefense。
研究者将 ControlNet + IP-Adapter 风格化管线中两个全局条件权重提升为逐位置空间图,在单次生成中实现内容与风格的局部、分轴控制。由于两个权重作用于不相交通路,独立调节可覆盖从自由重生成到身份保持的 2x2 修图组合,且编辑被限制在指定区域。
一篇概念性研究议程论文提出以生产为中心的框架,对比直接图像/视频生成与 LLM 写代码渲染两条路径下的检测与水印,并按生产阶段组织图像、视频、源码与渲染感知水印。框架区分被动推理、消息恢复与认证溯源,结合 Claude、OpenAI 及渲染工具接口提出十个研究问题,涵盖可识别性、可观测性、可恢复载荷、同步与合成等。论文共 46 页,不含实验,不主张新定理。
UltraDiff 将可微渲染范式扩展到医学超声,把超声成像建模为以飞行时间门控的路径空间积分,并推导出前向模型及场景参数梯度的 Monte Carlo 估计器。该框架基于 Mitsuba 3 实现,在逆几何估计任务中从球体出发优化 SDF,可从模拟 B 超扫查和真实脊柱体模机器人采集中恢复椎体表面,无需预分割图像即可在 B 超图像上无监督完成,几何精度与当前最优方法相当。
研究者提出一种方法,将 Trellis 2 等以物体为中心的 3D 生成器改造为可处理室内外场景的单图 3D 重建。方法通过按相机距离自适应分块、建立显式 2D-3D 对应关系,并合成约 4,000 个室外场景扩充训练数据。在 Tanks and Temples、ScanNet++ 及真实图像上,该方法在几何精度和感知质量上均优于所有基线。
研究者提出 BASA,一种后端无关的稀疏注意力机制,用移位局部窗口注意力替代视觉自注意力,通过跨 DiT 块的结构化窗口移位实现全局信息交换,消除窗口边界造成的网格状伪影。BASA 无需定制算子即可部署在现有注意力后端,在 FLUX 上实测加速超过理论估计的 90%,在 Wan 上实现 4.52 倍注意力加速,并保持有竞争力的生成质量。
PDB(Point-Based Deformation Blending)是一种网格无关的面部动画重定向方法,从源中性表情对预测一组形变控制点,并从目标中性网格计算混合权重,权重每个目标只算一次、可跨帧复用。
研究者提出 Reserve-Guided Elicitation(RGE)框架,将预训练模型中稀疏的、对来源敏感的内部组件视为“取证储备”,通过 Forensic Lens(F-lens)定位储备位点与方向,并仅在这些位点插入 Forensic Reserve Adapters(FRA)。
研究用预训练 Stable Diffusion 作为骨干,结合 2D 基础模型的伪深度目标微调 LiDAR 条件深度模型,训练时按不同 beam 预算随机抽稀 LiDAR 条件。在 nuScenes 上对物理留出的真实 beam 评估,4-beam 输入下 δ1.25 准确率达 66.8%,而散点插值仅 45.1%,稀疏场景优势最大。类别分层误差显示平面最先恢复,深度不连续物体最早退化。
研究者提出自适应神经细胞自动机(aNCA)架构,用可变形卷积动态调整感知野,在网格类数据上迭代推理 2D 空间关系。在公开基准上,该方法求解数独、迷宫最短路径等图像谜题取得 SOTA 且可理解的结果,并具备较强泛化能力。
研究提出一种可变形 CT-超声配准框架,利用 CT 的 HU 值近似组织刚度作为空间变化正则化,并结合探针接触区位移先验与扇形几何正则项,通过 SIREN 逐帧优化、以归一化梯度场(NGF)训练。该方法在刚性初始化基础上将配准精度提升 17%,优于经典可变形基线,且保持近乎零的拓扑折叠。
研究者提出 ConnectomeX 与 FlyVision,一种保留 ON/OFF 并行处理、循环计算和群体图交互的可训练架构。
UniCounting 提出固定词表、无需图像查询的多类别计数方法,仅输入 RGB 图像即可输出完整的类别—计数向量。它用冻结的 SAM 2.1 生成掩码、DINOv2 与 OpenCLIP 提供关系与类别特征,仅训练一个 3,267 参数的类别共享关系头预测同实例亲和度。
PolarScale 是一个将辐射尺度作为显式预测与评估目标的 RGB-to-Stokes 基准,基于现有三色全 Stokes 测量,要求模型预测归一化 Stokes 分量、AoLP/DoLP/DoCP 及每场景尺度。
诺丁汉大学团队提出 RACE-FPP,将深度学习角点检测融入条纹投影轮廓术(FPP)标准标定流程,并显式分析定位误差在整条标定链中的传播。在干净与退化图像混合数据集上,相机重投影误差从 1.237 像素降至 0.259 像素,投影仪重投影误差降低约 50%,重建工件的几何精度也优于传统流程。
View Matters 是一个视图重要性感知的文本驱动 3D Gaussian 编辑框架,通过关键帧重要性估计(KIE)识别可靠视图,再经关键帧引导编辑(KGE)将编辑信号非对称传播至非关键帧,并用重要性感知优化(IAO)在 3DGS 优化中保持该偏好。在 23 组场景-提示词对上,其平均 CLIP 文本-图像相似度达 0.2822、方向相似度达 0.2564,编辑耗时四分钟。
研究团队提出一种基于 Transformer 的重建框架,将冻结及参数高效微调的 CLIP、BiomedCLIP、DINOv2 视觉编码器用作心脏 MRI 加速重建的先验。
研究提出相位速度蒸馏(PVD),将生成过程分为粗、细两个阶段,各用一个半尺寸专家模型建模平均速度,累计计算量仅相当于一次完整骨干前向。