RBMatch:面向半监督建筑足迹提取的双层类别重平衡框架
RBMatch 是一个双层类别重平衡框架,同时调控伪标签生成与无监督优化,以缓解遥感建筑足迹提取中的前景-背景失衡问题。该框架包含自适应类别阈值(ACT)、置信度感知类别平衡重加权(CACBR)和分布对齐(DAL)三个组件。
RBMatch 是一个双层类别重平衡框架,同时调控伪标签生成与无监督优化,以缓解遥感建筑足迹提取中的前景-背景失衡问题。该框架包含自适应类别阈值(ACT)、置信度感知类别平衡重加权(CACBR)和分布对齐(DAL)三个组件。
针对保护性扰动在照片缩放后失效的问题,研究者提出 SRIM,通过采样覆盖全尺度范围的锚点尺度并按当前最弱尺度加权,提升未知缩放下的最差情况防护。在 9 至 30 百万像素全分辨率照片、2 至 8 倍下采样条件下,SRIM 将 FLUX.2-klein 编辑的最差情况扰动从最强已发表保护的 0.192 LPIPS 提升至 0.463,同等可见度下防护约翻倍。
SimCortex v2 是一个从 T1 加权 MRI 同时重建左右脑 WM 与 pial 表面的深度学习框架,在 14 个队列 560 例(13 个训练中未见)上平均对称表面距离 0.253 mm,与最强基线持平。92.14% 的病例未检测到表面间碰撞,自交比例 0.044% 为学习类方法中最低,而所有基线在每个病例中均至少产生一次碰撞。源代码、配置、预训练权重、预处理数据与评测划分已公开。
研究者提出免训练框架 HGSS(Hierarchically Grounded Semantic Surgery),通过层级跨度定位与动态属性绑定,在不更新模型权重的前提下实现组合式概念擦除。
研究者提出自监督适配框架 LAO-X,无需任何人工标注即可在 X 光安检扫描中定位任意物体。该方法通过显著性引导的物体挖掘与吸收度域的物理合成生成图像—标注对,并用遮挡控制的课程策略微调 SAM2 定位器。在六个 X 光基准上,LAO-X 在高度杂乱场景中较 SAM2 及 X 光专用基线提升 2% 至 23% mAP。
研究团队为巴基斯坦旁遮普构建了结合 Random Forest、XGBoost、支持向量回归与 Ridge 堆叠集成、并搭配 MobileNetV2 叶片健康分类器的作物产量预测原型,部署为带 SHAP 解释的 Web 应用。
DTFormer 是一个三模态(RGB-D-Text)语义分割框架,通过 Text-guided Semantic Alignment Module(TSAM)将文本线索编码为语义原型,并在编码器和解码器多层显式对齐 RGB-D 多模态特征,从而对表示学习施加语义正则。
研究提出可泛化小样本类增量学习(G-FSCIL)设定,即基类会话本身仅有少量类别。方法用冻结的潜在扩散模型构建类特定合成候选池,并学习兼顾语义一致性与视觉多样性的知识筛选策略,将其蒸馏为可迁移的选择策略在基类会话后复用。配合合成信息原型初始化与双向边界校准,该方法在实验中持续优于现有 FSCIL 基线,减少遗忘并改善新旧类平衡。
DistScene 是一个从单张图像生成组合式 3D 场景的框架,将环境作为显式场景组件与物体联合建模,以提供物体摆放的几何上下文。
针对文本到图像模型中概念激活轨迹偏离直线的问题,研究者提出 KANSteer,用 Kolmogorov-Arnold Networks(KANs)将概念遍历建模为穿过中间状态的曲线,使引导方向随概念变化并保持可解释性。在多个概念和文本到图像扩散 Transformer 上,KANSteer 比线性引导更贴合激活轨迹,对中间属性的遍历也更平滑。
UniPro 是一个统一的多模式医学图像分割模型,通过传播机制把 2D 分割扩展到 3D 体数据,在单一基于切片的框架内同时支持语义分割、上下文分割、交互式分割和基于传播的分割。
研究提出路径-流对齐作为 flow matching 的统一训练目标,联合训练保端点的路径网络与流网络,使流匹配路径速度、路径对齐当前流。作者发现路径过拟合:对齐损失下降但样本质量变差,与概率路径中的低熵瓶颈有关。为此引入随机路径正则化器,隐藏部分源信息并保持端点精确,在 ImageNet-256x256 与 SiT 骨干上跨模型规模持续改善 FID。
Learned AMDI 保留 AMDI 固定树传播器与层级约束,用 proximal policy optimization 训练的共享局部策略替换传播后选择器。在九个留出案例中,它执行 393 次细化,将平均终端参考差异从 0.17496 降至 0.13657,占用率从 0.13737 升至 0.26660。该共享 actor 无需重训练即可迁移到 64×64 和 128×128 图像。
RefRoute 通过紧凑残差条件与条件/注意力路由,降低多参考图像生成的参考 token 数量与注意力开销。在 ManyRef100 基准上,其 Weighted-Ref-VIEScore 达 36.06,FLUX.2-Klein-9B 为 8.88;16 个参考下,50 步与 4 步配置分别较对应 FLUX 基线提速 18.3 倍和 14.2 倍。
REViT-v2 是一种基于窗口化群卷积自注意力和层级特征架构的可扩展旋转-反射群等变视觉 Transformer,可扩展至数百万参数规模并在 ImageNet 等大尺寸图像数据集上训练。该模型的代码与预训练权重已公开,相关论文被 NeurIPS NeurREPS workshop 2026 接收。
研究发现,从 SD1.5 到 FLUX.2 和 Z-Image 的多种文生图模型 VAE 共享一个与亮度和对立色对齐的颜色子空间,该子空间通过编码器线性近似和潜在引导被一致地定位。基于此提出三项应用:ColorTuning 在 GenColorBench 的 CSS3/X11 细粒度颜色系统上实现 SOTA 精确数值颜色生成,以及饱和度控制和颜色迁移。代码与模型已公开。
研究提出方向性 Fréchet 距离,即最优传输位移在给定方向上的期望平方投影,用于揭示生成模型评测中差异的具体来源。在图像、视频和蛋白质案例中,少数可解释方向即可解释大部分距离,并据此解释了 COCO 数据集上扩散采样步数增加导致 ImageReward 提升但 FID 变差的现象,量化了 FVD 对逐帧外观的偏好。代码已开源。
一项泄漏控制研究用固定 nano 级 YOLO26n-seg 模型对比皮肤镜预处理效果,原始图像加在线增强在病灶不相交测试集上取得 mask mAP₅₀:₉₅ 0.5636、Dice 0.9356、macro-F1 0.6917。
针对扩散模型的潜空间水印方法,一项理论分析首次解释了这类方法为何对旋转、缩放、平移等图像扰动缺乏不变性,并推导出刻画像素空间扰动与潜空间响应关系的最大扰动界。研究还首次给出覆盖实际检测机制各组件的解析形式,实验验证了理论结论:在当前设计范式下,基于潜空间的水印方法固有地表现出有限鲁棒性。
研究者提出 Global Transport(GT),一种不依赖类别标签的全局类别无关最优传输耦合,用于条件流模型的训练。GT 单独使用会因将不同条件关联到源噪声不同区域而降低性能,但与无分类器引导(CFG)结合后,在离散类别和连续文本条件的图像生成中,跨模型规模和采样预算均稳定提升生成效果。该结果表明耦合设计应在推理时的引导流下评估,可作为无需改动架构、采样器或引导机制的训练期优化手段。
研究提出 DDT-RFE,移除 Decoupled Diffusion Transformer(DDT)编码器每个 block 中 Self-Attention 和 MLP 周围的残差连接,并将输入 patch embedding 与中间及最终编码器特征融合作为编码器输出,以在保持训练稳定的同时学习更抽象的表征。
研究提出 Relative Taylor Debiasing(RTD)算法,用于估计生成模型评测指标 FID,达到 O(d/ε²) 的样本复杂度并证明其最优性。
Local2Mesh 提出一种空间局部化的轮廓到网格框架,无需 3D 网格标注即可从稀疏 2D 轮廓重建 3D 左心室几何,通过几何感知对齐校正层间错位,并用平面感知 Local Router 按顶点到平面距离将轮廓特征路由至模板顶点。
研究者提出 Best-of-N Guidance(BoNG),将 BoN 采样直接融入反向扩散过程,通过去噪粒子间的非对称引导交互,把粒子群导向更高奖励区域。在 36 项对比中 BoNG 有 29 项表现最佳,对 SMC 和 Vanilla BoN 的胜率达 80.56%。该方法支持多输出,ImageReward 分数为最新基于采样的引导方法的 1.3 倍,速度提升 1.6 倍,代码已开源。
研究者提出一种多尺度视觉特征表示,将边缘与轮廓特征及其空间关系编码后,集成进无梯度的发展式学习框架,在类增量 MNIST 上大幅提升识别准确率。该方法无需回放缓冲区或预设任务边界,存储量相当时可匹配或超越基于回放与正则化的基线,且不遗忘旧类别。学到的表示保持人类可解释性,基线方法则在训练周期内丢失大部分刚学类别后再重新学习。
研究者推出 3D-DefectBench,用覆盖几何、纹理与提示词遵循的九类细粒度二元缺陷评估 3D 生成,并跨 84 种推理设计对 VLM、相机协议、视觉输入与提示词方案做析因分析。
D3S2 是面向语义分割的扩散引导数据集蒸馏框架,采用类平衡掩码选择与扩散引导图像合成两阶段设计,通过分割一致性损失和类级特征匹配损失提升合成数据训练效用。在 1% 压缩率下,该方法在 ADE20K 和 COCO-Stuff 上以 Mask2Former(Swin-S)分别达到 24.99% 和 35.49% mIoU,较随机选择高出 9.34% 和 5.70%。代码已开源。
研究者提出目标感知频率-空间协同增强(FSCE)框架,用于抗噪 SAR ATR,通过频率-空间建模实现早期特征稳定并结合语义正则化。该框架在网络入口设计 FS-EAE 模块抑制噪声传播,并引入 APSA 机制以在线教师策略施加语义约束。在 MSTAR、OpenSARShip 和 FUSARShip 上的实验验证了其有效性,轻量版 FSCE-Net_μ 仅 0.17M 参数。
该方法在解码阶段恢复分割与分类分支的信息交换,通过四级解码器上的 Task Interaction Module(TIM)传递边界上下文,并用 Adaptive Interaction Weighting(AIW)按图像和层级自适应融合特征。
研究将 Hough 变换与单应性估计引入目标检测模型,对超市货架倾斜拍摄的图像进行矫正,以提升商品识别准确率。团队为此构建了新数据集,并在多种目标检测模型上验证:图像矫正能提高倾斜图像中商品的检测精度,但效果受拍摄角度和单图物体密度限制。
研究者提出 Dual-FDM,一种在频率感知扩散模型中解耦双重图像参考的个性化生成范式,可同时处理定制风格迁移与色彩风格迁移。该方法通过掩码策略在频域解耦不同频段:定制风格迁移用定制参考前景的中频段替换风格参考背景的中频段,色彩风格迁移则用色彩参考前景与背景的低频段替换风格参考背景的低频段。实验验证其优于当前最先进的个性化图像生成扩散模型,代码已公开,论文将发表于 NeurIPS 2026。
ElasticFit 是一个 VLM 引导的贴合感知 3D 物体插入框架,通过场景锚定的结构化拟合线索,将 VLM 推理转化为显式 3D 约束,支持刚性放置、等比缩放和弹性贴合三种适配模式。在固定资产基线对比中,其空间关系成功率从 50.8% 提升至 69.7%,支撑成功率从 48.3% 提升至 91.7%。该工作已被 NeurIPS 2026 接收。
WildMatch 提出一种仅用身份标签的弱监督方法,将预训练关键点匹配器适配到野生动物重识别任务,无需关键点级或几何对应标注。该方法用预训练匹配器挖掘图像对,从身份一致性导出弱正负监督,对比微调匹配网络以增强同身份对应、抑制异身份对应。在多个开源野生动物重识别数据集上,其准确率超过现成匹配器和一种 SOTA 局部-全局融合方法,并在留出个体的开放世界协议下学到可迁移的对应先验。
研究者提出 Anchor and Adapt 两阶段提示词学习框架,将异常语义获取与目标正常外观适配分离:Stage I 从带标注辅助数据学习可迁移的正常与异常锚点,Stage II 固定锚点并用少量目标正常样本适配额外正常分支。在 MVTec-AD 与 VisA 跨数据集 1-shot、2-shot、4-shot 设置下,该框架取得有竞争力的检测与定位性能,且无需合成异常生成。
研究提出 Diffusion On-Policy Context Distillation(D-OPCD),将智能体改进后的提示词作为特权上下文,把智能体框架的能力蒸馏进扩散模型权重,使其仅凭原始查询也能保留部分框架收益。
该研究提出一种能量自适应噪声调度与白化策略,将全局频谱白化与能量条件化噪声分配结合,根据各变换系数的能量及图像相关的能量路径联合调制注入噪声,同时保持高斯转移与闭式边缘分布,兼容标准 DDPM 和 DDIM 流程。在 CIFAR-10 上,该方法将紧凑型 DCTdiff U-Net 变体的 FID 从 142.48 降至 100.45。
研究者提出 ENCORE,首个精确的并行推理时控制方法,通过让每个副本存储生成轨迹,将向上移动变为截断,从而避免模拟难以处理的逆时间过程。该方法证明了目标不变性,并在合成目标、生物分子玻尔兹曼采样和图像生成中取得有竞争力的精度与多样性,还能应用于现有 RE 校正无法处理的蒸馏采样器。
针对 Classifier-free guidance(CFG)缺乏显式判据、难以判断引导轨迹是否按预期推进的问题,研究者提出 Spectral Correction Guidance,通过将中间状态频谱与扩散前向过程的解析参考频谱对齐来校正采样偏差。
针对文本到图像生成的免训练安全防护,研究揭示全局不安全假设存在覆盖度与选择性的权衡:紧凑不安全子空间无法覆盖异构的不安全语义,而更广的聚合会扭曲安全邻近的良性提示词。
研究者提出秩感知投机采样(RASS),一种基于秩感知列表耦合的扩散草稿树验证规则,按提议-目标均值位移对草稿候选排序并采样秩权重,以最小化所选提议与目标分布的总变差。