SpikeMoE:受大脑启发的脉冲混合专家竞争路由框架
SpikeMoE 将神经元尺度的脉冲动力学与模型尺度的专家选择相结合,提出受海马 CA1 区竞争抑制机制启发的脉冲 k-WTA Router,通过侧向抑制和不应期按离散脉冲计数选择 Top-K 专家。该框架还配备两阶段缺失模态建模模块,在视觉、语言和多模态基准上达到 SNN 基线中的 SOTA,性能匹配或超越 ANN 对应方案,并在多种缺失模态条件下保持稳健。
SpikeMoE 将神经元尺度的脉冲动力学与模型尺度的专家选择相结合,提出受海马 CA1 区竞争抑制机制启发的脉冲 k-WTA Router,通过侧向抑制和不应期按离散脉冲计数选择 Top-K 专家。该框架还配备两阶段缺失模态建模模块,在视觉、语言和多模态基准上达到 SNN 基线中的 SOTA,性能匹配或超越 ANN 对应方案,并在多种缺失模态条件下保持稳健。
GLANCE 是一种一次性块草拟方法,可在不改动 VLM 目标模型的前提下实现无损推测解码,其块扩散头在一次前向传播中读取已融合的视觉语言状态并草拟整个 token 块。在固定轮次预算的生产引擎中,GLANCE 解码速度最高达自回归解码的 3.05 倍,在 grounded 任务上平均优于生产级 EAGLE3-VL 头约 11%。代码已开源。
针对不完整观测下的多模态情感分析(MSA),研究者提出 MRCF(Modality Reliability-Calibrated Framework),显式建模模态可靠性以缓解可靠性失配与可靠性传播偏差。MRCF 包含可靠性感知分支、可靠性引导交互分支和可靠性校准融合模块,在 CMU-MOSI、CMU-MOSEI 和 CH-SIMS 上取得强劲表现。
一项 arXiv 研究以视觉语言模型为测试平台,首次系统比较了残差流经 tuned lens 低维投影和最终 top-k logits 两个瓶颈后保留的信息。结果显示,模型 top logit 值这类易获取的瓶颈同样会泄露图像查询中与任务无关的信息,某些情况下泄露量堪比直接投影完整残差流。
4D-HOF 是一个前馈框架,利用视觉基础模型生成的粗略手物状态,通过条件流匹配将其输运至交互流形,前馈式修正平移、旋转与对齐误差。其生成式建模可在输运过程中直接以物理交互约束和 2D 观测证据进行测试时引导,无需重建后再做后处理优化。在域外基准上,4D-HOF 取得 SOTA 性能,重建更稳定准确。
DepthWorld 是首个基于 Stable Video Diffusion 的 3D 世界模型,通过空间 latent tiling 联合预测多视角 RGB 与深度,同时保持预训练 VAE 不变。
WorldSonus 是一个面向世界模型的交互式视频转音频框架,可实时合成空间音效。它采用流式因果自回归扩散架构,实时因子低至 0.41,并通过以音频为中心的描述管线与分块提示词调度实现生成过程中的动态声音控制,同时利用立体声与 ambisonic 数据实现空间对齐。实验显示其在声学质量与空间对齐上匹配或超越当前最优的双向模型。
EgoLAP 是一个 VLA 预训练框架,通过共享的基于语言的动作链式推理,联合学习人类与机器人轨迹,将动作意图表达为结构化、时间抽象的语言动作。在真实世界与仿真实验中,EgoLAP 达到 80.1% 的平均真实任务进度,相比替代动作表示取得 2.3 倍性能提升,且运动级推理优于结合子任务、物体框与视觉轨迹的复合推理格式。
研究者提出 Selective-RL,通过隔离强化学习阶段的参数更新、保留其主导矩阵方向并保持幅度,将其迁移至 VLM 的语言模块。在三个模型家族、五个视觉推理基准上,该方法在 15 项对比中有 12 项优于完整更新插值,其中 Qwen 接收模型的 MathVision 提升 8.55 个百分点。对照实验显示,仅靠更新幅度或任意低秩无法复现该增益。
研究者提出 Coordinated Multi-Agent Diffusion Steering(CMDS),将冻结的预训练扩散模型视为可复用生成原语,通过学习的控制协调其反向过程。
MedCORE 是一个将临床推理结构化的视觉-语言诊断框架,把诊断过程拆解为临床标准、定位对应图像区域,并用 Graph Attention Network 建模标准间依赖。
研究者推出 Wiki-Talkie,一个覆盖德语、英语、西班牙语、法语、意大利语五种语言的多语言数据集,取自 Wikipedia Talk 页面的真实对话,并配以真实用户社区衍生的人格画像。在下一轮对话生成任务上,用户评论历史所体现的交互行为持续优于显式人格信息;模型系统性地少产生负面或极端情绪,同时多产生引用与建议,表现出偏向顺从与积极的偏差,且这一模式在各语言间稳健成立。
Knee3DVLM 是一个序列感知的视觉语言模型,利用全容积 DESS 与液体敏感 TSE MRI 预测 57 个源自 MOAKS 的解剖定位二分类诊断目标。
研究者提出免训练框架 GeoPID,从几何视角将 VLM 中的多模态信息分解为冗余、模态独有和协同三类成分。在 22 个 VLM 和 14 个 benchmark 上的分析显示,需要视觉 grounding 的问题中正确预测具有更强的视觉独有成分。基于此,GeoPID 在推理时沿视觉独有子空间选择性放大视觉表征,无需更新模型参数即平均提升 7.63% 相对准确率。
研究者提出面向自动驾驶视频的时空一致性对抗攻击(STCA),分模态扩展、空间攻击与 STCA 攻击三阶段,其中模态扩展用 caption 引导选帧、STCA 阶段用运动引导掩码破坏跨帧时序一致性。
VisionWeave 通过门控空间池化器与粒度路由器,让 MLLM 端到端学习按内容自适应分配视觉 token 粒度。基于 Qwen3.8-27B,它在八个基准上平均节省 43.0% token 并保留 98.9% 原生性能,而固定 50% 节省目标的 token 剪枝基线仅保留 88%。部署于 SGLang 后吞吐提升 2.3 倍,平均 TTFT 降低 54.4%、TPOT 降低 60.6%。
PixelTriage 是一个置于检索之后的小模型插件,不生成文本,仅凭对话、简短笔记和每张检索记忆的缩略图,就能在回答模型运行前预测该记忆的像素能带来多少增益。
针对静态跨模态对齐易导致过度对齐、置信度融合忽视特征量级差异的问题,研究者提出对齐与校准驱动的多模态学习框架 ACML。该框架包含动态跨模态三元组对齐模块和差异感知注意力校准策略,前者按置信度差距对正样本对施加差异化约束,后者依据特征量级与置信度差异自适应调整注意力正则。在多个多模态基准数据集上,ACML 的性能与鲁棒性持续优于近期 SOTA 方法。
研究提出多模态知识蒸馏(MKD)框架,用低秩多模态融合(LMF)结合预训练WSI图像编码器与临床文本编码器,教师模型学习图像-文本融合表示,学生模型蒸馏后仅凭图像即可推理。在PatchGastric基准上平均准确率比SOTA至少高3.35%,且不依赖Transformer融合、多任务学习或大语言模型,源代码已开源。
研究提出视觉弃权概念,即模型在请求的视觉变换不可能完成时应识别并拒绝生成。为此构建了 Draw-or-Decline 基准,包含 7 类任务的 1,050 对可行-不可行请求,评测 8 个统一多模态模型发现编辑能力与弃权能力相互独立,最强编辑器编辑准确率 68.4% 却仅拒绝 0.4% 的不可行请求。
SENSE 是一个状态感知框架,用于生成可玩的分支视觉小说并支持多轨情绪导航。它整合了名为 MIND 的状态化叙事架构、结构分析器和路径感知上下文管理模块,可从少量高层输入生成多条交叉路线,同时保持角色一致性与叙事因果性。基于 LLM 评判、情感指标和视觉评估的结果显示,SENSE 在叙事多样性和素材整合稳健性上优于基线,初步人类试验显示情绪保真度有方向性提升,娱乐性相当。
研究提出选择性情感层微调框架 SALFT,用于视频 Vision Transformer 的玩家唤醒度识别,通过层参数 L2-norm 变化筛选微调层,仅更新约 8% 参数(减少超 92%)。
OpenSplatGraph 是一个统一框架,可直接从在线高斯开放词汇语义地图构建持久 3D 场景图,通过可靠性感知语义场实现置信度感知、查询条件下的物体提取。提取的物体实例关联持久图节点,支持属性与关系跨观测和查询增量更新,兼顾语言引导的物体定位与结构化关系推理。该工作已被 ACCV 2026 接收,在标准 3D 场景理解基准和真实机器人实验中取得有竞争力的表现。
研究者提出 Physics-Guided Visual Prompting(PG-VP),一种即插即用多模态感知模块,让冻结的 VLA 模型通过叠加随帧移动的虚拟障碍物绕开 RGB 相机不可见的辐射与热源,无需重新训练。
研究用多个不同基础模型构建异构社交网络模拟,发现智能体获得的互动量更多取决于其基础模型而非被分配的人格。当混合的模型数量增加时,基础模型的吸引或排斥效应显著增强,暗示网络动态在大规模下可能收敛于基础模型效应。内容中介分析显示基础模型跨语境具有可预测性,且模型的词汇模式与互动最大化风格存在关联。
ElasticFit 是一个 VLM 引导的贴合感知 3D 物体插入框架,通过场景锚定的结构化拟合线索,将 VLM 推理转化为显式 3D 约束,支持刚性放置、等比缩放和弹性贴合三种适配模式。在固定资产基线对比中,其空间关系成功率从 50.8% 提升至 69.7%,支撑成功率从 48.3% 提升至 91.7%。该工作已被 NeurIPS 2026 接收。
研究者发布 TC3-VQA 数据集,用于将伤情视觉观察与战术战伤救治(TC3)临床指南相连接。该数据集由公开教学与实战视频及权威 TC3 文档构建,含 581 个条目、11 个概念和 1,860 个问题,覆盖干预识别、教义、临床推理、流程指导及视觉信息不足时的拒答。
研究者推出 PlaySuite,一个基于 5K 多款开源视频游戏构建的交互式视觉智能基准,覆盖 Pygame、HTML5、Godot 和 Unity 等引擎。该基准配套统一的闭环交互框架和 Video-LLM-as-a-judge 评测协议,并评测了 14 个近期开源模型。结果显示存在明显的感知-行动差距:模型虽推理能力较强,但在空间定位、动作执行和自我纠错上持续失败。
一项研究提出仅靠单个前置 RGB 摄像头和图神经网络,将模拟火车司机状态分为警觉、非警觉和紧急三类。消融实验显示,在光照条件下融合面部与骨骼特征的三分类模型准确率达 81%,二分类警觉/非警觉准确率达 99%,优于仅用面部或骨骼特征的模型。研究同时发布了一个涵盖三种光照条件的受控 RGB 视频数据集。
研究者演示了一套由视觉语言模型(VLM)引导的电磁数字孪生在线校准框架,在 Unitree G1 机器人和 NVIDIA Sionna 上运行,通过两次 VLM 调用完成材质分类与路径点规划。在真实室内场景中,该框架在 20 米行程内实现归一化平均绝对电导率误差 1.74×10⁻⁴,随机初始化则始终无法收敛,随机路径点所需行程超过两倍。
一项受控研究在 313 条 StrongREJECT 提示切片上,用五个多模态模型(附录另测 InternVL3.5-8B)剖析图生文越狱中的图像侧因素:纯有害查询即使配无关良性图片,多数模型攻击成功率仍很低,而攻击图像会大幅提升该指标。
研究者提出 IAU-FOA,一种结合视觉不变性增强与自适应非平衡最优传输的定向对抗攻击方法,通过在全局与局部 patch 层面同时对齐对抗样本和目标样本,提升对闭源 MLLM 的可迁移性。
两个 PersonaPlex-7B 实例在共享时钟上交换音频 token 进行无脚本对话,其轮次交接时序呈现耦合,但换手明显偏晚,中位数为 400-560 ms,而人类为 137 ms。在伙伴轮次最后 120 ms 内,人类约十分之一的交接发生于此,而模型仅占 1%。延迟单向通道会使响应一比一平移,且响应前的准备期为空,表明模型是在感知到对方结束后的被动等待,而非人类时序所需的轮末预判。
AssemState 是一个零样本家具装配框架,通过锚点引导的边界装配状态将手册页面分解为单部件操作并恢复装配树,再用迭代后状态反馈精修引导 SE(3) 位姿更新与修正,并通过仿真释放测试验证物理合理性。
研究者提出 Sensor-Language-Action(SLA)建模框架,以语言作为感知与行动之间的语义接口,将多模态传感器观测、自然语言和动作统一在一个模型中。
研究者提出量子纠缠多模态融合网络(QEMFN),将预训练视觉与文本特征投影为角度参数化量子态,经模态内与跨模态纠缠电路测量后生成融合表示。在参数预算匹配且冻结同一 CLIP 骨干的条件下,QEMFN 在 COCO-5k 和 Flickr30k 上优于多层感知机、张量融合、FiLM、交叉注意力、紧凑 Transformer 及去量子化的配对拓扑对照等经典融合基线。
ChartBmkAgent 能从稀疏的错误分类规范出发,通过中央 harness 治理多个专用智能体,构建完整的 Chart QA 诊断样本,并要求每个阶段提供与原始错误类别对齐的证据。
研究者推出 DSV-Mem 基准,用于评估 MLLM 智能体的密集有状态视觉记忆,包含专家审核场景和 1000 道题,覆盖 Current State、Past State、Derived State、Change History、Conflict/Refusal 五类。
研究提出多智能体系统的"执行一致性"定义,通过状态使用、信息交接和最终状态一致性等职责判断任务是否被满足。受控移除回执、动作依赖等证据后,82.4% 的对立标签对无法区分,恢复后 97.9% 可分离。基于 CAVERT 框架从日志提取关系并应用该标准,在全部 12 个基准执行器设置中诊断表现优于契约提示 LLM 和规则基线,并在四个环境中优于规则引导恢复。
WorkflowOps 是一个多智能体工作流编排框架,能从历史工作流中学习智能体协作先验,并按需扩展智能体池以覆盖新能力需求。它通过转移概率矩阵引导 DAG 工作流构建,并用分层语义匹配策略将 LLM 路由调用减少超 80%。在代码、数学与问答混合测试集上,其端到端通过率优于近期工作流构建基线,在结构化可分解任务上提升最大。