4D-HOF:用流匹配实现前馈式 4D 手物交互重建
4D-HOF 是一个前馈框架,利用视觉基础模型生成的粗略手物状态,通过条件流匹配将其输运至交互流形,前馈式修正平移、旋转与对齐误差。其生成式建模可在输运过程中直接以物理交互约束和 2D 观测证据进行测试时引导,无需重建后再做后处理优化。在域外基准上,4D-HOF 取得 SOTA 性能,重建更稳定准确。
4D-HOF 是一个前馈框架,利用视觉基础模型生成的粗略手物状态,通过条件流匹配将其输运至交互流形,前馈式修正平移、旋转与对齐误差。其生成式建模可在输运过程中直接以物理交互约束和 2D 观测证据进行测试时引导,无需重建后再做后处理优化。在域外基准上,4D-HOF 取得 SOTA 性能,重建更稳定准确。
IdeaAnchor 提出一种用结构化规格作为特权信号训练 LLM 进行科研选题的范式,每个实例编码输入论文的功能角色、关系与目标综合标准。研究者从已发表论文中挖掘实例,通过示范、自蒸馏和强化学习训练模型,并在推理时用检索增强生成。实验显示选题质量持续提升,其中 anchor 训练强化创造性综合,检索改善细节展开,两者结合效果最佳。
DepthWorld 是首个基于 Stable Video Diffusion 的 3D 世界模型,通过空间 latent tiling 联合预测多视角 RGB 与深度,同时保持预训练 VAE 不变。
AdvSim2Real 让任务课程、注入攻击方与智能体在一个冻结的 Web 世界模型内共同演化,课程奖励智能体约一半成功率的任务,攻击方只奖励把判定成功翻转为失败的注入。训练使 4B 智能体在有无攻击下完成率均上升,并能抵御从未训练过的前沿模型攻击,能力提升还迁移到真实浏览器。在 150 个 Web 任务上,面对该未见攻击方,其完成率相对基线智能体提升 33.6%。
WorldSonus 是一个面向世界模型的交互式视频转音频框架,可实时合成空间音效。它采用流式因果自回归扩散架构,实时因子低至 0.41,并通过以音频为中心的描述管线与分块提示词调度实现生成过程中的动态声音控制,同时利用立体声与 ambisonic 数据实现空间对齐。实验显示其在声学质量与空间对齐上匹配或超越当前最优的双向模型。
研究者提出 Calibrated Pruning 强化学习(RLCP),利用 critic 分数和在线阈值自适应调整保留动作集,并证明自适应轨迹上代理漏检率的确定性上界。在 KuaiRand-Pure 和 MovieLens 1M 上对比四种 RL 基线,19 种配置中至少一个 RLCP 变体取得最高目录多样性,达最强基线的 1.11× 至 5.21×,会话深度相当且保留集不更大。
EgoLAP 是一个 VLA 预训练框架,通过共享的基于语言的动作链式推理,联合学习人类与机器人轨迹,将动作意图表达为结构化、时间抽象的语言动作。在真实世界与仿真实验中,EgoLAP 达到 80.1% 的平均真实任务进度,相比替代动作表示取得 2.3 倍性能提升,且运动级推理优于结合子任务、物体框与视觉轨迹的复合推理格式。
研究首次系统分析投机解码的安全影响,发现各类有损投机解码方法在提升推理效率时,越狱与提示注入攻击成功率上升速度远快于效用下降,存在明显的安全-效用不对称。为此提出 SecureSD,理论分析指出安全退化主要源于 draft model 生成的早期 token,故对早期解码位置的 draft token 采用更严格验证标准。
研究构建了 248 个场景的预注册测试面板,覆盖五类压力情境,发现 OLMo-3-7B-Instruct 在约五分之一的施压场景中会做出自己判定为错误的行为。这一"言行差距"取决于后训练配方:OLMo-3 和 Meta 的 Llama-3.1-8B-Instruct 存在该差距,而基于同一 Llama-3.1 权重训练的 Ai2 Tulu 3 在整个面板上未显现。
MemFLoRA 是一种面向 CNN 边缘适配的低秩适配器,采用内存优先设计而非直接套用面向 Transformer 的 LoRA。它冻结下投影、训练尺度匹配的上投影,并将保存状态压缩到低秩分支,在三个 HAR 数据集和两个 CNN 骨干上,相比全量微调减少 98.5-98.7% 的激活内存和 94.9-97.3% 的峰值训练状态内存,同时匹配或超过 CNN PEFT 基线。
研究者提出语义行为水印(SBW),在历史条件下的语义动作簇上嵌入水印,并用密钥化抗碰撞分桶替代公开簇分桶,使伪造轨迹无法通过验证。在 ToolBench(每模型 600 条轨迹)上,改写场景下簇级检测率为 0.49-0.66,而精确符号方案仅 0.05-0.17;ALFWorld(每模型 100 集)上为 0.92-0.97 对 0.00-0.01。
研究者提出 Selective-RL,通过隔离强化学习阶段的参数更新、保留其主导矩阵方向并保持幅度,将其迁移至 VLM 的语言模块。在三个模型家族、五个视觉推理基准上,该方法在 15 项对比中有 12 项优于完整更新插值,其中 Qwen 接收模型的 MathVision 提升 8.55 个百分点。对照实验显示,仅靠更新幅度或任意低秩无法复现该增益。
一项案例研究记录了一个由编码智能体构建、由无正式软件工程背景的运营者治理的生产级医疗平台。其工作流演变为人类主导的元智能体系统:一个智能体写代码,其他智能体监督审查,项目规则持续传递经验。运营者发现测试、监控和审查智能体均可能出错,部分监控只测代理指标而非结果,部分审计静默失败,一次自动修复还引发了运营中断。
研究者推出 HygieneRoboBench,包含 134 个任务族、624 个实例,用于评估规划器如何依据执行历史识别接触污染风险并规划安全后续动作。评测显示,基于 LLM 与符号规划的基线能安全完成任务,却未必在用户优先级下实现最低执行成本。
研究者提出"特征信息动力学"框架,用信息论方法定位扩散模型中每个特征在何时被生成,借助 I-MMSE 恒等式将特征互信息变化率与最优无条件去噪损失和特征条件去噪损失之间的差距关联,给出特征信息密度的实用估计器。
研究者提出一种从短程试点训练中选择 Adam 共享记忆参数 β₁=β₂=β 的方法,选定后在全量训练中保持固定。该方法基于 Adam 归一化方向的局部模型,在采样波动与梯度平均延迟之间取得平衡,导出三次记忆规则,其系数由少量试点检查点的梯度探测估计。
针对互联网级服务故障排查,研究者提出智能体系统 E4,采用"受限创造力"范式,不让 LLM 智能体写任意代码或生成任意回复,而是通过一个无循环数据流程序的受限 DSL 生成响应。在合成与真实混合负载上,E4 准确率最高提升 62%,成本最高降低 12 倍,同时提供更可解释的响应。
低成本地面多机器人系统 CropSentry 通过多模态叶片传感逐行监测作物健康,两台自主机器人采集叶片颜色与环境数据并上传主机器人,生成实时网页仪表盘。63 次观测实验显示作物健康分类总体准确率 84.12%,其中健康植株 82.60%、营养缺乏植株 88%、患病植株 80%,10 次从机观测的无线通信成功率达 100%。
研究者提出 Coordinated Multi-Agent Diffusion Steering(CMDS),将冻结的预训练扩散模型视为可复用生成原语,通过学习的控制协调其反向过程。
研究揭示模型的学习方式会显著影响其后续的遗忘(unlearning)表现:以泛化为主的模型在遗忘时对保留集的性能损伤更大。作者通过模块加法中的 grokking 现象区分记忆型与泛化型模型,并引入分桶模块加法在记忆-泛化连续谱上精细控制两种策略的贡献,发现该趋势近乎单调。这一关系在 LLM 的逐字回忆与事实回忆遗忘场景中同样成立。
FedDermaSeg 用联邦学习实现隐私保护的皮肤病变分割,在 ISIC 2018 训练与验证集上模拟分布式环境训练,并在 ISIC 2018 测试集和 PH2 数据集上评估。结果显示其性能与集中式训练相当,且持续优于各本地训练模型,无需集中聚合医学图像即可协同分割。
RAG-PIBench 是一个面向 RAG 提示注入检测的基准,包含 4,876 条上下文样本,划分为冻结的训练、验证与受保护测试集,并采用防泄漏构建流程与严格评测协议。
研究分析激活引导所用去偏见方向的实际编码内容,发现该方向由模型置信度主导,在激活空间中指向高概率到低概率 token 区域,而非编码有意义的偏见表征。沿该方向引导虽能降低偏见指标,但实为降低模型置信度所致:在 QA 基准上模型因此拒绝作答,附带改善了公平性指标。研究指出,将偏见线性表征与模型置信度解耦十分困难,基于引导的去偏见结果需谨慎解读。
一项 SoK 研究系统综述了 100 项涉及儿童与青少年接触 AI 的实证 HCI 研究,覆盖学校、家庭、护理和公共服务场景。基于 YAIR 风险分类与 MIT Mitigation Taxonomy,研究发现多数风险仅有提出或构想中的对策,少数被实际部署,经评估者更少,且现有评估多衡量技术性能而非是否真正防止伤害。
针对非线性记忆网络在序列测试时训练中难以单遍优化、串行 TTT 反而不如固定基座并行 TTT 的问题,研究者提出 DeltaTTT,将两层记忆网络的联合内循环优化改为逐层学习,每层分配局部预测目标并通过状态相关的 delta 规则更新。该方法保留非线性读出并支持分块并行计算,在 DeltaNet 和 LaCT 骨干上提升了语言建模与检索表现。
针对可解释性探针得分缺乏固定含义的问题,研究者提出用 floor(简单输入已能预测的部分)和 ceiling(完整输入可预测的部分)两个参照点来解读探针得分,二者之间的 headroom 才是模型真正计算出的信息。
研究提出 Micro Neural Policies(MNP),将 Evolution Strategy 与基于 Statistical Model Checking 的验证结合用于策略搜索,大幅压缩神经网络规模。
研究者提出一种可扩展的客户感知概率负荷预测框架,通过共享模型学习共性需求行为,仅适配一小组低维参数,让每个负荷按自身特征组合这些适配组件。在 SMART-DS 数据集 590 条负荷曲线上,该方法在确定性精度和概率质量上均优于统计、神经网络、Transformer 及预训练时间序列基线,同时保持较低的存储与推理成本。
FlowCF 是一种模型无关的生成式反事实解释方法,将反事实生成建模为从事实类到目标类的稀疏传输,并用流匹配求解,通过新型混合流算子扩展到混合特征类型。在六个基准数据集上,FlowCF 取得最佳数值稀疏性与接近度,仅改变 29% 的数值特征(最佳基线为 89%),位移小 70%。该工作已被 NeurIPS 2026 GDDL Workshop 接收。
MedCORE 是一个将临床推理结构化的视觉-语言诊断框架,把诊断过程拆解为临床标准、定位对应图像区域,并用 Graph Attention Network 建模标准间依赖。
研究者推出 Wiki-Talkie,一个覆盖德语、英语、西班牙语、法语、意大利语五种语言的多语言数据集,取自 Wikipedia Talk 页面的真实对话,并配以真实用户社区衍生的人格画像。在下一轮对话生成任务上,用户评论历史所体现的交互行为持续优于显式人格信息;模型系统性地少产生负面或极端情绪,同时多产生引用与建议,表现出偏向顺从与积极的偏差,且这一模式在各语言间稳健成立。
X-OPM 提出一种可解释的数字片上功耗建模框架,用树模型捕捉特征交互、线性模型完成预测,并引入 human-in-the-loop 流程平衡精度与建模成本。在商用 C906 向量处理器上,采样窗口小于 8 cycles 时全部工作负载均达 R² > 0.93,而 APOLLO、COBIT 和标准 MLP 均无法在所有测试用例上泛化。
一项预注册研究用 880 个语言模型评分者对 189 份访谈做八项 Patient Health Questionnaire 评估,发现模型选择解释了汇总症状得分方差的 30.0%,稳定的参与者差异仅占 10.5%。
Knee3DVLM 是一个序列感知的视觉语言模型,利用全容积 DESS 与液体敏感 TSE MRI 预测 57 个源自 MOAKS 的解剖定位二分类诊断目标。
MetaLearnNCA 提出一种去中心化少样本元学习框架,通过耦合神经细胞自动机(NCA)的动力学交互完成任务适配,推理时无需计算解析梯度。该框架由 Active-NCA 和 Meta-NCA 组成,后者作为去中心化细胞优化器在局部邻域扩散空间误差残差以动态更新空间程序。
跨分词器在线策略蒸馏(OPD)中,严格 1:1 对齐已覆盖大部分学生生成 token,将 reverse KL 限制在共享词表 top-16 子集即可达到与全共享词表 OPD 相当的准确率,优于所评估的跨分词器基线。
NVIDIA 提出 NeMo-DCR(Delta-Compressed Refit),只传输权重变化量却保持比特精确,接收端得到与全量重配完全相同的参数和 buffer 位。
研究团队构建了一个轮次标注的多轮基准(423 段对话、1,661 个标注轮次状态)和带模拟用户的评估框架,用 6 个数据集与 6 个开源权重 LLM 测试不可回答性探针的迁移能力。
研究提出失败驱动提示词优化方法 FDPR,通过分析 LLM 在漏洞分析中的反复失败模式来指导提示词改进。团队基于 DVJA 识别出误报、漏报、无依据推理和 CWE 误分类等失败模式,并在 Juliet Test Suite 上评估优化后的提示词,同时进行跨模型验证。结果显示该方法提升了 LLM 漏洞分析的可靠性,并提炼出可复用的提示词设计原则。
研究者提出免训练框架 GeoPID,从几何视角将 VLM 中的多模态信息分解为冗余、模态独有和协同三类成分。在 22 个 VLM 和 14 个 benchmark 上的分析显示,需要视觉 grounding 的问题中正确预测具有更强的视觉独有成分。基于此,GeoPID 在推理时沿视觉独有子空间选择性放大视觉表征,无需更新模型参数即平均提升 7.63% 相对准确率。