NormPaST-Risk:面向阿尔茨海默病检测的在线手写轨迹段级风险发现
研究者提出 NormPaST-Risk,将在线手写阿尔茨海默病(AD)检测重构为局部疾病相关片段发现,通过多尺度时序编码器与选择性 Paper-Air 状态空间编码器建模笔画动态,区分纸面运动执行与空中规划行为。
研究者提出 NormPaST-Risk,将在线手写阿尔茨海默病(AD)检测重构为局部疾病相关片段发现,通过多尺度时序编码器与选择性 Paper-Air 状态空间编码器建模笔画动态,区分纸面运动执行与空中规划行为。
研究团队开发了可调节置信度、透明度、正式度、果断性等信任相关特质、规则与人设的聊天机器人搭建环境,115 名 8-18 岁学习者共制作了 119 个聊天机器人。
ValueDiff 是一种基于值几何的 KV cache 淘汰方法,按 value 向量与缓存均值的 L2 偏差对 token 排序,在弱注意力汇模型上替代依赖注意力汇的既有方案。
研究者提出基于局部掩码 SAE 的无监督异常检测框架,利用线性表示假设下邻近点共享小共同活跃支撑的特性,在多种架构和数据集上验证了 LLM 安全检测的可行性。当允许使用 1% 的分布外数据校准时,该方法达到接近最优的性能,且仅需 1-2% 的 SAE 神经元参与计算。该工作发表于 NeurIPS2026。
研究者提出 Causal Semantic World Action Model(CSWAM),在 FastWAM 基础上引入基于 V-JEPA 2.1 的因果语义专家,通过因果注意力将历史语义上下文共享给视频与动作流,推理时仅需当前视频状态和语义历史即可完成动作去噪。
SpliTEE 将 LLM 推理拆分到 Intel TDX TEE 与不受信任的 GPU 之间,并用差分隐私保护中间表示,避免加密带来的量化问题。作者对 LLM 推理关键函数做了全局敏感度分析,并推导出掩码与噪声抵消的浮点误差上界。基于 Llama-3.2-3B 和 Qwen3-4B 的实现比全 TDX 推理快近 2 倍,比 Slalom 最多快 43% 且准确率更高。
研究者提出成本感知分层多智能体系统(HMAS),将证据获取建模为带预算的序贯决策问题,仅在静态证据置信度不足或控制器内智能体分歧时才升级到动态与内存分析。
论文提出 Latent Diagnostic Taxonomy 框架,用于构建作为防护层的分类器并诊断其哪些高置信决策可信。该框架通过交叉验证选择嵌入维度,定位约占训练样本 29% 的潜在支持向量,并据此构建诊断分类体系。在公开提示词注入数据集上,约 77% 的高置信决策在移除单个 token 后不再稳健,且脆弱性分为置信度校准失败与可被利用的捷径两类。
PertMind 将细胞扰动图谱转化为强化学习环境,以实测基因响应作为可计算奖励,结合可信轨迹监督初始化与基因、通路、格式三级强化信号。该模型仅在正向扰动响应预测上训练,却在未见细胞环境中提升响应推断,并零样本迁移至反向扰动识别、双扰动推理、表型筛选优先级排序和生物过程解读。
一项研究用十个月欧洲地面观测数据,将 12 个物理与 AI 预报模型对照 ECMWF IFS 评估,覆盖 10 m 风速、2 m 气温、太阳辐射和降水。结果显示 AI 模型在极端条件下并无统一的尾部劣势:部分 AI 模型比 IFS 更准,另一些则明显退化,物理模型间也存在类似差异。所有模型都表现出高值低估、低值高估的共同条件误差模式,尾部表现取决于模型、变量和评估设置,而非是否由 AI 生成。
研究提出一个受控基准,用有序规划操作刻画 LLM 智能体在信息物理系统中的控制轨迹,由 Llama-3.3-70B 在 40 个产消者的辐射状馈线上执行需求响应实验。
研究基于合成基准 SBID-FD,将已知含冲突的段落分为 11 类不一致类型,并对比冻结编码器、微调编码器、证据增强分类器、提示式大语言模型与 LoRA 适配生成模型。结果显示任务特定适配显著优于冻结表示,微调后的 300M 编码器可与更大规模的提示与适配模型竞争。自动提取的证据能提供额外信号,但仅能恢复参考跨度带来的部分收益。
研究者提出一种多尺度视觉特征表示,将边缘与轮廓特征及其空间关系编码后,集成进无梯度的发展式学习框架,在类增量 MNIST 上大幅提升识别准确率。该方法无需回放缓冲区或预设任务边界,存储量相当时可匹配或超越基于回放与正则化的基线,且不遗忘旧类别。学到的表示保持人类可解释性,基线方法则在训练周期内丢失大部分刚学类别后再重新学习。
研究者提出 Variational-Ising-Attention(VIA),在 softmax 归一化基础上引入相互作用 Ising 模型,通过变分平均场推断从可学习的成对耦合中生成注意力模式,将注意力从孤立项的排序扩展为相互作用实体的集体状态。
研究者提出 Retrieval-Augmented Interpretable Learning(RAIL),一种概率元学习框架,可从自然语言任务描述和已学预测器记忆中合成系数空间结构,零样本生成任务特定的可解释模型。
研究者推出 3D-DefectBench,用覆盖几何、纹理与提示词遵循的九类细粒度二元缺陷评估 3D 生成,并跨 84 种推理设计对 VLM、相机协议、视觉输入与提示词方案做析因分析。
Guided Action Flow(GAF)通过从机器人任务 rollout 中学习紧凑的观测条件动作价值 critic,并用其动作梯度引导反向流采样,使监督微调后的 VLA 策略保持冻结。
研究者提出 Prime Fourier Embeddings(PFE),将整数编码为素数索引的 (cos, sin) 对,使模运算只需选择相关素数通道。基于 Schur 引理,作者证明任何对乘积群作用等变的线性映射必为块对角结构,每个素数对应一个独立块;中国剩余定理可预测无平方因子合数模的任务相关通道。
研究者提出用程序合成近似 Transformer 注意力头行为的方法:先计算注意力矩阵,再让预训练语言模型据此生成 Python 程序,最后按留出输入上的预测效果重排序。
SAE++ 是一种级联稀疏自编码器架构,通过在初级 SAE 的解码器权重上训练二级 SAE,学习多模态 LLM 中的层级视觉概念,避免嵌套式共享前缀耦合与朴素堆叠的瓶颈。在 Qwen3-VL、Gemma-3 和 LLaVA 上的多组视觉数据集实验中,SAE++ 在层级概念一致性上优于当前最优 SAE 基线,并支持对 MLLM 输出进行组级概念干预。代码已开源。
研究者提出 support-conditioned control-sensitivity regularization,通过促进训练充分区域的局部响应性来保留控制引发的状态变化,解决学习动力学对控制不敏感、掩盖 OOD 信号的问题。该方法在视觉避障、操作和真实机器人导航实验中提升了 OOD 检测能力与闭环规划安全性,论文已被 CoRL 2026 接收。
研究揭示推理训练语言模型在数千至数十万候选标签中做多标签选择时,依赖一组小型、全局、分阶段的注意力头,在 MIMIC-IV 临床编码任务(5,651 个诊断码全部入上下文)中经消融与 knock-in 验证为必要且充分。作者提出 MISTILL,在决策事件处额外监督学生模型的池化注意力,跨家族学生对比决策的因果恢复近乎翻倍。
FFR 是首个将 Forward-Forward(FF)学习扩展到真实回归任务的框架,在六个真实回归基准上平均恢复 BP 精度的 98.5%,同时将深度 8 时的峰值训练内存降至 BP 的 27%、深度 32 时降至 8%,单次迭代时间约为 BP 的 72%。它引入序数竞争 goodness 函数、分层阶梯架构与带不确定性估计的层次化预测三项创新,显著优于所有无 BP 的竞争方法。
研究团队提出 GPU 加速的持续强化学习域 Banyan,可参数化控制地图布局、交互对象和子目标依赖层级三个独立任务轴。实验发现,沿各轴增加多样性会带来系统性迁移,但多样性过高会抑制学习器持续适应新任务分布的能力:在新任务上成功率趋于平台,却在旧任务上持续提升。该现象在多种持续学习算法、记忆架构、模型规模以及物理控制域 Kinetix 中均成立。
研究提出终端表示(TR),一种结构上区别于后继表示(SR)和默认表示(DR)的新型强化学习表示方法。TR 与 DR 一样编码奖励加权轨迹,但可作为更低维对象学习,且无需特征分解即可直接用于选项发现、奖励塑形、迁移学习和探索等任务,同时绕开对称转移动态假设。
研究者提出 SPATIALUNCERTAIN 评测框架,用遮挡造成的证据缺失和透视造成的误导证据两类场景,考察视觉语言模型能否判断当前视角是否可靠。在八个开源与闭源 VLM 上,模型行为并不跟随视觉证据的可靠性:证据消失时不会更谨慎,透视冲突时判断更依赖投影外观而非未变的物理 3D 关系。
D3S2 是面向语义分割的扩散引导数据集蒸馏框架,采用类平衡掩码选择与扩散引导图像合成两阶段设计,通过分割一致性损失和类级特征匹配损失提升合成数据训练效用。在 1% 压缩率下,该方法在 ADE20K 和 COCO-Stuff 上以 Mask2Former(Swin-S)分别达到 24.99% 和 35.49% mIoU,较随机选择高出 9.34% 和 5.70%。代码已开源。
研究者提出 Distribution-Aware Reward(DAR),一种 on-policy 强化学习目标,通过联合评估同一输入下多次预测形成的经验预测分布,并按留一法贡献为每个预测分配奖励。在合成插值/外推任务及代码、分子两个真实科学回归任务上,DAR 相比监督微调和逐点强化学习降低了预测误差、提升了排序质量,并给出校准更好的不确定性估计。
研究提出内在偏差假说(IBH),指出 LLM 智能体的调用/不调用决策映射中存在与激活无关的调用偏移,使其在激活持平时仍倾向调用工具。在 When2Call 基准上,三个家族六个模型调用准确率高但不调用准确率明显偏低,整体准确率仅 55%-70%。团队用稀疏自编码器(SAE)提取决策特征并估计该偏移,再以 AMCS 因果校正,缓解过度调用并提升整体准确率,调用准确率几乎不降。
KadiAssistant 是一款集成于 Kadi 科研数据生态的隐私设计 AI 助手,结合自托管大语言模型与隐私保护语义搜索,可访问 Kadi 上的文件与记录元数据,帮助研究人员检索、聚合和结构化异构科研数据。该助手遵循 Kadi 的细粒度访问权限控制,旨在打通材料科学等跨学科领域的术语与标准壁垒,并强化 FAIR 原则中的可发现性。
研究者提出随机惩罚-障碍法(SPBM),通过引入对偶变量的指数平均、稳定化的惩罚调度和 Moreau 包络来处理非光滑性,用于约束机器学习(CML)问题。在公平性和物理信息神经网络实验中,SPBM 与当前最优方法相比具有竞争力。在公平性基准上,当约束数量从 90 增至 9900 时,CML 方法的每轮运行时间基本与约束数量无关,且不超过正则化 Adam 每轮运行时间的 1.3 倍。
NeurIPS 2026 论文《Voice "Cloning" is Style Transfer》发现,广泛使用的语音克隆模型并非忠实复制个人声音,而是对源声音系统性施加风格迁移。人类标注者认为克隆语音比原声更权威、温暖、像客服且更像真人,对其信任度更高,也更愿意向其透露敏感个人信息。研究还显示,克隆导致口音、语速和音频嵌入空间方差缩小,造成说话人特征同质化。
PBT-Bench 是一个覆盖 40 个真实 Python 库、100 道基于属性测试题的基准,每题注入语义 bug 共 365 个(平均 3.65 个),默认随机输入几乎无法触发。
研究者提出 Residual Latent Action(RLA),可从 DINO 残差中学习,并据此构建 RLA-WM 世界模型,通过 flow matching 预测 RLA 值。
研究针对区块经济价值随机、采矿与加工产能随时间变化的动态机会约束露天矿调度问题,提出双目标进化算法,同时最大化期望折现利润并最小化其标准差。为应对动态变化,作者提出基于多样性的变化响应机制,修复部分不可行解并在检测到变化时引入额外可行解。在六个矿山实例上,该机制在四种多目标进化算法中均持续优于基于重新评估的基线策略。
研究用反事实图像集考察大型视觉语言模型(LVLM)在不同文化语境下对人物道德、伦理与政治价值的判断,基于 480 万次 LVLM 生成结果,识别出三种可跨多个架构不同模型复现的问卷锚定偏差模式。
一项研究分析了 Transformer 中双随机注意力的秩衰减问题,发现用 Sinkhorn 算法归一化的双随机注意力矩阵比标准 softmax 行随机注意力更能有效保持秩,且残差连接对缓解秩崩溃至关重要。该现象在情感分析和图像分类任务上得到实证验证,理论上推导出纯自注意力下秩随深度双重指数衰减至 1 的界。
一种新的神经优化方法通过迭代精炼从噪声样本中寻找全局最小值,在多模态测试函数上平均误差为 8.05%,相比样条初始化的 36.24% 提升了 28.18%。该模型在 72% 的测试案例中成功找到全局最小值且误差低于 10%,无需导数信息或多次重启。
针对现有奖励模型依赖昂贵显式反馈的问题,研究者提出 ImplicitRM,可从点击、复制、跳过等隐式用户反馈中学习无偏奖励模型。该方法用分层模型将训练样本划分为四个潜在组,并推导出理论上无偏的似然最大化目标,以解决隐式反馈缺乏明确负样本和存在选择偏差两大挑战。
研究者提出目标感知频率-空间协同增强(FSCE)框架,用于抗噪 SAR ATR,通过频率-空间建模实现早期特征稳定并结合语义正则化。该框架在网络入口设计 FS-EAE 模块抑制噪声传播,并引入 APSA 机制以在线教师策略施加语义约束。在 MSTAR、OpenSARShip 和 FUSARShip 上的实验验证了其有效性,轻量版 FSCE-Net_μ 仅 0.17M 参数。