跳到正文
10月7日周三
  1. arXiv cs.AI27

    局部稀疏性实现无监督 LLM 安全检测

    研究者提出基于局部掩码 SAE 的无监督异常检测框架,利用线性表示假设下邻近点共享小共同活跃支撑的特性,在多种架构和数据集上验证了 LLM 安全检测的可行性。当允许使用 1% 的分布外数据校准时,该方法达到接近最优的性能,且仅需 1-2% 的 SAE 神经元参与计算。该工作发表于 NeurIPS2026。

  2. arXiv cs.AI27

    SpliTEE:用 GPU 辅助 TEE 结合差分隐私实现快速私密 LLM 推理

    SpliTEE 将 LLM 推理拆分到 Intel TDX TEE 与不受信任的 GPU 之间,并用差分隐私保护中间表示,避免加密带来的量化问题。作者对 LLM 推理关键函数做了全局敏感度分析,并推导出掩码与噪声抵消的浮点误差上界。基于 Llama-3.2-3B 和 Qwen3-4B 的实现比全 TDX 推理快近 2 倍,比 Slalom 最多快 43% 且准确率更高。

  3. arXiv cs.AI24

    Latent Diagnostic Taxonomy:面向提示词注入检测的分类器构建与决策诊断框架

    论文提出 Latent Diagnostic Taxonomy 框架,用于构建作为防护层的分类器并诊断其哪些高置信决策可信。该框架通过交叉验证选择嵌入维度,定位约占训练样本 29% 的潜在支持向量,并据此构建诊断分类体系。在公开提示词注入数据集上,约 77% 的高置信决策在移除单个 token 后不再稳健,且脆弱性分为置信度校准失败与可被利用的捷径两类。

  4. arXiv cs.AI27

    PertMind:用细胞扰动数据强化学习激发 LLM 涌现生物推理能力

    PertMind 将细胞扰动图谱转化为强化学习环境,以实测基因响应作为可计算奖励,结合可信轨迹监督初始化与基因、通路、格式三级强化信号。该模型仅在正向扰动响应预测上训练,却在未见细胞环境中提升响应推断,并零样本迁移至反向扰动识别、双扰动推理、表型筛选优先级排序和生物过程解读。

  5. arXiv cs.AI32

    AI 天气模型真的会漏报极端天气吗?研究对比 12 个模型后发现并非如此

    一项研究用十个月欧洲地面观测数据,将 12 个物理与 AI 预报模型对照 ECMWF IFS 评估,覆盖 10 m 风速、2 m 气温、太阳辐射和降水。结果显示 AI 模型在极端条件下并无统一的尾部劣势:部分 AI 模型比 IFS 更准,另一些则明显退化,物理模型间也存在类似差异。所有模型都表现出高值低估、低值高估的共同条件误差模式,尾部表现取决于模型、变量和评估设置,而非是否由 AI 生成。

  6. arXiv cs.AI22

    财务披露文本中的细粒度不一致分类诊断研究

    研究基于合成基准 SBID-FD,将已知含冲突的段落分为 11 类不一致类型,并对比冻结编码器、微调编码器、证据增强分类器、提示式大语言模型与 LoRA 适配生成模型。结果显示任务特定适配显著优于冻结表示,微调后的 300M 编码器可与更大规模的提示与适配模型竞争。自动提取的证据能提供额外信号,但仅能恢复参考跨度带来的部分收益。

  7. arXiv cs.AI22

    多尺度结构特征助力持续、可理解的视觉识别:一种发展式学习框架

    研究者提出一种多尺度视觉特征表示,将边缘与轮廓特征及其空间关系编码后,集成进无梯度的发展式学习框架,在类增量 MNIST 上大幅提升识别准确率。该方法无需回放缓冲区或预设任务边界,存储量相当时可匹配或超越基于回放与正则化的基线,且不遗忘旧类别。学到的表示保持人类可解释性,基线方法则在训练周期内丢失大部分刚学类别后再重新学习。

  8. arXiv cs.AI22

    Prime Fourier Embeddings:面向模运算的原理性基

    研究者提出 Prime Fourier Embeddings(PFE),将整数编码为素数索引的 (cos, sin) 对,使模运算只需选择相关素数通道。基于 Schur 引理,作者证明任何对乘积群作用等变的线性映射必为块对角结构,每个素数对应一个独立块;中国剩余定理可预测无平方因子合数模的任务相关通道。

  9. arXiv cs.AI22

    SAE++:级联稀疏自编码器学习多模态 LLM 的多层级视觉概念

    SAE++ 是一种级联稀疏自编码器架构,通过在初级 SAE 的解码器权重上训练二级 SAE,学习多模态 LLM 中的层级视觉概念,避免嵌套式共享前缀耦合与朴素堆叠的瓶颈。在 Qwen3-VL、Gemma-3 和 LLaVA 上的多组视觉数据集实验中,SAE++ 在层级概念一致性上优于当前最优 SAE 基线,并支持对 MLLM 输出进行组级概念干预。代码已开源。

  10. arXiv cs.AI22

    面向潜在建模的敏感性塑造:提升生成动力学模型的 OOD 检测与安全规划

    研究者提出 support-conditioned control-sensitivity regularization,通过促进训练充分区域的局部响应性来保留控制引发的状态变化,解决学习动力学对控制不敏感、掩盖 OOD 信号的问题。该方法在视觉避障、操作和真实机器人导航实验中提升了 OOD 检测能力与闭环规划安全性,论文已被 CoRL 2026 接收。

  11. arXiv cs.AI24

    Characterize Then Distill:大输出空间中的机制化推理

    研究揭示推理训练语言模型在数千至数十万候选标签中做多标签选择时,依赖一组小型、全局、分阶段的注意力头,在 MIMIC-IV 临床编码任务(5,651 个诊断码全部入上下文)中经消融与 knock-in 验证为必要且充分。作者提出 MISTILL,在决策事件处额外监督学生模型的池化注意力,跨家族学生对比决策的因果恢复近乎翻倍。

  12. arXiv cs.AI24

    FFR:面向回归任务的前向-前向学习框架

    FFR 是首个将 Forward-Forward(FF)学习扩展到真实回归任务的框架,在六个真实回归基准上平均恢复 BP 精度的 98.5%,同时将深度 8 时的峰值训练内存降至 BP 的 27%、深度 32 时降至 8%,单次迭代时间约为 BP 的 72%。它引入序数竞争 goodness 函数、分层阶梯架构与带不确定性估计的层次化预测三项创新,显著优于所有无 BP 的竞争方法。

  13. arXiv cs.AI30

    任务多样性带来系统性迁移却抑制持续强化学习:Banyan 域研究

    研究团队提出 GPU 加速的持续强化学习域 Banyan,可参数化控制地图布局、交互对象和子目标依赖层级三个独立任务轴。实验发现,沿各轴增加多样性会带来系统性迁移,但多样性过高会抑制学习器持续适应新任务分布的能力:在新任务上成功率趋于平台,却在旧任务上持续提升。该现象在多种持续学习算法、记忆架构、模型规模以及物理控制域 Kinetix 中均成立。

  14. arXiv cs.AI22

    强化学习中的终端表示(Terminal Representation)

    研究提出终端表示(TR),一种结构上区别于后继表示(SR)和默认表示(DR)的新型强化学习表示方法。TR 与 DR 一样编码奖励加权轨迹,但可作为更低维对象学习,且无需特征分解即可直接用于选项发现、奖励塑形、迁移学习和探索等任务,同时绕开对称转移动态假设。

  15. arXiv cs.AI32

    SPATIALUNCERTAIN:VLM 能否判断何时不该回答空间问题?

    研究者提出 SPATIALUNCERTAIN 评测框架,用遮挡造成的证据缺失和透视造成的误导证据两类场景,考察视觉语言模型能否判断当前视角是否可靠。在八个开源与闭源 VLM 上,模型行为并不跟随视觉证据的可靠性:证据消失时不会更谨慎,透视冲突时判断更依赖投影外观而非未变的物理 3D 关系。

  16. arXiv cs.AI22

    D3S2:面向语义分割的扩散引导数据集蒸馏框架

    D3S2 是面向语义分割的扩散引导数据集蒸馏框架,采用类平衡掩码选择与扩散引导图像合成两阶段设计,通过分割一致性损失和类级特征匹配损失提升合成数据训练效用。在 1% 压缩率下,该方法在 ADE20K 和 COCO-Stuff 上以 Mask2Former(Swin-S)分别达到 24.99% 和 35.49% mIoU,较随机选择高出 9.34% 和 5.70%。代码已开源。

  17. arXiv cs.AI22

    面向 LLM 回归的预测分布强化学习:Distribution-Aware Reward 方法

    研究者提出 Distribution-Aware Reward(DAR),一种 on-policy 强化学习目标,通过联合评估同一输入下多次预测形成的经验预测分布,并按留一法贡献为每个预测分配奖励。在合成插值/外推任务及代码、分子两个真实科学回归任务上,DAR 相比监督微调和逐点强化学习降低了预测误差、提升了排序质量,并给出校准更好的不确定性估计。

  18. arXiv cs.AI32

    LLM 智能体为何过度调用工具:诊断内在过度调用偏差

    研究提出内在偏差假说(IBH),指出 LLM 智能体的调用/不调用决策映射中存在与激活无关的调用偏移,使其在激活持平时仍倾向调用工具。在 When2Call 基准上,三个家族六个模型调用准确率高但不调用准确率明显偏低,整体准确率仅 55%-70%。团队用稀疏自编码器(SAE)提取决策特征并估计该偏移,再以 AMCS 因果校正,缓解过度调用并提升整体准确率,调用准确率几乎不降。

  19. arXiv cs.AI22

    KadiAssistant:面向 Kadi4Mat 信息检索的对话式 AI 智能体

    KadiAssistant 是一款集成于 Kadi 科研数据生态的隐私设计 AI 助手,结合自托管大语言模型与隐私保护语义搜索,可访问 Kadi 上的文件与记录元数据,帮助研究人员检索、聚合和结构化异构科研数据。该助手遵循 Kadi 的细粒度访问权限控制,旨在打通材料科学等跨学科领域的术语与标准壁垒,并强化 FAIR 原则中的可发现性。

  20. arXiv cs.AI22

    随机惩罚-障碍法 SPBM:面向约束机器学习的新方法

    研究者提出随机惩罚-障碍法(SPBM),通过引入对偶变量的指数平均、稳定化的惩罚调度和 Moreau 包络来处理非光滑性,用于约束机器学习(CML)问题。在公平性和物理信息神经网络实验中,SPBM 与当前最优方法相比具有竞争力。在公平性基准上,当约束数量从 90 增至 9900 时,CML 方法的每轮运行时间基本与约束数量无关,且不超过正则化 Adam 每轮运行时间的 1.3 倍。

  21. arXiv cs.AI42

    研究揭示语音“克隆”实为风格迁移:NeurIPS 2026 论文发现克隆语音更权威、更值得信任

    NeurIPS 2026 论文《Voice "Cloning" is Style Transfer》发现,广泛使用的语音克隆模型并非忠实复制个人声音,而是对源声音系统性施加风格迁移。人类标注者认为克隆语音比原声更权威、温暖、像客服且更像真人,对其信任度更高,也更愿意向其透露敏感个人信息。研究还显示,克隆导致口音、语速和音频嵌入空间方差缩小,造成说话人特征同质化。

  22. arXiv cs.AI12

    进化优化如何求解动态机会约束露天矿调度问题

    研究针对区块经济价值随机、采矿与加工产能随时间变化的动态机会约束露天矿调度问题,提出双目标进化算法,同时最大化期望折现利润并最小化其标准差。为应对动态变化,作者提出基于多样性的变化响应机制,修复部分不可行解并在检测到变化时引入额外可行解。在六个矿山实例上,该机制在四种多目标进化算法中均持续优于基于重新评估的基线策略。

  23. arXiv cs.AI22

    Sinkhorn 双随机注意力秩衰减分析

    一项研究分析了 Transformer 中双随机注意力的秩衰减问题,发现用 Sinkhorn 算法归一化的双随机注意力矩阵比标准 softmax 行随机注意力更能有效保持秩,且残差连接对缓解秩崩溃至关重要。该现象在情感分析和图像分类任务上得到实证验证,理论上推导出纯自注意力下秩随深度双重指数衰减至 1 的界。

  24. arXiv cs.AI27

    ImplicitRM:从隐式反馈学习无偏奖励模型用于 LLM 对齐

    针对现有奖励模型依赖昂贵显式反馈的问题,研究者提出 ImplicitRM,可从点击、复制、跳过等隐式用户反馈中学习无偏奖励模型。该方法用分层模型将训练样本划分为四个潜在组,并推导出理论上无偏的似然最大化目标,以解决隐式反馈缺乏明确负样本和存在选择偏差两大挑战。