跳到正文
10月7日周三
  1. arXiv cs.AI22

    学习方式如何决定遗忘效果:从记忆到泛化的连续谱研究

    研究揭示模型的学习方式会显著影响其后续的遗忘(unlearning)表现:以泛化为主的模型在遗忘时对保留集的性能损伤更大。作者通过模块加法中的 grokking 现象区分记忆型与泛化型模型,并引入分桶模块加法在记忆-泛化连续谱上精细控制两种策略的贡献,发现该趋势近乎单调。这一关系在 LLM 的逐字回忆与事实回忆遗忘场景中同样成立。

  2. arXiv cs.AI29

    研究揭示 LLM 潜在空间偏见方向实际编码的是模型置信度而非公平性

    研究分析激活引导所用去偏见方向的实际编码内容,发现该方向由模型置信度主导,在激活空间中指向高概率到低概率 token 区域,而非编码有意义的偏见表征。沿该方向引导虽能降低偏见指标,但实为降低模型置信度所致:在 QA 基准上模型因此拒绝作答,附带改善了公平性指标。研究指出,将偏见线性表征与模型置信度解耦十分困难,基于引导的去偏见结果需谨慎解读。

  3. arXiv cs.AI24

    SoK:面向青少年的以人为本 AI 安全研究综述

    一项 SoK 研究系统综述了 100 项涉及儿童与青少年接触 AI 的实证 HCI 研究,覆盖学校、家庭、护理和公共服务场景。基于 YAIR 风险分类与 MIT Mitigation Taxonomy,研究发现多数风险仅有提出或构想中的对策,少数被实际部署,经评估者更少,且现有评估多衡量技术性能而非是否真正防止伤害。

  4. arXiv cs.AI21

    DeltaTTT:面向非线性循环记忆的逐层优化方法

    针对非线性记忆网络在序列测试时训练中难以单遍优化、串行 TTT 反而不如固定基座并行 TTT 的问题,研究者提出 DeltaTTT,将两层记忆网络的联合内循环优化改为逐层学习,每层分配局部预测目标并通过状态相关的 delta 规则更新。该方法保留非线性读出并支持分块并行计算,在 DeltaNet 和 LaCT 骨干上提升了语言建模与检索表现。

  5. arXiv cs.AI13

    从共享需求模式到局部不确定性:用紧凑适配混合实现概率负荷预测

    研究者提出一种可扩展的客户感知概率负荷预测框架,通过共享模型学习共性需求行为,仅适配一小组低维参数,让每个负荷按自身特征组合这些适配组件。在 SMART-DS 数据集 590 条负荷曲线上,该方法在确定性精度和概率质量上均优于统计、神经网络、Transformer 及预训练时间序列基线,同时保持较低的存储与推理成本。

  6. arXiv cs.AI13

    FlowCF:用流匹配为混合类型表格数据生成稀疏反事实解释

    FlowCF 是一种模型无关的生成式反事实解释方法,将反事实生成建模为从事实类到目标类的稀疏传输,并用流匹配求解,通过新型混合流算子扩展到混合特征类型。在六个基准数据集上,FlowCF 取得最佳数值稀疏性与接近度,仅改变 29% 的数值特征(最佳基线为 89%),位移小 70%。该工作已被 NeurIPS 2026 GDDL Workshop 接收。

  7. arXiv cs.AI26

    Wiki-Talkie:基于真实讨论的多语言人格化智能体基准

    研究者推出 Wiki-Talkie,一个覆盖德语、英语、西班牙语、法语、意大利语五种语言的多语言数据集,取自 Wikipedia Talk 页面的真实对话,并配以真实用户社区衍生的人格画像。在下一轮对话生成任务上,用户评论历史所体现的交互行为持续优于显式人格信息;模型系统性地少产生负面或极端情绪,同时多产生引用与建议,表现出偏向顺从与积极的偏差,且这一模式在各语言间稳健成立。

  8. arXiv cs.AI20

    X-OPM:面向鲁棒性增强的可解释自动数字片上功耗建模

    X-OPM 提出一种可解释的数字片上功耗建模框架,用树模型捕捉特征交互、线性模型完成预测,并引入 human-in-the-loop 流程平衡精度与建模成本。在商用 C906 向量处理器上,采样窗口小于 8 cycles 时全部工作负载均达 R² > 0.93,而 APOLLO、COBIT 和标准 MLP 均无法在所有测试用例上泛化。

  9. arXiv cs.AI22

    从失败中学习:面向 LLM 漏洞分析的失败驱动提示词优化方法

    研究提出失败驱动提示词优化方法 FDPR,通过分析 LLM 在漏洞分析中的反复失败模式来指导提示词改进。团队基于 DVJA 识别出误报、漏报、无依据推理和 CWE 误分类等失败模式,并在 Juliet Test Suite 上评估优化后的提示词,同时进行跨模型验证。结果显示该方法提升了 LLM 漏洞分析的可靠性,并提炼出可复用的提示词设计原则。

  10. arXiv cs.AI29

    GeoPID:分解与引导视觉语言模型中的视觉信息

    研究者提出免训练框架 GeoPID,从几何视角将 VLM 中的多模态信息分解为冗余、模态独有和协同三类成分。在 22 个 VLM 和 14 个 benchmark 上的分析显示,需要视觉 grounding 的问题中正确预测具有更强的视觉独有成分。基于此,GeoPID 在推理时沿视觉独有子空间选择性放大视觉表征,无需更新模型参数即平均提升 7.63% 相对准确率。

  11. arXiv cs.AI24

    Atom-JEPA:面向 3D 原子系统的联合嵌入预测架构

    Atom-JEPA 是一个自监督预训练框架,通过原子级和子结构级的互补目标,从无标注 3D 结构中学习潜在表示。该模型在大规模分子与晶体数据集上预训练,经微调后在分子 ADMET 与量子化学性质预测任务上达到 SOTA,在晶体材料物理性质预测上也极具竞争力。代码与预训练模型 checkpoint 已公开。

  12. arXiv cs.AI22

    Foresight-over-Graph:面向知识库问答的远见感知证据检索框架

    针对 LLM 引导的图推理中逐跳贪心剪枝过于短视、易过早丢弃关键证据分支的问题,研究者提出远见感知证据检索框架 Foresight-over-Graph(FoG),通过远到近反馈引导路径探索并维护紧凑记忆子图。在常用 KBQA 基准上 FoG 达到 SOTA,CWQ 的 Hit 指标提升 16.58%,同时减少 LLM 调用与 token 消耗。代码已开源,论文被 NeurIPS 2026 接收。

  13. arXiv cs.AI22

    MARCO:面向蛋白质生成模型的放射性水印框架

    MARCO 是首个专为蛋白质生成模型(PGM)设计的放射性水印框架,通过辅助编码器-解码器在扩散逆向去噪过程中迭代嵌入水印,原始 PGM 参数保持冻结。它采用针对 C_α 原子对距离和扭转角(ψ, φ)的专用损失函数,并结合对抗训练与随机攻击模拟,以保持生物物理保真度和鲁棒性。水印会自动转移到任何基于水印数据训练的盗版模型输出中,从而有效对抗模型提取攻击。

  14. arXiv cs.AI17

    利用历史数据缓解自动驾驶远程操控 QoS 预测中的概念漂移

    针对自动驾驶远程操控的预测性 QoS(pQoS),研究者基于实测数据提出预测框架,预测上行数据速率与往返时延两项网络 KPI。该框架将历史数据纳入预测流程,以缓解概念漂移导致的机器学习模型在未见数据上的性能退化,并引入关键场景检测指标专门评估远程操控场景下的预测表现。

  15. arXiv cs.AI22

    DySCo:面向边缘-云协同 LLM 推理的动态分片与深度同步批处理

    DySCo 是一个边缘-云协同 LLM 推理运行时,通过保持 KV 缓存本地化并引入 dyForward 层范围执行器,让边缘设备无需重载权重即可运行可配置的连续层范围。其深度同步批处理(DSB)将异构请求推进到最深切分点并批处理公共后缀,在平均并发为 8 时吞吐量较 FIFO 提升 275%、较精确匹配批处理提升 48%、较轮询交错提升 79%,同时降低平均每会话延迟。

  16. arXiv cs.AI29

    VOMMI:面向移动操作的可携带演示采集与学习框架

    VOMMI 是一个可携带的移动操作演示采集与学习框架,通过离线轨迹重建和在线视觉-运动条件化,将便携 RGB 演示接入 VLA 后训练。其 R2-VO 用稀疏几何锚点精修轨迹,使身体与手部流的绝对轨迹误差平均降低 24.6%。仅用便携演示后训练的策略基座速度误差比机器人采集演示低 18.2%,在三项真机任务上平均成功率较 OpenPI 0.5 提升 8.3 个百分点。

  17. arXiv cs.AI19

    STRUCTURALCOST:用于建模人类句子处理难度的受控阅读时间数据集

    STRUCTURALCOST 是一个自定速阅读数据集,包含 475 名参与者和 40,800 条观测,用于分离长距离主谓依存解析的处理成本。研究发现,主句动词处的人类阅读时间随依存长度增加,由句法嵌套而非线性距离驱动;n-gram、SSM 和 Transformer 等语言模型仅部分反映这一难度曲线,且低估了人类的工作记忆整合成本,该差距在不同架构和模型规模下持续存在。

  18. arXiv cs.AI29

    S1-MAS:用 System One 引导计算分工实现 token 高效多智能体协作

    研究者提出 S1-MAS 多智能体框架,将任务选择、角色分配、消息路由等有界协调决策交给轻量 System One 模型,把开放式推理留给能力更强的 LLM worker。在七个基准上与 AgentVerse、DyLAN、SelfOrg 对比,S1-MAS 将 GPT-4o token 消耗降低 44.9%-97.2%,端到端延迟降低 37.8%-93.0%,同时取得更高准确率。

  19. arXiv cs.AI24

    无有效选项 MCQA 下的 LLM 弃答:惩罚框架分析

    研究提出"惩罚框架无有效选项 MCQA"设定,在 MMLU-Pro 数学子集上移除正确选项,允许模型选择剩余选项或输出 ABSTAIN,并对无效强制选择进行惩罚。实验显示,即便有明确的无有效选项提示和惩罚评分,模型在原本答对的题目上仍会给出无效强制选择,说明高 MCQA 准确率并不能完全保证弃答可靠性。该工作已被 AACL-IJCNLP 2026 主会议短论文接收。

  20. arXiv cs.AI62

    论文指出 Lean 验证 AI 自动形式化无法保证自然语言证明正确

    arXiv 论文指出,AI 自动形式化把自然语言数学文本翻译成 Lean 后,机械验证通过并不能保证原自然语言论证正确。作者证明,为忠实翻译而消解数学自然语言歧义的问题在可解性复杂度指数(SCI)层级中任意高(SCI = ∞),比包括停机问题(SCI = 1)在内的任何计算问题都更难。

    推荐理由:论文用可计算性层级论证自然语言数学文本的忠实翻译不可判定,并给出 Lean 形式化与原文不符的实例。