跳到正文
10月7日周三
  1. arXiv cs.AI20

    FSCE:面向抗噪 SAR ATR 的目标感知频率-空间协同增强框架

    研究者提出目标感知频率-空间协同增强(FSCE)框架,用于抗噪 SAR ATR,通过频率-空间建模实现早期特征稳定并结合语义正则化。该框架在网络入口设计 FS-EAE 模块抑制噪声传播,并引入 APSA 机制以在线教师策略施加语义约束。在 MSTAR、OpenSARShip 和 FUSARShip 上的实验验证了其有效性,轻量版 FSCE-Net_μ 仅 0.17M 参数。

  2. arXiv cs.AI22

    FedAlign-MoE:面向移动边缘网络数据异构的联邦 MoE 对齐框架

    针对移动边缘设备上 MoE 大语言模型联邦微调中的数据异构问题,研究者提出联邦聚合对齐框架 FedAlign-MoE,通过一致性加权对齐路由分布、分布正则优化本地门控网络,并量化同索引专家的语义一致性以选择性聚合。实验显示,该框架在非 IID 联邦环境下收敛更快、精度更高,且计算轻量、通信高效。

  3. arXiv cs.AI22

    PC-Diffuser:面向扩散轨迹规划器的路径一致胶囊 CBF 安全过滤

    PC-Diffuser 是一种安全增强框架,将可认证、路径一致的障碍函数结构直接嵌入扩散规划的每一步去噪循环中。它用胶囊距离障碍函数评估碰撞风险以更好反映车辆几何、减少不必要的保守性,并通过运动学自行车模型把去噪路点转为动态可行运动,再施加路径一致安全过滤器消除残余约束违反且不产生几何畸变。

  4. arXiv cs.AI27

    DMAST:双模态多阶段对抗安全训练让多模态 Web Agent 抵御跨模态攻击

    针对多模态 Web Agent 双流架构易被 DOM 注入同时污染截图与无障碍树的问题,研究者提出双模态多阶段对抗安全训练框架 DMAST,将智能体与攻击者建模为双人一般和马尔可夫博弈并分三阶段协同训练。在 MiniWob++ 上,含视觉组件的攻击效果远超纯文本注入;在分布外任务上 DMAST 将攻击成功率从 41.2% 降至 21.4%,任务完成率相对提升超 60%(6.2%→10.2%)。

  5. arXiv cs.AI24

    用多模态 LLM 实时生成游戏解说:基于停顿感知的解码方法

    研究提出两种基于提示的解码策略实现实时游戏视频解说生成:固定间隔解码与动态间隔解码,后者根据上一句解说的预估时长调整下一次预测时机,无需微调即可实现停顿感知生成。在日语和英语的赛车与格斗游戏数据集上,动态间隔解码生成的解说在时间与内容上更贴近人类解说。团队同时开源了多语言基准数据集、训练模型与实现代码。

  6. arXiv cs.AI28

    ReLoop:面向可靠 LLM 优化的结构化建模与行为验证

    ReLoop 通过结构化生成与行为验证两项机制,解决 LLM 生成优化代码时"可求解但语义错误"的静默失败问题。结构化生成将代码生产拆为理解、形式化、合成、验证四阶段,在 RetailOpt-190 上配合 Claude Opus 4.6 提升 8.5pp 准确率;行为验证借助求解器参数扰动检测残留错误,在 MAMO-ComplexLP 上提升 4.4pp。

  7. arXiv cs.AI22

    UniST-Pred:面向交通网络中断场景的鲁棒统一时空交通预测框架

    UniST-Pred 是一个统一时空交通预测框架,先将时间建模与空间表征学习解耦,再通过自适应表征级融合将两者整合。研究基于 MATSim 微观交通模拟器构建数据集,在严重网络断连场景下评估其鲁棒性,并在标准交通预测数据集上取得与现有成熟模型相当的竞争性表现,同时保持轻量设计。源代码与生成数据集已公开。

  8. arXiv cs.AI41

    X 推荐系统无意中刻画用户意识形态立场

    研究基于 X 平台向法国 682 名志愿者展示的 250 万条 "Who to Follow" 推荐,重建了 X 推荐系统对 26,509 个账号的嵌入向量近似值,并计算出经调查校准的意识形态分数。该嵌入中存在一个按左—右政治立场排序的方向(Pearson rho = 0.887),且区别于年龄、性别或热度方向,移除该方向可在精度损失有限的情况下提升推荐多样性。

  9. arXiv cs.AI20

    Goal-PD:面向鲁棒非光滑凸去中心化学习的快速异步 Gossip 算法

    研究者提出异步 gossip 原始-对偶算法 Goal-PD,每个节点仅需维护两个变量,不再随节点度数增长,从而大幅降低去中心化学习的显存开销。该算法被证明几乎必然收敛到最优解,并在目标函数为分段线性二次时具有线性收敛速度;在去中心化均值估计中,成对平均被证明是 Goal-PD 的特例。

  10. arXiv cs.AI22

    基于混合整数优化的交叉群体公平性研究

    研究者提出基于混合整数优化(MIO)的统一框架,用于训练交叉群体公平且内在可解释的分类器,并证明了 MSD 与 SPSF 两种交叉公平性度量在检测最不公平子群上的等价性。实验表明该 MIO 算法在发现偏见方面表现更优,可将交叉偏见控制在可接受阈值以下,面向金融、医疗等受监管行业。

  11. arXiv cs.AI22

    CLAS:面向多语言大模型的跨语言激活引导方法

    研究者提出跨语言激活引导(CLAS),一种无需训练、在推理时选择性调节神经元激活的干预方法,用于缩小大模型主导语言与非主导语言之间的性能差距。在分类和生成基准上,CLAS 平均提升 2.3%(Acc.)和 3.4%(F1),同时保持高资源语言性能。研究发现有效迁移依赖功能分化而非严格对齐,性能增益与语言聚类分离度提升相关,该方法无需修改模型权重。

  12. arXiv cs.AI42

    MiniScope:用最小权限为 AI 智能体授权

    研究者提出任务中心的分层权限模型 MiniScope,将智能体视为任务角色下的委托方,自动发现权限层级并在运行时执行上下文最小权限。评估显示,相比逐工具提示,MiniScope 对谨慎型和典型用户分别减少 43.4%-89.4% 的模拟权限确认,并缓解全部权限提升攻击,对效用和运行时影响可忽略。在真实部署中,它还在 ChatGPT 和 Claude 中发现 6 处过度授权的连接器配置。

  13. arXiv cs.AI22

    QDF:用二次型加权学习目标训练多步时间序列预测模型

    针对现有均方误差等学习目标忽略未来步标签自相关、且对不同预测步采用等权处理的问题,研究者提出二次型加权学习目标及 Quadratic Direct Forecast(QDF)学习算法,通过自适应更新的加权矩阵训练预测模型。实验显示 QDF 能有效提升多种预测模型性能,达到 SOTA,代码已开源,该工作被 ICLR 2026 接收。

  14. arXiv cs.AI22

    DistDF:时间序列预测需要联合分布 Wasserstein 对齐

    针对时间序列预测中直接预测(DF)依赖均方误差估计条件负对数似然、在标签序列存在自相关时产生偏差的问题,研究者提出 DistDF,通过最小化预测与标签序列条件分布间的分布差异实现对齐。该方法引入联合分布 Wasserstein 差异,可证明其上界为所需条件差异,且可处理、可微、兼容梯度优化。实验显示 DistDF 提升了多种预测模型并取得领先性能,代码已开源,论文被 ICLR 2026 接收。

  15. arXiv cs.AI35

    Speak to a Protein:交互式多模态蛋白质研究 AI 协同科学家

    Speak to a Protein 是一款交互式多模态 AI 协同科学家,可将蛋白质分析转化为对话,检索并整合文献、结构与配体数据,在实时 3D 场景中给出有依据的回答,并支持高亮、标注、操作和查看可视化。该系统还能按需生成并运行代码,以文本和图形解释结果,用于探究结合口袋、构象变化和构效关系。该工具免费开放使用。

  16. arXiv cs.AI22

    仅凭原始数据统计量预测核回归学习曲线:Hermite 特征结构假设(HEA)

    研究提出 Hermite 特征结构假设(HEA),仅用经验数据协方差矩阵和目标函数的经验多项式分解两项测量,即可预测核回归在 CIFAR-5m、SVHN、ImageNet 等真实数据集上的学习曲线。该假设在高斯数据上得到证明,真实图像数据也"足够高斯"使其成立;研究还发现 MLP 在特征学习阶段按 HEA 预测的顺序学习 Hermite 多项式。

  17. arXiv cs.AI22

    用激活引导向量缓解 LLM 评估器中的自我偏好偏差

    针对 LLM 作为自动评估器时偏爱自身输出的"自我偏好偏差",研究者提出在推理阶段用轻量引导向量(steering vectors)进行干预,无需重新训练。通过 Contrastive Activation Addition(CAA)和基于优化的方法构建向量,可将不合理的自我偏好偏差降低最多 97%,显著优于提示词和 DPO 基线。

  18. arXiv cs.AI30

    梯度反转攻击在联邦学习中真的可行吗?arXiv 新研究给出实测结论

    一项 arXiv 研究系统评估了图像类联邦学习场景下梯度反转攻击的实际可行性,覆盖图像分类与目标检测任务及当代分辨率的经典视觉架构。结果显示,现代性能优化模型在视觉上始终能抵抗有意义的图像重建,此前的成功案例多依赖推理模式运行或架构简化等上界设定。在诚实但好奇的服务器假设下,高保真图像重建不构成生产级联邦学习系统的关键隐私风险。

  19. arXiv cs.AI22

    CMCM-DLM:用扩散语言模型实现跨模态可控分子生成

    研究者提出 CMCM-DLM,一个模块化框架,可将预训练扩散模型扩展至支持异构分子约束而无需重训主干。该框架用结构控制模块(SCM)在扩散早期引导分子骨架生成,再由性质控制模块(PCM)将生成导向目标化学性质。多数据集实验显示其具备有效的跨模态可控性与较强适应性。

  20. arXiv cs.AI22

    FedCoT:面向大语言模型的通信高效联邦推理增强框架

    FedCoT 是一个联邦推理框架,通过轻量级 CoT 重采样配合紧凑判别器筛选,并用客户端感知的 LoRA 堆叠与加权分类器聚合来应对数据异构、降低聚合噪声和通信开销。客户端本地生成候选推理链与监督信号,服务器仅聚合轻量模块,数据始终保留在本地。在医疗推理基准上,该方法在紧张资源预算下取得稳定提升,代码已公开,论文被 EMNLP 2026 收录。

  21. arXiv cs.AI26

    LLM 与人类的情感概念表征差异研究:模型更分类化、同质化且确定性更强

    研究用认知评价理论构建了覆盖 15 种情绪类别的基准数据集,通过行为表征对比 LLM 与人类的情感概念结构。结果显示 LLM 的情感表征比人类更分类化、同质化和确定化,单一情绪概念内部多样性更低、不同情绪间距更大,且该分类结构对任务框架和人口学角色等上下文变化保持稳健。

  22. arXiv cs.AI22

    Time-o1:时间序列预测需要变换后的标签对齐

    针对时间序列预测中时序均方误差忽略标签自相关、任务数量过多的问题,研究者提出变换增强损失函数 Time-o1,将标签序列变换为去相关且显著性可区分的分量,让模型对齐最显著分量。实验显示 Time-o1 达到 SOTA 性能,并兼容多种预测模型,代码已开源,该工作被 NeurIPS 2025 接收为 poster。

  23. arXiv cs.AI27

    KO:受动力学启发的神经优化器,用 PDE 模拟方法提升参数多样性

    研究者提出 KO(Kinetics-inspired Optimizer),一种基于动力学理论与偏微分方程的可插拔优化模块,通过离散化 Boltzmann 输运方程引入随机交互来增强参数多样性、缓解权重凝聚。理论分析表明 KO 可证明地提升参数多样性并保持收敛保证。在 CIFAR-10/100、ImageNet 图像分类和大规模语言模型预训练中,KO 以可忽略的额外计算成本持续提升准确率。

  24. arXiv cs.AI22

    Mask Fine-Tuning:不更新权重,用二值掩码微调提升 LLM 性能

    研究者提出 Mask Fine-Tuning(MFT),一种在不更新模型权重的前提下,对已充分微调的 LLM 学习并施加二值掩码的微调范式,用标准微调目标做监督。在 LLaMA2-7B 与 LLaMA3.1-8B 上,MFT 使用相同微调数据集在 IFEval 上平均提升 2.70/4.15。该方法可与现有 LLM 优化流程兼容,并将掩码操作从网络剪枝压缩拓展到更广泛的模型能力提升。

  25. arXiv cs.AI40

    大规模预训练数据集不能保证图像分类微调后的鲁棒性

    研究提出 Robustness Inheritance Benchmark(ImageNet-RIB),用于评估预训练模型微调后的鲁棒性保持情况。结果显示,在 LAION-2B 等最大最多样数据集上预训练的模型,在小数据集上微调后鲁棒性损失更大、绝对鲁棒性更低,这种崩溃出现在 CLIP 等对比预训练模型及其微调变体中,并随预训练规模增大而加剧,而所测试的监督模型未出现该现象。

  26. arXiv cs.AI22

    FreDF:在频域中学习预测的时间序列模型

    针对直接预测(DF)范式忽略未来标签间自相关导致学习目标有偏的问题,研究者提出频域增强直接预测方法 FreDF,通过在频域中学习预测来缓解标签自相关、降低估计偏差。实验显示 FreDF 显著优于现有 SOTA 方法,并兼容多种预测模型,代码已开源,该工作被 ICLR 2025 接收。

  27. arXiv cs.AI22

    HED:超图增强双卷积网络用于捆绑推荐

    研究者提出超图增强双卷积神经网络(HED),构建包含用户—捆绑、用户—物品、捆绑—物品交互及用户内、捆绑内关系的完整超图,并将完整超图传播与用户—捆绑分支耦合。在 NetEase 上 HED-128 在六项指标上较最强基线提升 5.04–6.97%,在 Youshu 上 HED-64 提升 1.87–4.56%。消融实验支持用户—捆绑分支与类型内关系的贡献,并量化了完整超图的内存开销等计算代价。

  28. arXiv cs.AI51

    TasteVal:用算力效率衡量 AI 系统的实验研究品味

    研究者提出 TasteVal 基准,用于评估前沿模型的实验研究品味,即给定固定研究问题后迭代设计实验并从结果中得出结论的能力。该基准将实验研究品味操作化为算力效率,包含 8 个开放式任务,模型作为 Researcher 设计实验、由固定 Coder agent 实现并反馈结果,预算为 40 H100 小时或 120 小时挂钟时间。

  29. arXiv cs.AI22

    从异构行为数据诱导人格画像:数据访问机制如何影响 LLM 调查模拟对齐

    研究提出用匿名公共行为数据诱导人口群体级人格画像来驱动 LLM 智能体模拟调查回答,并考察数据领域、规模与粒度对对模拟对齐的影响。结果显示,域外来源诱导的人格画像很少优于仅基于基本人口信息的模拟,主要原因是人群不匹配;但当画像被准确分配到目标人口群体时,对齐效果显著提升。来自目标域调查数据的画像随问题历史增多而泛化更好,表明更丰富的行为证据能带来更稳定的人格特质推断。