跳到正文
10月7日周三
  1. arXiv cs.AI22

    FedCoT:面向大语言模型的通信高效联邦推理增强框架

    FedCoT 是一个联邦推理框架,通过轻量级 CoT 重采样配合紧凑判别器筛选,并用客户端感知的 LoRA 堆叠与加权分类器聚合来应对数据异构、降低聚合噪声和通信开销。客户端本地生成候选推理链与监督信号,服务器仅聚合轻量模块,数据始终保留在本地。在医疗推理基准上,该方法在紧张资源预算下取得稳定提升,代码已公开,论文被 EMNLP 2026 收录。

  2. arXiv cs.AI26

    LLM 与人类的情感概念表征差异研究:模型更分类化、同质化且确定性更强

    研究用认知评价理论构建了覆盖 15 种情绪类别的基准数据集,通过行为表征对比 LLM 与人类的情感概念结构。结果显示 LLM 的情感表征比人类更分类化、同质化和确定化,单一情绪概念内部多样性更低、不同情绪间距更大,且该分类结构对任务框架和人口学角色等上下文变化保持稳健。

  3. arXiv cs.AI22

    Time-o1:时间序列预测需要变换后的标签对齐

    针对时间序列预测中时序均方误差忽略标签自相关、任务数量过多的问题,研究者提出变换增强损失函数 Time-o1,将标签序列变换为去相关且显著性可区分的分量,让模型对齐最显著分量。实验显示 Time-o1 达到 SOTA 性能,并兼容多种预测模型,代码已开源,该工作被 NeurIPS 2025 接收为 poster。

  4. arXiv cs.AI27

    KO:受动力学启发的神经优化器,用 PDE 模拟方法提升参数多样性

    研究者提出 KO(Kinetics-inspired Optimizer),一种基于动力学理论与偏微分方程的可插拔优化模块,通过离散化 Boltzmann 输运方程引入随机交互来增强参数多样性、缓解权重凝聚。理论分析表明 KO 可证明地提升参数多样性并保持收敛保证。在 CIFAR-10/100、ImageNet 图像分类和大规模语言模型预训练中,KO 以可忽略的额外计算成本持续提升准确率。

  5. arXiv cs.AI22

    Mask Fine-Tuning:不更新权重,用二值掩码微调提升 LLM 性能

    研究者提出 Mask Fine-Tuning(MFT),一种在不更新模型权重的前提下,对已充分微调的 LLM 学习并施加二值掩码的微调范式,用标准微调目标做监督。在 LLaMA2-7B 与 LLaMA3.1-8B 上,MFT 使用相同微调数据集在 IFEval 上平均提升 2.70/4.15。该方法可与现有 LLM 优化流程兼容,并将掩码操作从网络剪枝压缩拓展到更广泛的模型能力提升。

  6. arXiv cs.AI40

    大规模预训练数据集不能保证图像分类微调后的鲁棒性

    研究提出 Robustness Inheritance Benchmark(ImageNet-RIB),用于评估预训练模型微调后的鲁棒性保持情况。结果显示,在 LAION-2B 等最大最多样数据集上预训练的模型,在小数据集上微调后鲁棒性损失更大、绝对鲁棒性更低,这种崩溃出现在 CLIP 等对比预训练模型及其微调变体中,并随预训练规模增大而加剧,而所测试的监督模型未出现该现象。

  7. arXiv cs.AI22

    FreDF:在频域中学习预测的时间序列模型

    针对直接预测(DF)范式忽略未来标签间自相关导致学习目标有偏的问题,研究者提出频域增强直接预测方法 FreDF,通过在频域中学习预测来缓解标签自相关、降低估计偏差。实验显示 FreDF 显著优于现有 SOTA 方法,并兼容多种预测模型,代码已开源,该工作被 ICLR 2025 接收。

  8. arXiv cs.AI22

    HED:超图增强双卷积网络用于捆绑推荐

    研究者提出超图增强双卷积神经网络(HED),构建包含用户—捆绑、用户—物品、捆绑—物品交互及用户内、捆绑内关系的完整超图,并将完整超图传播与用户—捆绑分支耦合。在 NetEase 上 HED-128 在六项指标上较最强基线提升 5.04–6.97%,在 Youshu 上 HED-64 提升 1.87–4.56%。消融实验支持用户—捆绑分支与类型内关系的贡献,并量化了完整超图的内存开销等计算代价。

  9. arXiv cs.AI51

    TasteVal:用算力效率衡量 AI 系统的实验研究品味

    研究者提出 TasteVal 基准,用于评估前沿模型的实验研究品味,即给定固定研究问题后迭代设计实验并从结果中得出结论的能力。该基准将实验研究品味操作化为算力效率,包含 8 个开放式任务,模型作为 Researcher 设计实验、由固定 Coder agent 实现并反馈结果,预算为 40 H100 小时或 120 小时挂钟时间。

  10. arXiv cs.AI22

    从异构行为数据诱导人格画像:数据访问机制如何影响 LLM 调查模拟对齐

    研究提出用匿名公共行为数据诱导人口群体级人格画像来驱动 LLM 智能体模拟调查回答,并考察数据领域、规模与粒度对对模拟对齐的影响。结果显示,域外来源诱导的人格画像很少优于仅基于基本人口信息的模拟,主要原因是人群不匹配;但当画像被准确分配到目标人口群体时,对齐效果显著提升。来自目标域调查数据的画像随问题历史增多而泛化更好,表明更丰富的行为证据能带来更稳定的人格特质推断。

  11. arXiv cs.AI24

    EnGRICH:用人类批评增强生成式奖励模型

    研究者提出 GRM 训练框架 EnGRICH,通过一个从少量人类批评中学习的训练期 MetaCritic,为生成的批评构建针对性评分标准并评估其证据覆盖度与正确性,从而提供过程奖励和结构化探索引导。MetaCritic 在训练中进一步优化,将人类评价标准泛化到仅有结果标签的偏好数据;推理时训练好的 GRM 独立运行。在七个奖励模型基准上,EnGRICH 持续优于竞争基线。

  12. arXiv cs.AI24

    微调 VLM 提升 AI 空间智能:理解 3D 与 2D 旋转

    研究通过微调 Google DeepMind 的 Gemma-4 MoE 模型提升视觉语言模型的空间推理能力,在 2D 和 3D 旋转检测上均取得明显改进。微调后的 Gemma-4 MoE 模型在预测由轴和角度定义的旋转时显著优于微调后的 Gemma-4 通用模型,且无需显式坐标系即可改善 2D 表示的角度估计。研究还发现,可识别物体并未提升角度检测准确率,具有显著线性特征的物体反而表现更好。

  13. arXiv cs.AI22

    用结构化 CoT 提升 AI 空间智能:GPT-5.6 的 3D 旋转可视化与推理

    研究团队基于 Revised PSVT:R 测试 GPT-5.6 的 3D 旋转空间推理能力,并叠加图形与上下文特征评估不同 CoT 策略的影响。结构化 CoT 在 PSVT:R 及带坐标系数据集上均提升了 GPT-5.6 的表现,三种 CoT 方法(结构化 CoT、few-shot 结构化 CoT、带自优化提示词的结构化 CoT)之间无显著差异。

  14. arXiv cs.AI44

    LUMOS:追踪 LLM 参数化知识从训练数据到行为输出的因果链

    研究者提出诊断框架 LUMOS,基于训练语料完全透明的 OLMo 2,追踪 LLM 参数化知识从训练数据曝光到行为输出的因果链。结果显示模型内部对罕见事实的编码可分性达 84%,但行为表达仅 54%,该检索差距随规模扩大而收窄。模型对已训练内容自我反思准确率为 83%,对未见内容降至随机基线 49%,且链式推理提示只会抬高置信度而非改善校准。

  15. arXiv cs.AI36

    PAPER2LLM++:让 LLM 从研究论文中持续自我进化

    PAPER2LLM++ 是一个让 LLM 从研究论文中持续自我进化的框架,它把论文当作模型改进的证据与监督信号,而非仅用于检索的知识。对每篇新论文,它提取有证据支撑的发现,检验所报告的局限是否仍存在于当前模型,必要时转化为候选学习信号,并通过 try-evaluate-commit 流程仅在提升目标行为且不显著遗忘或损害通用能力时才提交更新。

  16. arXiv cs.AI27

    GraphMemory:将记忆与上下文解耦的 token 高效测试时持续学习结构化记忆

    研究者提出 GraphMemory,一种轻量级图结构记忆系统,可累积、精炼、组织并连接可复用策略,每次查询只检索相关子图,使模型无需接触全部记忆即可完成在线上下文适配。在有界检索下,检索记忆量随处理样本数增长保持恒定,下游性能与基线相当,同时记忆构建 token 消耗减少约 81-85%。

  17. arXiv cs.AI24

    重新思考面向生成的知识检索:RAG 架构与应用综述

    一篇综述系统梳理了 RAG(检索增强生成)的三大基础组件——检索、生成与增强,涵盖稠密与稀疏检索器、融合策略、嵌入向量优化及基于强化学习的检索策略。文章围绕效率、安全、以用户为中心的交互和复杂推理四条新兴轴线对近期创新进行分类,并回顾了 Naïve RAG、Advanced RAG 和 Modular RAG 等架构变体及评估协议与领域应用进展。

  18. arXiv cs.AI24

    SpikeMoE:受大脑启发的脉冲混合专家竞争路由框架

    SpikeMoE 将神经元尺度的脉冲动力学与模型尺度的专家选择相结合,提出受海马 CA1 区竞争抑制机制启发的脉冲 k-WTA Router,通过侧向抑制和不应期按离散脉冲计数选择 Top-K 专家。该框架还配备两阶段缺失模态建模模块,在视觉、语言和多模态基准上达到 SNN 基线中的 SOTA,性能匹配或超越 ANN 对应方案,并在多种缺失模态条件下保持稳健。

  19. arXiv cs.AI27

    ReSolve:通过选择性生成式审核复用候选推理

    ReSolve 是一种免训练推理方法,通过选择性生成式审核复用候选推理:当候选答案分歧或无法解析时,调用模型检查已有推导并纳入有界循环。在 130 道竞赛数学题上,ReSolve 在两个独立候选池中分别答对 100 和 99 题,优于同四候选投票的 91 和 92 题,且相比八样本自一致性分别少用 46.3% 和 47.2% 的 token。消融实验显示移除可见推导后准确率从 100 降至 93。

  20. arXiv cs.AI22

    用推理外化让 LLM 忠实叙述股票收益预测:Qwen3-32B-Instruct 证据忠实度升至 0.996

    一项研究提出 LLM 叙事框架,将时序 SHAP 证据与历史市场状态类比结合,用于横截面股票收益预测的可解释叙述。在 Qwen3 上的对照实验显示,逐步外化数值与关系推理后,Qwen3-32B-Instruct 的证据忠实度从 0.696 提升至 0.996,时序与关系准确率同步改善。历史类比虽未提升结构化自动忠实度,但获得了更高的人工评分有用性。

  21. arXiv cs.AI31

    MLToolBench:为机器学习开发训练工具增强智能体

    研究者提出 ToolMLBench 工具套件与 SFT+RL 训练流程,让智能体学会在机器学习实验中诊断性地调用工具,并用 SPICE 方法以特权上下文对工具动作概率的改变作为轮级奖励。在 80 个合成任务上训练后,Qwen3-8B 域内成功率从 24.8% 升至 52.4%,Qwen3.5-35B-A3B 从 35.6% 升至 69.2%,后者域外也从 31% 提升到 48%。

  22. arXiv cs.AI37

    AX 是新的 AEO:AI 智能体时代网站可读性比被提及更重要

    研究提出"智能体体验(AX)"是新的 AEO:在 1,056 家真实企业上运行 37,927 次智能体购买旅程后发现,仅 7-10% 的最终答案来自模型训练知识。具备 AX 的企业有 78% 的答案由自家页面构建(对照组 56%),被明确推荐的概率高 1.9 倍;而不可读企业获得有据答案的成本平均高 64%。主要失败并非编造而是遗漏——网页构建的答案缺失买家所需事实的概率高 3.7 倍。

  23. arXiv cs.AI22

    用校准良好的 Deep Ensemble 替代高斯过程,提升水上溢油监测的路径规划效果

    针对高斯过程各向同性核在溢油等非均匀现象上失配的问题,研究用校准良好的 Deep Ensemble 替换高斯过程来改进信息路径规划。在留出的随机溢油场景中,Deep Ensemble 将归一化重建误差较高斯过程基线降低 83%,并使多步前瞻规划器比贪心选择的重建误差最多低 32%、IoU 超过 0.85。

  24. arXiv cs.AI22

    动作塑形:策略只吸收其能表达的动作偏移

    论文提出"动作塑形"原理:可训练策略会吸收其输出层能精确复现的动作偏移,被吸收的偏移可在部署时移除且回报不变。最小实例是学习门控后的零初始化线性头,门控会自行先升后降,在 20 个任务上移除该头几乎无代价。该吸收条件取决于精确复现而非容量,非线性头即使参数更多也不会被吸收。

  25. arXiv cs.AI37

    JEV-as-a-Judge:置信时接受,不确定时升级

    JEV-as-a-Judge 提出用只输出标签概率的决策型评判模型 JEV 做评估,由置信度决定直接采纳还是升级给推理型评判模型。在 16 个生成式与奖励模型评判器的对比中,JEV 在可直接从文本读出结论的场景下与 GPT-6 相差 3 分以内,费用仅为其 0.36%,中位延迟 0.15 秒,但在数学、代码和逻辑等需推导结论的场景落后。