跳到正文
10月7日周三
  1. arXiv cs.AI51

    TasteVal:用算力效率衡量 AI 系统的实验研究品味

    研究者提出 TasteVal 基准,用于评估前沿模型的实验研究品味,即给定固定研究问题后迭代设计实验并从结果中得出结论的能力。该基准将实验研究品味操作化为算力效率,包含 8 个开放式任务,模型作为 Researcher 设计实验、由固定 Coder agent 实现并反馈结果,预算为 40 H100 小时或 120 小时挂钟时间。

  2. arXiv cs.AI22

    从异构行为数据诱导人格画像:数据访问机制如何影响 LLM 调查模拟对齐

    研究提出用匿名公共行为数据诱导人口群体级人格画像来驱动 LLM 智能体模拟调查回答,并考察数据领域、规模与粒度对对模拟对齐的影响。结果显示,域外来源诱导的人格画像很少优于仅基于基本人口信息的模拟,主要原因是人群不匹配;但当画像被准确分配到目标人口群体时,对齐效果显著提升。来自目标域调查数据的画像随问题历史增多而泛化更好,表明更丰富的行为证据能带来更稳定的人格特质推断。

  3. arXiv cs.AI24

    微调 VLM 提升 AI 空间智能:理解 3D 与 2D 旋转

    研究通过微调 Google DeepMind 的 Gemma-4 MoE 模型提升视觉语言模型的空间推理能力,在 2D 和 3D 旋转检测上均取得明显改进。微调后的 Gemma-4 MoE 模型在预测由轴和角度定义的旋转时显著优于微调后的 Gemma-4 通用模型,且无需显式坐标系即可改善 2D 表示的角度估计。研究还发现,可识别物体并未提升角度检测准确率,具有显著线性特征的物体反而表现更好。

  4. arXiv cs.AI44

    LUMOS:追踪 LLM 参数化知识从训练数据到行为输出的因果链

    研究者提出诊断框架 LUMOS,基于训练语料完全透明的 OLMo 2,追踪 LLM 参数化知识从训练数据曝光到行为输出的因果链。结果显示模型内部对罕见事实的编码可分性达 84%,但行为表达仅 54%,该检索差距随规模扩大而收窄。模型对已训练内容自我反思准确率为 83%,对未见内容降至随机基线 49%,且链式推理提示只会抬高置信度而非改善校准。

  5. arXiv cs.AI36

    PAPER2LLM++:让 LLM 从研究论文中持续自我进化

    PAPER2LLM++ 是一个让 LLM 从研究论文中持续自我进化的框架,它把论文当作模型改进的证据与监督信号,而非仅用于检索的知识。对每篇新论文,它提取有证据支撑的发现,检验所报告的局限是否仍存在于当前模型,必要时转化为候选学习信号,并通过 try-evaluate-commit 流程仅在提升目标行为且不显著遗忘或损害通用能力时才提交更新。

  6. arXiv cs.AI27

    GraphMemory:将记忆与上下文解耦的 token 高效测试时持续学习结构化记忆

    研究者提出 GraphMemory,一种轻量级图结构记忆系统,可累积、精炼、组织并连接可复用策略,每次查询只检索相关子图,使模型无需接触全部记忆即可完成在线上下文适配。在有界检索下,检索记忆量随处理样本数增长保持恒定,下游性能与基线相当,同时记忆构建 token 消耗减少约 81-85%。

  7. arXiv cs.AI24

    SpikeMoE:受大脑启发的脉冲混合专家竞争路由框架

    SpikeMoE 将神经元尺度的脉冲动力学与模型尺度的专家选择相结合,提出受海马 CA1 区竞争抑制机制启发的脉冲 k-WTA Router,通过侧向抑制和不应期按离散脉冲计数选择 Top-K 专家。该框架还配备两阶段缺失模态建模模块,在视觉、语言和多模态基准上达到 SNN 基线中的 SOTA,性能匹配或超越 ANN 对应方案,并在多种缺失模态条件下保持稳健。

  8. arXiv cs.AI22

    用推理外化让 LLM 忠实叙述股票收益预测:Qwen3-32B-Instruct 证据忠实度升至 0.996

    一项研究提出 LLM 叙事框架,将时序 SHAP 证据与历史市场状态类比结合,用于横截面股票收益预测的可解释叙述。在 Qwen3 上的对照实验显示,逐步外化数值与关系推理后,Qwen3-32B-Instruct 的证据忠实度从 0.696 提升至 0.996,时序与关系准确率同步改善。历史类比虽未提升结构化自动忠实度,但获得了更高的人工评分有用性。

  9. arXiv cs.AI31

    MLToolBench:为机器学习开发训练工具增强智能体

    研究者提出 ToolMLBench 工具套件与 SFT+RL 训练流程,让智能体学会在机器学习实验中诊断性地调用工具,并用 SPICE 方法以特权上下文对工具动作概率的改变作为轮级奖励。在 80 个合成任务上训练后,Qwen3-8B 域内成功率从 24.8% 升至 52.4%,Qwen3.5-35B-A3B 从 35.6% 升至 69.2%,后者域外也从 31% 提升到 48%。

  10. arXiv cs.AI22

    FHRFormer:用于胎心率时间序列补全与预测的自监督掩码 Transformer 框架

    FHRFormer 是一个基于掩码 Transformer 自编码器的自监督框架,用于重建胎心率(FHR)监测中因传感器位移等原因丢失的信号,并可同时用于信号补全与预测。该方法能捕捉数据的局部时间与频率成分,在不同缺失时长下均表现稳健,克服了传统插值方法难以保留信号频谱特征的局限。该框架可回溯应用于研究数据集以支持 AI 风险算法开发,未来有望集成到可穿戴 FHR 监测设备中。

  11. arXiv cs.AI12

    Ego2World:将第一视角烹饪视频编译为可执行世界以进行信念状态规划

    Ego2World 是一个可执行基准,将第一视角烹饪视频转化为由图转移规则驱动的符号世界,基于 HD-EPIC 从视频标注中提取可复用转移规则。评估时模拟器维护隐藏世界图,智能体仅凭局部观察和执行反馈在自身部分信念图上规划,无法观测真实世界状态。实验显示动作重叠分数会高估物理状态成功率,而持久信念记忆能提升任务完成率并减少重复视觉探索。

  12. arXiv cs.AI22

    XDecomposer:无需先验的多相 X 射线衍射集合分解

    XDecomposer 是一个无需候选相列表、结构模板或相数量先验的多相 XRD 分解与识别框架,将多相衍射分析建模为集合预测问题,在统一架构中推断无序的相分辨组分、混合比例及结构表示。该框架结合相查询驱动的分解机制与衍射一致性物理重建,在模拟和实验数据集上显著提升重建精度与相识别能力,并对未见混合物保持较强泛化性。代码已开源,论文被 NeurIPS 2026 接收。

  13. arXiv cs.AI28

    FRAGMENTA:面向小数据药物先导优化的端到端片段生成模型与智能体调优框架

    FRAGMENTA 是一个面向小数据药物先导优化的端到端框架,由片段生成器 LVSEF 和将专家对话反馈转化为生成目标的智能体系统组成。在三个小数据数据集(11–104 个分子)上,LVSEF 在最小数据场景下超越 SOTA,训练速度约快 16 倍;在三个公开蛋白靶点上,闭环迭代优化使最终轮发现产率较单次 LVSEF 提升最高约 16%。

  14. arXiv cs.AI25

    PuzzleJAX:面向推理与学习的基准测试

    PuzzleJAX 是一个 GPU 加速的益智游戏引擎与描述语言,支持对树搜索、强化学习和 LLM 推理能力进行快速基准测试。它基于 PuzzleScript 风格的 DSL 动态编译任意游戏,已在其上验证了数百款 PuzzleScript 游戏,并分析了搜索、学习与语言模型在这些游戏上的表现。该工作发表于 IEEE Conference on Games 2026。

  15. arXiv cs.AI24

    IdeaAnchor:教 LLM 从文献中提炼研究想法

    IdeaAnchor 提出一种用结构化规格作为特权信号训练 LLM 进行科研选题的范式,每个实例编码输入论文的功能角色、关系与目标综合标准。研究者从已发表论文中挖掘实例,通过示范、自蒸馏和强化学习训练模型,并在推理时用检索增强生成。实验显示选题质量持续提升,其中 anchor 训练强化创造性综合,检索改善细节展开,两者结合效果最佳。

  16. arXiv cs.AI34

    后训练决定 LLM 是否按自身道德判断行事:OLMo-3、Llama-3.1、Tulu 3 对比研究

    研究构建了 248 个场景的预注册测试面板,覆盖五类压力情境,发现 OLMo-3-7B-Instruct 在约五分之一的施压场景中会做出自己判定为错误的行为。这一"言行差距"取决于后训练配方:OLMo-3 和 Meta 的 Llama-3.1-8B-Instruct 存在该差距,而基于同一 Llama-3.1 权重训练的 Ai2 Tulu 3 在整个面板上未显现。

  17. arXiv cs.AI22

    MemFLoRA:面向边缘端 CNN 适配的内存下限 LoRA

    MemFLoRA 是一种面向 CNN 边缘适配的低秩适配器,采用内存优先设计而非直接套用面向 Transformer 的 LoRA。它冻结下投影、训练尺度匹配的上投影,并将保存状态压缩到低秩分支,在三个 HAR 数据集和两个 CNN 骨干上,相比全量微调减少 98.5-98.7% 的激活内存和 94.9-97.3% 的峰值训练状态内存,同时匹配或超过 CNN PEFT 基线。

  18. arXiv cs.AI20

    Selective-RL:选择性迁移 RL 更新实现视觉推理能力跨模型迁移

    研究者提出 Selective-RL,通过隔离强化学习阶段的参数更新、保留其主导矩阵方向并保持幅度,将其迁移至 VLM 的语言模块。在三个模型家族、五个视觉推理基准上,该方法在 15 项对比中有 12 项优于完整更新插值,其中 Qwen 接收模型的 MathVision 提升 8.55 个百分点。对照实验显示,仅靠更新幅度或任意低秩无法复现该增益。

  19. arXiv cs.AI10

    Adam 优化器共享记忆参数 β 的早期选择方法

    研究者提出一种从短程试点训练中选择 Adam 共享记忆参数 β₁=β₂=β 的方法,选定后在全量训练中保持固定。该方法基于 Adam 归一化方向的局部模型,在采样波动与梯度平均延迟之间取得平衡,导出三次记忆规则,其系数由少量试点检查点的梯度探测估计。

  20. arXiv cs.AI22

    学习方式如何决定遗忘效果:从记忆到泛化的连续谱研究

    研究揭示模型的学习方式会显著影响其后续的遗忘(unlearning)表现:以泛化为主的模型在遗忘时对保留集的性能损伤更大。作者通过模块加法中的 grokking 现象区分记忆型与泛化型模型,并引入分桶模块加法在记忆-泛化连续谱上精细控制两种策略的贡献,发现该趋势近乎单调。这一关系在 LLM 的逐字回忆与事实回忆遗忘场景中同样成立。

  21. arXiv cs.AI21

    DeltaTTT:面向非线性循环记忆的逐层优化方法

    针对非线性记忆网络在序列测试时训练中难以单遍优化、串行 TTT 反而不如固定基座并行 TTT 的问题,研究者提出 DeltaTTT,将两层记忆网络的联合内循环优化改为逐层学习,每层分配局部预测目标并通过状态相关的 delta 规则更新。该方法保留非线性读出并支持分块并行计算,在 DeltaNet 和 LaCT 骨干上提升了语言建模与检索表现。

  22. arXiv cs.AI13

    从共享需求模式到局部不确定性:用紧凑适配混合实现概率负荷预测

    研究者提出一种可扩展的客户感知概率负荷预测框架,通过共享模型学习共性需求行为,仅适配一小组低维参数,让每个负荷按自身特征组合这些适配组件。在 SMART-DS 数据集 590 条负荷曲线上,该方法在确定性精度和概率质量上均优于统计、神经网络、Transformer 及预训练时间序列基线,同时保持较低的存储与推理成本。