跳到正文
今天10月7日周三374 条
  1. arXiv cs.AI15

    基础模型辅助的多智能体强化学习用于无线随机接入网络优化

    研究提出用基础模型(FM)提升多智能体强化学习(MARL)在无线随机接入(RA)网络优化中的效率,设计了基于共识的去中心化 MARL 架构下的 FM 辅助 actor-critic 算法。收敛性分析表明,该算法在局部奖励交换与非线性价值函数近似下,达到与传统 MARL 相同的收敛阶数。数值结果显示该方法显著提升了 RA 网络优化的 MARL 速度。

  2. arXiv cs.AI24

    AlignQuant:面向高效 LLM 生成的 Tile 对齐混合精度量化

    AlignQuant 是一种训练后量化方法,以 GPU 兼容的二维权重 tile 作为精度分配、紧凑存储与执行的统一单元,让精度在输出通道内跟随敏感度。在 4 个 3B 至 14B 参数的 LLM 上,它相比 BF16 实现最高 2.50 倍生成加速并保持模型质量,评测覆盖 3 种 GPU 和最高 64K token 上下文。实现已开源。

  3. arXiv cs.AI29

    Apple 提出 Stepped MoE:段级路由实现可配置推理复杂度

    Apple 提出 Stepped MoE 框架,将弹性结构与稀疏门控架构结合,让单一模型可在 1、2、3、4 billion 参数间灵活切换,并保持输入自适应路由。该模型在知识密集型基准上比同规模稠密模型准确率高 2-5%,延迟与稠密模型相当,同时通过共享参数节省设备磁盘空间,适配端侧推理的 DRAM 与算力限制。

  4. arXiv cs.AI22

    FlexiFlow:基于多臂老虎机的 ML 工作流模型动态切换

    FlexiFlow 是一个数据流系统,能在当前模型准确率偏低时动态切换到备选模型,通过多臂老虎机方法对模型进行排序,综合考虑模型运行时间、通过用户自定义断言的概率以及 ML 工作流的计算结构。实验显示,切换模型可将工作流准确率提升最高 23%,运行时复用中间结果相比顺序执行工作流还能带来 48% 的效率提升。

  5. arXiv cs.AI29

    最小见证强化学习 MWRL:让模型从验证器反馈中学会完整见证族

    研究者提出最小见证强化学习(MWRL),将"找出全部最小充分见证"形式化为最小见证识别问题,仅凭单个黑盒验证器的反馈位即可完成信用分配。该方法从问题定义直接推导,统一了最小性与备选解恢复两项要求,并据此给出可恢复完整见证族的值迭代规划器和可扩展到大语言模型的策略梯度方法。实验中 MWRL 能找回大部分最小见证,而其他方法只返回冗余超集或单一见证。

  6. arXiv cs.AI22

    能否预测 LLM 评审的位置翻转?基于残差流激活的线性探针研究

    研究发现,LLM 评审在候选回答顺序调换时可能改变判定,而判定前的残差流激活可预测这种位置翻转。在 JudgeBench 的 534 对样本上,针对三个 Qwen3 评审和 Llama-3.1-8B 训练的线性探针 AUROC 达 .621-.850,比结合语言化置信度、判定标签 logits、回答长度和初始选择的基线高 .062-.113。

  7. arXiv cs.AI24

    推荐系统递归自我改进不止看后继模型精度:状态保留与跨代优势 CGA

    研究提出推荐系统递归自我改进(Rec-RSI)中的"分布式进展"问题,并用跨代优势(CGA)量化跨代与同代模型对的差异。在四个数据集和三种序列推荐编码器上,GRU4Rec 和 SASRec 更适合跨代配对,FMLP 首次更新偏向同代配对、第二次更新后转向跨代配对;秩分离统计在 12/12 首次更新和 5/6 第二次更新设置中选出更强模型族,留出测试中 34/36 条轨迹优于直接后继模型。

  8. arXiv cs.AI23

    macro2mind:用预测市场信号训练 LLM 学习个体行为推理

    研究者提出 macro2mind,用 GRPO 结合预测市场价格信号训练语言模型,将行为推理拆解为推断市场参与者群体、预测其信念更新并聚合为价格的显式步骤。该方法在 SWM-Bench 的 Polymarket 数据上取得 SOTA 方向准确率与相关性,并零样本迁移至 Humanual、OvertonBench、PRISM、CAD 四个用户模拟基准。

  9. arXiv cs.AI22

    TRIAGE:面向原生 NVFP4 强化学习的方向感知失配稳定方法

    TRIAGE 是一种方向感知的稳定方法,通过段级诊断选择性再平衡策略梯度更新,并对残余严重失配做有界修复,从而在采样器和学习器上保留原生 NVFP4 的 W4A4 前向执行。在 Qwen3-4B 与 Qwen3-30B-A3B 上,该方法在整个训练周期内保持稳定优化,在五个数学推理基准上达到全精度水平,rollout 吞吐量较 BF16 最高提升 2.3 倍。

  10. arXiv cs.AI22

    知识蒸馏与量化压缩用于生物医学领域神经机器翻译研究

    研究将知识蒸馏与量化联合应用于法译英生物医学翻译,蒸馏并量化的学生模型相比原始基线体积缩小69%、推理速度提升98.21%、CO2排放降低98.46%,且未牺牲翻译质量。该工作还开发并比较了多种微调策略,以让压缩后的学生模型适应专业术语密集、平行语料稀缺的低资源领域。

  11. arXiv cs.AI30

    DART-ES:面向 Evolution Strategies 微调 LLM 的难度感知重加权与定向回放

    DART-ES 通过扰动种群通过率估计题目局部可解性并聚合历史观测构建动态难度状态,联合指导难度重加权与稀有可解样本回放,无需额外难度模型或反向传播。它在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率达 49.20%。

  12. arXiv cs.AI24

    Transformer 拒绝机制中的组件与维度稀疏性

    研究将 LLM 的拒绝行为引导分解为组件级干预,在四个开源权重模型中发现拒绝方向集中于仅占上游组件 28–48% 的稀疏子集,仍保留 88–101% 的引导效果。在这些机制内部,有效引导进一步集中于约 50% 的残差流维度,保留 85–98% 的组件机制基线效果。团队已开源全部代码与原始实验结果。

  13. arXiv cs.AI22

    对齐中线性奖励的公理可满足性:用最小松弛量满足 PO 与 PMC

    针对线性奖励拟合人类偏好时无法满足 PO 与 PMC 公理的问题,研究者将线性模型放宽为允许每个候选者带有松弛量,求出满足公理且总松弛量最小的松弛线性奖励。当候选数 m 且 margin η 不超过 O(1/m²) 时,最优总松弛量上界为 O(1),并给出紧实例。新方法对每次比较错误的线性部分计费,同时最小化总松弛量与违规数,实验显示其线性奖励优于线性 BTL。

  14. arXiv cs.AI26

    PPWM:面向精准高效长时程规划的并行预测世界模型

    研究者提出并行预测世界模型(PPWM),可并行预测有限时程轨迹,同时保留未来表示之间的因果交互,从而去除自回归 rollout 中逐状态解码反馈路径。在四项视觉控制任务上,PPWM 取得最低的长时程预测误差和最高的 CEM 模拟器成功率,CEM 规划速度平均超过自回归 LeWM 基线 3 倍以上。

  15. arXiv cs.AI22

    MoF:面向黑盒 LLM 个性化的偏好感知混合建模

    针对黑盒 LLM 个性化中用户专属评分头导致参数量随用户数线性增长的问题,研究者提出 Mixture-of-Facets(MoF)框架,将用户偏好建模为共享潜在偏好分面的组合,通过历史条件路由在共享分面头上实现个性化。MoF 无需额外参数更新即可泛化到训练中未见的用户,在多种个性化任务上取得更强性能,同时保持更可扩展、更参数高效的设计。该工作已被 EMNLP 2026 接收。

  16. arXiv cs.AI41

    用 AI 辅助完成庞加莱猜想的 Lean 4 形式化

    研究团队完成了庞加莱猜想的 AI 辅助 Lean 4 形式化,项目起步时几何分析方向可复用的形式化基础设施十分有限。他们用数学家编写的证明蓝图配合明确的里程碑陈述来组织工作,使多个智能体可并行推进,并让数学家能定位阻塞点、给出有效数学指导。该工作分析了这一流程背后的人工介入与组织选择,为未来形式化项目提供了可复用基础设施的起点。