跳到正文
今天10月7日周三547 条
  1. arXiv cs.AI33

    Sherpa:让 LLM 学会自适应教学

    多轮强化学习框架 Sherpa 通过构建多种具有不同学习偏好的学生原型,训练教师模型直接最大化学生学习效果,使其所教学生在所有原型上平均提升 20.5 个百分点。在 MathTutorBench 评测中,Sherpa 将整体教学法得分从 52.5% 提升至 79.2%;人类研究显示,其训练出的教师模型在 79.6% 的成对比较中优于基座模型。

  2. arXiv cs.AI31

    ScienceClaw:跨自然科学与社会科学评测 AI-for-Science 智能体的持续自进化

    研究团队提出 ScienceClaw,将 AI-for-Science 智能体的自进化形式化为固定参数的程序自进化,统一任务求解、科学验证与程序更新。配套的 ScienceClaw-Eval 覆盖 23 个学科,通过顺序任务流与独立重置评测衡量科学正确性、进化增益、保持能力、跨数据集迁移和进化成本。

  3. arXiv cs.AI34

    迈向对齐扩展定律:一个框架与首批预注册测量

    研究提出对齐扩展定律框架,将对齐负担建模为 B_r(N)=a_rN^alpha_r,并给出三种负担操作化方式,区分观测、审计与真实对齐。预注册再分析显示,Pythia 分类器把攻击成功率压到 10% 以下所需算力按 N^0.60 增长;Qwen2.5 0.5B-72B 试点中,真实性指数为 -0.05、陈述倾向为 0.48,谄媚与植入后门尚未确定。

  4. arXiv cs.AI17

    Cylindrical Geodesic Flow Matching:面向准周期生理信号变换的柱面测地线流匹配

    研究者提出柱面测地线流匹配(cylindrical geodesic flow matching),用于成对心血管波形的准周期生理信号变换。该方法用相位—振幅柱面上的闭式测地线替代流匹配中的标准仿射路径,消除插值时的振幅与瞬时频率失真,并将每个训练对转化为稠密的速度监督。

  5. arXiv cs.AI22

    表格基础模型的标准化陷阱:认证联合标签处理

    针对预训练表格基础模型(TFM)是否采用固定权重解释上下文学习,研究者提出两种仅依赖标准化标签预测的认证方法,可排除固定权重预测和独立非线性标签变换之和两种解释。在评估的五个公开 TFM 上,认证结果显示改变一个上下文标签会改变其他标签对预测的影响,即"联合处理",且该行为随训练出现,注意力分数承载了大部分测得的交互。

  6. arXiv cs.AI24

    CoDe-LoRA:通过知识巩固与解耦缓解 LLM 持续学习中的正交性困境

    针对 O-LoRA 等正交投影方法在 LLM 持续学习中引发的"正交性困境",研究者提出免回放方法 CoDe-LoRA,将学习过程解耦为通用知识巩固与任务专属知识分离,并借助自适应零空间投影与语义路由平衡知识积累和任务适配。在四个骨干模型和三个持续学习基准上,CoDe-LoRA 取得最佳平均准确率,论文已被 EMNLP 2026 主会接收,代码已开源。

  7. arXiv cs.AI22

    MASC:面向心理咨询中一致客户角色扮演的多智能体自校准框架与潜在构念对齐

    研究者提出 MASC,一个结合构念引导生成、协作精炼、一致性验证与基于记忆修订的多智能体自校准框架,用于心理咨询中保持客户角色扮演的心理一致性。团队同时发布 CRPC-Bench 基准,包含 38 个动机式访谈客户画像及人格与情绪标注,覆盖会话级画像、大五人格与轮次级心理状态、沟通行为和情绪表达。实验显示 MASC 在画像、人格、接受度与轮次级一致性上均优于现有方法,异构配置整体表现最强。

  8. arXiv cs.AI17

    QEMFN:基于可训练纠缠的资源感知混合视觉语言融合网络

    研究者提出量子纠缠多模态融合网络(QEMFN),将预训练视觉与文本特征投影为角度参数化量子态,经模态内与跨模态纠缠电路测量后生成融合表示。在参数预算匹配且冻结同一 CLIP 骨干的条件下,QEMFN 在 COCO-5k 和 Flickr30k 上优于多层感知机、张量融合、FiLM、交叉注意力、紧凑 Transformer 及去量子化的配对拓扑对照等经典融合基线。

  9. arXiv cs.AI15

    从优化的金属微观结构与织构反推合金成分与工艺参数

    研究用107组镁合金挤压条件(14种合金)的数据,比较传统晶粒与织构统计、预训练图像编码器视觉嵌入和晶粒网络图神经网络三种描述符,反推合金成分与工艺参数。5折交叉验证下,传统描述符对留出条件识别正确合金的准确率为65%,而随机猜最常见合金仅17%,学习嵌入低于30%;微观结构可将温度误差较仅用成分大致减半。

  10. arXiv cs.AI29

    同一反馈不同答案:前沿模型客户反馈分析中的运行间不稳定性

    一项研究提出重复运行评估框架,用主题流失率和数量分歧两项指标衡量 AI 智能体处理非结构化数据的可重复性。在 Claude Opus 4.8 与 1000 条记录语料固定条件下,基于分类体系的智能体(TGA)相比原始生成和分层分解将主题流失率降低 86–88%,匹配主题的数量分歧为零。该框架面向客户反馈、财报、法律文档等重复性知识工作场景。

  11. arXiv cs.AI22

    各向同性却无法解码:潜在预测式文本表征中的序列内容充分性缺口

    研究提出信息论分解,将输入歧义、表征损失与读出失配分离,并构建可恢复视图证明完美一致与联合各向同性高斯性可同时与零目标信息共存。基于此提出非自回归框架 CANOPE,在 40,000 条验证序列上,latent-agreement(PL0)与 token-grounded(PL2)池化排名几乎相同,但位置 Recall@1 分别为 13.5% 和 98.8%。

  12. arXiv cs.AI17

    用文本环境上下文与空间图增强 LLM 区域海表温度预报

    研究将区域多步海表温度(SST)预报建模为条件数值生成,用历史 SST 与异常序列、日期对齐的环境记录和静态海洋知识构成文本上下文,并通过图神经网络生成连续的空间前缀注入 LLM 输入。在南海 SST 预报的十个预测步上,完整配置取得对比方法中最佳 MAE 和 R²。配套的规则模块将预测趋势与环境因子方向匹配知识条目,返回带来源的事后上下文解释。

  13. arXiv cs.AI22

    ThinkFuse:面向小型推理模型的轨迹感知测试时融合方法

    ThinkFuse 是一种免训练的测试时融合框架,通过对比片段级不确定性与轨迹级不确定性趋势来识别不稳定推理点,并将辅助推理路径融合进主模型轨迹。在数学与知识密集型推理基准上,它优于现有基线,跨模型组合均有稳定提升,且主模型更小时仍保持稳健。该方法所需融合触发次数更少、生成 token 更少,代码已开源,论文被 EMNLP 2026 Findings 接收。

  14. arXiv cs.AI24

    OTel:开放电信 AI 数据集、基准与模型发布

    研究者发布开放电信 AI 资源 OTel,包含面向检索、重排序、指令微调与安全/拒答的衍生电信数据集,以及 30 个全参数后训练基线,覆盖 10 个嵌入模型、3 个重排序器和 17 个语言模型。截至 2026 年 5 月 3 日,相关模型下载量超 1600 万次。后训练后嵌入检索达 93.1% NDCG@10,重排序达 0.947 MRR@10,语言模型正确率达 87.8%。

  15. arXiv cs.AI37

    AgentMemGate:解决对话助手记忆中的推测污染问题

    AgentMemGate 是一种写入时门控机制,可将提取的陈述分类为推测、已完成事件、更正或其他,阻止未确认的计划进入记忆存储。在 147 组对话的留出集上,Mem0 和 Graphiti 分别将 35.2% 和 27.3% 的未决计划断言为当前状态;AgentMemGate 在核心基准上将污染从 87.5% 降至零,任务准确率从 65% 提升至 95%。

  16. arXiv cs.AI26

    BluffJAX:JAX 中的对抗性不完美信息博弈开源套件

    BluffJAX 是一个基于 JAX 的开源对抗性不完美信息博弈套件,包含 Texas Hold'Em Poker、Kuhn Poker 等经典基准,以及此前未被强化学习研究过的 Bluff、Stud Poker 和 Kemps。其在单 GPU 和多 GPU 设置下实现每秒数亿样本的吞吐量扩展,并提供了强化学习、树搜索和博弈求解算法的基线结果。

  17. arXiv cs.AI18

    LSC-DPO:学习信号受控的直接偏好优化

    研究提出 LSC-DPO,从损失几何视角将 DPO 损失中的 sigmoid 因子视为刻画目标局部敏感度的学习信号,并动态将其调节至目标区间。在 AlpacaEval 2、MT-Bench 和 Anthropic-HH 上,LSC-DPO 持续优于 DPO 及强偏好优化基线。研究还发现不同系数初始化会产生不同的瞬态学习信号轨迹,据此推导出信号预算补偿规则,显著降低跨初始化的性能波动。

  18. arXiv cs.AI22

    个人智能体中介推荐:跨平台用户历史如何平衡平台排序的救援与误改

    研究提出"个人智能体中介推荐"范式:平台推荐器用本地信息排序候选集,个人 LLM 智能体借助用户授权的跨平台历史对排序进行中介,生成最终 top-K 列表。为此推出 MediateRec 基准,并给出 Personal Attribution Mediation Optimization(PAMO)训练方法,通过反事实遮蔽跨平台历史来估计个人中介支持度。

  19. arXiv cs.AI19

    交错参与下的多智能体强化学习:SPL 训练增强方法

    研究提出交错参与(SP)下的多智能体强化学习设定,即部分智能体先行动并留下对后续智能体有用的信息,形成跨时间、跨智能体的学习依赖。为此提出训练期增强方法 SPL,通过前瞻性获取监督训练早期智能体、以结果监督训练后续接收方。在 60 组 MPE/RWARE 骨干设置对比中,SPL 每次任务完成度均更高,平均提升 14.1%,并扩展至八智能体团队和 Isaac Lab 的 UAV-UGV 环境。