跳到正文
10月7日周三
  1. arXiv cs.AI22

    Anchor and Adapt:面向少样本工业异常检测的非对称提示词自适应框架

    研究者提出 Anchor and Adapt 两阶段提示词学习框架,将异常语义获取与目标正常外观适配分离:Stage I 从带标注辅助数据学习可迁移的正常与异常锚点,Stage II 固定锚点并用少量目标正常样本适配额外正常分支。在 MVTec-AD 与 VisA 跨数据集 1-shot、2-shot、4-shot 设置下,该框架取得有竞争力的检测与定位性能,且无需合成异常生成。

  2. arXiv cs.AI30

    DART-ES:面向 Evolution Strategies 微调 LLM 的难度感知重加权与定向回放

    DART-ES 通过扰动种群通过率估计题目局部可解性并聚合历史观测构建动态难度状态,联合指导难度重加权与稀有可解样本回放,无需额外难度模型或反向传播。它在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率达 49.20%。

  3. arXiv cs.AI27

    CrystalJev:用原子基础模型"快思考与慢思考"加速材料发现

    CrystalJev 将冻结的原子间势模型当作快速决策者,对未弛豫结构单次前向查询即可输出带校准概率的"稳定"判断,成本仅为弛豫计算的约三十分之一。在 65 个 Matbench Discovery 模型上,该方法用价值信息理论只在决策可能改变处调用慢速计算,并同样回答电子、力学与分子问题。

  4. arXiv cs.AI37

    APEX:面向 LLM 智能体的执行边界主动防护

    APEX 是一种针对 LLM 智能体间接提示注入(IPI)的主动防御方案,将防护点从攻击模式识别转移到执行边界,通过执行前编译的授权契约同时实现证据门控预防与欺骗式暴露。在六项基准中,APEX 对 13 个基线取得五项 0% 攻击成功率、第六项 0.56%,并在三类能力单元(Tools、MCP servers、Skills)的自适应攻击下保持 0%。代码已开源。

  5. arXiv cs.AI29

    仅用判决结果后训练小模型:拒绝采样与纯标签训练能否恢复证据?

    研究测量小语言模型仅凭判决结果后训练时的证据恢复能力,在 ContractNLI 上人类证据跨度留至评估阶段。纯标签训练达到准确率 0.896、跨度 F1 0.564,逐字引用率从 0.597 升至 0.729;拒绝采样达到 0.797 和 0.556,逐字引用率升至 0.701。两种方法都能在无人标注证据的情况下改善证据质量,但单一语料单一种子尚无法判定哪种更优。

  6. arXiv cs.AI24

    Transformer 拒绝机制中的组件与维度稀疏性

    研究将 LLM 的拒绝行为引导分解为组件级干预,在四个开源权重模型中发现拒绝方向集中于仅占上游组件 28–48% 的稀疏子集,仍保留 88–101% 的引导效果。在这些机制内部,有效引导进一步集中于约 50% 的残差流维度,保留 85–98% 的组件机制基线效果。团队已开源全部代码与原始实验结果。

  7. arXiv cs.AI22

    对齐中线性奖励的公理可满足性:用最小松弛量满足 PO 与 PMC

    针对线性奖励拟合人类偏好时无法满足 PO 与 PMC 公理的问题,研究者将线性模型放宽为允许每个候选者带有松弛量,求出满足公理且总松弛量最小的松弛线性奖励。当候选数 m 且 margin η 不超过 O(1/m²) 时,最优总松弛量上界为 O(1),并给出紧实例。新方法对每次比较错误的线性部分计费,同时最小化总松弛量与违规数,实验显示其线性奖励优于线性 BTL。

  8. arXiv cs.AI29

    零样本可视化(ZSV):用用户提示词定义的坐标轴探索文本语料

    研究者提出零样本可视化(ZSV)任务,用户用自然语言指定概念,文档被映射到对应概念轴上以便可视化探索。团队建立基准,对比嵌入相似度、直接语义判断和条件似然估计三类方法,发现基于 next-token 概率的打分在语义忠实度、分数保真度和计算成本间取得最佳实用权衡。研究还发现分级轴配合二元相关性过滤的设计要点,并揭示离题文档中存在组合式情感偏差。

  9. arXiv cs.AI33

    Sherpa:让 LLM 学会自适应教学

    多轮强化学习框架 Sherpa 通过构建多种具有不同学习偏好的学生原型,训练教师模型直接最大化学生学习效果,使其所教学生在所有原型上平均提升 20.5 个百分点。在 MathTutorBench 评测中,Sherpa 将整体教学法得分从 52.5% 提升至 79.2%;人类研究显示,其训练出的教师模型在 79.6% 的成对比较中优于基座模型。

  10. arXiv cs.AI44

    BOTTLED 基准:LLM 智能体能否把通用能力"装瓶"成廉价可复用方案?

    研究者提出 BOTTLED 基准,让 LLM 智能体在固定时间、算力和 API 预算下自主处理整个未标注工作负载,可选择训练小模型或编写可复用程序。在十款模型、三项任务中,强零样本表现并不能可靠转化为强"装瓶"能力,60 次运行中有 48 次低于其零样本性能 95% 置信区间下限,31 次不及同等 token 预算下两种小模型蒸馏基线中较强的一个。

  11. arXiv cs.AI24

    智能体的历史行为能预测上下文压缩何时有害吗?TRACE 配对重放语料上的有限效应

    研究基于 TRACE 公开语料库的 590 个 AppWorld 压缩边界,检验智能体近期行为能否预测上下文压缩带来的损害。结果显示边界前历史对压缩后损害的预测能力很弱,最佳扩展协议触发器在留出集上 AUROC 仅 0.66,而同一边界复现为 0.72;最佳冻结可解释触发器避开 21% 有害边界,同时保留 84% 的压缩机会。

  12. arXiv cs.AI31

    ScienceClaw:跨自然科学与社会科学评测 AI-for-Science 智能体的持续自进化

    研究团队提出 ScienceClaw,将 AI-for-Science 智能体的自进化形式化为固定参数的程序自进化,统一任务求解、科学验证与程序更新。配套的 ScienceClaw-Eval 覆盖 23 个学科,通过顺序任务流与独立重置评测衡量科学正确性、进化增益、保持能力、跨数据集迁移和进化成本。

  13. arXiv cs.AI23

    全双工语音模型对话中的轮次交接为何滞后:PersonaPlex-7B 自对弈时序研究

    两个 PersonaPlex-7B 实例在共享时钟上交换音频 token 进行无脚本对话,其轮次交接时序呈现耦合,但换手明显偏晚,中位数为 400-560 ms,而人类为 137 ms。在伙伴轮次最后 120 ms 内,人类约十分之一的交接发生于此,而模型仅占 1%。延迟单向通道会使响应一比一平移,且响应前的准备期为空,表明模型是在感知到对方结束后的被动等待,而非人类时序所需的轮末预判。

  14. arXiv cs.AI32

    ParanoiaEval:评测智能体编程中不必要的防御性工作

    研究者推出 ParanoiaEval,首个统一评测编程智能体风险处理能力的基准,基于软件工程风险管理的 Avoidance-Transfer-Mitigation-Acceptance 框架,包含 200 个证据受控的仓库级任务对。在 8 个代表性模型上的实验显示,即便有明确证据,仍有 11.2%-58.7% 的运行出现不必要的风险处理,且更强的任务能力并不保证更恰当的风险处理。

  15. arXiv cs.AI26

    PPWM:面向精准高效长时程规划的并行预测世界模型

    研究者提出并行预测世界模型(PPWM),可并行预测有限时程轨迹,同时保留未来表示之间的因果交互,从而去除自回归 rollout 中逐状态解码反馈路径。在四项视觉控制任务上,PPWM 取得最低的长时程预测误差和最高的 CEM 模拟器成功率,CEM 规划速度平均超过自回归 LeWM 基线 3 倍以上。

  16. arXiv cs.AI34

    迈向对齐扩展定律:一个框架与首批预注册测量

    研究提出对齐扩展定律框架,将对齐负担建模为 B_r(N)=a_rN^alpha_r,并给出三种负担操作化方式,区分观测、审计与真实对齐。预注册再分析显示,Pythia 分类器把攻击成功率压到 10% 以下所需算力按 N^0.60 增长;Qwen2.5 0.5B-72B 试点中,真实性指数为 -0.05、陈述倾向为 0.48,谄媚与植入后门尚未确定。

  17. arXiv cs.AI17

    Cylindrical Geodesic Flow Matching:面向准周期生理信号变换的柱面测地线流匹配

    研究者提出柱面测地线流匹配(cylindrical geodesic flow matching),用于成对心血管波形的准周期生理信号变换。该方法用相位—振幅柱面上的闭式测地线替代流匹配中的标准仿射路径,消除插值时的振幅与瞬时频率失真,并将每个训练对转化为稠密的速度监督。