跳到正文
今天10月7日周三563 条
  1. arXiv cs.AI22

    ReRAM 存内计算 CNN 加速器的故障脆弱性实证研究

    研究者开发了一套故障注入框架,在软件和硬件层面考察大规模 CNN 在 ReRAM 存内计算(PIM)加速器上推理时的脆弱性,通过将 CNN 学习参数映射到 ReRAM 交叉阵列并注入 stuck-at high(SaH)与 stuck-at low(SaL)故障,发现脆弱性受层类型与深度、参数在层内的位置以及故障取值与类型影响,且 SaL 比 SaH 造成更严重的分类精度下降。

  2. arXiv cs.AI30

    DART-ES:面向 Evolution Strategies 微调 LLM 的难度感知重加权与定向回放

    DART-ES 通过扰动种群通过率估计题目局部可解性并聚合历史观测构建动态难度状态,联合指导难度重加权与稀有可解样本回放,无需额外难度模型或反向传播。它在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率达 49.20%。

  3. arXiv cs.AI27

    CrystalJev:用原子基础模型"快思考与慢思考"加速材料发现

    CrystalJev 将冻结的原子间势模型当作快速决策者,对未弛豫结构单次前向查询即可输出带校准概率的"稳定"判断,成本仅为弛豫计算的约三十分之一。在 65 个 Matbench Discovery 模型上,该方法用价值信息理论只在决策可能改变处调用慢速计算,并同样回答电子、力学与分子问题。

  4. arXiv cs.AI29

    仅用判决结果后训练小模型:拒绝采样与纯标签训练能否恢复证据?

    研究测量小语言模型仅凭判决结果后训练时的证据恢复能力,在 ContractNLI 上人类证据跨度留至评估阶段。纯标签训练达到准确率 0.896、跨度 F1 0.564,逐字引用率从 0.597 升至 0.729;拒绝采样达到 0.797 和 0.556,逐字引用率升至 0.701。两种方法都能在无人标注证据的情况下改善证据质量,但单一语料单一种子尚无法判定哪种更优。

  5. arXiv cs.AI29

    零样本可视化(ZSV):用用户提示词定义的坐标轴探索文本语料

    研究者提出零样本可视化(ZSV)任务,用户用自然语言指定概念,文档被映射到对应概念轴上以便可视化探索。团队建立基准,对比嵌入相似度、直接语义判断和条件似然估计三类方法,发现基于 next-token 概率的打分在语义忠实度、分数保真度和计算成本间取得最佳实用权衡。研究还发现分级轴配合二元相关性过滤的设计要点,并揭示离题文档中存在组合式情感偏差。

  6. arXiv cs.AI33

    Sherpa:让 LLM 学会自适应教学

    多轮强化学习框架 Sherpa 通过构建多种具有不同学习偏好的学生原型,训练教师模型直接最大化学生学习效果,使其所教学生在所有原型上平均提升 20.5 个百分点。在 MathTutorBench 评测中,Sherpa 将整体教学法得分从 52.5% 提升至 79.2%;人类研究显示,其训练出的教师模型在 79.6% 的成对比较中优于基座模型。

  7. arXiv cs.AI31

    ScienceClaw:跨自然科学与社会科学评测 AI-for-Science 智能体的持续自进化

    研究团队提出 ScienceClaw,将 AI-for-Science 智能体的自进化形式化为固定参数的程序自进化,统一任务求解、科学验证与程序更新。配套的 ScienceClaw-Eval 覆盖 23 个学科,通过顺序任务流与独立重置评测衡量科学正确性、进化增益、保持能力、跨数据集迁移和进化成本。

  8. arXiv cs.AI34

    迈向对齐扩展定律:一个框架与首批预注册测量

    研究提出对齐扩展定律框架,将对齐负担建模为 B_r(N)=a_rN^alpha_r,并给出三种负担操作化方式,区分观测、审计与真实对齐。预注册再分析显示,Pythia 分类器把攻击成功率压到 10% 以下所需算力按 N^0.60 增长;Qwen2.5 0.5B-72B 试点中,真实性指数为 -0.05、陈述倾向为 0.48,谄媚与植入后门尚未确定。

  9. arXiv cs.AI17

    Cylindrical Geodesic Flow Matching:面向准周期生理信号变换的柱面测地线流匹配

    研究者提出柱面测地线流匹配(cylindrical geodesic flow matching),用于成对心血管波形的准周期生理信号变换。该方法用相位—振幅柱面上的闭式测地线替代流匹配中的标准仿射路径,消除插值时的振幅与瞬时频率失真,并将每个训练对转化为稠密的速度监督。

  10. arXiv cs.AI22

    表格基础模型的标准化陷阱:认证联合标签处理

    针对预训练表格基础模型(TFM)是否采用固定权重解释上下文学习,研究者提出两种仅依赖标准化标签预测的认证方法,可排除固定权重预测和独立非线性标签变换之和两种解释。在评估的五个公开 TFM 上,认证结果显示改变一个上下文标签会改变其他标签对预测的影响,即"联合处理",且该行为随训练出现,注意力分数承载了大部分测得的交互。

  11. arXiv cs.AI24

    CoDe-LoRA:通过知识巩固与解耦缓解 LLM 持续学习中的正交性困境

    针对 O-LoRA 等正交投影方法在 LLM 持续学习中引发的"正交性困境",研究者提出免回放方法 CoDe-LoRA,将学习过程解耦为通用知识巩固与任务专属知识分离,并借助自适应零空间投影与语义路由平衡知识积累和任务适配。在四个骨干模型和三个持续学习基准上,CoDe-LoRA 取得最佳平均准确率,论文已被 EMNLP 2026 主会接收,代码已开源。

  12. arXiv cs.AI22

    MASC:面向心理咨询中一致客户角色扮演的多智能体自校准框架与潜在构念对齐

    研究者提出 MASC,一个结合构念引导生成、协作精炼、一致性验证与基于记忆修订的多智能体自校准框架,用于心理咨询中保持客户角色扮演的心理一致性。团队同时发布 CRPC-Bench 基准,包含 38 个动机式访谈客户画像及人格与情绪标注,覆盖会话级画像、大五人格与轮次级心理状态、沟通行为和情绪表达。实验显示 MASC 在画像、人格、接受度与轮次级一致性上均优于现有方法,异构配置整体表现最强。

  13. arXiv cs.AI17

    QEMFN:基于可训练纠缠的资源感知混合视觉语言融合网络

    研究者提出量子纠缠多模态融合网络(QEMFN),将预训练视觉与文本特征投影为角度参数化量子态,经模态内与跨模态纠缠电路测量后生成融合表示。在参数预算匹配且冻结同一 CLIP 骨干的条件下,QEMFN 在 COCO-5k 和 Flickr30k 上优于多层感知机、张量融合、FiLM、交叉注意力、紧凑 Transformer 及去量子化的配对拓扑对照等经典融合基线。

  14. arXiv cs.AI15

    从优化的金属微观结构与织构反推合金成分与工艺参数

    研究用107组镁合金挤压条件(14种合金)的数据,比较传统晶粒与织构统计、预训练图像编码器视觉嵌入和晶粒网络图神经网络三种描述符,反推合金成分与工艺参数。5折交叉验证下,传统描述符对留出条件识别正确合金的准确率为65%,而随机猜最常见合金仅17%,学习嵌入低于30%;微观结构可将温度误差较仅用成分大致减半。

  15. arXiv cs.AI29

    同一反馈不同答案:前沿模型客户反馈分析中的运行间不稳定性

    一项研究提出重复运行评估框架,用主题流失率和数量分歧两项指标衡量 AI 智能体处理非结构化数据的可重复性。在 Claude Opus 4.8 与 1000 条记录语料固定条件下,基于分类体系的智能体(TGA)相比原始生成和分层分解将主题流失率降低 86–88%,匹配主题的数量分歧为零。该框架面向客户反馈、财报、法律文档等重复性知识工作场景。

  16. arXiv cs.AI22

    各向同性却无法解码:潜在预测式文本表征中的序列内容充分性缺口

    研究提出信息论分解,将输入歧义、表征损失与读出失配分离,并构建可恢复视图证明完美一致与联合各向同性高斯性可同时与零目标信息共存。基于此提出非自回归框架 CANOPE,在 40,000 条验证序列上,latent-agreement(PL0)与 token-grounded(PL2)池化排名几乎相同,但位置 Recall@1 分别为 13.5% 和 98.8%。

  17. arXiv cs.AI17

    用文本环境上下文与空间图增强 LLM 区域海表温度预报

    研究将区域多步海表温度(SST)预报建模为条件数值生成,用历史 SST 与异常序列、日期对齐的环境记录和静态海洋知识构成文本上下文,并通过图神经网络生成连续的空间前缀注入 LLM 输入。在南海 SST 预报的十个预测步上,完整配置取得对比方法中最佳 MAE 和 R²。配套的规则模块将预测趋势与环境因子方向匹配知识条目,返回带来源的事后上下文解释。

  18. arXiv cs.AI22

    ThinkFuse:面向小型推理模型的轨迹感知测试时融合方法

    ThinkFuse 是一种免训练的测试时融合框架,通过对比片段级不确定性与轨迹级不确定性趋势来识别不稳定推理点,并将辅助推理路径融合进主模型轨迹。在数学与知识密集型推理基准上,它优于现有基线,跨模型组合均有稳定提升,且主模型更小时仍保持稳健。该方法所需融合触发次数更少、生成 token 更少,代码已开源,论文被 EMNLP 2026 Findings 接收。

  19. arXiv cs.AI24

    OTel:开放电信 AI 数据集、基准与模型发布

    研究者发布开放电信 AI 资源 OTel,包含面向检索、重排序、指令微调与安全/拒答的衍生电信数据集,以及 30 个全参数后训练基线,覆盖 10 个嵌入模型、3 个重排序器和 17 个语言模型。截至 2026 年 5 月 3 日,相关模型下载量超 1600 万次。后训练后嵌入检索达 93.1% NDCG@10,重排序达 0.947 MRR@10,语言模型正确率达 87.8%。

  20. arXiv cs.AI37

    AgentMemGate:解决对话助手记忆中的推测污染问题

    AgentMemGate 是一种写入时门控机制,可将提取的陈述分类为推测、已完成事件、更正或其他,阻止未确认的计划进入记忆存储。在 147 组对话的留出集上,Mem0 和 Graphiti 分别将 35.2% 和 27.3% 的未决计划断言为当前状态;AgentMemGate 在核心基准上将污染从 87.5% 降至零,任务准确率从 65% 提升至 95%。