跳到正文
10月7日周三
  1. arXiv cs.AI22

    表格基础模型的标准化陷阱:认证联合标签处理

    针对预训练表格基础模型(TFM)是否采用固定权重解释上下文学习,研究者提出两种仅依赖标准化标签预测的认证方法,可排除固定权重预测和独立非线性标签变换之和两种解释。在评估的五个公开 TFM 上,认证结果显示改变一个上下文标签会改变其他标签对预测的影响,即"联合处理",且该行为随训练出现,注意力分数承载了大部分测得的交互。

  2. arXiv cs.AI24

    CoDe-LoRA:通过知识巩固与解耦缓解 LLM 持续学习中的正交性困境

    针对 O-LoRA 等正交投影方法在 LLM 持续学习中引发的"正交性困境",研究者提出免回放方法 CoDe-LoRA,将学习过程解耦为通用知识巩固与任务专属知识分离,并借助自适应零空间投影与语义路由平衡知识积累和任务适配。在四个骨干模型和三个持续学习基准上,CoDe-LoRA 取得最佳平均准确率,论文已被 EMNLP 2026 主会接收,代码已开源。

  3. arXiv cs.AI27

    zkLLMPoT:面向大语言模型训练的高效零知识证明框架

    zkLLMPoT 是一个零知识框架,通过前向评估而非验证优化轨迹来证明训练后检查点的审计属性,认证成本与训练迭代次数无关。该框架分两阶段:训练方固定架构并提交权重,审计方选择挑战序列后,训练方证明模型在这些序列上的目标值。在四类模型家族上,1.1-1.5B 参数模型证明耗时 41-59 秒,13B 模型为 131 秒,序列长度 512 时验证时间低于半秒。

  4. arXiv cs.AI22

    MASC:面向心理咨询中一致客户角色扮演的多智能体自校准框架与潜在构念对齐

    研究者提出 MASC,一个结合构念引导生成、协作精炼、一致性验证与基于记忆修订的多智能体自校准框架,用于心理咨询中保持客户角色扮演的心理一致性。团队同时发布 CRPC-Bench 基准,包含 38 个动机式访谈客户画像及人格与情绪标注,覆盖会话级画像、大五人格与轮次级心理状态、沟通行为和情绪表达。实验显示 MASC 在画像、人格、接受度与轮次级一致性上均优于现有方法,异构配置整体表现最强。

  5. arXiv cs.AI22

    OSFP4:面向 NVFP4 量化的对角平滑与块缩放联合优化

    研究者提出 NVFP4 量化方案 OSFP4,对每个线性投影使用对角平滑矩阵,在 NVFP4 下联合优化平滑项与块缩放以最小化矩阵乘量化误差,并兼容 round-to-nearest 与 GPTQ 式逐次干扰消除。实验显示 OSFP4 在对应量化设置下取得所评估方案中最高的平均精度,同时保留约 94-97% 的厂商 NVFP4 prefill 吞吐,代码已开源。

  6. arXiv cs.AI26

    神经解码中上下文先验下的置信度排序反转

    研究发现,上下文先验在提升神经到语言解码候选分数的同时,会让残留错误变得更自信。在 MEG-MASC 上,区分修复与残留错误的 AUROC 从初始排名 2-3 时的 0.70 降至排名 21-50 时的 0.39,而排名 20 之后的错误占融合后全部错误的 46.6%。分别读取局部与先验分数可改善选择性解码,解码器在 74.5% 的窗口作答(原为 56.7%),92% 的输出集仍包含正确候选。

  7. arXiv cs.AI17

    QEMFN:基于可训练纠缠的资源感知混合视觉语言融合网络

    研究者提出量子纠缠多模态融合网络(QEMFN),将预训练视觉与文本特征投影为角度参数化量子态,经模态内与跨模态纠缠电路测量后生成融合表示。在参数预算匹配且冻结同一 CLIP 骨干的条件下,QEMFN 在 COCO-5k 和 Flickr30k 上优于多层感知机、张量融合、FiLM、交叉注意力、紧凑 Transformer 及去量子化的配对拓扑对照等经典融合基线。

  8. arXiv cs.AI37

    Learn2Play Bench:LLM 智能体在陌生环境中从经验学习的效果如何?

    研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体从交互经验中学习的能力,并提供可复现反馈与自动评分。评测发现:完整保留动作与反馈记录比总结成规则或策略更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定骨干模型时更换 harness 可提升表现并降低推理成本。

  9. arXiv cs.AI15

    从优化的金属微观结构与织构反推合金成分与工艺参数

    研究用107组镁合金挤压条件(14种合金)的数据,比较传统晶粒与织构统计、预训练图像编码器视觉嵌入和晶粒网络图神经网络三种描述符,反推合金成分与工艺参数。5折交叉验证下,传统描述符对留出条件识别正确合金的准确率为65%,而随机猜最常见合金仅17%,学习嵌入低于30%;微观结构可将温度误差较仅用成分大致减半。

  10. arXiv cs.AI27

    多智能体系统中的执行一致性:超越修正记忆

    研究提出多智能体系统的"执行一致性"定义,通过状态使用、信息交接和最终状态一致性等职责判断任务是否被满足。受控移除回执、动作依赖等证据后,82.4% 的对立标签对无法区分,恢复后 97.9% 可分离。基于 CAVERT 框架从日志提取关系并应用该标准,在全部 12 个基准执行器设置中诊断表现优于契约提示 LLM 和规则基线,并在四个环境中优于规则引导恢复。

  11. arXiv cs.AI27

    POLAR:面向工具调用 LLM 智能体的本体引导风险预防框架

    POLAR 是一个面向小型工具调用智能体的护栏框架,通过结构化双层本体评估动作可逆性,为每个动作生成分级可逆性分数,未达阈值的调用会在执行前被剪枝。在 τ²-bench 上对六种智能体模型评测,POLAR 使其中四个模型在 airline 域的平均任务奖励提升 0.11 至 0.18 分,但十八个模型—领域组合中仅八个整体改善,retail 域及更强模型常出现回退。

  12. arXiv cs.AI31

    SpeedrunBench:用视频游戏速通挑战 LLM 智能体

    研究者推出 SPEEDRUNBENCH,一个覆盖 9 款游戏、评估前沿 LLM 智能体策略形成能力的基准,要求智能体反复改进策略、反思表现并长程推理,以不断超越自己和他人。实验显示,前沿智能体在简单平台跳跃游戏中接近人类世界纪录,但在更长、更复杂的游戏上受实际预算限制仍落后于人类。该基准因几乎总存在更快的通关时间而具备抗饱和特性。

  13. arXiv cs.AI29

    同一反馈不同答案:前沿模型客户反馈分析中的运行间不稳定性

    一项研究提出重复运行评估框架,用主题流失率和数量分歧两项指标衡量 AI 智能体处理非结构化数据的可重复性。在 Claude Opus 4.8 与 1000 条记录语料固定条件下,基于分类体系的智能体(TGA)相比原始生成和分层分解将主题流失率降低 86–88%,匹配主题的数量分歧为零。该框架面向客户反馈、财报、法律文档等重复性知识工作场景。

  14. arXiv cs.AI24

    移动 GUI 智能体能否服务所有用户?PAIR 与 RePAIR 揭示跨用户可靠性差异

    研究提出 PAIR 流水线构建用户条件化应用状态,并推出 RePAIR 训练方法,从跨用户子目标结果差异中学习以提升可靠性。在六款智能体上,用户条件化 UI 中任务成功率下降 6.98 至 15.4 个百分点,涉及用户个人内容时差距扩大至 8.77 至 22.0 个百分点。RePAIR 在未见用户上将整体 Task SR 提升 9.42 个百分点。

  15. arXiv cs.AI26

    Confidence Reasoning Graphs:面向 LLM 智能体的结构化置信度估计

    研究者提出 Confidence Reasoning Graphs(CRG),一种推理时框架,仅凭单条轨迹即可估计 LLM 智能体完成任务的成功概率,无需模型内部信号或训练数据。CRG 将任务声明分解为基于轨迹证据的子声明,逐项估计置信度后再聚合为整体置信度。在三个智能体基准、三个骨干模型和三个智能体框架上,CRG 的置信度校准与风险感知决策均优于口头表达、采样和白盒代理基线。

  16. arXiv cs.AI22

    各向同性却无法解码:潜在预测式文本表征中的序列内容充分性缺口

    研究提出信息论分解,将输入歧义、表征损失与读出失配分离,并构建可恢复视图证明完美一致与联合各向同性高斯性可同时与零目标信息共存。基于此提出非自回归框架 CANOPE,在 40,000 条验证序列上,latent-agreement(PL0)与 token-grounded(PL2)池化排名几乎相同,但位置 Recall@1 分别为 13.5% 和 98.8%。

  17. arXiv cs.AI17

    用文本环境上下文与空间图增强 LLM 区域海表温度预报

    研究将区域多步海表温度(SST)预报建模为条件数值生成,用历史 SST 与异常序列、日期对齐的环境记录和静态海洋知识构成文本上下文,并通过图神经网络生成连续的空间前缀注入 LLM 输入。在南海 SST 预报的十个预测步上,完整配置取得对比方法中最佳 MAE 和 R²。配套的规则模块将预测趋势与环境因子方向匹配知识条目,返回带来源的事后上下文解释。

  18. arXiv cs.AI22

    ShanLiangRen:面向个性化每日膳食规划的 AI 营养智能体

    研究团队提出个性化全量化多目标膳食规划问题(MDP),并开发营养智能体 ShanLiangRen。该系统将饮食规格、营养数据、用户属性与自然语言需求转化为个性化约束规划实例,通过精确检索增强生成缩小候选食材与食谱范围,再由 LLM 在确定性营养计算和约束校验反馈下按 Pareto 原则迭代优化方案。系统输出含明确食材与分量的全量化餐食计划及营养合规报告,已以微信小程序形式上线。

  19. arXiv cs.AI26

    自参照社会偏好:不观察他人奖励也能学会合作

    研究者提出"自参照社会偏好"方法,让每个智能体学习自身奖励模型,并将其应用于其他智能体的观测轨迹,从自身视角评估对方结果,再接入标准社会偏好机制。在 Escape Room、Clean Up 和 Commons Harvest 三个序贯社会困境中,智能体无需观察他人奖励即可学会合作,甚至在独立学习失败的环境中也能实现合作,且收益分配常比能获取真实奖励的智能体更公平。

  20. arXiv cs.AI32

    WorkflowOps:为多智能体工作流编排学习智能体协作先验

    WorkflowOps 是一个多智能体工作流编排框架,能从历史工作流中学习智能体协作先验,并按需扩展智能体池以覆盖新能力需求。它通过转移概率矩阵引导 DAG 工作流构建,并用分层语义匹配策略将 LLM 路由调用减少超 80%。在代码、数学与问答混合测试集上,其端到端通过率优于近期工作流构建基线,在结构化可分解任务上提升最大。

  21. arXiv cs.AI27

    DHCG:为基于 LLM 的多智能体推理动态构建分层协作图

    DHCG 框架通过 Planner、Worker、Generator 三个模块,从零逐步构建动态分层协作图,并支持提前终止或按需扩展。在代码生成、数学推理等基准上,其平均性能较单智能体基线提升 13.06 分,优于静态与动态 MAS 基线 2.77-8.02 分。该框架还引入动作感知偏好优化训练 Planner,并展现出跨 Planner 主干与未见 Worker 模型的泛化能力。