跳到正文
10月7日周三
  1. arXiv cs.AI40

    Jarvis:面向多方对话的主动式语音智能体

    Jarvis 是一款能实时参与多人对话的主动式语音智能体,基于事先共享的文档跟进讨论,仅在群体遗漏或说错事实且数轮内未自我纠正时出声干预。它由小型开源权重模型驱动,结合确定性检查,并将每条论断锚定到原文句子。在 CHI-180-proactive 数据集上,Jarvis 对多数干预事件判断正确,且在群体自行解决问题时 97% 的情况下保持沉默;23 人实时研究验证了这一趋势。

  2. arXiv cs.AI24

    ElasticFit:基于 VLM 推理与生成式适配的贴合感知 3D 物体插入

    ElasticFit 是一个 VLM 引导的贴合感知 3D 物体插入框架,通过场景锚定的结构化拟合线索,将 VLM 推理转化为显式 3D 约束,支持刚性放置、等比缩放和弹性贴合三种适配模式。在固定资产基线对比中,其空间关系成功率从 50.8% 提升至 69.7%,支撑成功率从 48.3% 提升至 91.7%。该工作已被 NeurIPS 2026 接收。

  3. arXiv cs.AI24

    AlignQuant:面向高效 LLM 生成的 Tile 对齐混合精度量化

    AlignQuant 是一种训练后量化方法,以 GPU 兼容的二维权重 tile 作为精度分配、紧凑存储与执行的统一单元,让精度在输出通道内跟随敏感度。在 4 个 3B 至 14B 参数的 LLM 上,它相比 BF16 实现最高 2.50 倍生成加速并保持模型质量,评测覆盖 3 种 GPU 和最高 64K token 上下文。实现已开源。

  4. arXiv cs.AI17

    用树蒸馏为纵向主动特征获取学习可解释策略,降低参与者负担

    针对纵向研究中预测精度与参与者负担的矛盾,研究者提出一种树蒸馏方法,从基于神经网络的 Longitudinal Active Feature Acquisition(LAFA)网络中学习可解释策略。该方法在模拟实验和预测每日饮酒量的 EMA 实证数据集上验证,均能在精度损失极小的前提下显著减少每次采集的条目数量。

  5. arXiv cs.AI24

    BeFOND:将稀疏自编码器的推理与学习统一为自然梯度流

    研究者提出 BeFOND,一种无编码器的稀疏编码模型,将推理与字典学习统一为共享变分自由能上的自然梯度流,具备闭式推理与学习动态。在合成数据上,BeFOND 提升了字典恢复与稀有特征检测能力,且随叠加程度增加对 amortized 基线的优势扩大;在语言模型激活上,它以更少训练数据超越预训练参考 SAE,特征质量随字典宽度持续提升。

  6. arXiv cs.AI17

    DeepAJM:面向不规则采样数据的深度关联联合模型

    研究者提出深度联合模型 DeepAJM,无需参数假设即可同时建模纵向与生存结局,并通过可部分解释的关联结构将纵向过程与生存风险相连。该模型在心血管疾病 EHR 队列、原发性胆汁性肝硬化(PBC2)数据集和模拟数据集上,与经典参数联合模型、TransformerJM、DA-LSTM 及基于 Cox 的生存模型对比,在 C-index、时间依赖 AUROC 和 AUPRC 上均取得最佳区分度。

  7. arXiv cs.AI17

    WildMatch:面向野生动物重识别的弱监督图像匹配器适配方法

    WildMatch 提出一种仅用身份标签的弱监督方法,将预训练关键点匹配器适配到野生动物重识别任务,无需关键点级或几何对应标注。该方法用预训练匹配器挖掘图像对,从身份一致性导出弱正负监督,对比微调匹配网络以增强同身份对应、抑制异身份对应。在多个开源野生动物重识别数据集上,其准确率超过现成匹配器和一种 SOTA 局部-全局融合方法,并在留出个体的开放世界协议下学到可迁移的对应先验。

  8. arXiv cs.AI29

    Apple 提出 Stepped MoE:段级路由实现可配置推理复杂度

    Apple 提出 Stepped MoE 框架,将弹性结构与稀疏门控架构结合,让单一模型可在 1、2、3、4 billion 参数间灵活切换,并保持输入自适应路由。该模型在知识密集型基准上比同规模稠密模型准确率高 2-5%,延迟与稠密模型相当,同时通过共享参数节省设备磁盘空间,适配端侧推理的 DRAM 与算力限制。

  9. arXiv cs.AI27

    Logbook:面向小时级长音频事件理解的基准

    研究者推出 Logbook,一个面向小时级音频理解的基准,录音时长从 10 分钟到 6 天,要求系统在给定连续音频和事件标签词表下输出无间隙的分段、标签与描述。团队对比了 52 个端到端与级联系统,并消融微调、上下文长度和推理预算,发现任务可解但最佳系统仍低于人类参考水平,过度分段普遍存在,微调可部分缓解,端到端系统通常优于级联系统但随上下文变长而退化。

  10. arXiv cs.AI27

    POLAR:用 LLM 合成真实网络威胁证据,辅助漏洞优先级排序与缓解

    POLAR 是一个 LLM 驱动的框架,可将厂商公告、漏洞库和威胁情报中的碎片化证据合成为以威胁为中心的评估。它先拆分重叠事件并将威胁锚定到来源证据,再结合严重性指标与按时间排序的利用信号估算近期被利用概率,并将威胁数据关联到权威修复知识以组织缓解措施。在公开资源收集的真实漏洞证据上,POLAR 在异构事件和零日场景中提升了威胁排序与缓解检索效果。

  11. arXiv cs.AI22

    FlexiFlow:基于多臂老虎机的 ML 工作流模型动态切换

    FlexiFlow 是一个数据流系统,能在当前模型准确率偏低时动态切换到备选模型,通过多臂老虎机方法对模型进行排序,综合考虑模型运行时间、通过用户自定义断言的概率以及 ML 工作流的计算结构。实验显示,切换模型可将工作流准确率提升最高 23%,运行时复用中间结果相比顺序执行工作流还能带来 48% 的效率提升。

  12. arXiv cs.AI23

    SAFESHIELD:面向小语言模型部署时安全的决策组织框架

    SAFESHIELD 是面向小语言模型的部署时安全系统,将安全决策组织为准入、路由、证据、放行四类职责,并把已提交决策记录为可审计的 Decision Traces。协调消融实验显示,移除准入门控会显著增加误放行,而放行决策缺少上游证据时准确率从 96.0% 降至 69.5%,表明部署时安全不仅取决于单个护栏能力,也取决于决策如何组织与协调。

  13. arXiv cs.AI29

    最小见证强化学习 MWRL:让模型从验证器反馈中学会完整见证族

    研究者提出最小见证强化学习(MWRL),将"找出全部最小充分见证"形式化为最小见证识别问题,仅凭单个黑盒验证器的反馈位即可完成信用分配。该方法从问题定义直接推导,统一了最小性与备选解恢复两项要求,并据此给出可恢复完整见证族的值迭代规划器和可扩展到大语言模型的策略梯度方法。实验中 MWRL 能找回大部分最小见证,而其他方法只返回冗余超集或单一见证。

  14. arXiv cs.AI27

    DRMoET:分布鲁棒混合专家(MoE)训练方法

    研究者提出 DRMoET,一种将逐层专家视为内生鲁棒分组、优化高损失路由结果的即插即用目标,而非仅均衡流量。在 FLAME-MoE 配方下,10.3B 总参数、67B 训练 token 时,DRMoET 将七任务平均分从 0.6625 提升至 0.6767,无辅助损失均衡基线为 0.6431。强制 mid-k 误路由下超额损失降低 4.3%,专家损失方差下降而均值几乎不变。

  15. arXiv cs.AI32

    PlaySuite:面向交互式视觉智能的大规模基准

    研究者推出 PlaySuite,一个基于 5K 多款开源视频游戏构建的交互式视觉智能基准,覆盖 Pygame、HTML5、Godot 和 Unity 等引擎。该基准配套统一的闭环交互框架和 Video-LLM-as-a-judge 评测协议,并评测了 14 个近期开源模型。结果显示存在明显的感知-行动差距:模型虽推理能力较强,但在空间定位、动作执行和自我纠错上持续失败。

  16. arXiv cs.AI42

    通过随机嵌入扰动越狱开放权重 LLM

    研究者提出 Perturbed Embedding Vector(PEV)攻击,仅向提示词的嵌入向量表示中加入独立高斯噪声,即可越狱六种不同规模的常见开放权重 LLM,在 JailbreakBench 上对所有模型、所有提示词均生成不安全回复。PEV 无需梯度计算、逐提示优化或修改模型内部权重,取得首次成功攻击的平均算力成本比此前方法低至多一个数量级,每个测试模型上首次越狱通常在一分钟内出现。

  17. arXiv cs.AI22

    能否预测 LLM 评审的位置翻转?基于残差流激活的线性探针研究

    研究发现,LLM 评审在候选回答顺序调换时可能改变判定,而判定前的残差流激活可预测这种位置翻转。在 JudgeBench 的 534 对样本上,针对三个 Qwen3 评审和 Llama-3.1-8B 训练的线性探针 AUROC 达 .621-.850,比结合语言化置信度、判定标签 logits、回答长度和初始选择的基线高 .062-.113。