跳到正文
今天10月7日周三1233 条
  1. arXiv cs.LG26

    视觉语言模型中的空间变量绑定双机制

    视觉语言模型(VLM)通过两种并行机制表示空间变量绑定:语言模型主干中间层在物体视觉 token 上编码内容无关的空间关系,但该机制对预测仅起次要作用;主导空间信息来自视觉编码器,其表示编码物体布局并被语言模型主干直接利用,且该信号全局分布于视觉 token,延伸至背景区域。在 COCO 数据集上全局放大视觉空间表示可纠正不同规模模型的空间变量绑定失败。

  2. arXiv cs.CL22

    语言模型具备文字系统感知能力吗?AACL-IJCNLP 2026 研究测试 SLM 与 LLM 的多文字系统知识

    一项被 AACL-IJCNLP 2026 接收的研究测试了 SLM 与 LLM 是否具备文字系统(script)知识,即能否让输出文字系统匹配输入,以及能否遵循指定文字系统的指令。测试模型均达到近乎完美的拉丁文字系统保真度(超过 98%),并能高频遵循文字系统指令,但 LLM 在非标准文字系统组合上得分高于 SLM。

  3. arXiv cs.LG24

    自监督语音模型发现音系向量算术:[b] = [d] - [t] + [p]

    一项覆盖 96 种语言的研究发现,自监督语音模型(S3M)的表示空间中存在对应音系特征的线性方向,且这些音系向量的尺度与对应特征的声学实现程度连续相关。例如 [d] 与 [t] 的差构成清浊向量,将其加到 [p] 上得到 [b],缩放该向量则产生清浊连续谱。这表明 S3M 以音系可解释且可组合的向量编码语音,实现音系向量算术。代码与交互演示已公开。

  4. arXiv cs.CL29

    幻觉检测基准中的标注问题:一项实证评估

    研究用 900 个人工标注的问答对,覆盖三个常用 QA 数据集和三个生成模型,评估了词汇相似度指标、基于参考蕴含的 NLI 基线及七个 LLM 评判器作为自动标注器的表现。实验发现自动标注策略之间及其与人工标注之间存在显著分歧,多数策略还表现出明显的方向性误差偏差。对多数评判器-生成器组合而言,将面向忠实性的提示词替换为面向事实正确性的提示词,能提升与人工标注的一致性并减少假阳性主导。

  5. arXiv cs.LG22

    多目标对齐中的跨目标干扰:COVER 重加权方法研究

    研究首次系统分析了 LLM 多目标对齐中"跨目标干扰"现象——标量化训练只提升部分目标而其他目标退化,该现象普遍存在但强依赖模型。作者推导出局部协方差定律,并据此提出 COVER(协方差下限强制重加权)控制器,仅在目标奖励与标量化分数的协方差低于阈值时提升其权重。实验表明 COVER 能缓解干扰,且在目标已协同改善时与线性标量化持平。

  6. arXiv cs.CL26

    如何用四象限方法评估 Redpine Science

    Redpine Science 通过 MCP 和 API 为模型与智能体提供同行评审文献的统一访问入口。在 ScholarQABench SciFact 上,接入 Redpine Science 的智能体正确回答 94.4% 的论断,无检索时为 87.6%;在专家验证问题集上,其陈述所需论断的比例为 80.1%,仅用网页搜索的智能体为 70.2%。

  7. arXiv cs.CL22

    伪词探针研究:LLM 缺乏人类伪词处理所依赖的亚词汇敏感性

    研究用两个意大利语二选一伪词实验测试五款 LLM,并与人类行为基线对比。当选项含真实词提供的词汇熟悉度线索时,LLM 与人类的一致性更高;在纯伪词条件下则明显低于字符 n-gram 模型 fastText。驱动人类与 fastText 一致的亚词汇余弦相似度线索未能稳定迁移到人类与 LLM 的对齐上,推理 token 消耗也与人类处理难度无稳定关系。

  8. arXiv cs.LG22

    PyDPF:基于 PyTorch 的可微粒子滤波 Python 包

    PyDPF 是一个基于 PyTorch 的可微粒子滤波(DPF)Python 包,用统一 API 实现了多种通过改造重采样步骤实现可微的粒子滤波方法。该框架复现了多项已有研究的实验,并展示 DPF 如何应对状态空间建模中的常见挑战,论文共 46 页,正投稿于 Journal of Statistical Software,代码与文档已公开。

  9. arXiv cs.CL13

    ARIA:面向粤语歌词创作的声音驱动旋律-声调关系建模

    针对粤语歌词创作中旋律与声调需紧密对齐的问题,研究者提出 ARIA 框架,可直接从带字符级时间戳的演唱录音生成粤语歌词。该框架先用 TRATE 从演唱音频预测 0243 声调序列,再用 DRA-TCLG 结合检索增强的词汇引导生成流畅歌词,并构建了大规模对齐的音频-粤拼-0243 数据集。

  10. arXiv cs.CL22

    Nucleus Speculative Decoding:超越精确分布的合理性感知验证

    研究者提出 Nucleus Speculative Decoding(NSD),一种将目标模型合理性纳入验证的宽松投机解码方法:草稿 token 满足标准接受规则或落入目标模型 nucleus 即被接受。实验显示 NSD 相比自回归解码吞吐最高提速 5.16×,相比标准投机解码最高提速 3.15×,同时保持有竞争力的任务表现,并带来更长的接受长度。

  11. arXiv cs.LG22

    大语言模型用于加密货币交易分析:一项 Bitcoin 案例研究

    研究将 LLM 应用于真实加密货币交易图,以 Bitcoin 为案例,提出三层评估框架及 LLM4TG 图表示格式与 CETraS 采样算法,显著降低 token 需求。实验显示节点级基础信息识别准确率超 98.50%,有效特征获取比例达 95.00%,分类任务 top-3 准确率在少量标注数据下达 72.43% 并附带解释。

  12. arXiv cs.CL25

    读取而非操控:用 Router Logits 为 MoE 视觉语言模型做多模态安全检测

    研究者提出一种轻量级 router-logit 安全检测器,在 prompt prefill 阶段读取 MoE 视觉语言模型的 routing 信号,在生成前识别不安全请求,无需修改模型参数或专家路由。在 Qwen3-VL 和 Kimi-VL 上,该检测器大幅降低 HoliSafe 基准上的安全错误,并泛化到 MISHard 和 MM-SafetyBench 等分布外安全基准。

  13. arXiv cs.CL26

    预填充决策模型的读出稳定性:零标签预测与推理时算力分配

    受 Jev 模型启发的预填充决策模型单次前向即可为候选菜单打分,成本比同规模生成式语言模型低一到两个数量级。当干预只改变候选菜单而输入文本不变时,其干预后准确率可由缓存的首次前向分布预测,无需标签和第二次前向,在七个模型族、十个数据集上误差在 4.2 分以内。

  14. arXiv cs.CL22

    通过击键动态检测 LLM 辅助的越南语写作:行为操纵下的鲁棒性研究

    研究构建了越南语击键数据集,涵盖真实写作、转录和改写三种模式,并设计了用户刻意改变打字模式的行为操纵威胁模型。在用户无关和上下文无关设置下,基于 1D-CNN 和 TypeNet 的序列模型在多数情况下优于时序与节奏特征方法,但转录可被可靠识别,改写和对抗操纵样本常被误判为真实写作。引入行为操纵数据的对抗训练后,可分离性和鲁棒性显著提升。

  15. arXiv cs.LG22

    有损压缩 PDE 训练输入:场重建误差无法决定训练算子的成本排序

    研究发现,PDE 训练输入的有损压缩中,场重建误差无法决定训练后算子的精度成本。压缩场经全精度代理算子传递后的扰动比例与方程平滑行为一致,在不同 PDE 族间跨越两个数量级以上。在均方误差训练下,重建误差在 104 次成本比较中颠倒 36 次,而基于相同前向传播的探针仅颠倒 12 次。

  16. arXiv cs.CL29

    DLoop:循环式投机解码

    DLoop 是一种循环式投机解码方法,在验证前自适应执行多轮起草,让草稿模型在保持置信时持续生成 token,再统一验证所有累积的草稿 token。该方法在 EAGLE-3、DFlash、Domino、DSpark 及多 token 预测模块上把实际加速提升 5% 至 41%,同时保持无损解码。配套的循环感知训练让草稿模型接触未验证草稿 token 的自身隐藏状态,从而在额外起草阶段保持可靠。

  17. arXiv cs.CL22

    HARP:通过显式偏好推断实现异构偏好下的 LLM 编排

    针对现有 LLM 编排器将智能体偏好信念存于提示词、缺乏显式更新规则导致早期错误持续传播的问题,研究者提出 HARP 框架,为每个智能体在有限候选偏好集上维护数值后验并用贝叶斯规则闭式更新,语言模型仅提供动作与各候选似然。HARP 被证明可达到与显式联合推断相同的 Õ(√K) 贝叶斯遗憾,其增强版 HARP⁺ 通过为区分候选的动作加奖励,在最优动作无信息时仍能持续推断。

  18. arXiv cs.LG15

    大初始化下逻辑梯度下降轨迹的近似理想路径

    研究针对严格线性可分数据上的全批量逻辑梯度下降(GD),在大初始化尺度 R 下构建了一条由有限线性段组成的唯一连续理想路径,包含负间隔修正与最小间隔增长两个阶段。经两阶段时间重参数化后,固定步长 GD 轨迹除以 R 会随 R→∞ 均匀收敛到该路径,并给出考虑初始化扰动与阶段过渡的定量误差界。该近似还给出峰值评估损失与累积训练损失的渐近公式,其中峰值评估损失即使两端损失趋于零也可随 R 线性增长。

  19. arXiv cs.CL27

    HouseholdBench:评估大语言模型预测家庭经济行为的能力

    研究者推出 HouseholdBench,整合 6 项美国家庭调查与 32 个预测任务,覆盖消费、收入、劳动、预期和住房等数值、分类及概率结果,用于测试 LLM 能否预测家庭行为及其对政策变化的调整。13 个闭源与开源权重 LLM 参与评测,最佳模型将数值结果误差降低 12.2%,多数任务中梯度提升树排名第一。通过微调并聚合 16 次预测,40 亿参数开源模型可达到闭源模型水平。

  20. arXiv cs.LG17

    DePICT:面向受限下游任务的决策保持接口

    研究者提出 DePICT,一种通过按优化器解敏感度对上下文方向排序并跨运行区间聚合,来构建决策保持接口的方法。该方法基于 KKT 条件刻画上下文方向何时与优化器相关,指出出现在活跃优化问题中并不代表变量会影响最终决策,某些方向的影响会被对偶变量吸收。在受控诊断中,DePICT 精确恢复决策相关接口,将线性预测器 regret 降至 0.009,而最强竞争基线为 0.475。

  21. arXiv cs.CL22

    儿童手语翻译安全审计:SLT 与儿童安全防护的交叉评估缺失

    自动手语翻译(SLT)已进入消费产品,但尚无公开系统将 SLT 与儿童安全防护工具联合评估,主流已部署 SLT 模型也未在 18 岁以下手语者上训练或正式评测。否定、角色、保密、紧急或求助等翻译错误可能在不影响流畅度的情况下改变安全判定。论文提出一套由聋人群体参与部署前审计框架,含失败分类、场景模板、四种比较条件和四项结果指标,计划以 Auslan 为首个案例。

  22. arXiv cs.CL24

    用自动化提问补齐门诊临床文档缺口:LLM 能否接管 DAU 查询闭环

    研究提出 DAU(Draft、Ask、Update)流程,检验 LLM 能否自动完成临床文档专员向医生发起的澄清提问闭环。团队审计 3000 次真实就诊、分析 2.1 万轮真实对话澄清轮次,并基于公开数据构建五个转录降级基准;发现有用提问的预测因子因任务而异,约 9% 的轮次反而损害性能,多由冗余提问和仍触发改写的非回答造成。

  23. arXiv cs.LG32

    语言模型能从测试时计算中获得多少收益?SELF-POT 基准给出量化答案

    研究者提出 SELF-POT 基准与评估框架,在竞赛数学、竞技编程和智能体工作流中衡量模型的测试时潜力,并按美元计费所有模型调用(含选择与评判)。在 350 个密封任务、五个低成本推理模型上,以 Claude Opus 5.5 Direct 为参照,收益取决于领域、选择规则与失败处理。

  24. arXiv cs.CL30

    Kurate:可扩展的科学质量分析系统

    研究团队推出 Kurate,利用 LLM 评估已发表研究的质量,并结合论文及其试验注册、研究方案等相关文档,将每项判断链接到对应原文段落。该系统对 4,347 篇论文(其中 3,913 篇为随机试验)按统计功效、因果识别、预注册等 8 个维度打分,发现统计功效、选择性报告和分析预注册问题最为常见。

  25. arXiv cs.LG17

    对抗性线性 CMDP 的速率最优算法

    针对损失与约束函数随回合对抗变化、转移未知的片段式对抗线性 CMDP,新提出的 primal-dual 算法将 regret 与累积约束违反从 \widetilde{\mathcal{O}}(K^{3/4}) 降至 \widetilde{\mathcal{O}}(\sqrt{K}),且无需 Slater 条件。