AgSpec:在编码智能体流水线中突破基于检索的投机解码上限
AgSpec 是一个面向编码智能体流水线的检索式投机解码框架,从会话、工作区和全局语料中检索,并按智能体输出格式索引已打开文件,同时用离线测得的长度上限约束草稿长度、再根据验证反馈在线调整。
AgSpec 是一个面向编码智能体流水线的检索式投机解码框架,从会话、工作区和全局语料中检索,并按智能体输出格式索引已打开文件,同时用离线测得的长度上限约束草稿长度、再根据验证反馈在线调整。
研究者提出 NFA-LM,一个面向 NFA 约束生成的多项式时间引擎,在温和假设下具备理论保证。该任务可归约为 #NFA 计数问题,而精确 #NFA 是 #P-complete,此前已有工作证明其存在 FPRAS。实验显示 NFA-LM 能高效生成高质量输出,且近似误差有理论界。
研究者微调多语言编码器搭配仿射跨度标注头,在 35 种语言的前沿模型标注数据上训练,在 7 种语言 1,283 条人工金标测试段上取得最佳 redaction F1 88.8,远超 GLiNER2 的 69.1、Microsoft Presidio 的 57.3 和 OpenAI Privacy Filter 微调的 35.8。
针对约鲁巴语轮廓声调在正字法中长期难以标注、部分人名拼写甚至因此反转含义的问题,该论文提出采用 caron 和 circumflex 符号在单元音上编码升调和降调。这一做法可追溯至 Olmsted(1951)的约鲁巴语音学研究,并首次使这些声调可通过标准键盘输入和计算文本处理实现。方案已在 WriteYoruba 键盘和 TTSYoruba 语音合成器中落地实现。
研究评估了测试时扩展与后训练方法在个体立场预测中的表现,基于包含 500 名 Hacker News 用户、2499 个预测任务的 STANCE-BENCH,识别出错误共识、选择失败、响应过拟合和早期平台四种失效模式。结合候选立场直接评分与历史支持度评估的方法,在 781 任务测试集上用 Qwen3-8B 达到 21.83 Macro F1,高于直接评分的 19.27。
针对业界和学界用 LLM 驱动的合成受访者替代真人样本的做法,研究者提出一套验证框架,要求每项效度声明明确与人类数据的对应层级,并覆盖 location、dispersion、response process、structure 四项诊断及实验效应对比。框架还要求报告子群体效度,并将分布、程序与承认三个公平维度操作化为可测量指标,最后以电动汽车充电电价为例演示并给出报告清单。
Dream-RSI 是一个让 AI 智能体递归自我改进探索策略的框架,它把历史发现树当作回放模拟器,在模拟器中"做梦"获得低成本 off-policy 反馈来评估和优化探索策略,无需反复进行昂贵的在线评估。改进后的策略再部署到线上驱动新发现,持续扩充模拟器池形成自我改进循环。在 4 个领域的 9 项任务上,Dream-RSI 取得有竞争力的质量并提升了发现效率。
一项被 SLT 2026 接收的研究构建了统一生成式评测套件,在匹配数据分布与生成设置下对比纯语音、纯文本和语音-文本语言模型。结果显示联合语音-文本建模显著提升语义连贯性,但音素级指标变化有限,说话人相似度与预测质量反而更低,情感分布指标则有所改善。相比更大规模的纯语音模型,该语音-文本模型在基于转写的语义连贯性上缩小了大部分规模差距。
研究者基于英文 WinoQueer 基准构建了荷兰语数据集 WinoQueer-NL,最终包含 42,906 条句子,用于评估荷兰语及多语言模型对 LGBTQ+ 群体的偏见。经 43 名荷兰酷儿参与者调查,171 条刻板印象中 145 条被确认具有文化相关性,并新增 22 条偏见。模型平均偏见分约 50%,但部分模型对跨性别身份有高达 97% 的概率偏向刻板句子,对男同性恋相关句对仅 6%。
研究者提出免训练方法 TwinKV,用非局部 post-RoPE key 频率对 value energy 打折,在精确存储预算下保留原始 key 和 value。
迭代学习模型研究发现,当高频含义被赋予更高出现频率时,它们可以像自然语言一样摆脱低频含义所遵循的语法约束。但若频率结构施加在含义向量的组成部分而非完整含义向量上,语言将无法跨代稳定传递,即便最高频元素能被可靠习得。结果表明,频率只有在学习者能整体习得的形式-含义单元上分布时,才能塑造涌现的语言结构。
研究者发布德语开放问答临床基准 MedQADE,含 3,800 组问答、10 位医生标注和 9 个 LLM 评审。医生对答案正确性一致性中等偏强(Cohen's kappa = 0.612),Gemini 3 Flash 接近留一医生参考(kappa = 0.694 vs 0.709)。
研究者将对话情感识别(ERC)任务引入手语视频分析,并提出基于 STUDIES 语料库脚本构建的 eJSL Dialog 数据集,包含 1,920 个视频样本、480 段对话。在该数据集上的系统基准测试表明,将对话式 ERC 框架扩展到手语对话在当前基准设定下可行,但现有视觉表征在捕捉手语特有的情感线索方面仍存在局限。
研究对 41 个开源权重 LLM 进行六种行为经济学博弈测试,发现博弈中表现出的合作倾向能稳健预测其在 AI for Science 任务中的团队表现。在共享 GPU 或额度约束下,善于协调并投入乘法式团队生产的模型,在科学报告的准确性、质量和完整性三项指标上均更优。该框架可在多智能体部署前快速筛查模型的合作适配度。
研究团队用回译与微调模型,从少量种子语料生成 170 万条法语合成推文及合成推理轨迹,训练出 600M 参数、支持英法双语推理的模型,在人工标注评测数据上达到 77-79% 准确率,追平或超过 SOTA 专有 LLM 与专用编码器。该流程在降低标注成本的同时避免暴露敏感用户数据,可迁移至其他场景和语言。
研究者提出双向基准 GapEval,用于量化统一多模态模型(UMM)理解与生成能力之间的差距,每道题均可用图像和文本两种模态作答,实现双向推理与跨模态一致性的对称评估。实验显示,不同架构的 UMM 在两个方向上普遍存在持续差距,表明当前模型仅实现表层统一,而非深层认知融合。从知识操作角度的实证研究进一步发现,UMM 内部知识往往彼此割裂,跨模态的能力涌现与知识并不同步。
研究者发布 TabiBERT,一个基于 ModernBERT 架构、从零预训练的土耳其语单语编码器,训练数据为 1 万亿 token,来自 86.58B token 的多领域语料(网页文本 72%、科学出版物 19%、源代码 6%、数学内容 0.3%),支持 8,192 token 上下文,是现有土耳其语 BERT 模型的 16 倍。
研究者发布 Infinity-Chat,一个包含 26K 条真实开放式用户查询的大规模数据集,并首次提出覆盖 6 大类别、17 个子类别的开放式提示词分类体系。
VietBinoculars 是一个零样本检测框架,将 PhoGPT-4B 的 observer 与 performer 模型与校准后的全局决策阈值结合,并采用越南语专用 BPE 分词。
Common Corpus 是迄今最大的开放 LLM 预训练数据集,数据均为无版权或开放许可内容,总量约两万亿 token,涵盖从高资源欧洲语言到低资源语言及大量代码数据。研究团队在该数据集上训练了两个小型语言模型,性能与同规模模型相当,表明其适合多语言预训练。该数据集已被 ICLR 2026 接收为 Oral 论文。
Pleias 发布 Pleias-RAG-350m 和 Pleias-RAG-1B 两款小型推理模型,原生支持引用与字面引文溯源,并整合查询路由、查询改写和来源重排等 RAG 工作流功能。
一项系统性研究提出统一框架,将 Product Quantization(PQ)与 Residual Quantization(RQ)及其混合变体纳入同一设计空间,用于分析生成式信息检索中数值型 DocID 的层次与并行结构、DocID 长度和码本大小等超参数的影响。
在 NQ320K 和 MS300K 上,研究者用残差量化、乘积量化和随机标识符分别训练自回归、掩码扩散和块扩散模型,固定标识符长度与训练预算后对比多种解码方式。
研究发现 EmoNet-Face-HQ 细粒度情绪识别基准的失败源于答案读取方式而非模型感知能力:改用 logits 逐类二分类读取后,11 个开源 VLM 全部超过专家一致性锚点(κ_w=0.507-0.586),其中 3 个显著优于微调模型 EIF(Small κ_w=0.551,Large κ_w=0.534)。
研究者提出 DyaFDB,一个在二元设定下评估全双工语音对话模型的框架:两个模型按指定角色直接对话,目标可合作或冲突,双方均由外部裁判离线打分。该框架实例化 4 项任务、140 个场景,记录 7,560 段对话,覆盖 6 种自博弈与交叉配对。实验显示模型行为会持续重塑其对话伙伴,因此每个模型必须同时充当对方的考官与被试,固定 interlocutor 无法胜任。
HINTT 团队提交第二届 MLC-SLM 挑战赛的系统,比较了级联与统一两种多语言说话人属性 ASR 方案。最终提交采用级联流水线,由微调后的 DiariZen 说话人分离模型、微调后的 Qwen3-ASR 模型和基于 LLM 的生成式纠错组成;同时用相同官方数据微调 VibeVoice-ASR 作为统一模型对比。
一项基于 130 个软件修复原子状态转换的研究发现,基于身份的时间记忆在普通转换条件下模型判定准确率达 98.5%,但追加对旧陈述的逐字重读后准确率降至 10.8%,陈旧值比率升至 88.5%。一个拒绝重新激活已退役值的防护机制可将准确率恢复到 97.7%、陈旧值比率降至 0.8%,但无法在没有额外变更溯源的情况下识别合法的回滚。
研究者提出一种提示词相对激活引导机制,无需重新训练即可让预训练 TTS 模型生成更清晰的语音,模拟 Lombard 效应中的发声力度增强与超清晰发音。该方法在已见和未见说话人及多种语言上系统改变 Lombard 相关声学特征,说话人相似度保持 89-95%,在 1 dB SNR 背景噪声下将 WER 降低 7-22%。
研究者提出一种将句子重音检测(SSD)与辅助词重音检测(WSD)结合的新型建模范式,并引入词跨度重音正则化器(WSR),将 token 级 SSD 概率集中于重音词跨度内。在 TinyStress-15K 基准上,该方法优于强基线,完整配置取得最佳 SSD 结果。
研究将物体从冻结的 V-JEPA 2 预测器中隐藏,发现其预测对静止物体仅部分保留、对容器内物体完全丢失,运动物体在 0.3 秒内即消失(V-JEPA 自带 tube mask 下为 0.5 秒,ViT-H 在 90% 掩码率下可保留至 1.1 秒)。
SharedKV-BT 让行为树每个活跃节点暴露阶段本地字段与候选,由 Shared-KV 并行打分并将选中决策交给独立执行系统。在机器人操作、移动导航和计算机使用三类任务上,其类型化决策比提示词匹配的自回归解码快 2.36-4.15 倍;操作任务中节点本地 Shared-KV 将联合决策准确率从 75% 提升至 94%,闭环成功率从 0% 提升至 60%。
研究者提出一种基于 Koopmanism Response 框架的校准式、按模式分解的测试方法,用于检验学习型随机模拟器能否正确响应外部强迫。
研究将虚假信息早期分诊建模为"延续预测"问题:仅凭前30分钟活动预测传播树后续增长。在FibVID数据集352棵测试树上,结合节点数与结构深度熵、时间到达熵的模型将log变换后未来增长的R²从0.307提升至0.323,log-MAE降低2.4%;在97棵高活跃度树上R²从0.248升至0.395,Spearman's ρ从0.394升至0.529。
一种量子原生加载器只需学习数据集的低维描述,即可用一组固定电路加载每个信号。在五个公开数据集的七种视图上,它以相同门成本达到最强结构化加载器的精度,且每个信号所需参数少数倍。预注册盲复现显示,信号规模扩大十六倍时,达到全信号精度十个百分点以内所需的随机子集大小保持稳定,而结构化加载器所需子集持续增长。
研究者提出 AID(AI Infrastructure Dynamics)框架,用于描述物理、计算、网络与服务耦合过程中的 AI 推理基础设施学习问题,支持结构化可变状态、异步观测、多物理时间尺度和随服务变化的需求。该框架区分了现有策略下的预测表示与动作变化下保持服务结果的表示,并给出观测无法区分模型时预测误差下界及精确受控状态约简的充分条件两项分析结果。
SEAL 通过零和加性残差重建与稀疏专家路由,解决紧凑时频分离器的掩码缩放受限和共享单元计算冗余问题。在 EchoSet 上,SEAL (small) 以少 28% 参数和 2.9 倍 MACs 超越 TIGER (small) 0.31 dB SI-SDRi,SEAL (large) 以 3.1 倍更少 MACs 达到 TIGER (large) 0.07 dB 以内。
GIVE-KWS 通过门控交叉注意力将唇动视觉证据注入查询音频,在 -10 dB 下将未见关键词的 EER 较基准系统降低 72.9%,平均降低 62.8%。研究发现视觉鲁棒性依赖两个条件:携带音素信息的视觉表征,以及注入视觉证据而非缩放音频特征的融合方式。在携带音素的编码器下,注入相比掩码在 -10 dB 下带来 4.0-9.3 dB 的有效 SNR 增益。
研究者提出约束拉格朗日抽象域(CLAD),可在由凸约束组合定义的输入区域上对神经网络计算可靠的过近似,并通过投影原始-对偶方法求解拉格朗日乘子下的 max-min 问题。在 4 个卷积网络、1,944 个实例的评测中,CLAD 在标准无约束 Linf 属性上与 GCPCROWN 验证数量相当且运行时间相近,在 L2-ball 约束属性上比 GCPCROWN 多验证 60% 的实例,整体多 22%。
Nord-Parl-TTS 是一个面向芬兰语和瑞典语的开放 TTS 数据集,从北欧议会演讲录音中提取了 900 小时芬兰语和 5090 小时瑞典语语音,采用改编版 Emilia 数据处理流程构建,并包含统一评测集。该数据集旨在缩小高资源与低资源语言之间的 TTS 资源差距,已被 ICASSP 2026 接收。
研究者将 Embedded Language Flows(ELF)扩展至数学推理与代码生成,提出 ELF-REG,用冻结的 AR 教师模型监督中间去噪特征并提供与响应联合去噪的全局表示。