DirectSpeech2LLM:缓解 Speech-LLM 提示词过拟合的端到端框架
DirectSpeech2LLM 是一个端到端框架,用于缓解 Speech-LLM 的提示词过拟合问题——仅在 ASR 指令上训练的模型难以泛化到语音翻译等新指令。
DirectSpeech2LLM 是一个端到端框架,用于缓解 Speech-LLM 的提示词过拟合问题——仅在 ASR 指令上训练的模型难以泛化到语音翻译等新指令。
视觉语言模型(VLM)通过两种并行机制表示空间变量绑定:语言模型主干中间层在物体视觉 token 上编码内容无关的空间关系,但该机制对预测仅起次要作用;主导空间信息来自视觉编码器,其表示编码物体布局并被语言模型主干直接利用,且该信号全局分布于视觉 token,延伸至背景区域。在 COCO 数据集上全局放大视觉空间表示可纠正不同规模模型的空间变量绑定失败。
一项被 AACL-IJCNLP 2026 接收的研究测试了 SLM 与 LLM 是否具备文字系统(script)知识,即能否让输出文字系统匹配输入,以及能否遵循指定文字系统的指令。测试模型均达到近乎完美的拉丁文字系统保真度(超过 98%),并能高频遵循文字系统指令,但 LLM 在非标准文字系统组合上得分高于 SLM。
一项覆盖 96 种语言的研究发现,自监督语音模型(S3M)的表示空间中存在对应音系特征的线性方向,且这些音系向量的尺度与对应特征的声学实现程度连续相关。例如 [d] 与 [t] 的差构成清浊向量,将其加到 [p] 上得到 [b],缩放该向量则产生清浊连续谱。这表明 S3M 以音系可解释且可组合的向量编码语音,实现音系向量算术。代码与交互演示已公开。
研究用 900 个人工标注的问答对,覆盖三个常用 QA 数据集和三个生成模型,评估了词汇相似度指标、基于参考蕴含的 NLI 基线及七个 LLM 评判器作为自动标注器的表现。实验发现自动标注策略之间及其与人工标注之间存在显著分歧,多数策略还表现出明显的方向性误差偏差。对多数评判器-生成器组合而言,将面向忠实性的提示词替换为面向事实正确性的提示词,能提升与人工标注的一致性并减少假阳性主导。
研究提出 TACIT 框架,将外部能力需求分解为 Source、Transformation、World Effect 三个维度,定义八种能力类别,并用 1,600 条平衡训练查询在四个开源 LLM 家族的生成前隐藏状态上训练线性探针。
研究首次系统分析了 LLM 多目标对齐中"跨目标干扰"现象——标量化训练只提升部分目标而其他目标退化,该现象普遍存在但强依赖模型。作者推导出局部协方差定律,并据此提出 COVER(协方差下限强制重加权)控制器,仅在目标奖励与标量化分数的协方差低于阈值时提升其权重。实验表明 COVER 能缓解干扰,且在目标已协同改善时与线性标量化持平。
Redpine Science 通过 MCP 和 API 为模型与智能体提供同行评审文献的统一访问入口。在 ScholarQABench SciFact 上,接入 Redpine Science 的智能体正确回答 94.4% 的论断,无检索时为 87.6%;在专家验证问题集上,其陈述所需论断的比例为 80.1%,仅用网页搜索的智能体为 70.2%。
研究将无监督与监督学习结合,用短无序纳米线中 Majorana 分裂的无标签模拟数据,区分"拓扑"与"平庸"相并定位二者在参数空间中的交叉点。该方法有望用于在实验 Majorana 纳米线中识别拓扑,论文发表于 Phys. Rev. B 114, 165418。
研究用两个意大利语二选一伪词实验测试五款 LLM,并与人类行为基线对比。当选项含真实词提供的词汇熟悉度线索时,LLM 与人类的一致性更高;在纯伪词条件下则明显低于字符 n-gram 模型 fastText。驱动人类与 fastText 一致的亚词汇余弦相似度线索未能稳定迁移到人类与 LLM 的对齐上,推理 token 消耗也与人类处理难度无稳定关系。
PyDPF 是一个基于 PyTorch 的可微粒子滤波(DPF)Python 包,用统一 API 实现了多种通过改造重采样步骤实现可微的粒子滤波方法。该框架复现了多项已有研究的实验,并展示 DPF 如何应对状态空间建模中的常见挑战,论文共 46 页,正投稿于 Journal of Statistical Software,代码与文档已公开。
针对粤语歌词创作中旋律与声调需紧密对齐的问题,研究者提出 ARIA 框架,可直接从带字符级时间戳的演唱录音生成粤语歌词。该框架先用 TRATE 从演唱音频预测 0243 声调序列,再用 DRA-TCLG 结合检索增强的词汇引导生成流畅歌词,并构建了大规模对齐的音频-粤拼-0243 数据集。
研究人员开发了 DRTool,一个通过 R 包提供的交互式工具箱,用于帮助分析人员识别高维聚类中的虚假簇。该工具包含可视化评估和假设检验等新的聚类验证技术,可辅助识别数据过度聚类现象,并更好地解读高维聚类结果。
研究者提出 OMIT 基准,包含 218 个配对框架场景、覆盖 10 种冲突类型,场景由基于 LLM 的五视角哲学人格面板(功利主义、义务论、美德伦理、关怀伦理与契约主义)的分歧模式构建。
AEGIS 是一个面向共享多 GPU 服务器的运行时调度系统,通过将内存可行性、放置后观测、运行时压力过滤、放置与 OOM 感知恢复整合进单一调度循环,实现深度学习训练工作负载的可控共置。
研究者提出 Nucleus Speculative Decoding(NSD),一种将目标模型合理性纳入验证的宽松投机解码方法:草稿 token 满足标准接受规则或落入目标模型 nucleus 即被接受。实验显示 NSD 相比自回归解码吞吐最高提速 5.16×,相比标准投机解码最高提速 3.15×,同时保持有竞争力的任务表现,并带来更长的接受长度。
研究将 LLM 应用于真实加密货币交易图,以 Bitcoin 为案例,提出三层评估框架及 LLM4TG 图表示格式与 CETraS 采样算法,显著降低 token 需求。实验显示节点级基础信息识别准确率超 98.50%,有效特征获取比例达 95.00%,分类任务 top-3 准确率在少量标注数据下达 72.43% 并附带解释。
研究者提出一种轻量级 router-logit 安全检测器,在 prompt prefill 阶段读取 MoE 视觉语言模型的 routing 信号,在生成前识别不安全请求,无需修改模型参数或专家路由。在 Qwen3-VL 和 Kimi-VL 上,该检测器大幅降低 HoliSafe 基准上的安全错误,并泛化到 MISHard 和 MM-SafetyBench 等分布外安全基准。
研究者推出 SteerScope,一个双轴多维评估套件,通过 15 项指标联合刻画 LLM 引导效果与方法属性,并在匹配模型、任务和评估协议下基准测试了涵盖 4 个家族的 23 种方法,包括 prompting、LoRA 和 SFT 基线。
研究者用机器学习模型在专有 Nasdaq 数据上训练,将可观测的高频交易活动映射到公开日内变量,从而为 2010 至 2023 年全部美股生成每日的流动性供给型与需求型高频交易指标。
研究者提出图基础模型 Wander,将图学习统一建模为部分观测图的补全,并通过随机游走这一通用接口,让单个预训练 checkpoint 同时适配同构图与多关系图,覆盖不同特征、标签和关系模式。
受 Jev 模型启发的预填充决策模型单次前向即可为候选菜单打分,成本比同规模生成式语言模型低一到两个数量级。当干预只改变候选菜单而输入文本不变时,其干预后准确率可由缓存的首次前向分布预测,无需标签和第二次前向,在七个模型族、十个数据集上误差在 4.2 分以内。
研究者推出 ProactiveCoach 套件,包含训练集 ProactiveCoach-Instruct、评测基准 ProactiveCoachBench 及微调 VLM 与自适应引导系统,在 phase、step、action 三个层级提供分层引导。
研究构建了越南语击键数据集,涵盖真实写作、转录和改写三种模式,并设计了用户刻意改变打字模式的行为操纵威胁模型。在用户无关和上下文无关设置下,基于 1D-CNN 和 TypeNet 的序列模型在多数情况下优于时序与节奏特征方法,但转录可被可靠识别,改写和对抗操纵样本常被误判为真实写作。引入行为操纵数据的对抗训练后,可分离性和鲁棒性显著提升。
研究发现,PDE 训练输入的有损压缩中,场重建误差无法决定训练后算子的精度成本。压缩场经全精度代理算子传递后的扰动比例与方程平滑行为一致,在不同 PDE 族间跨越两个数量级以上。在均方误差训练下,重建误差在 104 次成本比较中颠倒 36 次,而基于相同前向传播的探针仅颠倒 12 次。
DLoop 是一种循环式投机解码方法,在验证前自适应执行多轮起草,让草稿模型在保持置信时持续生成 token,再统一验证所有累积的草稿 token。该方法在 EAGLE-3、DFlash、Domino、DSpark 及多 token 预测模块上把实际加速提升 5% 至 41%,同时保持无损解码。配套的循环感知训练让草稿模型接触未验证草稿 token 的自身隐藏状态,从而在额外起草阶段保持可靠。
研究提出 Asymmetric SupCon 预训练目标,在台湾 NHIRD 的 398 万名患者纵向病历上预训练时序 Transformer 编码器,并迁移至美国 MIMIC-IV 与 EHRSHOT 数据集。
针对现有 LLM 编排器将智能体偏好信念存于提示词、缺乏显式更新规则导致早期错误持续传播的问题,研究者提出 HARP 框架,为每个智能体在有限候选偏好集上维护数值后验并用贝叶斯规则闭式更新,语言模型仅提供动作与各候选似然。HARP 被证明可达到与显式联合推断相同的 Õ(√K) 贝叶斯遗憾,其增强版 HARP⁺ 通过为区分候选的动作加奖励,在最优动作无信息时仍能持续推断。
研究针对严格线性可分数据上的全批量逻辑梯度下降(GD),在大初始化尺度 R 下构建了一条由有限线性段组成的唯一连续理想路径,包含负间隔修正与最小间隔增长两个阶段。经两阶段时间重参数化后,固定步长 GD 轨迹除以 R 会随 R→∞ 均匀收敛到该路径,并给出考虑初始化扰动与阶段过渡的定量误差界。该近似还给出峰值评估损失与累积训练损失的渐近公式,其中峰值评估损失即使两端损失趋于零也可随 R 线性增长。
研究者推出 HouseholdBench,整合 6 项美国家庭调查与 32 个预测任务,覆盖消费、收入、劳动、预期和住房等数值、分类及概率结果,用于测试 LLM 能否预测家庭行为及其对政策变化的调整。13 个闭源与开源权重 LLM 参与评测,最佳模型将数值结果误差降低 12.2%,多数任务中梯度提升树排名第一。通过微调并聚合 16 次预测,40 亿参数开源模型可达到闭源模型水平。
一套完全离线的语音到语音翻译流水线可在 4 GB 显存的 Jetson Nano 上运行,无需重训练即可自我修正弱翻译。系统由 Whisper-tiny ASR 与 Opus-MT 翻译器组成,多语言 BERT 余弦相似度作为质量估计(QE)门控,在置信度低于阈值 τ 时触发二次修正。
研究者提出 DePICT,一种通过按优化器解敏感度对上下文方向排序并跨运行区间聚合,来构建决策保持接口的方法。该方法基于 KKT 条件刻画上下文方向何时与优化器相关,指出出现在活跃优化问题中并不代表变量会影响最终决策,某些方向的影响会被对偶变量吸收。在受控诊断中,DePICT 精确恢复决策相关接口,将线性预测器 regret 降至 0.009,而最强竞争基线为 0.475。
自动手语翻译(SLT)已进入消费产品,但尚无公开系统将 SLT 与儿童安全防护工具联合评估,主流已部署 SLT 模型也未在 18 岁以下手语者上训练或正式评测。否定、角色、保密、紧急或求助等翻译错误可能在不影响流畅度的情况下改变安全判定。论文提出一套由聋人群体参与部署前审计框架,含失败分类、场景模板、四种比较条件和四项结果指标,计划以 Auslan 为首个案例。
SCAD 将长时程智能体的交互组织为规划与有界子任务执行,在局部上下文中蒸馏执行过程,并通过跨 rollout 的子任务前缀树优化规划信用分配。在全部评测基准上,SCAD 的宏平均准确率较最强训练基线在文本任务上提升 4.48 个百分点、多模态任务上提升 4.19 个百分点。
研究提出 DAU(Draft、Ask、Update)流程,检验 LLM 能否自动完成临床文档专员向医生发起的澄清提问闭环。团队审计 3000 次真实就诊、分析 2.1 万轮真实对话澄清轮次,并基于公开数据构建五个转录降级基准;发现有用提问的预测因子因任务而异,约 9% 的轮次反而损害性能,多由冗余提问和仍触发改写的非回答造成。
研究者提出 SkillEvoLean,一种变异增强的技能自进化框架,用于构建技能增强的 Lean 证明器,在不更新模型参数的前提下联合进化高层求解策略与参考知识。
研究提出"洞见溯源"(Insight Provenance)任务,判断审稿洞见来自人类、LLM 还是二者混合,并基于 4,057 篇论文和 12,660 条人类审稿构建 InsightProv-v0,用 GPT-4o、Gemini 和 DeepSeek 模拟不同 LLM 参与程度并做句级标注。
研究者提出 SELF-POT 基准与评估框架,在竞赛数学、竞技编程和智能体工作流中衡量模型的测试时潜力,并按美元计费所有模型调用(含选择与评判)。在 350 个密封任务、五个低成本推理模型上,以 Claude Opus 5.5 Direct 为参照,收益取决于领域、选择规则与失败处理。
研究团队推出 Kurate,利用 LLM 评估已发表研究的质量,并结合论文及其试验注册、研究方案等相关文档,将每项判断链接到对应原文段落。该系统对 4,347 篇论文(其中 3,913 篇为随机试验)按统计功效、因果识别、预注册等 8 个维度打分,发现统计功效、选择性报告和分析预注册问题最为常见。
针对损失与约束函数随回合对抗变化、转移未知的片段式对抗线性 CMDP,新提出的 primal-dual 算法将 regret 与累积约束违反从 \widetilde{\mathcal{O}}(K^{3/4}) 降至 \widetilde{\mathcal{O}}(\sqrt{K}),且无需 Slater 条件。