STAVE:用两个向量替代上下文示例,实现结构化任务适配
研究者提出 STAVE,用两个任务专属向量替代上下文示例,实现冻结大模型的任务适配。一个 readout 向量更新生成答案的 token,一个 context 向量更新其他结构 token 组,二者用带/不带示例的提示词答案标签训练。
研究者提出 STAVE,用两个任务专属向量替代上下文示例,实现冻结大模型的任务适配。一个 readout 向量更新生成答案的 token,一个 context 向量更新其他结构 token 组,二者用带/不带示例的提示词答案标签训练。
SkillFormer 将音频理解分解为技能专属的低秩适配器,并通过学习到的路由器在推理时按问题动态组合激活,使音高查询与曲风分类查询调用不同参数。该方法仅增加不到 4% 的基座模型参数,无需改动音频编码器或语言主干,在三种架构不同的模型及 MMSU、MMAU-Pro、MMAR 上平均准确率提升 2.5 至 4.1 分。
MobileVISTA 是一种数据生成框架,通过联合增强自我中心视觉观测并重定向动作以补偿基座姿态变化,将标准姿态下的演示转化为多样化的姿态扰动训练数据。该框架针对相机随运动链移动且机器人占据大部分画面的自我中心平台(如人形机器人),在仿真任务和真实 Galaxea R1 Pro 上验证,无需额外采集演示或训练生成模型即可提升策略对分布外姿态的鲁棒性,且在人形机器人上收益最大。
研究提出双 IDS 框架,由量化 LSTM 的 QLSTM-IDS 与 8-bit 量化卷积自编码器的 QCAE-IDS 组成,分别检测已知与未知 CAN 总线攻击。
一项 VR 平衡干扰任务研究发现,伪迹去除虽能改善皮肤电活动(EDA)波形,却无法提升下游分类性能。基于专家校正 EDA 训练的残差门控网络在基准集上中位 AUROC 达 0.94,伪迹区域误差降低 17.8%,但迁移到 VR 录制数据后,五种已发表时间序列方法的平衡准确率变化仅为 -1.35 至 +0.93 个百分点,无一提升且两种下降。
AccentCL 是一个面向英语口音分类的类增量学习框架,基于冻结的 Whisper-Large-v3 编码器提取多层表示,结合不平衡感知交叉熵损失和域均值对齐损失,提升类别不平衡与跨语料域偏移下的鲁棒性。
研究者提出身份条件化分数融合框架,无需训练即可为每个底库身份定制融合权重,通过对比身份内一致性与跨身份冒充者提取身份专属画像,并与查询条件化自适应结合。在三个换装行人重识别基准上,该方法一致优于统计、排序和学习类基线,假未识别率最高绝对降低 8.8%。
研究评估行为与环境上下文能否为可解释的 IAM 策略风险优先级排序带来增量价值,使用包含 534 条真实 AWS 实验观测的 AWS IAM Context Bench 基准。
研究比较了量子测量 PAC 学习中纠缠测量学习规则与单副本学习规则的差异,构造出单副本学习规则渐近次优的学习场景。在自然联合可测性覆盖假设下,基于纠缠测量的学习规则相对单副本学习规则最多只有多项式级的样本复杂度优势。
研究者提出随机单循环恒定批量一阶惩罚方法 SICO,用于求解随机非凸-强凸双层优化问题。该方法每次迭代仅需 O(1) 个随机梯度样本,在无偏有界方差假设下达到 O(ε⁻⁶) 样本复杂度,在额外均方光滑假设下提升至 O(ε⁻⁴)。这是首个以单循环和恒定批量匹配全一阶 SBO 方法已知最优收敛速率的工作。
研究用多模态大语言模型将地面全景与卫星瓦片描述为结构化文本,在无训练条件下完成跨视角地理定位。在四个美国城市 9,826 对 VIGOR 数据上,全库描述相似度排序的 Recall@1 仅 0.39%;缩小到十个邻近瓦片后,MLLM 评判器打分可达随机排序的两倍,并能指出两段描述中一致与冲突的字段。
混合跨模态注意力网络(HCMAN)通过 Transformer 跨模态注意力机制融合乳腺钼靶图像与结构化临床数据,在埃塞俄比亚四家转诊医院 1,024 名患者的 2,560 张钼靶图像上实现 97.8% 准确率、97.2% 敏感度、98.3% 特异度和 0.987 的 AUC,显著优于纯图像基线。
一篇 78 页综述系统梳理了机器学习增强的迭代方法,用于求解线性与非线性方程组。这类被称为混合迭代方法的技术将经典迭代求解器与 ML 结合,在保持可解释性与可靠性的同时提升效率。文章还讨论了该方向的开放挑战与未来研究路径。
研究探讨了量子变分自编码器(QVAE)能否学习解耦且可解释的潜在因子,并厘清了单个量子潜在维度的定义。在包括 MNIST 变体在内的三个数据集上,QVAE 能够发现因子化且语义可解释的潜在表征,单个量子比特可作为有意义的潜在因子。该结果为理解量子潜在空间及其结构化表征学习潜力奠定了基础。
研究者提出一种交错投影梯度下降的模仿学习方案,训练时在标准模仿梯度步之间插入 k 步安全修正,将网络动作拉向安全集投影,运行时仅用训练好的网络、无需安全滤波器。在非线性自动驾驶赛车任务中,该方法在足够大的权重下达到无约束模仿的圈速,同时将违规回合比例从 15% 降至 1%,约为惩罚方法最佳权重的六分之一。代价是额外的训练计算量。
针对 LLM 从单轮补全转向智能体轨迹后推理硬件经济性的变化,论文用 roofline 分析和闭式 episode 延迟模型指出,智能体轨迹顺序依赖、有效 batch 为 1。
研究发现,从 SD1.5 到 FLUX.2 和 Z-Image 的多种文生图模型 VAE 共享一个与亮度和对立色对齐的颜色子空间,该子空间通过编码器线性近似和潜在引导被一致地定位。基于此提出三项应用:ColorTuning 在 GenColorBench 的 CSS3/X11 细粒度颜色系统上实现 SOTA 精确数值颜色生成,以及饱和度控制和颜色迁移。代码与模型已公开。
ImpactMat 是面向逆向撞击声渲染的数据集与基准,提供单一及混合材质的撞击声样本并配对真实材质参数,同时提出一个前馈模型,可从一段或多段录音中预测材质参数,并利用混合材质学习材质类型间的平滑过渡。实验显示该方法优于竞争基线,无需人工调参即可从真实录音重新渲染撞击声。
研究者提出 OCBench,一个带可控脚本策略的机器人操作基准,其脚本策略具备与人类演示相似的关键特性,从而在受控环境中复现了行为克隆的多种反常现象,例如模型对数据过拟合越严重性能反而持续提升、无动作分块的完全闭环策略往往彻底失败。OCBench 依托 GPU 加速环境和脚本策略,可对以往报道的 BC 相关现象展开分析并证伪多种假设。
Fiorillo v0.5 是一个开放模型,基于 Qwen3-4B-Base 加低秩适配器和决策头,仅用 2,657 篇训练文章中许可允许复用的 1,431 篇针对 Evidence Inference 2.0 微调,回答干预对结局的显著影响方向并给出概率。
研究者提出 Hierarchy-GBP(H-GBP),一个两阶段迭代框架,先用粗化图近似(抽象)解决全局误差并投影回原图(恢复),再用 GBP 精修局部误差,并通过推导组合矩阵算子及谱半径分析证明了收敛性。
AdaLoop 是一种轻量级循环模块,能让音频语言模型根据音频-问题对自动学习所需的潜在精炼步数,通过共享 transformer 块在问题引导下迭代音频表示,并由学习到的停止机制决定退出时机。
FactorBench 是一个面向组合的自动化因子挖掘基准,对比了 9 种自动化挖掘方法在 5 个股票市场上挖掘的约 5000 个因子。该基准从因子有效性、时序泛化性、风险与风格暴露后的预测能力,以及方法内与方法间因子池的差异性(含与 Alpha101 的相似度)三个层面追踪挖掘系统输出,并评估复合信号质量与计入成本后的多头及多空组合表现。结果显示,没有任何一种范式能持续占优。
研究基于 MGPHot 流行音乐标注数据集构建基准,模拟不同标注预算下的音乐标注模式扩展。结果显示,即使标注预算很小,监督适配也比音频语言模型的零样本预测更有效;在中等预算下,复用冻结表示是最高效的方法,且无需深度适配所需的调优。
研究者提出一种稀疏图方法,通过阻尼非局部哈密顿动力学将概率质量输运至多模态目标分布,结合对数均值迁移率与对称 Lévy 型交互权重,并用最近邻连接加采样长程边实现空间分离区域间的直接质量交换。图构建完成后密度演化是确定性的,每次更新成本与节点数及长程采样预算成线性关系。合成多模态分布实验显示,相比一阶与 MCMC 基线,该方法模态平衡更好、模态覆盖更稳定。
一项针对四旋翼飞行控制的研究对比了从无风、离散 1-cosine 阵风、统计湍流、合成相干结构到大气边界层大涡模拟场的五种扰动保真度,在全交叉训练-测试矩阵中评估 PPO 智能体,并以级联 PID 和几何 SE(3) 控制器作为免训练参照,风速扫描范围 0-12 m/s。
研究者提出 SynEval,一个面向多表(关系型)合成数据库的六维评估框架,联合评估逐列保真度、多变量结构保持(含条件分布检查 P(Y|X))、跨表完整性、ML 效用、隐私保护与边缘情况鲁棒性。该框架输出统一的加权质量分,支持按表和按维度下钻,且与生成器无关,可对任意真实与合成 CSV 文件夹自动推断 schema 并运行。
研究提出方向性 Fréchet 距离,即最优传输位移在给定方向上的期望平方投影,用于揭示生成模型评测中差异的具体来源。在图像、视频和蛋白质案例中,少数可解释方向即可解释大部分距离,并据此解释了 COCO 数据集上扩散采样步数增加导致 ImageReward 提升但 FID 变差的现象,量化了 FVD 对逐帧外观的偏好。代码已开源。
研究为 Conformal Prediction 的预测集大小作为不确定性度量提供了信息论基础,提出基于预测集大小与覆盖率的广义信息度量族,并证明 Shannon 互信息可由该族精确积分表示。
研究者提出 Neural Petri Flow(NPF),将 Petri 网的守恒性与非负性硬编码为无参数层,仅学习各变迁的速率律,使原子映射、反应分类与前向预测统一为同一 firing 向量上的任务。
研究精确滑动窗口约束下的线性 bandit:离线场景下凸性与循环平移不变性使平稳解在 w∣T 时最优,否则存在 O(w) 加性差距;在线场景仅靠几何结构不足以学习,甚至可能无法实现次线性 regret。作者引入转移直径 τ 与稀有切换 OFUL 算法,regret 为 Õ(d√T+τd+w),并在去除循环不变性后引入历史状态直径 D,取得 Õ(d√T+dD+w) 的 regret 界。
针对鲁棒 bandits(原 imprecise bandits)此前只有 Θ(√T) 遗憾保证而无计算保证的问题,研究者识别出一个可用多项式时间学习器实现 Õ(√T) 遗憾的特例,并证明该特例的若干小推广均为 NP-hard,表明其处于可解性边界。作者称这是朝着用计算高效学习器解决 AI 对齐问题方向的一小步。
针对在线逆线性优化,研究者提出一种确定性算法,在任意时间跨度 T 下取得 O(√d) 的最优遗憾,且运行时间为 d 和 T 的多项式级。此前 Sakaue 用随机算法达到该最优遗憾,但每轮需 (dT)^{O(d)} 次线性优化,并公开询问能否在多项式时间内实现。新算法是 Sakaue 等人与 Cai 等人变尺度算法的变体,当查询点远离更新位置时撤销度量更新。
GeneICL 是一个 4.2M 参数的表格基础模型,通过基于实测批量表达谱构建的半合成预训练先验与参数高效循环架构,在 80 项临床结局预测任务中取得最佳综合排名,参数最多减少 387 倍,推理无需梯度更新,笔记本 CPU 上数秒即可完成预测。该模型还通过 Cox 偏似然残差将右删失生存预测无训练地归约为回归任务。
研究提出统一概率框架,将 GP 预测器与显式外生噪声机制配对,为二元、名义和有序离散结果分别推导精确的条件噪声反演方法,并证明其能复现拟合模型的观测与干预分布。在合成 SCM 上,对有序数据误用分类耦合会使反事实误差膨胀约三倍,且该误差不随数据量增加而下降。
一项研究在 ARC-TGI 基准上对 decoder-only、encoder-decoder 和 MoE 三类小语言模型进行了超 1000 次监督微调实验,发现模型虽能达到较高的分布内准确率,但技能习得对优化敏感且在各任务族间分布不均。
针对上下文赌博机离策略评估中动作级重要性权重方差过大的问题,研究者提出 Variance Optimal-CEM(VOCEM)估计器,在 OffCEM 与 Doubly Robust(DR)之间插值并选取使方差最小的系数,推导出闭式总体最优解,其方差不超过两个端点。在受控合成实验和两个大动作基准上,VOCEM 在全部 23 种评估条件下均优于 OffCEM 和 DR,稳定性与经验鲁棒性更强。
研究提出 ResNet-BiLSTM 模型用于游戏画面多标签感知 Bug 检测,在基准数据集上取得 85.78% 的 F1 分数,优于 Inflated 3D ConvNet 和 3D ResNet 等视频分类模型。结果表明时序依赖建模有助于提升基于视频的 Bug 检测准确率。研究同时发布新数据集,包含 77,969 个视频片段、约 120 万帧,覆盖 5 类 Bug 在同一帧中的组合。
CNet 是一个基于 C++/CUDA 的复数神经网络框架,用 Wirtinger 微积分做梯度下降,分类采用 Born 规则测量 p_k = |z_k|² / ‖z‖² 而非 softmax。
研究者提出即插即用的随机傅里叶特征高斯过程注意力模块 RFF-GPA,将注意力表示为用随机傅里叶特征近似平稳核的高斯过程,把后验均值与方差的近似复杂度降到序列长度的线性级。在多个真实数据集上,该模块在保持预测精度的同时改善了校准表现。