语言能保留多少地点信息?零样本语言推理用于跨视角地理定位
研究用多模态大语言模型将地面全景与卫星瓦片描述为结构化文本,在无训练条件下完成跨视角地理定位。在四个美国城市 9,826 对 VIGOR 数据上,全库描述相似度排序的 Recall@1 仅 0.39%;缩小到十个邻近瓦片后,MLLM 评判器打分可达随机排序的两倍,并能指出两段描述中一致与冲突的字段。
研究用多模态大语言模型将地面全景与卫星瓦片描述为结构化文本,在无训练条件下完成跨视角地理定位。在四个美国城市 9,826 对 VIGOR 数据上,全库描述相似度排序的 Recall@1 仅 0.39%;缩小到十个邻近瓦片后,MLLM 评判器打分可达随机排序的两倍,并能指出两段描述中一致与冲突的字段。
混合跨模态注意力网络(HCMAN)通过 Transformer 跨模态注意力机制融合乳腺钼靶图像与结构化临床数据,在埃塞俄比亚四家转诊医院 1,024 名患者的 2,560 张钼靶图像上实现 97.8% 准确率、97.2% 敏感度、98.3% 特异度和 0.987 的 AUC,显著优于纯图像基线。
一篇 78 页综述系统梳理了机器学习增强的迭代方法,用于求解线性与非线性方程组。这类被称为混合迭代方法的技术将经典迭代求解器与 ML 结合,在保持可解释性与可靠性的同时提升效率。文章还讨论了该方向的开放挑战与未来研究路径。
研究探讨了量子变分自编码器(QVAE)能否学习解耦且可解释的潜在因子,并厘清了单个量子潜在维度的定义。在包括 MNIST 变体在内的三个数据集上,QVAE 能够发现因子化且语义可解释的潜在表征,单个量子比特可作为有意义的潜在因子。该结果为理解量子潜在空间及其结构化表征学习潜力奠定了基础。
研究者提出一种交错投影梯度下降的模仿学习方案,训练时在标准模仿梯度步之间插入 k 步安全修正,将网络动作拉向安全集投影,运行时仅用训练好的网络、无需安全滤波器。在非线性自动驾驶赛车任务中,该方法在足够大的权重下达到无约束模仿的圈速,同时将违规回合比例从 15% 降至 1%,约为惩罚方法最佳权重的六分之一。代价是额外的训练计算量。
针对 LLM 从单轮补全转向智能体轨迹后推理硬件经济性的变化,论文用 roofline 分析和闭式 episode 延迟模型指出,智能体轨迹顺序依赖、有效 batch 为 1。
研究发现,从 SD1.5 到 FLUX.2 和 Z-Image 的多种文生图模型 VAE 共享一个与亮度和对立色对齐的颜色子空间,该子空间通过编码器线性近似和潜在引导被一致地定位。基于此提出三项应用:ColorTuning 在 GenColorBench 的 CSS3/X11 细粒度颜色系统上实现 SOTA 精确数值颜色生成,以及饱和度控制和颜色迁移。代码与模型已公开。
ImpactMat 是面向逆向撞击声渲染的数据集与基准,提供单一及混合材质的撞击声样本并配对真实材质参数,同时提出一个前馈模型,可从一段或多段录音中预测材质参数,并利用混合材质学习材质类型间的平滑过渡。实验显示该方法优于竞争基线,无需人工调参即可从真实录音重新渲染撞击声。
研究者提出 OCBench,一个带可控脚本策略的机器人操作基准,其脚本策略具备与人类演示相似的关键特性,从而在受控环境中复现了行为克隆的多种反常现象,例如模型对数据过拟合越严重性能反而持续提升、无动作分块的完全闭环策略往往彻底失败。OCBench 依托 GPU 加速环境和脚本策略,可对以往报道的 BC 相关现象展开分析并证伪多种假设。
Fiorillo v0.5 是一个开放模型,基于 Qwen3-4B-Base 加低秩适配器和决策头,仅用 2,657 篇训练文章中许可允许复用的 1,431 篇针对 Evidence Inference 2.0 微调,回答干预对结局的显著影响方向并给出概率。
研究者提出 Hierarchy-GBP(H-GBP),一个两阶段迭代框架,先用粗化图近似(抽象)解决全局误差并投影回原图(恢复),再用 GBP 精修局部误差,并通过推导组合矩阵算子及谱半径分析证明了收敛性。
AdaLoop 是一种轻量级循环模块,能让音频语言模型根据音频-问题对自动学习所需的潜在精炼步数,通过共享 transformer 块在问题引导下迭代音频表示,并由学习到的停止机制决定退出时机。
FactorBench 是一个面向组合的自动化因子挖掘基准,对比了 9 种自动化挖掘方法在 5 个股票市场上挖掘的约 5000 个因子。该基准从因子有效性、时序泛化性、风险与风格暴露后的预测能力,以及方法内与方法间因子池的差异性(含与 Alpha101 的相似度)三个层面追踪挖掘系统输出,并评估复合信号质量与计入成本后的多头及多空组合表现。结果显示,没有任何一种范式能持续占优。
研究基于 MGPHot 流行音乐标注数据集构建基准,模拟不同标注预算下的音乐标注模式扩展。结果显示,即使标注预算很小,监督适配也比音频语言模型的零样本预测更有效;在中等预算下,复用冻结表示是最高效的方法,且无需深度适配所需的调优。
研究者提出一种稀疏图方法,通过阻尼非局部哈密顿动力学将概率质量输运至多模态目标分布,结合对数均值迁移率与对称 Lévy 型交互权重,并用最近邻连接加采样长程边实现空间分离区域间的直接质量交换。图构建完成后密度演化是确定性的,每次更新成本与节点数及长程采样预算成线性关系。合成多模态分布实验显示,相比一阶与 MCMC 基线,该方法模态平衡更好、模态覆盖更稳定。
一项针对四旋翼飞行控制的研究对比了从无风、离散 1-cosine 阵风、统计湍流、合成相干结构到大气边界层大涡模拟场的五种扰动保真度,在全交叉训练-测试矩阵中评估 PPO 智能体,并以级联 PID 和几何 SE(3) 控制器作为免训练参照,风速扫描范围 0-12 m/s。
研究者提出 SynEval,一个面向多表(关系型)合成数据库的六维评估框架,联合评估逐列保真度、多变量结构保持(含条件分布检查 P(Y|X))、跨表完整性、ML 效用、隐私保护与边缘情况鲁棒性。该框架输出统一的加权质量分,支持按表和按维度下钻,且与生成器无关,可对任意真实与合成 CSV 文件夹自动推断 schema 并运行。
研究提出方向性 Fréchet 距离,即最优传输位移在给定方向上的期望平方投影,用于揭示生成模型评测中差异的具体来源。在图像、视频和蛋白质案例中,少数可解释方向即可解释大部分距离,并据此解释了 COCO 数据集上扩散采样步数增加导致 ImageReward 提升但 FID 变差的现象,量化了 FVD 对逐帧外观的偏好。代码已开源。
研究为 Conformal Prediction 的预测集大小作为不确定性度量提供了信息论基础,提出基于预测集大小与覆盖率的广义信息度量族,并证明 Shannon 互信息可由该族精确积分表示。
研究者提出 Neural Petri Flow(NPF),将 Petri 网的守恒性与非负性硬编码为无参数层,仅学习各变迁的速率律,使原子映射、反应分类与前向预测统一为同一 firing 向量上的任务。
研究精确滑动窗口约束下的线性 bandit:离线场景下凸性与循环平移不变性使平稳解在 w∣T 时最优,否则存在 O(w) 加性差距;在线场景仅靠几何结构不足以学习,甚至可能无法实现次线性 regret。作者引入转移直径 τ 与稀有切换 OFUL 算法,regret 为 Õ(d√T+τd+w),并在去除循环不变性后引入历史状态直径 D,取得 Õ(d√T+dD+w) 的 regret 界。
针对鲁棒 bandits(原 imprecise bandits)此前只有 Θ(√T) 遗憾保证而无计算保证的问题,研究者识别出一个可用多项式时间学习器实现 Õ(√T) 遗憾的特例,并证明该特例的若干小推广均为 NP-hard,表明其处于可解性边界。作者称这是朝着用计算高效学习器解决 AI 对齐问题方向的一小步。
针对在线逆线性优化,研究者提出一种确定性算法,在任意时间跨度 T 下取得 O(√d) 的最优遗憾,且运行时间为 d 和 T 的多项式级。此前 Sakaue 用随机算法达到该最优遗憾,但每轮需 (dT)^{O(d)} 次线性优化,并公开询问能否在多项式时间内实现。新算法是 Sakaue 等人与 Cai 等人变尺度算法的变体,当查询点远离更新位置时撤销度量更新。
GeneICL 是一个 4.2M 参数的表格基础模型,通过基于实测批量表达谱构建的半合成预训练先验与参数高效循环架构,在 80 项临床结局预测任务中取得最佳综合排名,参数最多减少 387 倍,推理无需梯度更新,笔记本 CPU 上数秒即可完成预测。该模型还通过 Cox 偏似然残差将右删失生存预测无训练地归约为回归任务。
研究提出统一概率框架,将 GP 预测器与显式外生噪声机制配对,为二元、名义和有序离散结果分别推导精确的条件噪声反演方法,并证明其能复现拟合模型的观测与干预分布。在合成 SCM 上,对有序数据误用分类耦合会使反事实误差膨胀约三倍,且该误差不随数据量增加而下降。
一项研究在 ARC-TGI 基准上对 decoder-only、encoder-decoder 和 MoE 三类小语言模型进行了超 1000 次监督微调实验,发现模型虽能达到较高的分布内准确率,但技能习得对优化敏感且在各任务族间分布不均。
针对上下文赌博机离策略评估中动作级重要性权重方差过大的问题,研究者提出 Variance Optimal-CEM(VOCEM)估计器,在 OffCEM 与 Doubly Robust(DR)之间插值并选取使方差最小的系数,推导出闭式总体最优解,其方差不超过两个端点。在受控合成实验和两个大动作基准上,VOCEM 在全部 23 种评估条件下均优于 OffCEM 和 DR,稳定性与经验鲁棒性更强。
研究提出 ResNet-BiLSTM 模型用于游戏画面多标签感知 Bug 检测,在基准数据集上取得 85.78% 的 F1 分数,优于 Inflated 3D ConvNet 和 3D ResNet 等视频分类模型。结果表明时序依赖建模有助于提升基于视频的 Bug 检测准确率。研究同时发布新数据集,包含 77,969 个视频片段、约 120 万帧,覆盖 5 类 Bug 在同一帧中的组合。
CNet 是一个基于 C++/CUDA 的复数神经网络框架,用 Wirtinger 微积分做梯度下降,分类采用 Born 规则测量 p_k = |z_k|² / ‖z‖² 而非 softmax。
研究者提出即插即用的随机傅里叶特征高斯过程注意力模块 RFF-GPA,将注意力表示为用随机傅里叶特征近似平稳核的高斯过程,把后验均值与方差的近似复杂度降到序列长度的线性级。在多个真实数据集上,该模块在保持预测精度的同时改善了校准表现。
一项泄漏控制研究用固定 nano 级 YOLO26n-seg 模型对比皮肤镜预处理效果,原始图像加在线增强在病灶不相交测试集上取得 mask mAP₅₀:₉₅ 0.5636、Dice 0.9356、macro-F1 0.6917。
一篇 31 页的 arXiv 文章以几何方式重新推导奇异值分解(SVD),主张其构造正是主成分分析、核方法与 PageRank 背后的机制。文章先由单位圆到椭圆的映射推出奇异值,再用该构造证明谱定理而非假设它,并说明最大化递归对应幂法与 PageRank、定位极大值的引理对应梯度下降的停止规则。
研究首次对 TabICL 免训练图节点分类做保形可靠性分析,以每张图一半节点为标注上下文,冻结的上下文预测器使 split conformal prediction 在有限样本下精确有效。
研究提出统一 Bregman 散度框架,将 Shampoo 优化器中 Frobenius、KL 等散度选择纳入同一视角联合分析。通过梯度二阶矩的谱分析发现,部分散度能更好补偿有限样本下二阶矩的低估,解释了不同 Shampoo 变体的行为差异,并在 GPT-2 预训练实验中验证。
研究提出 Prefix-State Hybrid Block Attention(PHBA),用 top-k 块稀疏检索替代固定局部滑动窗口注意力,并将每个检索块与其前缀状态配对,前缀状态由块边界处的门控线性递归构建。
研究者在 Latent Dynamics Networks(LDNet)基础上提出改进方法,使其能处理初始条件变化的 PDE 系统,同时保留原有端到端训练和无编码器特性。
针对早期阶段数据预测布线后时序的难题,研究者提出 STEP-KD,利用布线后、布局后、floorplan 后各阶段教师模型,通过表征对齐将知识序贯蒸馏到综合后学生模型。实验显示其将 Total Negative Slack 预测的加权平均绝对百分比误差降至 19.78%,而业界标准 STA 工具为 74.84%。
研究者提出 Sparse Segment Reduction(SSR),一种针对三值 LLM 与三值权重网络(TWN)推理的三值矩阵乘法方法,通过专用三值数据格式和随稀疏度扩展的计算树利用稀疏结构。
VETTA 通过共享轻量 critic 上的独立价值头,联合学习回合级与 token 级信用,并将回合优势与响应内中心化的 token 残差结合用于 PPO 更新。
研究提出用占用度量(occupancy measure)将 MDP 重构为线性规划(LP),通过 pivoting 算法识别可行多面体的活跃约束,推导出闭式梯度,替代依赖 Bellman 方程 KKT 条件、需在全状态-动作对上求解线性系统的方法。