TerrainForge:面向反事实自动驾驶的物理基础道路几何编辑框架
TerrainForge 能从重建的多车驾驶片段中生成以道路几何为核心的反事实场景,其统一道路模型将场景形变与四轮车辆动力学相连,使坡顶、坡谷、减速带和摩擦变化传导至车辆运动、相机视角与车间距。
TerrainForge 能从重建的多车驾驶片段中生成以道路几何为核心的反事实场景,其统一道路模型将场景形变与四轮车辆动力学相连,使坡顶、坡谷、减速带和摩擦变化传导至车辆运动、相机视角与车间距。
多模态基准 TasteBench 发布,用于可持续蛋白的感官预测,包含基于 215 种植物基食品、21K+ 人类评估构建的食品级排序任务(935 个同类别排序对)和覆盖 15K 风味分子的分子级味觉分类任务。
ArrivalBench 不再只对智能体生成的数据管道做单次快照评测,而是在迟到、重复、乱序和重试等可重放的投递调度下重新执行管道,并要求最终状态等于完整日志的批量重算结果。
研究系统考察了深度序列模型在时间序列共形预测中的三种用法:条件分位数回归、条件分位数函数估计与局部化共形预测。作者给出理论分析,证明这三种方法在适当假设下均具备渐近条件覆盖率保证,并在真实数据集上验证了其有效性。
研究提出 SBERT2S1,将 Sentence-Transformers 编码器转换为双编码器、cross-head(C)与 prior-fused residual(PFR)决策模型,并发布生物医学类型化决策套件 BIODECIDE 及源自 NLM 索引的 243k 条训练决策 MEDLINE-S1。
研究融合美国 SEC 财务数据与 EPA 设施级温室气体登记数据,用梯度提升架构和 Mondrian Conformal Prediction 构建企业实际排放的算法基线,并据此提出 Conformal-Weighted Continuous Divergence(CWCD)指标,量化企业自报排放与算法基线之间的差距。
研究提出用 O'PRIOR 合成任务生成器构建可验证的归因测试台,每个预训练任务都带有结构机制、缺失、混杂、捷径和分布偏移的显式来源标注。在留出真实任务上,移除归因排名前 5% 的合成任务使平均 ROC-AUC 下降 0.013,随机移除仅下降 0.002±0.004,移除末位任务则提升 0.003。
研究者将仅作用于查询的低秩适配器 SampoTron 与 Nemotron-3-Embed-1B 模型结合,并按查询与索引语言做确定性路由:跨语言查询走适配器,同语言查询走原编码器。在采样的金融基准上,六个英/芬/瑞方向的 nDCG@10 均值从 0.241 提升至 0.291,相对增益 20.9%,且路由保留了原有同语言性能。
研究者提出特征追踪型物理信息神经网络 FT-PINN,将解网络定义在固定参考域上并与参数化非线性流形上的微分同胚变形映射复合,通过联合训练使配点自动聚集在激波等特征附近。在含合并激波的 Burgers 方程、Euler 激波管和二维正则激波反射四个测试问题上,FT-PINN 在有限配点预算下准确定位激波,而相同架构与预算的普通 PINN 则定位错误或无法形成激波。
用 Claude Opus 等前沿模型作为元智能体生成终端任务与验证器用于 RL 训练时,可运行 Docker 镜像和可执行测试套件并不保证端到端流程可靠,研究诊断出基准无效、harness 脆弱、奖励错位三类失败。
针对 Agentic Text-to-SQL 系统过早终止澄清、静默做出未验证假设的问题,研究者提出 PlanPool,将澄清计划外化为可变问题池,每个计划问题必须显式提问或丢弃后才能提交,交互中新发现的歧义可随时加入。在 BIRD-Interact 和 Spider 衍生的三个基准上,PlanPool 持续提升歧义覆盖率并减少静默失败,同时保持有竞争力的执行准确率。
Latent-MOPD 是首个面向 LLM 的表征级多教师同策略蒸馏(OPD)方法,同时利用专家的预测结果和计算这些预测所用的隐藏状态,无需额外教师训练。在同家族设置下,它在数学、代码和逻辑共 9 个基准上均优于仅 token、仅表征和均匀平均基线,参数量与各教师相同时多数基准超过单基准最佳教师;跨家族教师下也在全部基准上超过单通道基线。
TRACE 是一个可复现的电价预测基准,包含美国某主要市场五个区域的 7,300 个区域-日实例,将电价与预测截止时点可获取的官方运营文本配对,并在每个截止点重建文本以避免信息泄漏。在时序基础模型上,TRACE 使上尾 pinball loss 中位数降低 7.4%;跨日文本错配消融实验则使增益反转,低于无文本基线。
针对交叉拟合中忽略交叉折依赖的置信区间在非正则场景下覆盖不足的问题,研究者利用新的局部性条件证明一大类交叉拟合估计量仍满足中心极限定理,但渐近方差需按交叉折相关性调整。随后提出估计该相关性并构造达到渐近名义覆盖率的置信区间,在随机森林与神经网络的模拟研究中取得近似名义覆盖率。
针对大语言模型强化学习通常最大化期望回报、概率求和无法指出哪条解法真正有效的问题,研究者提出 Tropical Reinforcement Learning,用取最大值的热带半环替代概率相加,使状态价值对应最可能被验证解法的对数概率并附带可复用路径。
对四个开放权重类型化决策模型的研究发现,模型返回的概率主要取决于选项标签而非其定义,即存在"选项标签偏差"。删除全部定义后准确率几乎不变(laya-td:0.8559 对 0.8487),而将选项改名为 A、B 后准确率提升 +0.1511。
研究对正则化经验风险加入随机线性项 z~N(0,σ²I_d) 后,释放确定性梯度下降第 N 次迭代所得有限计算的差分隐私性质。在强凸、光滑且 Hessian 满足 Lipschitz 条件下,证明 z↦w_N 在隐私论证所用有界域上是 C¹ 微分同胚,并给出 Jacobian 最小奇异值的定量下界。
研究团队提出 DeskForge,一个通过组合和探索真实应用生成大规模监督数据的可控桌面环境,并据此构建了包含 120 万条标注桌面观测、1.597 亿个元素实例的 DeskForge-1M 语料。
推荐理由:论文给出可控桌面环境与 120 万条标注数据,并展示四个视觉语言模型在 GUI 定位基准上的提升幅度。
GRAFT 是一个持续多教师蒸馏框架,让统一骨干网络从开放序列的基础模型中逐步获取能力,新增教师时只需一次蒸馏而非全量重蒸馏。它引入 Teacher Specific Readout Tokens 为每个教师提供独立读出,并用 Geometry Agnostic Relational Loss 对齐视觉语言教师。
研究将行为评估扩展到潜空间,在全部 11 个开放权重 LLM 中发现了专门的临床概念中心,这些中心可解释、仅对对齐的临床叙事激活,并在受限与开放式场景中因果驱动模型行为。在对抗性角色提示下模型仍保持内部一致并持续使用相关概念中心,而对齐提示可提升下游临床表现;沿这些中心进行引导也能带来下游改进。盲法临床医生验证显示,这些概念中心的激活与使用可预测临床医生的偏好。
针对全模态大模型音视频联合推理成本高的问题,研究提出以文本为中心的后训练范式:先用纯文本训练做主推理优化,再用缩减数据的原生音视频 RL 精修感知。最佳纯文本配置下,SFT 加 RL 使 Qwen2.5-Omni-7B 九项推理得分的几何均值较基座提升 25.83%,GPU 时长比完整原生音视频路线少 56.6%。
一项 arXiv 研究用可解析的线性-softmax 策略,对分类任务中 SFT 与 RFT 的更新做了语义与风格分解:在相同策略和提示词下,两者语义更新平行,但风格动态不同。RFT 用精确策略梯度可保持类内风格对称,而 SFT 在非均匀教师下会产生偏离轴的风格漂移。该漂移在显式条件下导致分离:从同一完美拟合检查点做群体更新时,SFT 的遗忘在有限训练区间内有严格正下界,RFT 则保持零语义误差。
研究者提出由编码智能体驱动、带人工验证的转换流程,将 BIRD 的 Text-to-SQL 基准转为面向文档数据库的 AptMQL-Bench,包含 21 个数据库、3,186 条自然语言请求及对应 MQL 查询,迁移自 SQLite 且无数据丢失。
Ian Osband 提出 horizon loss,将交叉熵视为"耐心的准确率",并按剩余训练量截断,从而在训练后期向精确策略梯度过渡。在 MNIST 及 ImageNet 上使用 ResNet-50、ResNet-101 和 ViT-S/16 测试,该方法在固定学习率下提升 top-1 准确率,且标签噪声越大增益越明显。
研究对固定 YOLOv8s 行人检测器的后置解释在 PIE 与 JAAD 数据集上进行审计,发现基于删除的忠实度与解释时的检测强度强相关,D-RISE 的 Spearman 相关系数达 0.70 至 0.82,使朴素置信度分层比较不可靠。
研究者发布 SymCE,包含 4,707 道本科代数与实分析假猜想,每题配有可执行的逐定理 Python 验证器,验证器同时充当奖励函数。
研究将摊销结构化随机变分推理(Amortized Structured Stochastic Variational Inference)用于高斯过程隐变量模型,使隐空间的变分后验可条件依赖于诱导点取值,突破了原有诱导点与隐变量间平均场近似的限制。这一更灵活的变分后验在多项数据流形重建指标上取得提升。
ConvoDrift 是一个用于建模固定语义意图下渐进式风格语调漂移的多轮对话数据集,基于 15,727 个共享多轮对话结构构建,每段对话含六组提示词-回复对并标注风格漂移与方向标签。
研究通过可解析的事实回忆模型揭示,Muon 对应的 Spectral GF 将 subject 与 relation 依赖信息的学习时间比从 GF 的 Θ̃(√(S/R)) 降至 Θ̃(1),且固定 S、R 时误差随训练时间 T 以 exp(-poly(T)) 衰减,而 GF 仅为 1/(T log T)。
研究者提出 Predictively Oriented Gaussian Processes(PrO-GPs),将预测不确定性作为首要推断目标,以应对核函数与观测模型选择不当导致的模型误配问题。由于非参数模型的 PrO 后验无法直接计算,作者推导出简化形式与实用采样方案以实现高效计算。合成与真实数据实验显示,在模型误配下 PrO-GPs 的预测分布校准优于标准 GP 方法。
研究者提出 HOST,一种高效高斯 DAG 学习算法,用逐节点留出评分与凸回归替代子集搜索,且无需预先给定入度上界。在合适条件下,HOST 可在多项式时间内以 d log p 量级的样本复杂度精确恢复最大入度为 d 的 p 节点 DAG。实验显示其图恢复效果具竞争力,运行时间扩展性良好。
研究提出增量认知诊断框架 CLEAN,通过严格拓扑二分协议冻结历史诊断函数,并用确定性正交列掩码切断梯度干扰,同时以可扩展满秩分支学习新概念。在三个大规模教育数据集上,CLEAN 实现零 Representation Drift(RD),旧题指标与静态锚点完全一致,新题表现与强持续学习基线相当或更优。
研究者推出 EditHero,据称是首个面向长程、部件级 3D 编辑的基准,支持自然语言指令与几何、纹理的目标图像。其确定性装配引擎可在每次编辑后生成精确目标,每条序列均经人工审核。对比显示,非智能体方法常漏改并扰动应保持不变的区域,而 LLM/VLM 智能体通过代码自底向上编辑,指令遵循更好、更能保留未编辑部分,但每次编辑耗时数分钟。
针对每轮查询梯度、每 m 轮查询一次 Hessian 的惰性二阶预言机设定,研究者通过新的块零链构造证明了寻找 ε-解所需总迭代次数的下界为 Ω(m + m^{1/7} ε^{-2/7}),并提出新方法达到 Õ(m + m^{1/7} ε^{-2/7}) 的上界。
研究提出 THPL 生成式投喂决策框架,用于 RAS 虹鳟养殖:Fishsort 提取轨迹并建立活动系数 AC,与专家标注投喂强度呈显著单调正相关(Spearman ρ = 0.925,p < 0.001)。
Physical AI Smart Spaces 发布,这是首个同时提供大规模、多类别、多摄像头 3D 感知数据的室内智能空间基准,含近 1800 台摄像头拍摄的超 280 小时同步 1080p 视频,覆盖仓库、医院、零售等场景。
研究提出一种结合代理模型与强化学习的控制框架,用于优化核物理实验中的动态极化靶。基于 APOLLO 低温靶系统运行数据,高斯过程回归模型能提供校准的不确定性估计并识别训练分布外区域,MLP 对分布偏移敏感性有限。采用下置信界奖励训练的强化学习智能体,将操作员操作效果提升近 2 倍。
研究提出 JEPA 早期训练稳定性理论,将表征坍缩归因于驱动力 γ 与衰减效应 σ 的竞争,并预测出相边界,在超过 800 组 Tabular-JEPA 配置上得到验证。
一项预注册基准在 8 个公开数据集(200 至 20,000 训练行)和 4 个原生小型临床数据集上,对 CTGAN、TVAE、TabDDPM 等七种生成器进行了 2,220 次运行。在 24 个(数据集,深度模型)组合中有 23 个,深度模型在任何训练规模下都未超过最佳平凡基线。预注册预测的“小规模下深度模型排名不稳定”被证伪,相邻规模间平均 Kendall tau 为 0.806。
研究者提出 Lexicographic Multi-Objective On-Policy Distillation(LMOPD),一种按显式优先级整合奖励专精策略的多教师方法,通过字典序路由与对数策略修正投影保护高优先级能力。