跳到正文
10月5日周一
  1. arXiv cs.LG29

    ReRoute:无需受控实验,用部分机制知识实现科学仿真器反事实预测

    研究者提出 ReRoute 框架,将事实数据与部分机制知识结合,无需受控干预数据即可对预训练骨干模型进行反事实预测。在气候仿真任务中,面对严重 CO₂ 分布偏移,ReRoute 将聚合气候误差降低 18.2-31.8%,同时保持标准条件下的性能,成本仅为用额外受控模拟数据重训练的很小一部分。该构造的因果识别结果已在 Lean 中完成机器验证。

  2. arXiv cs.CV15

    DeepStratNet:面向稀疏标签地震层位追踪的上下文感知坐标回归框架

    DeepStratNet 将地震层位追踪从稠密语义分割改为有界坐标回归,模型直接预测每个横向位置处目标层位的时间/深度坐标。该框架由兼容任意预训练视觉骨干的轻量回归头与 LSTM 模块组成,用于建模切片间上下文并生成连续层位面,训练采用 L1 与 L2 损失并结合地质先验正则约束相邻道连续性。

  3. arXiv cs.CL37

    研究揭示大模型"审计缺口":事实回答正确不等于下游决策正确

    一项针对8个模型的研究发现,在剂量1000的虚假文档训练下,模型直接注入选择率高达95.8%–100%,但决策任务中的注入选择仅比真实对照训练高出1.7–14.4个百分点,形成"审计缺口"。在2019–20澳大利亚山火虚假帖文案例中,模型即使未复现被夸大的数字,仍会断言有人因纵火被捕。研究表明,正确的事实回答不能保证正确的决策,纠正事实也无法消除误导性叙事。

  4. arXiv cs.CL22

    基于查询感知路由的编码器跨语言检索性能提升

    研究者将仅作用于查询的低秩适配器 SampoTron 与 Nemotron-3-Embed-1B 模型结合,并按查询与索引语言做确定性路由:跨语言查询走适配器,同语言查询走原编码器。在采样的金融基准上,六个英/芬/瑞方向的 nDCG@10 均值从 0.241 提升至 0.291,相对增益 20.9%,且路由保留了原有同语言性能。

  5. arXiv stat.ML22

    FT-PINN:通过联合优化非线性变形流形实现物理信息神经网络的特征追踪

    研究者提出特征追踪型物理信息神经网络 FT-PINN,将解网络定义在固定参考域上并与参数化非线性流形上的微分同胚变形映射复合,通过联合训练使配点自动聚集在激波等特征附近。在含合并激波的 Burgers 方程、Euler 激波管和二维正则激波反射四个测试问题上,FT-PINN 在有限配点预算下准确定位激波,而相同架构与预算的普通 PINN 则定位错误或无法形成激波。

  6. arXiv cs.CL22

    PlanPool 如何解决 Agentic Text-to-SQL 中的欠规范问题

    针对 Agentic Text-to-SQL 系统过早终止澄清、静默做出未验证假设的问题,研究者提出 PlanPool,将澄清计划外化为可变问题池,每个计划问题必须显式提问或丢弃后才能提交,交互中新发现的歧义可随时加入。在 BIRD-Interact 和 Spider 衍生的三个基准上,PlanPool 持续提升歧义覆盖率并减少静默失败,同时保持有竞争力的执行准确率。

  7. arXiv cs.LG22

    Latent-MOPD:面向 LLM 的潜在多教师同策略蒸馏

    Latent-MOPD 是首个面向 LLM 的表征级多教师同策略蒸馏(OPD)方法,同时利用专家的预测结果和计算这些预测所用的隐藏状态,无需额外教师训练。在同家族设置下,它在数学、代码和逻辑共 9 个基准上均优于仅 token、仅表征和均匀平均基线,参数量与各教师相同时多数基准超过单基准最佳教师;跨家族教师下也在全部基准上超过单通道基线。

  8. arXiv stat.ML12

    TRACE:基于官方运营文本的可复现电价预测基准

    TRACE 是一个可复现的电价预测基准,包含美国某主要市场五个区域的 7,300 个区域-日实例,将电价与预测截止时点可获取的官方运营文本配对,并在每个截止点重建文本以避免信息泄漏。在时序基础模型上,TRACE 使上尾 pinball loss 中位数降低 7.4%;跨日文本错配消融实验则使增益反转,低于无文本基线。

  9. arXiv stat.ML12

    非正则条件下的交叉拟合:基于局部性的正态性与推断

    针对交叉拟合中忽略交叉折依赖的置信区间在非正则场景下覆盖不足的问题,研究者利用新的局部性条件证明一大类交叉拟合估计量仍满足中心极限定理,但渐近方差需按交叉折相关性调整。随后提出估计该相关性并构造达到渐近名义覆盖率的置信区间,在随机森林与神经网络的模拟研究中取得近似名义覆盖率。

  10. arXiv cs.CV62

    DeskForge:用桌面环境密集监督训练计算机使用智能体

    研究团队提出 DeskForge,一个通过组合和探索真实应用生成大规模监督数据的可控桌面环境,并据此构建了包含 120 万条标注桌面观测、1.597 亿个元素实例的 DeskForge-1M 语料。

    推荐理由:论文给出可控桌面环境与 120 万条标注数据,并展示四个视觉语言模型在 GUI 定位基准上的提升幅度。

  11. arXiv cs.CL29

    LLM 临床概念中心研究:潜空间中存在可定位、可因果驱动临床行为的表征

    研究将行为评估扩展到潜空间,在全部 11 个开放权重 LLM 中发现了专门的临床概念中心,这些中心可解释、仅对对齐的临床叙事激活,并在受限与开放式场景中因果驱动模型行为。在对抗性角色提示下模型仍保持内部一致并持续使用相关概念中心,而对齐提示可提升下游临床表现;沿这些中心进行引导也能带来下游改进。盲法临床医生验证显示,这些概念中心的激活与使用可预测临床医生的偏好。

  12. arXiv cs.CL27

    以文本为中心的后训练实现全模态推理:Qwen2.5-Omni-7B 推理得分提升 25.83%

    针对全模态大模型音视频联合推理成本高的问题,研究提出以文本为中心的后训练范式:先用纯文本训练做主推理优化,再用缩减数据的原生音视频 RL 精修感知。最佳纯文本配置下,SFT 加 RL 使 Qwen2.5-Omni-7B 九项推理得分的几何均值较基座提升 25.83%,GPU 时长比完整原生音视频路线少 56.6%。

  13. arXiv stat.ML22

    SFT 与 RFT 在分类任务上的对比研究:学习风格,遗忘语义

    一项 arXiv 研究用可解析的线性-softmax 策略,对分类任务中 SFT 与 RFT 的更新做了语义与风格分解:在相同策略和提示词下,两者语义更新平行,但风格动态不同。RFT 用精确策略梯度可保持类内风格对称,而 SFT 在非均匀教师下会产生偏离轴的风格漂移。该漂移在显式条件下导致分离:从同一完美拟合检查点做群体更新时,SFT 的遗忘在有限训练区间内有严格正下界,RFT 则保持零语义误差。

  14. arXiv stat.ML22

    PrO-GPs:面向预测的高斯过程后验

    研究者提出 Predictively Oriented Gaussian Processes(PrO-GPs),将预测不确定性作为首要推断目标,以应对核函数与观测模型选择不当导致的模型误配问题。由于非参数模型的 PrO 后验无法直接计算,作者推导出简化形式与实用采样方案以实现高效计算。合成与真实数据实验显示,在模型误配下 PrO-GPs 的预测分布校准优于标准 GP 方法。