跳到正文
10月5日周一
  1. arXiv cs.CL24

    EpiWorld:将 LLM 政策智能体锚定在流行病学世界模型中

    EpiWorld 是一个闭环框架,将 LLM 政策智能体锚定在动作条件流行病学世界模型和分层技能库上,通过反事实推演为政策选择提供反馈。在 COVID-19 和 Influenza 回顾性数据集上,该世界模型取得所有预测基线中最佳的分布外 Peak-MAE,闭环框架将累计住院率最多降低 59%,在六个 LLM 骨干上平均降低约 16%,优于强化学习和最优控制基线。

  2. arXiv cs.CV15

    DeepStratNet:面向稀疏标签地震层位追踪的上下文感知坐标回归框架

    DeepStratNet 将地震层位追踪从稠密语义分割改为有界坐标回归,模型直接预测每个横向位置处目标层位的时间/深度坐标。该框架由兼容任意预训练视觉骨干的轻量回归头与 LSTM 模块组成,用于建模切片间上下文并生成连续层位面,训练采用 L1 与 L2 损失并结合地质先验正则约束相邻道连续性。

  3. arXiv cs.CL37

    研究揭示大模型"审计缺口":事实回答正确不等于下游决策正确

    一项针对8个模型的研究发现,在剂量1000的虚假文档训练下,模型直接注入选择率高达95.8%–100%,但决策任务中的注入选择仅比真实对照训练高出1.7–14.4个百分点,形成"审计缺口"。在2019–20澳大利亚山火虚假帖文案例中,模型即使未复现被夸大的数字,仍会断言有人因纵火被捕。研究表明,正确的事实回答不能保证正确的决策,纠正事实也无法消除误导性叙事。

  4. arXiv cs.CL22

    用部分语音学习何时提交:面向端到端同声传译的 prefix 监督

    研究者用语音语言模型自身完整与部分波形的翻译结果构造 prefix 监督,无需转录文本或人工翻译,即可适配端到端同声传译。在 FLEURS 和 CoVoST2 三个翻译方向上,prefix 训练改善了质量—延迟前沿,置信度阈值提供了最稳定的操作区间;多轮 append-only 解码在低延迟下更强,其提交校准误差整体下降 63–68%,早期 prefix 下降 68–80%。

  5. arXiv cs.CV22

    SpectralCache:通过谱特征缓存加速基于扩散的世界模型

    SpectralCache 是一种免训练谱缓存框架,利用扩散世界模型特征在相邻去噪步间奇异子空间高度稳定的特性,复用稳定子空间并通过线性外推估计低维奇异值,从而跳过部分主干网络计算。在 HunyuanWorld-Voyager-13B 上,它实现 5.22 倍加速,静态场景 WorldScore 保持 65.90,推理效率显著优于现有免训练缓存方法。

  6. arXiv cs.AI32

    OEB(Open-Endedness Bench):从智能体执行记录评测其认知过程

    研究者提出 OEB(Open-Endedness Bench),一种只读取智能体执行记录、不依赖参考答案或结果分数的基准方法,将记录编译为认知事件图,从证据、实验、修正、无奖励黑客四个维度打分。在三个基准的 12 项任务、119 次已有运行中,智能体声称的改进只有 16-29% 属实;10 项任务中有 9 项的最佳运行在后半程尝试了更多新想法。

  7. arXiv cs.AI22

    MintFlow:面向受限流匹配的最小轨迹干预方法

    MintFlow 是一个免训练的受限采样框架,将约束满足建模为对预训练流轨迹的最小干预,通过伴随公式得到扰动的闭式解,无需迭代优化。该方法还能自适应选择干预时机,在生成视觉与物理系统建模任务中,约束满足效果与 SOTA 受限方法相当,同时更好地保留预训练生成分布。

  8. arXiv cs.AI22

    SatisDive:在文本到图像扩散中穿越满意度-多样性前沿

    SatisDive 是一种免训练的推理时方法,通过批次相对奖励阈值区分高低奖励候选,在满足奖励下限的同时保证批次多样性。在 Pick-a-Pic 上,以 FLUX.1-dev 为基座模型、HPSv3 为奖励时,最差候选奖励较 FK steering 提升最高 0.43;以 SANA-1.6B 为基座、ImageReward 为奖励时提升最高 0.70。

  9. arXiv cs.CL22

    基于查询感知路由的编码器跨语言检索性能提升

    研究者将仅作用于查询的低秩适配器 SampoTron 与 Nemotron-3-Embed-1B 模型结合,并按查询与索引语言做确定性路由:跨语言查询走适配器,同语言查询走原编码器。在采样的金融基准上,六个英/芬/瑞方向的 nDCG@10 均值从 0.241 提升至 0.291,相对增益 20.9%,且路由保留了原有同语言性能。

  10. arXiv stat.ML22

    FT-PINN:通过联合优化非线性变形流形实现物理信息神经网络的特征追踪

    研究者提出特征追踪型物理信息神经网络 FT-PINN,将解网络定义在固定参考域上并与参数化非线性流形上的微分同胚变形映射复合,通过联合训练使配点自动聚集在激波等特征附近。在含合并激波的 Burgers 方程、Euler 激波管和二维正则激波反射四个测试问题上,FT-PINN 在有限配点预算下准确定位激波,而相同架构与预算的普通 PINN 则定位错误或无法形成激波。

  11. arXiv cs.CL22

    PlanPool 如何解决 Agentic Text-to-SQL 中的欠规范问题

    针对 Agentic Text-to-SQL 系统过早终止澄清、静默做出未验证假设的问题,研究者提出 PlanPool,将澄清计划外化为可变问题池,每个计划问题必须显式提问或丢弃后才能提交,交互中新发现的歧义可随时加入。在 BIRD-Interact 和 Spider 衍生的三个基准上,PlanPool 持续提升歧义覆盖率并减少静默失败,同时保持有竞争力的执行准确率。

  12. arXiv cs.LG22

    Latent-MOPD:面向 LLM 的潜在多教师同策略蒸馏

    Latent-MOPD 是首个面向 LLM 的表征级多教师同策略蒸馏(OPD)方法,同时利用专家的预测结果和计算这些预测所用的隐藏状态,无需额外教师训练。在同家族设置下,它在数学、代码和逻辑共 9 个基准上均优于仅 token、仅表征和均匀平均基线,参数量与各教师相同时多数基准超过单基准最佳教师;跨家族教师下也在全部基准上超过单通道基线。

  13. arXiv cs.AI27

    MIRA:面向长时程研究智能体的元推理架构

    研究者提出 MIRA,一种将研究分配与执行分离的分层架构:外层元推理器从持久研究记录中整理上下文并生成下一步调查的工作指令,内层执行器逐条执行。无需策略训练,MIRA 在定理证明和开放式神经网络架构研究中提升了长时程推理并更有效分配额外算力。基于该先验初始化的生成式 actor-critic MIRA-AC 在四个 autoresearch 环境中提升了 gold 表现。

  14. arXiv stat.ML12

    TRACE:基于官方运营文本的可复现电价预测基准

    TRACE 是一个可复现的电价预测基准,包含美国某主要市场五个区域的 7,300 个区域-日实例,将电价与预测截止时点可获取的官方运营文本配对,并在每个截止点重建文本以避免信息泄漏。在时序基础模型上,TRACE 使上尾 pinball loss 中位数降低 7.4%;跨日文本错配消融实验则使增益反转,低于无文本基线。

  15. arXiv cs.CL29

    APDMem:面向查询自适应的智能体渐进式披露长期记忆架构

    APDMem 是一种分层长期记忆架构,将对话历史表示为主题摘要、个性化关键事实、轮级证据笔记和原始消息四层,推理时由控制器先读高层摘要、按需深入细节。在 LongMemEval 上,它仅访问 8% 的对话内容即取得强劲的长上下文记忆推理表现。该工作已被 EMNLP 2026(Industry Track)接收。

  16. arXiv stat.ML12

    非正则条件下的交叉拟合:基于局部性的正态性与推断

    针对交叉拟合中忽略交叉折依赖的置信区间在非正则场景下覆盖不足的问题,研究者利用新的局部性条件证明一大类交叉拟合估计量仍满足中心极限定理,但渐近方差需按交叉折相关性调整。随后提出估计该相关性并构造达到渐近名义覆盖率的置信区间,在随机森林与神经网络的模拟研究中取得近似名义覆盖率。

  17. arXiv cs.CV20

    基于 AI 的多阶段雄激素性脱发评估框架,从低倍头皮图像实现自动分析

    研究提出一套自动化头皮分析与临床决策支持框架,结合毛囊单位定位、可见毛干计数、校准毛干宽度估计、区域聚合与可解释规则层,用于雄激素性脱发(AGA)评估。临床队列含 243 名患者(127 例 AGA、116 例非 AGA),计算机视觉实验使用 160 名专家标注患者、2,400 张毛发镜图像及约 158,000 条毛囊单位标注。