跳到正文
今天10月7日周三1093 条
  1. arXiv cs.AI34

    EPOCH:通过证据治理搜索实现可靠发现

    EPOCH 是一种证据治理架构,通过显式任务契约、类型化记忆、主动证伪、准入检查和独立重放构建发现循环,让每个候选方案按其支撑主张的强度与范围接受评估。它在 AlgoTune 上取得 SOTA 聚合表现,平均归一化得分 0.65 对最强基线 0.53,并在内部 Math14 套件上取得最高平均分 0.57。在十个发现问题上,EPOCH 产出可执行构造、优化算法、反例和带证明支持的结果。

  2. arXiv cs.AI31

    SAGA:通过知识抽象实现 LLM 智能体自我进化

    针对 LLM 智能体难以从经验中持续进化的问题,研究者提出 SAGA 框架,将交互轨迹逐步抽象为情景描述、可复用流程和带明确适用条件的原理,并保留与执行证据的关联。检索到的原理会被实例化为任务专属指导,通过纠正反馈与重采样优化候选动作,形成执行—抽象反馈闭环。在 ScienceWorld 和 ALFWorld 上的实验显示任务表现提升,消融研究验证了上下文实例化与动作调控对利用原理级知识的重要性。

  3. arXiv cs.AI22

    视觉 Transformer 如何通过转喻回路为抽象概念奠基

    研究揭示 Vision Transformer 通过"转喻式奠基"机制识别抽象概念:在 CLIP 和 DINO 视觉编码器上应用 Transcoders 后发现,抽象预测由"火"等具体可解释的锚概念驱动,感知原语主导浅层、类物体锚点先于抽象目标出现,含渲染文字的图像则走独立的感知到文本路径。因果干预实验验证这些转喻中间特征确实参与抽象概念奠基。该成果发表于 EMNLP 2026 主会。

  4. arXiv cs.AI36

    GameGo:用真实资产锚定的合成轨迹训练游戏开发智能体

    研究团队提出 GameGo 框架,将简短游戏创意系统化转化为基于行业实践的产品需求文档,并构建了覆盖 2D、2.5D、3D 游戏的 55,060 条开发轨迹数据集 GameGoData 及含 124 个游戏查询的 GameGoBench。基于该数据训练的 GameGoCoder 在游戏开发基准上超越同类基线,性能接近前沿模型。代码、数据集与模型将全部公开。

10月6日周二
  1. 掘金18

    只盯被动响应做状态监测?论"控制信号"在变工况故障诊断中的重要作用

    发表于《Transactions of the Institute of Measurement and Control》的研究提出控制感知域对抗网络(CA-DANN),从"控制-诊断协同"视角切入变工况故障诊断。该方法以船用柴油机燃油喷射系统为对象,将主动控制信号与被动状态响应通过门控加权融合,并把传统二值域判别扩展为多类机动工况的细粒度对抗对齐,以消解工况调节与喷孔堵塞故障的表征混叠问题。

  2. Hacker News30

    用交叉注意力条件化学习爵士钢琴家风格

    研究者基于钢琴 MIDI 预训练的 16 层 Transformer 模型 Aria,在 PiJAMA 数据集中十二位爵士钢琴家的独奏上微调,并在最后八层插入门控交叉注意力层,读取每位钢琴家的学习嵌入向量。生成片段被分类器判定为对应钢琴家的比例为 70%,无条件下仅为 37%;仅用生成音乐训练的第二个分类器识别真实录音的准确率达 95%。

10月5日周一
  1. GitHub Blog · AI & ML60

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线,可对比不同审查系统并提交自己的智能体。基准基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言的 219 个公开 PR,采用多来源 golden set 与统一评分标准,发布前由资深工程师独立复核,与基准判定一致率 96.6%。

    推荐理由:GitHub 公开了代码审查基准的构建方法与离线到线上的验证数据,可据此判断评测信号是否可信。

  2. arXiv stat.ML22

    ENCORE:用副本交换实现扩散生成精确非平衡控制

    研究者提出 ENCORE,首个精确的并行推理时控制方法,通过让每个副本存储生成轨迹,将向上移动变为截断,从而避免模拟难以处理的逆时间过程。该方法证明了目标不变性,并在合成目标、生物分子玻尔兹曼采样和图像生成中取得有竞争力的精度与多样性,还能应用于现有 RE 校正无法处理的蒸馏采样器。

  3. arXiv stat.ML12

    Expected Utility Regret 规则:投资组合选择的 Minimax 与 Bayes 最优解

    研究提出 Expected Utility Regret(EUR)规则,可同时选择投资组合类别并估计其权重,在正则参数化收益模型中,单一 EUR 规则无需先验分布即可同时达到 minimax 与 Bayes 下界(含主常数项)。均值—方差组合与风险平价组合被推导为该框架的特例;当收益除以波动率的联合分布与资产顺序无关时,EUR 规则与风险平价组合一致。

  4. arXiv cs.AI24

    用程序精化与 LLM 智能体发现认知算法

    研究者提出一种混合系统,将认知算法发现视为程序精化问题:人类构建的认知模型以概率程序形式交给一组 LLM 智能体,由其识别模型与行为的不匹配、在研究者设定的约束内提出代码级修改并验证结构保真度,修改结果再传入概率推理模块完成隐变量推理与数据似然计算。在暴露多种认知算法的问题解决范式人类行为数据上,修订后的模型拟合度持续优于原始模型,并揭示出一小组反复出现的创新。

  5. arXiv cs.LG24

    自适应批处理为何有助于 LLM 预训练?无界方差视角下的解释

    研究提出广义 BG-a 噪声模型,在方差有界(a=0)与 BG-0 噪声(a=2)之间插值,并推导出增长相关的信息论下界 Ω(ε^-(4+a)) 及匹配上界。基于此设计的自适应批调度器在 C4 上预训练最高 1B 参数的 OLMo2 模型,在相同 token 预算下验证损失低于固定小批量与大批量训练,且迭代次数不到小批量训练的 10%。

  6. arXiv stat.ML26

    DAWIS:基于多任务插值的窗口逆采样数据同化方法

    研究者提出 DAWIS,一种统一滤波、固定滞后平滑与块平滑的数据同化方法,用多任务随机插值替代状态级先验的单一流时间,为窗口内每个连续状态分配独立流时间。同化循环将窗口反演为逐状态转折点向量并在观测引导下重新生成,从而在新观测到来时修正过去状态。在稀疏、含噪、非线性观测下,DAWIS 优于滤波和平滑基线,代码已开源。

  7. arXiv cs.CL15

    HakemBench:土耳其语类型化决策基准发布

    HakemBench 是一个土耳其语类型化决策基准,模型需读取文本、问题与固定选项集,并为每个选项输出概率。1.0 版以 CC BY 4.0 完全开源,含 2,346 个条目、4,275 道选择题、是非题和评分题,覆盖事实核查分流、教育、护栏、法律路由、内容审核、垃圾邮件与钓鱼、客户支持七个赛道。

  8. arXiv cs.CV22

    MapMergeLLM:用大语言模型实现矢量化地图聚合

    MapMergeLLM 将矢量化地图聚合建模为条件序列生成任务,由大语言模型直接预测聚合后的全局地图折线。该框架用模拟预测误差的合成局部地图训练,并引入几何感知预训练的坐标 tokenizer 与线级关联损失。在 Argoverse2 和 nuScenes 上,它无需针对特定检测器重训即大幅超越启发式与优化类聚合基线。

  9. arXiv cs.CL22

    面向大语言模型多任务后训练的自适应互蒸馏框架 AMD

    研究者提出自适应互蒸馏(AMD),一种协同后训练框架,同时训练两个采用不同任务平衡策略的模型,通过跨任务共享的短训练探针评估蒸馏权重调整,再按任务和迁移方向用验证分数择优。在六个基准和三个 LLM 主干上,两个 AMD 模型平均分均超过相同采样策略的 SFT 基线,合并后模型在三个主干上平均超出多任务 SFT 2.91 分。

  10. arXiv stat.ML12

    不完备线性自编码器中的尺度对称性破缺

    研究发现,不完备线性自编码器在 PCA 解流形上,SGD 会偏好较大的解码器权重,产生有方向的尺度漂移。该漂移发生在慢时间尺度上,且具有可解析处理的有效描述,但最终会因有限步长稳定性边界而停止。所得解在损失 Hessian 最大特征值意义上比平衡基线更尖锐,但不同尖锐度度量可能方向相反。

  11. arXiv cs.CL22

    FOVEATED:用聚焦视图提升非结构化知识编辑中的原子事实召回

    针对非结构化知识编辑中"上下文依赖"导致的原子事实召回失败问题,研究者提出即插即用框架 FOVEATED,通过随机偏移前文上下文 key 的 RoPE 位置构造聚焦视图,编辑时施加扰动、推理时移除,保持模型原生位置编码不变。该方法在五种知识编辑器、两个 LLM 主干和三个基准上均取得一致提升,并理论分析了其如何抵消上下文引起的难度低估。

  12. arXiv cs.CV24

    SCOPE-4D:内窥镜 4D 几何基础模型

    SCOPE-4D 是一个内窥镜 4D 几何基础模型,可从单目 RGB 视频单次前向推理中联合预测相机参数、稠密几何与 3D 组织轨迹。团队构建了约 5,000 段真实与合成胃肠内窥镜及腹腔镜视频的 SCOPE-5K 数据集,并提出 Common–Residual Motion(CRM)约束局部形变。在公开及新采集基准上,该模型展现出更强的域内外几何估计、3D 跟踪与长序列结肠重建稳定性。

  13. arXiv cs.LG22

    SF-MOPD:慢-快多教师在线策略蒸馏如何缓解能力干扰

    研究提出慢-快多教师在线策略蒸馏(SF-MOPD),通过将学生模型的指数移动平均作为"慢模型"能力参考,在 log-probability 空间剔除使快模型偏离慢模型的分量,保留对齐与正交分量。实验表明,SF-MOPD 在多模型规模上有效缓解能力干扰,增强多模态专业能力,并降低通用能力基准的平均退化,持续优于原版 MOPD。