AgentLens 论文:1,136 条「通过」的 SWE-Agent 轨迹中 122 条是走运
arXiv 论文 AgentLens 将 1,136 条通过轨迹分为 Ideal(20.2%)、Solid(69.1%)和 Lucky(10.7%)三档,Lucky Pass 在八个模型后端间跨度达 46 倍,而 pass rate 排名与过程质量排名全部不一致。
arXiv 论文 AgentLens 将 1,136 条通过轨迹分为 Ideal(20.2%)、Solid(69.1%)和 Lucky(10.7%)三档,Lucky Pass 在八个模型后端间跨度达 46 倍,而 pass rate 排名与过程质量排名全部不一致。
发表于《Transactions of the Institute of Measurement and Control》的研究提出控制感知域对抗网络(CA-DANN),从"控制-诊断协同"视角切入变工况故障诊断。该方法以船用柴油机燃油喷射系统为对象,将主动控制信号与被动状态响应通过门控加权融合,并把传统二值域判别扩展为多类机动工况的细粒度对抗对齐,以消解工况调节与喷孔堵塞故障的表征混叠问题。
Wavestone 四位研究者发布 83 页论文《Harness Engineering》,逐行阅读 Claude Code、Codex CLI、Gemini CLI。
一篇关于 LSM-Tree 键值存储的论文提出更优的时空权衡方案。该 PDF 在 Hacker News 获得 18 分,暂无评论。
研究者基于钢琴 MIDI 预训练的 16 层 Transformer 模型 Aria,在 PiJAMA 数据集中十二位爵士钢琴家的独奏上微调,并在最后八层插入门控交叉注意力层,读取每位钢琴家的学习嵌入向量。生成片段被分类器判定为对应钢琴家的比例为 70%,无条件下仅为 37%;仅用生成音乐训练的第二个分类器识别真实录音的准确率达 95%。
一项在田纳西州 18 所中学开展的两年集群随机对照实验发现,使用 Khanmigo 辅导的学生每学期数学成绩提升约 1.3 个全国百分位,一学年约 0.06 至 0.08 个标准差,全年积极参与的隐含效应达 0.14 个标准差,与无 AI 辅助的 Khan Academy 练习效果相近。
研究团队提出 Dust,首个在预训练 Transformer 语言模型上可与反向传播竞争的第零阶方法,通过在每个 token 上独立扰动激活(节点扰动)实现虚拟种群,单次前向传播即可并行评估所有成员。
Opus 5.5 智能体通过密度泛函理论计算发现两种室温磁性半导体候选材料。其一是全新设计的 Luttinger 补偿磁体 YBaMnFeO₅,预测带隙 2.35 eV,空穴自旋窗口 1.0 eV、电子自旋窗口 1.4 eV;另一种是 1999 年首次合成的已知材料,计算预测其具备目标性质。
过去一年,OpenAI、Anthropic 等实验室宣布在多个长期数学难题上取得突破,部分成果超出研究者对现有系统能力的预期,其中包括解决一个著名的千禧年大奖难题。这些本应被庆祝的结果却引发学界反弹,AI 实验室表示正在从早期错误中吸取教训,但承诺能否兑现尚待观察。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线,可对比不同审查系统并提交自己的智能体。基准基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言的 219 个公开 PR,采用多来源 golden set 与统一评分标准,发布前由资深工程师独立复核,与基准判定一致率 96.6%。
推荐理由:GitHub 公开了代码审查基准的构建方法与离线到线上的验证数据,可据此判断评测信号是否可信。
MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的 agentic AI 项目能进入生产,遗留数据系统、安全隐私顾虑以及知识与上下文缺失是主要失败点。
MIT 于 2026 年 6 月发布的报告指出,AI 正在削弱大学体验的核心环节:到办公室答疑的学生减少、线上讨论参与度下降、宿舍和图书馆的学习小组变少,教师也越来越难判断学生真正学到了什么。
Hinton、Bengio等22位作者发表论文《What if automating AI R&D triggers an intelligence explosion?
研究者提出 ENCORE,首个精确的并行推理时控制方法,通过让每个副本存储生成轨迹,将向上移动变为截断,从而避免模拟难以处理的逆时间过程。该方法证明了目标不变性,并在合成目标、生物分子玻尔兹曼采样和图像生成中取得有竞争力的精度与多样性,还能应用于现有 RE 校正无法处理的蒸馏采样器。
研究提出 Expected Utility Regret(EUR)规则,可同时选择投资组合类别并估计其权重,在正则参数化收益模型中,单一 EUR 规则无需先验分布即可同时达到 minimax 与 Bayes 下界(含主常数项)。均值—方差组合与风险平价组合被推导为该框架的特例;当收益除以波动率的联合分布与资产顺序无关时,EUR 规则与风险平价组合一致。
研究者提出一种混合系统,将认知算法发现视为程序精化问题:人类构建的认知模型以概率程序形式交给一组 LLM 智能体,由其识别模型与行为的不匹配、在研究者设定的约束内提出代码级修改并验证结构保真度,修改结果再传入概率推理模块完成隐变量推理与数据似然计算。在暴露多种认知算法的问题解决范式人类行为数据上,修订后的模型拟合度持续优于原始模型,并揭示出一小组反复出现的创新。
研究提出广义 BG-a 噪声模型,在方差有界(a=0)与 BG-0 噪声(a=2)之间插值,并推导出增长相关的信息论下界 Ω(ε^-(4+a)) 及匹配上界。基于此设计的自适应批调度器在 C4 上预训练最高 1B 参数的 OLMo2 模型,在相同 token 预算下验证损失低于固定小批量与大批量训练,且迭代次数不到小批量训练的 10%。
研究者提出 DAWIS,一种统一滤波、固定滞后平滑与块平滑的数据同化方法,用多任务随机插值替代状态级先验的单一流时间,为窗口内每个连续状态分配独立流时间。同化循环将窗口反演为逐状态转折点向量并在观测引导下重新生成,从而在新观测到来时修正过去状态。在稀疏、含噪、非线性观测下,DAWIS 优于滤波和平滑基线,代码已开源。
HakemBench 是一个土耳其语类型化决策基准,模型需读取文本、问题与固定选项集,并为每个选项输出概率。1.0 版以 CC BY 4.0 完全开源,含 2,346 个条目、4,275 道选择题、是非题和评分题,覆盖事实核查分流、教育、护栏、法律路由、内容审核、垃圾邮件与钓鱼、客户支持七个赛道。
MapMergeLLM 将矢量化地图聚合建模为条件序列生成任务,由大语言模型直接预测聚合后的全局地图折线。该框架用模拟预测误差的合成局部地图训练,并引入几何感知预训练的坐标 tokenizer 与线级关联损失。在 Argoverse2 和 nuScenes 上,它无需针对特定检测器重训即大幅超越启发式与优化类聚合基线。
研究者提出自适应互蒸馏(AMD),一种协同后训练框架,同时训练两个采用不同任务平衡策略的模型,通过跨任务共享的短训练探针评估蒸馏权重调整,再按任务和迁移方向用验证分数择优。在六个基准和三个 LLM 主干上,两个 AMD 模型平均分均超过相同采样策略的 SFT 基线,合并后模型在三个主干上平均超出多任务 SFT 2.91 分。
研究发现,不完备线性自编码器在 PCA 解流形上,SGD 会偏好较大的解码器权重,产生有方向的尺度漂移。该漂移发生在慢时间尺度上,且具有可解析处理的有效描述,但最终会因有限步长稳定性边界而停止。所得解在损失 Hessian 最大特征值意义上比平衡基线更尖锐,但不同尖锐度度量可能方向相反。
研究者提出多智能体框架 MEA,由 Proposer 智能体按问题与模态选择并配置解释工具,Actor 智能体针对忠实度端到端优化,将输出转化为自然语言解释,覆盖表格、文本和视觉模态。
针对非结构化知识编辑中"上下文依赖"导致的原子事实召回失败问题,研究者提出即插即用框架 FOVEATED,通过随机偏移前文上下文 key 的 RoPE 位置构造聚焦视图,编辑时施加扰动、推理时移除,保持模型原生位置编码不变。该方法在五种知识编辑器、两个 LLM 主干和三个基准上均取得一致提升,并理论分析了其如何抵消上下文引起的难度低估。
SCOPE-4D 是一个内窥镜 4D 几何基础模型,可从单目 RGB 视频单次前向推理中联合预测相机参数、稠密几何与 3D 组织轨迹。团队构建了约 5,000 段真实与合成胃肠内窥镜及腹腔镜视频的 SCOPE-5K 数据集,并提出 Common–Residual Motion(CRM)约束局部形变。在公开及新采集基准上,该模型展现出更强的域内外几何估计、3D 跟踪与长序列结肠重建稳定性。
研究提出慢-快多教师在线策略蒸馏(SF-MOPD),通过将学生模型的指数移动平均作为"慢模型"能力参考,在 log-probability 空间剔除使快模型偏离慢模型的分量,保留对齐与正交分量。实验表明,SF-MOPD 在多模型规模上有效缓解能力干扰,增强多模态专业能力,并降低通用能力基准的平均退化,持续优于原版 MOPD。
研究者提出用扩散模型生成合成传感器数据窗口,对 CABiGRU 采用两阶段训练:先在合成数据上预训练,再在真实数据上微调。在 DEO(drinking/eating/other)数据集上,该流程取得 90.6% 的平衡准确率,优于强监督基线,缓解了少数类欠拟合问题。
研究评估了多个大语言模型在时间与事件表达抽取任务中的泛化能力,覆盖领域迁移、对抗扰动、组合性和长度增加四个维度。结果显示,基础任务表现强通常预示泛化更好,但在大幅分布偏移下这一关系减弱;归纳式提示词在各维度表现最稳定,而规模、架构及演绎、溯因提示策略的收益不均且依赖具体维度。该研究已被 AACL-IJCNLP 2026 Findings 接收。
语言智能体在任务中难以有效利用交互历史,即使打乱过往动作顺序,任务成功率也仅小幅下降,说明智能体未能可靠地将过去动作与其结果关联。将每个返回的观测显式标注为前一动作的结果,可在不引入新环境信息的情况下提升任务成功率并减少下一步动作重复。基于此,研究者提出一种学习型校准器,通过重新评估过往动作并选择性记录经验来指导后续决策,效果优于单纯的结果标注。
OctLLM 提出用八叉树占用 token 构成的显式 3D 序列来表示几何,并通过随机清空倒数第二层节点、省略其后代得到更短的 S-Octree,用于位置感知的掩码建模生成与 3D 理解。
研究者提出 Sigma,首个大规模(3B/8B)连续扩散语言模型,基于可操控的低维 ODE/SDE 潜轨迹,按块通过似然优化训练,并利用自回归模型预训练权重热启动。
研究者推出 PowerBench,用于评估语言模型在权力转移请求中的偏见,区分自我赋权、去权和夺权三类请求,并设置不涉及权力转移的拒绝诱导请求作为对照。该基准开源了覆盖不同权力领域、情境、受影响方规模和用户原有权力地位的数据集,在三种实验条件下评测了 24 个模型(12 个来自美国、12 个来自中国开发者)。
FiberGeoText(FGT)是一种视觉语言模型,可将超高分辨率扩散 MRI 重建的浅表白质(SWM)短程纤维束组织为群体级聚类,它联合表征每条纤维束的三维轨迹、皮层解剖上下文与形状,并用预训练 LLM 编码多种脑区划分方案生成的文本化皮层端点信息。
针对 LoRA 在持续学习中出现的"谱可塑性崩溃"问题,研究者提出 MuLoRA,通过历史白化与动量更新的近似极正交化,联合控制低秩空间的容量分配与利用。在五个类增量基准、八种增量设置共 16 项指标中,MuLoRA 在其中 15 项取得最高平均准确率。
研究者提出一种基于仿真的 VLM 框架,可将 2D 野火模拟自动转换为带标注的视频片段,并作为免训练多智能体 VLM 系统的可复用多模态记忆。在留出生成片段上,视频记忆的四标签精确准确率达 51.5%,直接查询 VLM 为 22.6%,纯文本记忆仅 16-17%;完整系统在六个模拟器报告字段上准确率为 77.3%。该框架还通过组件消融、跨生成器测试和三次真实无人机评估验证了检索与报告能力。
研究用欧洲蝙蝠录音构建自然 IPI 与 50-ms 归一化 IPI 两组数据集,微调 EfficientNet-B0 和 PaSST 后发现 IPI 归一化影响因模型而异:PaSST 准确率从 71% 微降至 70%,EfficientNet 则从 47% 升至 57%,PaSST 两种条件下均优于 EfficientNet。
研究用 Mixture-of-Agents(MoA)方法测量单个 token 实际所需的计算量:由 Qwen、OLMo、R1-distilled 三个模型族共十五个不同规模模型逐 token 复现参考序列,以最小成功模型的推理成本作为该 token 的充分算力。
EviDent-CBCT 提出一种证据瓶颈式框架,用于在报告监督不完整的情况下从牙科 CBCT 生成报告:解剖感知网络将每次扫描映射为离散的牙级、全局及 tooth-IAC 证据记录,再由牙科逻辑一致性投影与确定性渲染器配合图像盲本地语言模型生成报告。
HyMLRaman 混合框架结合深度光谱特征提取、生成模型与经典机器学习分类器,可识别阿莫西林、氯霉素、环丙沙星、四环素、布洛芬、对乙酰氨基酚六种药物化合物。
研究者提出 ReRoute 框架,将事实数据与部分机制知识结合,无需受控干预数据即可对预训练骨干模型进行反事实预测。在气候仿真任务中,面对严重 CO₂ 分布偏移,ReRoute 将聚合气候误差降低 18.2-31.8%,同时保持标准条件下的性能,成本仅为用额外受控模拟数据重训练的很小一部分。该构造的因果识别结果已在 Lean 中完成机器验证。