EPOCH:通过证据治理搜索实现可靠发现
EPOCH 是一种证据治理架构,通过显式任务契约、类型化记忆、主动证伪、准入检查和独立重放构建发现循环,让每个候选方案按其支撑主张的强度与范围接受评估。它在 AlgoTune 上取得 SOTA 聚合表现,平均归一化得分 0.65 对最强基线 0.53,并在内部 Math14 套件上取得最高平均分 0.57。在十个发现问题上,EPOCH 产出可执行构造、优化算法、反例和带证明支持的结果。
EPOCH 是一种证据治理架构,通过显式任务契约、类型化记忆、主动证伪、准入检查和独立重放构建发现循环,让每个候选方案按其支撑主张的强度与范围接受评估。它在 AlgoTune 上取得 SOTA 聚合表现,平均归一化得分 0.65 对最强基线 0.53,并在内部 Math14 套件上取得最高平均分 0.57。在十个发现问题上,EPOCH 产出可执行构造、优化算法、反例和带证明支持的结果。
AegisFlow 是一个基于 LLM 的多智能体框架,通过 Watchdog 与 Repair 智能体自动生成、测试并部署代码补丁,在五类常见故障场景下将 MTTR 从平均 170 分钟降至 3.2 分钟,补丁成功率达 92%。
针对 LLM 智能体难以从经验中持续进化的问题,研究者提出 SAGA 框架,将交互轨迹逐步抽象为情景描述、可复用流程和带明确适用条件的原理,并保留与执行证据的关联。检索到的原理会被实例化为任务专属指导,通过纠正反馈与重采样优化候选动作,形成执行—抽象反馈闭环。在 ScienceWorld 和 ALFWorld 上的实验显示任务表现提升,消融研究验证了上下文实例化与动作调控对利用原理级知识的重要性。
研究揭示 Vision Transformer 通过"转喻式奠基"机制识别抽象概念:在 CLIP 和 DINO 视觉编码器上应用 Transcoders 后发现,抽象预测由"火"等具体可解释的锚概念驱动,感知原语主导浅层、类物体锚点先于抽象目标出现,含渲染文字的图像则走独立的感知到文本路径。因果干预实验验证这些转喻中间特征确实参与抽象概念奠基。该成果发表于 EMNLP 2026 主会。
RadOnc-Agent 是一个将放疗流程形式化为四个临床阶段、并通过对话界面提供 26 个可调用函数的智能体框架,由大语言模型控制器将临床意图映射为受 schema 约束的调用。
研究者提出 Anchor Divergences,通过对比学习、指数族与信息几何的相互作用,在固定表示上建立锚点概率分布与 Bregman 几何之间的对应关系,从而为特定语义结构定制几何度量。检索实验显示,该方法能高效指定上下文相关的语义相似度。代码已开源。
FluidPD 是一个面向 SLO 的 P/D 分离 LLM 服务系统,通过 FluidToken 将部分预填充计算卸载到空闲的解码 worker 以应对瞬时失衡,并用 FluidRole 原地切换运行中 worker 的预填充/解码角色以应对持续失衡,避免模型重载与引擎重启。
Text2Dashboard 是面向 DataBrain 的原型系统,通过可安装 Codex 插件与独立 Agent Runtime,将自然语言分析请求转化为可审查的仪表盘,由确定性软件控制执行并记录状态变更。
研究团队提出 GameGo 框架,将简短游戏创意系统化转化为基于行业实践的产品需求文档,并构建了覆盖 2D、2.5D、3D 游戏的 55,060 条开发轨迹数据集 GameGoData 及含 124 个游戏查询的 GameGoBench。基于该数据训练的 GameGoCoder 在游戏开发基准上超越同类基线,性能接近前沿模型。代码、数据集与模型将全部公开。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线,可对比不同审查系统并提交自己的智能体。基准基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言的 219 个公开 PR,采用多来源 golden set 与统一评分标准,发布前由资深工程师独立复核,与基准判定一致率 96.6%。
推荐理由:GitHub 公开了代码审查基准的构建方法与离线到线上的验证数据,可据此判断评测信号是否可信。
研究者提出 ENCORE,首个精确的并行推理时控制方法,通过让每个副本存储生成轨迹,将向上移动变为截断,从而避免模拟难以处理的逆时间过程。该方法证明了目标不变性,并在合成目标、生物分子玻尔兹曼采样和图像生成中取得有竞争力的精度与多样性,还能应用于现有 RE 校正无法处理的蒸馏采样器。
研究提出 Expected Utility Regret(EUR)规则,可同时选择投资组合类别并估计其权重,在正则参数化收益模型中,单一 EUR 规则无需先验分布即可同时达到 minimax 与 Bayes 下界(含主常数项)。均值—方差组合与风险平价组合被推导为该框架的特例;当收益除以波动率的联合分布与资产顺序无关时,EUR 规则与风险平价组合一致。
研究者提出一种混合系统,将认知算法发现视为程序精化问题:人类构建的认知模型以概率程序形式交给一组 LLM 智能体,由其识别模型与行为的不匹配、在研究者设定的约束内提出代码级修改并验证结构保真度,修改结果再传入概率推理模块完成隐变量推理与数据似然计算。在暴露多种认知算法的问题解决范式人类行为数据上,修订后的模型拟合度持续优于原始模型,并揭示出一小组反复出现的创新。
研究提出广义 BG-a 噪声模型,在方差有界(a=0)与 BG-0 噪声(a=2)之间插值,并推导出增长相关的信息论下界 Ω(ε^-(4+a)) 及匹配上界。基于此设计的自适应批调度器在 C4 上预训练最高 1B 参数的 OLMo2 模型,在相同 token 预算下验证损失低于固定小批量与大批量训练,且迭代次数不到小批量训练的 10%。
研究者提出 DAWIS,一种统一滤波、固定滞后平滑与块平滑的数据同化方法,用多任务随机插值替代状态级先验的单一流时间,为窗口内每个连续状态分配独立流时间。同化循环将窗口反演为逐状态转折点向量并在观测引导下重新生成,从而在新观测到来时修正过去状态。在稀疏、含噪、非线性观测下,DAWIS 优于滤波和平滑基线,代码已开源。
HakemBench 是一个土耳其语类型化决策基准,模型需读取文本、问题与固定选项集,并为每个选项输出概率。1.0 版以 CC BY 4.0 完全开源,含 2,346 个条目、4,275 道选择题、是非题和评分题,覆盖事实核查分流、教育、护栏、法律路由、内容审核、垃圾邮件与钓鱼、客户支持七个赛道。
MapMergeLLM 将矢量化地图聚合建模为条件序列生成任务,由大语言模型直接预测聚合后的全局地图折线。该框架用模拟预测误差的合成局部地图训练,并引入几何感知预训练的坐标 tokenizer 与线级关联损失。在 Argoverse2 和 nuScenes 上,它无需针对特定检测器重训即大幅超越启发式与优化类聚合基线。
研究者提出自适应互蒸馏(AMD),一种协同后训练框架,同时训练两个采用不同任务平衡策略的模型,通过跨任务共享的短训练探针评估蒸馏权重调整,再按任务和迁移方向用验证分数择优。在六个基准和三个 LLM 主干上,两个 AMD 模型平均分均超过相同采样策略的 SFT 基线,合并后模型在三个主干上平均超出多任务 SFT 2.91 分。
研究发现,不完备线性自编码器在 PCA 解流形上,SGD 会偏好较大的解码器权重,产生有方向的尺度漂移。该漂移发生在慢时间尺度上,且具有可解析处理的有效描述,但最终会因有限步长稳定性边界而停止。所得解在损失 Hessian 最大特征值意义上比平衡基线更尖锐,但不同尖锐度度量可能方向相反。
研究者提出多智能体框架 MEA,由 Proposer 智能体按问题与模态选择并配置解释工具,Actor 智能体针对忠实度端到端优化,将输出转化为自然语言解释,覆盖表格、文本和视觉模态。
针对非结构化知识编辑中"上下文依赖"导致的原子事实召回失败问题,研究者提出即插即用框架 FOVEATED,通过随机偏移前文上下文 key 的 RoPE 位置构造聚焦视图,编辑时施加扰动、推理时移除,保持模型原生位置编码不变。该方法在五种知识编辑器、两个 LLM 主干和三个基准上均取得一致提升,并理论分析了其如何抵消上下文引起的难度低估。
SCOPE-4D 是一个内窥镜 4D 几何基础模型,可从单目 RGB 视频单次前向推理中联合预测相机参数、稠密几何与 3D 组织轨迹。团队构建了约 5,000 段真实与合成胃肠内窥镜及腹腔镜视频的 SCOPE-5K 数据集,并提出 Common–Residual Motion(CRM)约束局部形变。在公开及新采集基准上,该模型展现出更强的域内外几何估计、3D 跟踪与长序列结肠重建稳定性。
研究提出慢-快多教师在线策略蒸馏(SF-MOPD),通过将学生模型的指数移动平均作为"慢模型"能力参考,在 log-probability 空间剔除使快模型偏离慢模型的分量,保留对齐与正交分量。实验表明,SF-MOPD 在多模型规模上有效缓解能力干扰,增强多模态专业能力,并降低通用能力基准的平均退化,持续优于原版 MOPD。
研究者提出用扩散模型生成合成传感器数据窗口,对 CABiGRU 采用两阶段训练:先在合成数据上预训练,再在真实数据上微调。在 DEO(drinking/eating/other)数据集上,该流程取得 90.6% 的平衡准确率,优于强监督基线,缓解了少数类欠拟合问题。
研究评估了多个大语言模型在时间与事件表达抽取任务中的泛化能力,覆盖领域迁移、对抗扰动、组合性和长度增加四个维度。结果显示,基础任务表现强通常预示泛化更好,但在大幅分布偏移下这一关系减弱;归纳式提示词在各维度表现最稳定,而规模、架构及演绎、溯因提示策略的收益不均且依赖具体维度。该研究已被 AACL-IJCNLP 2026 Findings 接收。
语言智能体在任务中难以有效利用交互历史,即使打乱过往动作顺序,任务成功率也仅小幅下降,说明智能体未能可靠地将过去动作与其结果关联。将每个返回的观测显式标注为前一动作的结果,可在不引入新环境信息的情况下提升任务成功率并减少下一步动作重复。基于此,研究者提出一种学习型校准器,通过重新评估过往动作并选择性记录经验来指导后续决策,效果优于单纯的结果标注。
OctLLM 提出用八叉树占用 token 构成的显式 3D 序列来表示几何,并通过随机清空倒数第二层节点、省略其后代得到更短的 S-Octree,用于位置感知的掩码建模生成与 3D 理解。
研究者提出 Sigma,首个大规模(3B/8B)连续扩散语言模型,基于可操控的低维 ODE/SDE 潜轨迹,按块通过似然优化训练,并利用自回归模型预训练权重热启动。
研究者推出 PowerBench,用于评估语言模型在权力转移请求中的偏见,区分自我赋权、去权和夺权三类请求,并设置不涉及权力转移的拒绝诱导请求作为对照。该基准开源了覆盖不同权力领域、情境、受影响方规模和用户原有权力地位的数据集,在三种实验条件下评测了 24 个模型(12 个来自美国、12 个来自中国开发者)。
FiberGeoText(FGT)是一种视觉语言模型,可将超高分辨率扩散 MRI 重建的浅表白质(SWM)短程纤维束组织为群体级聚类,它联合表征每条纤维束的三维轨迹、皮层解剖上下文与形状,并用预训练 LLM 编码多种脑区划分方案生成的文本化皮层端点信息。
针对 LoRA 在持续学习中出现的"谱可塑性崩溃"问题,研究者提出 MuLoRA,通过历史白化与动量更新的近似极正交化,联合控制低秩空间的容量分配与利用。在五个类增量基准、八种增量设置共 16 项指标中,MuLoRA 在其中 15 项取得最高平均准确率。
研究者提出一种基于仿真的 VLM 框架,可将 2D 野火模拟自动转换为带标注的视频片段,并作为免训练多智能体 VLM 系统的可复用多模态记忆。在留出生成片段上,视频记忆的四标签精确准确率达 51.5%,直接查询 VLM 为 22.6%,纯文本记忆仅 16-17%;完整系统在六个模拟器报告字段上准确率为 77.3%。该框架还通过组件消融、跨生成器测试和三次真实无人机评估验证了检索与报告能力。
研究用欧洲蝙蝠录音构建自然 IPI 与 50-ms 归一化 IPI 两组数据集,微调 EfficientNet-B0 和 PaSST 后发现 IPI 归一化影响因模型而异:PaSST 准确率从 71% 微降至 70%,EfficientNet 则从 47% 升至 57%,PaSST 两种条件下均优于 EfficientNet。
研究用 Mixture-of-Agents(MoA)方法测量单个 token 实际所需的计算量:由 Qwen、OLMo、R1-distilled 三个模型族共十五个不同规模模型逐 token 复现参考序列,以最小成功模型的推理成本作为该 token 的充分算力。
EviDent-CBCT 提出一种证据瓶颈式框架,用于在报告监督不完整的情况下从牙科 CBCT 生成报告:解剖感知网络将每次扫描映射为离散的牙级、全局及 tooth-IAC 证据记录,再由牙科逻辑一致性投影与确定性渲染器配合图像盲本地语言模型生成报告。
HyMLRaman 混合框架结合深度光谱特征提取、生成模型与经典机器学习分类器,可识别阿莫西林、氯霉素、环丙沙星、四环素、布洛芬、对乙酰氨基酚六种药物化合物。
研究者提出 ReRoute 框架,将事实数据与部分机制知识结合,无需受控干预数据即可对预训练骨干模型进行反事实预测。在气候仿真任务中,面对严重 CO₂ 分布偏移,ReRoute 将聚合气候误差降低 18.2-31.8%,同时保持标准条件下的性能,成本仅为用额外受控模拟数据重训练的很小一部分。该构造的因果识别结果已在 Lean 中完成机器验证。
SDECast 是一个基于 Neural SDE 的连续时间概率天气预报框架,通过扩展 SDE Matching 直接在物理空间学习随机动力学,训练时无需反复进行 SDE 模拟。
研究团队发布 O*NET-BENCH 审计套件,基于 45,796 份工人评分调查,在 4,501 条测试评分上评估了 6 个模型家族的 33 种评审配置。25 种配置的 pair accuracy 达到 0.60 以上,但评审给出的可接受回答比例在 3.0%-97.9% 之间,而职业匹配工人的接受率为 61.1%。
EpiWorld 是一个闭环框架,将 LLM 政策智能体锚定在动作条件流行病学世界模型和分层技能库上,通过反事实推演为政策选择提供反馈。在 COVID-19 和 Influenza 回顾性数据集上,该世界模型取得所有预测基线中最佳的分布外 Peak-MAE,闭环框架将累计住院率最多降低 59%,在六个 LLM 骨干上平均降低约 16%,优于强化学习和最优控制基线。