TopoPlanner:面向 LLM 智能体的拓扑一致任务规划框架
TopoPlanner 将工具依赖图提升为 cellular workflow complexes,作为拓扑感知上下文供 LLM 进行工具规划,通过 cosheaf 一致检索获取请求相关的闭合子复形,并对检索到的拓扑做多维结构推理后生成工具序列。在四个工具规划基准上,针对 loop、merge 及 loop-merge 工作流,该方法在不同本地 LLM 骨干上均优于基于提示词和图增强的基线。
TopoPlanner 将工具依赖图提升为 cellular workflow complexes,作为拓扑感知上下文供 LLM 进行工具规划,通过 cosheaf 一致检索获取请求相关的闭合子复形,并对检索到的拓扑做多维结构推理后生成工具序列。在四个工具规划基准上,针对 loop、merge 及 loop-merge 工作流,该方法在不同本地 LLM 骨干上均优于基于提示词和图增强的基线。
基于北京和成都路网速度数据构建的离线代理任务显示,联合校准上界可将路径覆盖率从83.19%提升至92.26%(北京M1)、75.14%至88.33%(成都M1)、74.01%至90.64%(成都M2),但C2策略分别使迟到率增加0.1633、0.7848、0.9200个百分点,平均出行时间增加0.588、3.082、4.418秒。
一项基于安徽宣城 29 天重建需求数据的分层诊断研究显示,入口级和车流级预测相对历史均值分别降低 4.03% 和 3.92% 的平均绝对误差,但因果预测与五秒事件 oracle 在冻结测试日反而使排队车秒数增加 6.09% 和 3.39%。
EPOCH 是一种证据治理架构,通过显式任务契约、类型化记忆、主动证伪、准入检查和独立重放构建发现循环,让每个候选方案按其支撑主张的强度与范围接受评估。它在 AlgoTune 上取得 SOTA 聚合表现,平均归一化得分 0.65 对最强基线 0.53,并在内部 Math14 套件上取得最高平均分 0.57。在十个发现问题上,EPOCH 产出可执行构造、优化算法、反例和带证明支持的结果。
AegisFlow 是一个基于 LLM 的多智能体框架,通过 Watchdog 与 Repair 智能体自动生成、测试并部署代码补丁,在五类常见故障场景下将 MTTR 从平均 170 分钟降至 3.2 分钟,补丁成功率达 92%。
针对 LLM 智能体难以从经验中持续进化的问题,研究者提出 SAGA 框架,将交互轨迹逐步抽象为情景描述、可复用流程和带明确适用条件的原理,并保留与执行证据的关联。检索到的原理会被实例化为任务专属指导,通过纠正反馈与重采样优化候选动作,形成执行—抽象反馈闭环。在 ScienceWorld 和 ALFWorld 上的实验显示任务表现提升,消融研究验证了上下文实例化与动作调控对利用原理级知识的重要性。
研究揭示 Vision Transformer 通过"转喻式奠基"机制识别抽象概念:在 CLIP 和 DINO 视觉编码器上应用 Transcoders 后发现,抽象预测由"火"等具体可解释的锚概念驱动,感知原语主导浅层、类物体锚点先于抽象目标出现,含渲染文字的图像则走独立的感知到文本路径。因果干预实验验证这些转喻中间特征确实参与抽象概念奠基。该成果发表于 EMNLP 2026 主会。
RadOnc-Agent 是一个将放疗流程形式化为四个临床阶段、并通过对话界面提供 26 个可调用函数的智能体框架,由大语言模型控制器将临床意图映射为受 schema 约束的调用。
研究者提出 Anchor Divergences,通过对比学习、指数族与信息几何的相互作用,在固定表示上建立锚点概率分布与 Bregman 几何之间的对应关系,从而为特定语义结构定制几何度量。检索实验显示,该方法能高效指定上下文相关的语义相似度。代码已开源。
FluidPD 是一个面向 SLO 的 P/D 分离 LLM 服务系统,通过 FluidToken 将部分预填充计算卸载到空闲的解码 worker 以应对瞬时失衡,并用 FluidRole 原地切换运行中 worker 的预填充/解码角色以应对持续失衡,避免模型重载与引擎重启。
Text2Dashboard 是面向 DataBrain 的原型系统,通过可安装 Codex 插件与独立 Agent Runtime,将自然语言分析请求转化为可审查的仪表盘,由确定性软件控制执行并记录状态变更。
研究团队提出 GameGo 框架,将简短游戏创意系统化转化为基于行业实践的产品需求文档,并构建了覆盖 2D、2.5D、3D 游戏的 55,060 条开发轨迹数据集 GameGoData 及含 124 个游戏查询的 GameGoBench。基于该数据训练的 GameGoCoder 在游戏开发基准上超越同类基线,性能接近前沿模型。代码、数据集与模型将全部公开。
OpenAI 公开 722 篇数学手稿,归为 372 组结果,出自一个尚未发布的内部模型,论文、源码和部分 Lean 证明已上传 GitHub。内容涉及准黎曼猜想、霍奇猜想、BSD 猜想、π 的无理性指数等,模型此前尝试约 4000 个研究问题,平均每项结果算力约相当于 ChatGPT Pro 思考 3 小时。
推荐理由:OpenAI 一次性公开 722 篇数学手稿,读者可了解其覆盖范围与数学界对核验进度的保留态度。
研究者提出 UniEvo-VL 自进化框架,让单个多模态模型以不同上下文分别充当教师和学生,利用自身批判作为特权信息,通过最小化去噪扩散分布差异实现自我改进。基于开源 Qwen-image-2512,GenEval 分数从 0.747 提升至 0.808,GenEval2 Soft-TIFA 从 32.97 提升至 35.53。
OpenAI 在数学预印本中提出一种整数乘法算法,复杂度低于 n log n。该结果以 OpenAI Math Release 预印本形式发布,作者署名 OpenAI。
OpenAI 以 722 篇手稿的形式公开了一批数学问题解答,覆盖 372 个结果族,据 AGMAI 称其中包含对“数百个”开放问题的解答。这些结果由一个未发布的前沿模型产出,OpenAI 称“平均结果”相当于 ChatGPT Pro 思考三小时,并同时公布了部分推理摘要、算力估算和尝试问题数量等细节。
OpenAI 在 GitHub 上公开了数学方向的 AI 研究进展,并提供了预印本目录。相关仓库地址为 github.com/openai/math,预印本位于其 preprints 子目录。
PhAI Labs 联合斯坦福、牛津、普林斯顿的研究者提出 JEPA-Anything,把 JEPA 的预测状态拆成四个正交因子、各由独立预测模块处理,再重组为完整世界状态,从而在物理、机器人、天气、单细胞和临床等七个领域共用一套架构。
arXiv 论文 AgentLens 将 1,136 条通过轨迹分为 Ideal(20.2%)、Solid(69.1%)和 Lucky(10.7%)三档,Lucky Pass 在八个模型后端间跨度达 46 倍,而 pass rate 排名与过程质量排名全部不一致。
发表于《Transactions of the Institute of Measurement and Control》的研究提出控制感知域对抗网络(CA-DANN),从"控制-诊断协同"视角切入变工况故障诊断。该方法以船用柴油机燃油喷射系统为对象,将主动控制信号与被动状态响应通过门控加权融合,并把传统二值域判别扩展为多类机动工况的细粒度对抗对齐,以消解工况调节与喷孔堵塞故障的表征混叠问题。
Wavestone 四位研究者发布 83 页论文《Harness Engineering》,逐行阅读 Claude Code、Codex CLI、Gemini CLI。
一篇关于 LSM-Tree 键值存储的论文提出更优的时空权衡方案。该 PDF 在 Hacker News 获得 18 分,暂无评论。
研究者基于钢琴 MIDI 预训练的 16 层 Transformer 模型 Aria,在 PiJAMA 数据集中十二位爵士钢琴家的独奏上微调,并在最后八层插入门控交叉注意力层,读取每位钢琴家的学习嵌入向量。生成片段被分类器判定为对应钢琴家的比例为 70%,无条件下仅为 37%;仅用生成音乐训练的第二个分类器识别真实录音的准确率达 95%。
一项在田纳西州 18 所中学开展的两年集群随机对照实验发现,使用 Khanmigo 辅导的学生每学期数学成绩提升约 1.3 个全国百分位,一学年约 0.06 至 0.08 个标准差,全年积极参与的隐含效应达 0.14 个标准差,与无 AI 辅助的 Khan Academy 练习效果相近。
研究团队提出 Dust,首个在预训练 Transformer 语言模型上可与反向传播竞争的第零阶方法,通过在每个 token 上独立扰动激活(节点扰动)实现虚拟种群,单次前向传播即可并行评估所有成员。
Opus 5.5 智能体通过密度泛函理论计算发现两种室温磁性半导体候选材料。其一是全新设计的 Luttinger 补偿磁体 YBaMnFeO₅,预测带隙 2.35 eV,空穴自旋窗口 1.0 eV、电子自旋窗口 1.4 eV;另一种是 1999 年首次合成的已知材料,计算预测其具备目标性质。
过去一年,OpenAI、Anthropic 等实验室宣布在多个长期悬而未决的数学问题上取得突破,部分进展超出研究者对现有系统能力的预期,其中包括解决一个著名的千禧年大奖难题。但 AI 实验室以硅谷式的高速推进方式冲撞这一学科,本应受到赞誉的成果反而引发反弹。AI 实验室表示正在从早先的错误中吸取教训,这些承诺能否兑现尚待观察。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线,可对比不同审查系统并提交自己的智能体。基准基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言的 219 个公开 PR,采用多来源 golden set 与统一评分标准,发布前由资深工程师独立复核,与基准判定一致率 96.6%。
推荐理由:GitHub 公开了代码审查基准的构建方法与离线到线上的验证数据,可据此判断评测信号是否可信。
MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的 agentic AI 项目能进入生产,遗留数据系统、安全隐私顾虑以及知识与上下文缺失是主要失败点。
MIT 于 2026 年 6 月发布的报告指出,AI 正在削弱大学体验的核心环节:到办公室答疑的学生减少、线上讨论参与度下降、宿舍和图书馆的学习小组变少,教师也越来越难判断学生真正学到了什么。
Hinton、Bengio等22位作者发表论文《What if automating AI R&D triggers an intelligence explosion?
研究者提出 ENCORE,首个精确的并行推理时控制方法,通过让每个副本存储生成轨迹,将向上移动变为截断,从而避免模拟难以处理的逆时间过程。该方法证明了目标不变性,并在合成目标、生物分子玻尔兹曼采样和图像生成中取得有竞争力的精度与多样性,还能应用于现有 RE 校正无法处理的蒸馏采样器。
研究提出 Expected Utility Regret(EUR)规则,可同时选择投资组合类别并估计其权重,在正则参数化收益模型中,单一 EUR 规则无需先验分布即可同时达到 minimax 与 Bayes 下界(含主常数项)。均值—方差组合与风险平价组合被推导为该框架的特例;当收益除以波动率的联合分布与资产顺序无关时,EUR 规则与风险平价组合一致。
研究者提出一种混合系统,将认知算法发现视为程序精化问题:人类构建的认知模型以概率程序形式交给一组 LLM 智能体,由其识别模型与行为的不匹配、在研究者设定的约束内提出代码级修改并验证结构保真度,修改结果再传入概率推理模块完成隐变量推理与数据似然计算。在暴露多种认知算法的问题解决范式人类行为数据上,修订后的模型拟合度持续优于原始模型,并揭示出一小组反复出现的创新。
研究提出广义 BG-a 噪声模型,在方差有界(a=0)与 BG-0 噪声(a=2)之间插值,并推导出增长相关的信息论下界 Ω(ε^-(4+a)) 及匹配上界。基于此设计的自适应批调度器在 C4 上预训练最高 1B 参数的 OLMo2 模型,在相同 token 预算下验证损失低于固定小批量与大批量训练,且迭代次数不到小批量训练的 10%。
研究者提出 DAWIS,一种统一滤波、固定滞后平滑与块平滑的数据同化方法,用多任务随机插值替代状态级先验的单一流时间,为窗口内每个连续状态分配独立流时间。同化循环将窗口反演为逐状态转折点向量并在观测引导下重新生成,从而在新观测到来时修正过去状态。在稀疏、含噪、非线性观测下,DAWIS 优于滤波和平滑基线,代码已开源。
HakemBench 是一个土耳其语类型化决策基准,模型需读取文本、问题与固定选项集,并为每个选项输出概率。1.0 版以 CC BY 4.0 完全开源,含 2,346 个条目、4,275 道选择题、是非题和评分题,覆盖事实核查分流、教育、护栏、法律路由、内容审核、垃圾邮件与钓鱼、客户支持七个赛道。
MapMergeLLM 将矢量化地图聚合建模为条件序列生成任务,由大语言模型直接预测聚合后的全局地图折线。该框架用模拟预测误差的合成局部地图训练,并引入几何感知预训练的坐标 tokenizer 与线级关联损失。在 Argoverse2 和 nuScenes 上,它无需针对特定检测器重训即大幅超越启发式与优化类聚合基线。
研究者提出自适应互蒸馏(AMD),一种协同后训练框架,同时训练两个采用不同任务平衡策略的模型,通过跨任务共享的短训练探针评估蒸馏权重调整,再按任务和迁移方向用验证分数择优。在六个基准和三个 LLM 主干上,两个 AMD 模型平均分均超过相同采样策略的 SFT 基线,合并后模型在三个主干上平均超出多任务 SFT 2.91 分。
研究发现,不完备线性自编码器在 PCA 解流形上,SGD 会偏好较大的解码器权重,产生有方向的尺度漂移。该漂移发生在慢时间尺度上,且具有可解析处理的有效描述,但最终会因有限步长稳定性边界而停止。所得解在损失 Hessian 最大特征值意义上比平衡基线更尖锐,但不同尖锐度度量可能方向相反。