RouteFlow:在合成路线隐空间中导航以实现可合成分子设计
RouteFlow 将可合成分子设计重构为在连续合成路线隐空间中的搜索,每个隐向量可映射回完整合成路线,从本质上保证可合成性。该框架采用奖励引导的流匹配作为采样器,并引入循环一致性机制稳定微调,防止优化偏离真实合成路线流形。在 Therapeutic Data Commons 的 16 项优化任务中,RouteFlow 在可合成性感知基线中取得最佳样本效率、最高合成可及性与最高逆合成成功率。
RouteFlow 将可合成分子设计重构为在连续合成路线隐空间中的搜索,每个隐向量可映射回完整合成路线,从本质上保证可合成性。该框架采用奖励引导的流匹配作为采样器,并引入循环一致性机制稳定微调,防止优化偏离真实合成路线流形。在 Therapeutic Data Commons 的 16 项优化任务中,RouteFlow 在可合成性感知基线中取得最佳样本效率、最高合成可及性与最高逆合成成功率。
研究团队提出 GroundAct,将物理实体作为 grounding 单元,用轻量 reference token 保持每个被选实体的连续状态可被符号推理寻址,仅由被引用实体与演化方案的交互来修正规划,形成从推理依据到规划动作的显式路径。GroundAct 在开环与闭环评测中均表现良好,覆盖正常、分布外与安全关键场景,闭环结果进一步验证了仿真驾驶能力。
研究考察了 11 个不同模型家族与参数规模的 LLM 在信息价值判断上的差异,并构建受控 elicitation 模拟,让不同模型在相同信息空间中使用同一选择规则,从而隔离模型判断对顺序信息搜寻的影响。研究刻画了模型特定偏好所导致的广度-深度行为,并分析了交互历史如何改变对候选信息的评估与选择。项目代码、数据与轨迹文件已公开。
针对 Muon 优化器是否需要细粒度谱整形,研究者提出两带谱重加权框架 BulkBoost,其噪声校准变体利用 split-minibatch 梯度差标定 Marchenko–Pastur 参考边缘,将谱分为 bulk 与 spike 两部分并共享一个增益。
研究用时间卷积分类器对20名参与者进行留一受试者(LOSO)交叉验证,基于角度阈值标注的GOOD/BAD步态周期,平均AUROC达0.948,BAD周期灵敏度0.941,GOOD周期特异度仅0.366。
研究人员推出 2D-FET-Bench V2,一个基于显微薄片轮廓构建的 128 项 FET 版图任务基准,用于测试语言模型智能体能否完成薄片专属的器件构造。
MemCo 是一个记忆中心协作框架,通过维护互补的局部与全局记忆空间,让 LLM 智能体泛化到未见交互环境。它按智能体当前状态和决策阶段路由局部与全局记忆,避免盲目迁移环境特定细节。在交互决策基准上,MemCo 相比孤立记忆和共享记忆基线提升了任务成功率并减少冗余探索。
研究者提出 Rationale-Guided Policy Optimization(RGPO),按模型当前能力自适应利用标准答案中的理由信息,将其作为临时脚手架,仅把更高奖励的模型自生成解回传到原始无引导设置。在纯语言与视觉语言推理任务上,RGPO 均持续优于 RLVR 基线,消融实验显示自适应理由引导是性能提升的关键。该工作已被 NeurIPS 2026 接收。
一篇综述系统梳理了神经符号 AI 中用作符号组件的三类规则语言——Datalog、答案集程序与概率逻辑程序,并沿语义、表达能力、神经集成和求值机制四个维度展开对比。作者分析了 50 余个近期系统与应用,覆盖数据库与编程语言、机器学习、视觉和机器人四个研究领域,并给出将应用场景映射到所需特性的决策矩阵,最后列出开放问题。该文将收录于 RuleML+RR 2026 会议论文集。
研究提出 Diffusion On-Policy Context Distillation(D-OPCD),将智能体改进后的提示词作为特权上下文,把智能体框架的能力蒸馏进扩散模型权重,使其仅凭原始查询也能保留部分框架收益。
研究提出 Looped Self-Distillation 自演化框架,模型在固定信息预算下反复从自身原始输出学习,无需外部评估或测试筛选。
AMBER 是一个让智能体在推理、行动的同时写入自由形式记忆的框架,追加式规则从结构上保证信息不被覆盖删除,可端到端用结果奖励做强化学习,无需大量人工整理的 SFT 数据。
一项针对 170 名大一经济学学生的双队列双重差分研究显示,使用经研究生助教核验的 AI 生成播客、FAQ 和测验学习指南,与 50 分制考核中 2.34 分的成绩优势相关。
研究评估轻量级开源语言模型在资源受限的边缘环境下,将输入数据实体匹配到最合适的智能数据模型(SDM)的表现,系统基准测试了通用、推理专用和代码专用三类架构在多个领域数据集上的效果。实验还将所调研的大语言模型与 TF-IDF 和轻量级句子编码器两种近零成本相似度基线在同一任务上对比,为判断 LLM 分类在边缘平台的实际价值提供参考。
一篇 arXiv 论文提出面向生成式 AI 的生产级内容抽取系统,将内容抽取作为独立生命周期阶段,包含选择性 OCR 路由、基于参考的抽取评分器、确定性结构感知父子分块器和只读检索评估器。
CuratorMAS 是一个多智能体协作框架,将数据集策展拆解为五个可编程执行阶段并组成可并行工作流,通过数据集探索、在线领域知识检索、评估标准推导与指标计算、过滤及技能进化模块完成自动策展。实验显示,该框架将噪声率最多降低 36.03 个百分点,下游模型 F1 分数最多提升 8.88 个百分点。
针对 AlphaFold 3 类共折叠模型输出中链间原子重叠、配体键长键角失真、环不共面及手性反转等物理违规问题,研究者提出两种闭式投影算子,直接作用于扩散模型去噪后的干净坐标估计 x̂₀:链间范德华投影推开冲突最严重的原子对,配体距离几何投影恢复键长、键角、内部接触、共面性与手性。
JIVEAdapter 是一种多任务加性低秩适配器,借鉴统计方法 JIVE,将每次权重更新分解为所有任务共享的 Joint 结构与各任务独有的 Individual 结构,并惩罚 Individual 与 Joint 近似正交以保持可解释性。
离线 AI 模块工作流发布语音优先的完全离线部署方案,包含模块化架构、低成本硬件 BOM 和面向 2-5B 参数指令微调模型的可复现量化与基准测试流程。
研究者提出 SSRFT(Supervised Safe-Role Fine-Tuning),首个将安全对齐重构为"内化预设安全角色"的框架,通过心理测量问题、少量越狱提示词和安全角色描述构建 SRQA 数据集,让模型内化安全价值观而非显式拒绝模式。
基于北京和成都路网速度数据构建的离线代理任务显示,联合校准上界可将路径覆盖率从83.19%提升至92.26%(北京M1)、75.14%至88.33%(成都M1)、74.01%至90.64%(成都M2),但C2策略分别使迟到率增加0.1633、0.7848、0.9200个百分点,平均出行时间增加0.588、3.082、4.418秒。
一项基于安徽宣城 29 天重建需求数据的分层诊断研究显示,入口级和车流级预测相对历史均值分别降低 4.03% 和 3.92% 的平均绝对误差,但因果预测与五秒事件 oracle 在冻结测试日反而使排队车秒数增加 6.09% 和 3.39%。
针对 LLM 智能体难以从经验中持续进化的问题,研究者提出 SAGA 框架,将交互轨迹逐步抽象为情景描述、可复用流程和带明确适用条件的原理,并保留与执行证据的关联。检索到的原理会被实例化为任务专属指导,通过纠正反馈与重采样优化候选动作,形成执行—抽象反馈闭环。在 ScienceWorld 和 ALFWorld 上的实验显示任务表现提升,消融研究验证了上下文实例化与动作调控对利用原理级知识的重要性。
RadOnc-Agent 是一个将放疗流程形式化为四个临床阶段、并通过对话界面提供 26 个可调用函数的智能体框架,由大语言模型控制器将临床意图映射为受 schema 约束的调用。
研究者提出 Anchor Divergences,通过对比学习、指数族与信息几何的相互作用,在固定表示上建立锚点概率分布与 Bregman 几何之间的对应关系,从而为特定语义结构定制几何度量。检索实验显示,该方法能高效指定上下文相关的语义相似度。代码已开源。
研究团队提出 GameGo 框架,将简短游戏创意系统化转化为基于行业实践的产品需求文档,并构建了覆盖 2D、2.5D、3D 游戏的 55,060 条开发轨迹数据集 GameGoData 及含 124 个游戏查询的 GameGoBench。基于该数据训练的 GameGoCoder 在游戏开发基准上超越同类基线,性能接近前沿模型。代码、数据集与模型将全部公开。
Amazon SageMaker HyperPod 通过 SageMaker Unified Studio 连接项目后,团队可在项目工作区启动训练与微调工作负载,同时由基础设施团队继续通过 SageMaker AI 接口和 API 管理集群。文章提出组织、项目、集群、工作负载四层控制模型,并说明如何跨层设计身份、容量与可观测性策略,在共享加速器算力时保留底层治理控制。
NVIDIA《State of AI in Telecommunications》报告显示,89% 受访者认为开源模型与软件对公司 AI 战略重要。NVIDIA 发布 300 亿参数的 Nemotron 3 Large Telco Model(LTM),由 AdaptKey 基于开源电信数据集微调,并开放完整微调流程。
NVIDIA Inception 计划中的多家初创公司正用 AI 补齐乳腺癌诊疗缺口:iSono Health 的 FDA 获批 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房标准化扫描,公司称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 FDA 获批 WRDensity 已用于数十万患者,并研发可自动筛除阴性乳腺钼靶的新一代 AI。
研究提出广义 BG-a 噪声模型,在方差有界(a=0)与 BG-0 噪声(a=2)之间插值,并推导出增长相关的信息论下界 Ω(ε^-(4+a)) 及匹配上界。基于此设计的自适应批调度器在 C4 上预训练最高 1B 参数的 OLMo2 模型,在相同 token 预算下验证损失低于固定小批量与大批量训练,且迭代次数不到小批量训练的 10%。
研究者提出 DAWIS,一种统一滤波、固定滞后平滑与块平滑的数据同化方法,用多任务随机插值替代状态级先验的单一流时间,为窗口内每个连续状态分配独立流时间。同化循环将窗口反演为逐状态转折点向量并在观测引导下重新生成,从而在新观测到来时修正过去状态。在稀疏、含噪、非线性观测下,DAWIS 优于滤波和平滑基线,代码已开源。
HakemBench 是一个土耳其语类型化决策基准,模型需读取文本、问题与固定选项集,并为每个选项输出概率。1.0 版以 CC BY 4.0 完全开源,含 2,346 个条目、4,275 道选择题、是非题和评分题,覆盖事实核查分流、教育、护栏、法律路由、内容审核、垃圾邮件与钓鱼、客户支持七个赛道。
MapMergeLLM 将矢量化地图聚合建模为条件序列生成任务,由大语言模型直接预测聚合后的全局地图折线。该框架用模拟预测误差的合成局部地图训练,并引入几何感知预训练的坐标 tokenizer 与线级关联损失。在 Argoverse2 和 nuScenes 上,它无需针对特定检测器重训即大幅超越启发式与优化类聚合基线。
研究者提出自适应互蒸馏(AMD),一种协同后训练框架,同时训练两个采用不同任务平衡策略的模型,通过跨任务共享的短训练探针评估蒸馏权重调整,再按任务和迁移方向用验证分数择优。在六个基准和三个 LLM 主干上,两个 AMD 模型平均分均超过相同采样策略的 SFT 基线,合并后模型在三个主干上平均超出多任务 SFT 2.91 分。
研究发现,不完备线性自编码器在 PCA 解流形上,SGD 会偏好较大的解码器权重,产生有方向的尺度漂移。该漂移发生在慢时间尺度上,且具有可解析处理的有效描述,但最终会因有限步长稳定性边界而停止。所得解在损失 Hessian 最大特征值意义上比平衡基线更尖锐,但不同尖锐度度量可能方向相反。
针对非结构化知识编辑中"上下文依赖"导致的原子事实召回失败问题,研究者提出即插即用框架 FOVEATED,通过随机偏移前文上下文 key 的 RoPE 位置构造聚焦视图,编辑时施加扰动、推理时移除,保持模型原生位置编码不变。该方法在五种知识编辑器、两个 LLM 主干和三个基准上均取得一致提升,并理论分析了其如何抵消上下文引起的难度低估。
SCOPE-4D 是一个内窥镜 4D 几何基础模型,可从单目 RGB 视频单次前向推理中联合预测相机参数、稠密几何与 3D 组织轨迹。团队构建了约 5,000 段真实与合成胃肠内窥镜及腹腔镜视频的 SCOPE-5K 数据集,并提出 Common–Residual Motion(CRM)约束局部形变。在公开及新采集基准上,该模型展现出更强的域内外几何估计、3D 跟踪与长序列结肠重建稳定性。
研究提出慢-快多教师在线策略蒸馏(SF-MOPD),通过将学生模型的指数移动平均作为"慢模型"能力参考,在 log-probability 空间剔除使快模型偏离慢模型的分量,保留对齐与正交分量。实验表明,SF-MOPD 在多模型规模上有效缓解能力干扰,增强多模态专业能力,并降低通用能力基准的平均退化,持续优于原版 MOPD。
研究者提出用扩散模型生成合成传感器数据窗口,对 CABiGRU 采用两阶段训练:先在合成数据上预训练,再在真实数据上微调。在 DEO(drinking/eating/other)数据集上,该流程取得 90.6% 的平衡准确率,优于强监督基线,缓解了少数类欠拟合问题。
OctLLM 提出用八叉树占用 token 构成的显式 3D 序列来表示几何,并通过随机清空倒数第二层节点、省略其后代得到更短的 S-Octree,用于位置感知的掩码建模生成与 3D 理解。