ProactiveCoach:用分层过程理解提升主动式 AI 助手
研究者推出 ProactiveCoach 套件,包含训练集 ProactiveCoach-Instruct、评测基准 ProactiveCoachBench 及微调 VLM 与自适应引导系统,在 phase、step、action 三个层级提供分层引导。
研究者推出 ProactiveCoach 套件,包含训练集 ProactiveCoach-Instruct、评测基准 ProactiveCoachBench 及微调 VLM 与自适应引导系统,在 phase、step、action 三个层级提供分层引导。
研究构建了越南语击键数据集,涵盖真实写作、转录和改写三种模式,并设计了用户刻意改变打字模式的行为操纵威胁模型。在用户无关和上下文无关设置下,基于 1D-CNN 和 TypeNet 的序列模型在多数情况下优于时序与节奏特征方法,但转录可被可靠识别,改写和对抗操纵样本常被误判为真实写作。引入行为操纵数据的对抗训练后,可分离性和鲁棒性显著提升。
研究发现,PDE 训练输入的有损压缩中,场重建误差无法决定训练后算子的精度成本。压缩场经全精度代理算子传递后的扰动比例与方程平滑行为一致,在不同 PDE 族间跨越两个数量级以上。在均方误差训练下,重建误差在 104 次成本比较中颠倒 36 次,而基于相同前向传播的探针仅颠倒 12 次。
研究提出 Asymmetric SupCon 预训练目标,在台湾 NHIRD 的 398 万名患者纵向病历上预训练时序 Transformer 编码器,并迁移至美国 MIMIC-IV 与 EHRSHOT 数据集。
研究针对严格线性可分数据上的全批量逻辑梯度下降(GD),在大初始化尺度 R 下构建了一条由有限线性段组成的唯一连续理想路径,包含负间隔修正与最小间隔增长两个阶段。经两阶段时间重参数化后,固定步长 GD 轨迹除以 R 会随 R→∞ 均匀收敛到该路径,并给出考虑初始化扰动与阶段过渡的定量误差界。该近似还给出峰值评估损失与累积训练损失的渐近公式,其中峰值评估损失即使两端损失趋于零也可随 R 线性增长。
研究者推出 HouseholdBench,整合 6 项美国家庭调查与 32 个预测任务,覆盖消费、收入、劳动、预期和住房等数值、分类及概率结果,用于测试 LLM 能否预测家庭行为及其对政策变化的调整。13 个闭源与开源权重 LLM 参与评测,最佳模型将数值结果误差降低 12.2%,多数任务中梯度提升树排名第一。通过微调并聚合 16 次预测,40 亿参数开源模型可达到闭源模型水平。
研究提出 DAU(Draft、Ask、Update)流程,检验 LLM 能否自动完成临床文档专员向医生发起的澄清提问闭环。团队审计 3000 次真实就诊、分析 2.1 万轮真实对话澄清轮次,并基于公开数据构建五个转录降级基准;发现有用提问的预测因子因任务而异,约 9% 的轮次反而损害性能,多由冗余提问和仍触发改写的非回答造成。
研究者提出 SkillEvoLean,一种变异增强的技能自进化框架,用于构建技能增强的 Lean 证明器,在不更新模型参数的前提下联合进化高层求解策略与参考知识。
研究提出"洞见溯源"(Insight Provenance)任务,判断审稿洞见来自人类、LLM 还是二者混合,并基于 4,057 篇论文和 12,660 条人类审稿构建 InsightProv-v0,用 GPT-4o、Gemini 和 DeepSeek 模拟不同 LLM 参与程度并做句级标注。
研究团队推出 Kurate,利用 LLM 评估已发表研究的质量,并结合论文及其试验注册、研究方案等相关文档,将每项判断链接到对应原文段落。该系统对 4,347 篇论文(其中 3,913 篇为随机试验)按统计功效、因果识别、预注册等 8 个维度打分,发现统计功效、选择性报告和分析预注册问题最为常见。
研究者提出 SPARC(Shared Phase and Retention Control for Efficient Adaptive Spectral Recurrence),仅用两个输入相关的标量信号即可在高维复数谱记忆中统一控制记忆保留与相位旋转,无需为每个记忆模式单独分配控制。
针对 LLM 遗忘中固定参数子集的做法,研究者提出 Intervention Score 与选择性动态干预重排(DIR-R),按实际遗忘更新的预测效果对可编辑参数组排序,并在校准探针支持下动态重排。
Turnslide 是一个全自动轻量级多轮工具调用数据合成框架,将每个 API 建模为有限状态机,用单次 LLM 调用把状态合法的工具序列翻译成完整训练样本。在 SLM 微调实验中,其生成轨迹的下游完整准确率达 70.7%,高于对比方法的 63.4% 和 53.7%,且 token 用量减少 3.6-6.6 倍。该工作已被 NeurIPS 2026 SLM-Agents Workshop 接收。
LionMuon 提出每 P 次迭代执行一次 Muon 谱步、其间执行 Lion 符号步,两者共享单一双 EMA 动量缓冲区,使 Muon 的计算与通信开销每 P 步仅支付一次,优化器状态仅为 AdamW 的一半。
WavePrune 通过将 RoPE 每个通道限制在第一个旋转周期内,消除位置混叠带来的注意力干扰,在五个测试模型中的四个上无需额外调优即提升 HELMET 分数(如 Qwen3-8B 从 35.7 升至 40.0)。
PReCache 是一个免训练的 KV cache 共享框架,通过 PreLRShared 和 ReBaseShared 两种设计共享基于预训练权重计算的 base cache,并预计算紧凑的智能体专属低秩(LR)cache。
研究提出条件锚定生成蒸馏(CAGD),保留少量旧提示词,用冻结的旧模型重建补全与生成状态,并在学习新任务时匹配其预测分布。在 219M 掩码扩散语言模型的持续适配中,CAGD 将四任务最终留出损失从 2.927 降至 1.114,反向任务顺序下从 2.168 降至 0.891。在教师生成支持相同的情况下,软目标比硬回放的平均损失低 0.055。
研究者提出 Adaptive LeWorldModel(ALeWM),一种基于 JEPA 的世界模型,通过让预测器从采样的前缀长度估计完整下一嵌入,把预测信息集中到宽潜在表示的紧凑前缀中。
研究者提出一种分层因果表征学习框架,应用于先进全球气候模型的海表温度场,首次同时显式建模内部气候变率引发的大气动力相互作用与温室气体、气溶胶浓度变化带来的强迫响应。在未见过的未来气候情景上评估时,该方法能准确预测长期全球平均及区域温度演变,并对温室气体和气溶胶浓度扰动给出物理上合理的响应。
FedGuide 是一个面向异构环境的联邦强化学习框架,用扩散先验作为行为模型为各客户端提供个性化数据分布,并通过最优传输混合专家(OT-MoE)聚合这些先验,而非直接平均本地策略。
研究通过短时固定权重衰减(WD)扰动扫描 Grokking 泛化前的平台期,发现扰动对泛化时间的影响在平台期早期无序,随后在可见泛化前形成稳定的剂量排序:WD 增强导致更早泛化,WD 减弱导致更晚泛化。
研究系统评估了 TabPFN-TS 和 Chronos-2 在德国两个区域供热网络中的零样本概率热负荷预测表现,并与训练基线对比。全年基准中两个时序基础模型在确定性精度上均优于所有训练基线,Chronos-2 在主数据集上取得最佳 CVRMSE 12.48%,TabPFN-TS 为 13.07%。采用 12 周滚动上下文与环境温度的每小时 24 小时预测即可,更长上下文窗口未提升精度。
针对 JEPA 世界模型联合训练中表征坍缩导致潜在距离无法反映任务目标的问题,研究者提出 SCALE(State-CAlibrated Latent Embeddings),将采样的成对潜在距离与任务相关状态空间距离相关联。
研究提出一种无标签的结构前沿划分方法,保留最稀疏且理化性质最偏远的骨架组,在六个公开 ADMET 任务上评估。相比 70/10/20 骨架对照,前沿划分使等权主误差中位数上升 87.0%,均值上升 130.3%;移除 BBB 后均值降至 75.9%,该端点是唯一在前沿处排名反转的任务。
研究者提出 Particle MCTS(PMCTS),一种适配神经网络评估、面向 GPU 批并行加速的并行 MCTS 算法,同时保留 MCTS 的近似策略改进解释。PMCTS 随并行算力扩展良好,在 Chess、19x19 Go、9x9 Go、Gardner Chess、Snake、Brax 经典控制环境及 Sokoban 中的 LLM 推理等离散与连续动作基准上,持续优于或比肩主流启发式基线。
研究者提出分布鲁棒多目标优化(DR-MOO),在各自最坏分布下最小化多个目标,并给出 Pareto 型解概念与带理论保证的 MGDA 算法。基于拉格朗日对偶重构的双循环 MGDA 达到 ε-Pareto 稳定点的样本复杂度为 O(ε^-8),而结合大批量采样与梯度裁剪的单循环 double-clip MGDA 将复杂度降至 O(ε^-4)。
研究者提出 Observable Neural ODEs(ObsNODEs),一种基于可观测标准型的 Neural ODE 模型,可在隐藏混杂和部分观测状态下实现连续时间动态治疗效应的识别与因果预测。该方法通过连续时间条件前门调整公式,将潜在结果分布表达为测量模型、潜在动态与滤波分布的组合,并在合成、半合成及真实临床数据上验证了其优于近期序列模型的性能。
研究提出一种门控主动学习框架,将好奇心驱动采样与基于简谐振子模型拟合的物理信息质量控制过滤器结合,可在数据采集阶段自动排除低保真数据。在PbTiO3薄膜的BEPS数据集上,该方法优于随机采样、标准主动学习和多任务学习策略,并已在另一PbTiO3薄膜样品的实时自主显微镜实验中验证有效。
研究提出质量守恒感知机(MCP)框架,通过在单一 MCP 储水单元中逐步嵌入有界土壤储水、状态依赖导水率、可变孔隙度、下渗能力、地表积水、垂向排水与非线性地下水位动态等水文过程约束,在美国本土 5 个水文气候区共 15 个流域上以日径流预测为目标进行评估。
针对大规模推荐系统中哈希索引的嵌入向量碰撞问题,研究者提出基于线性探测的 Multi-Probe Zero Collision Hash(MPZCH),在合理表规模下可完全消除碰撞。
研究人员提出 STAMP(Stochastic Temporal Autoencoder with Masked Pretraining),一种通过随机过程编码时间信息的 Siamese MAE 框架,以两个输入体积之间的时间差为条件,并将 MAE 重建损失重构为条件变分推理目标。
研究者提出 Mask Fine-Tuning(MFT),一种不修改骨干权重的视觉语言模型适配方法,通过学习掩码选择性路由预训练连接中的信息,动态发现更对齐下游目标的子网络。实验显示 MFT 在多个视觉语言基准上持续优于 Full Fine-Tuning(FFT)和 Parameter-Efficient Fine-Tuning(PEFT),且不增加知识、不改变部署架构。
该研究为高斯分布下二次代价的最优传输(OT)与内积 Gromov-Wasserstein(IGW)对齐给出完整理论刻画,解决了可分 Hilbert 空间上非中心高斯 IGW 对齐这一开放问题,通过等距与余等距上的二次优化给出精确变分刻画及紧的解析上下界。
研究提出 Footprint-Aware Regression(FAR)深度学习框架,同时预测涡度相关通量塔的空间足迹与像素级 CO₂ 通量,避免异质景观下高分辨率数据训练产生的偏差。
针对物理神经网络(PNN)权重调整缓慢的瓶颈,研究者提出 TIDAL-Net,利用 PNN 中快速前向动态与缓慢可训练权重之间的时间尺度分离,通过逐层时间复用提升有效深度并控制实现成本。在图像分类和自然语言处理任务上的数值实验显示,仅需对常规 PNN 做少量修改即可提升性能。
研究者提出 Physically-isolated Experts Routing Network(PiERN),一种在 token 级调度计算与推理的架构,使单条思维链内可迭代交替进行高精度数值计算与推理。
该研究针对 GSAM 算法,在采用递增批量大小或余弦退火、线性衰减等学习率策略时从理论上证明了其收敛性。数值实验表明,使用递增批量大小相比固定批量大小和学习率,能达到更低的最坏情况 ℓ∞ 自适应锐度。
研究者为具有空间变化抗扩散系数的 Kuramoto–Sivashinsky 方程提出首个反馈镇定设计,通过引入第二个边界输入并借助 Heymann 引理分配不同角色,克服了 Coron 与 Lü(2015)单输入 Fredholm 设计在重复不稳定特征值处的可控性失效。
研究者提出层级连续扩散语言模型 H-CDLM,通过并行扩散 token 及其聚类得到的粗粒度语义表示,以极小的算力与参数开销提升连续扩散语言模型。应用于 CoBit 得到 H-CoBit,在 LM1B 上生成困惑度 49.4、OWT 上 50.4,较基线分别改善 24.2 和 20.7 点,GSM8K 准确率达 27.4%。该框架同样适用于流匹配模型 FLM,代码将公开。
语言模型微调时看似遗忘的知识往往仍被存储且可恢复,这种现象被称为伪遗忘。研究通过一个最小联想记忆模型复现了该动态:共享结构的键、集中的新值和网络归一化三者共同作用,微调将所有旧表示沿同一方向移动,暂时隐藏旧事实但保留其相对几何结构;归一化在新事实学会后撤回这一偏移,而事实特异性变化则持续累积并导致侵蚀。