AEGIS:面向多租户深度学习训练的运行时 GPU 共置调度系统
AEGIS 是一个面向共享多 GPU 服务器的运行时调度系统,通过将内存可行性、放置后观测、运行时压力过滤、放置与 OOM 感知恢复整合进单一调度循环,实现深度学习训练工作负载的可控共置。
AEGIS 是一个面向共享多 GPU 服务器的运行时调度系统,通过将内存可行性、放置后观测、运行时压力过滤、放置与 OOM 感知恢复整合进单一调度循环,实现深度学习训练工作负载的可控共置。
研究者提出 Nucleus Speculative Decoding(NSD),一种将目标模型合理性纳入验证的宽松投机解码方法:草稿 token 满足标准接受规则或落入目标模型 nucleus 即被接受。实验显示 NSD 相比自回归解码吞吐最高提速 5.16×,相比标准投机解码最高提速 3.15×,同时保持有竞争力的任务表现,并带来更长的接受长度。
研究将 LLM 应用于真实加密货币交易图,以 Bitcoin 为案例,提出三层评估框架及 LLM4TG 图表示格式与 CETraS 采样算法,显著降低 token 需求。实验显示节点级基础信息识别准确率超 98.50%,有效特征获取比例达 95.00%,分类任务 top-3 准确率在少量标注数据下达 72.43% 并附带解释。
研究者提出一种轻量级 router-logit 安全检测器,在 prompt prefill 阶段读取 MoE 视觉语言模型的 routing 信号,在生成前识别不安全请求,无需修改模型参数或专家路由。在 Qwen3-VL 和 Kimi-VL 上,该检测器大幅降低 HoliSafe 基准上的安全错误,并泛化到 MISHard 和 MM-SafetyBench 等分布外安全基准。
研究者推出 SteerScope,一个双轴多维评估套件,通过 15 项指标联合刻画 LLM 引导效果与方法属性,并在匹配模型、任务和评估协议下基准测试了涵盖 4 个家族的 23 种方法,包括 prompting、LoRA 和 SFT 基线。
研究者用机器学习模型在专有 Nasdaq 数据上训练,将可观测的高频交易活动映射到公开日内变量,从而为 2010 至 2023 年全部美股生成每日的流动性供给型与需求型高频交易指标。
研究者提出图基础模型 Wander,将图学习统一建模为部分观测图的补全,并通过随机游走这一通用接口,让单个预训练 checkpoint 同时适配同构图与多关系图,覆盖不同特征、标签和关系模式。
受 Jev 模型启发的预填充决策模型单次前向即可为候选菜单打分,成本比同规模生成式语言模型低一到两个数量级。当干预只改变候选菜单而输入文本不变时,其干预后准确率可由缓存的首次前向分布预测,无需标签和第二次前向,在七个模型族、十个数据集上误差在 4.2 分以内。
研究者推出 ProactiveCoach 套件,包含训练集 ProactiveCoach-Instruct、评测基准 ProactiveCoachBench 及微调 VLM 与自适应引导系统,在 phase、step、action 三个层级提供分层引导。
研究构建了越南语击键数据集,涵盖真实写作、转录和改写三种模式,并设计了用户刻意改变打字模式的行为操纵威胁模型。在用户无关和上下文无关设置下,基于 1D-CNN 和 TypeNet 的序列模型在多数情况下优于时序与节奏特征方法,但转录可被可靠识别,改写和对抗操纵样本常被误判为真实写作。引入行为操纵数据的对抗训练后,可分离性和鲁棒性显著提升。
研究发现,PDE 训练输入的有损压缩中,场重建误差无法决定训练后算子的精度成本。压缩场经全精度代理算子传递后的扰动比例与方程平滑行为一致,在不同 PDE 族间跨越两个数量级以上。在均方误差训练下,重建误差在 104 次成本比较中颠倒 36 次,而基于相同前向传播的探针仅颠倒 12 次。
DLoop 是一种循环式投机解码方法,在验证前自适应执行多轮起草,让草稿模型在保持置信时持续生成 token,再统一验证所有累积的草稿 token。该方法在 EAGLE-3、DFlash、Domino、DSpark 及多 token 预测模块上把实际加速提升 5% 至 41%,同时保持无损解码。配套的循环感知训练让草稿模型接触未验证草稿 token 的自身隐藏状态,从而在额外起草阶段保持可靠。
研究提出 Asymmetric SupCon 预训练目标,在台湾 NHIRD 的 398 万名患者纵向病历上预训练时序 Transformer 编码器,并迁移至美国 MIMIC-IV 与 EHRSHOT 数据集。
针对现有 LLM 编排器将智能体偏好信念存于提示词、缺乏显式更新规则导致早期错误持续传播的问题,研究者提出 HARP 框架,为每个智能体在有限候选偏好集上维护数值后验并用贝叶斯规则闭式更新,语言模型仅提供动作与各候选似然。HARP 被证明可达到与显式联合推断相同的 Õ(√K) 贝叶斯遗憾,其增强版 HARP⁺ 通过为区分候选的动作加奖励,在最优动作无信息时仍能持续推断。
研究针对严格线性可分数据上的全批量逻辑梯度下降(GD),在大初始化尺度 R 下构建了一条由有限线性段组成的唯一连续理想路径,包含负间隔修正与最小间隔增长两个阶段。经两阶段时间重参数化后,固定步长 GD 轨迹除以 R 会随 R→∞ 均匀收敛到该路径,并给出考虑初始化扰动与阶段过渡的定量误差界。该近似还给出峰值评估损失与累积训练损失的渐近公式,其中峰值评估损失即使两端损失趋于零也可随 R 线性增长。
研究者推出 HouseholdBench,整合 6 项美国家庭调查与 32 个预测任务,覆盖消费、收入、劳动、预期和住房等数值、分类及概率结果,用于测试 LLM 能否预测家庭行为及其对政策变化的调整。13 个闭源与开源权重 LLM 参与评测,最佳模型将数值结果误差降低 12.2%,多数任务中梯度提升树排名第一。通过微调并聚合 16 次预测,40 亿参数开源模型可达到闭源模型水平。
一套完全离线的语音到语音翻译流水线可在 4 GB 显存的 Jetson Nano 上运行,无需重训练即可自我修正弱翻译。系统由 Whisper-tiny ASR 与 Opus-MT 翻译器组成,多语言 BERT 余弦相似度作为质量估计(QE)门控,在置信度低于阈值 τ 时触发二次修正。
研究者提出 DePICT,一种通过按优化器解敏感度对上下文方向排序并跨运行区间聚合,来构建决策保持接口的方法。该方法基于 KKT 条件刻画上下文方向何时与优化器相关,指出出现在活跃优化问题中并不代表变量会影响最终决策,某些方向的影响会被对偶变量吸收。在受控诊断中,DePICT 精确恢复决策相关接口,将线性预测器 regret 降至 0.009,而最强竞争基线为 0.475。
自动手语翻译(SLT)已进入消费产品,但尚无公开系统将 SLT 与儿童安全防护工具联合评估,主流已部署 SLT 模型也未在 18 岁以下手语者上训练或正式评测。否定、角色、保密、紧急或求助等翻译错误可能在不影响流畅度的情况下改变安全判定。论文提出一套由聋人群体参与部署前审计框架,含失败分类、场景模板、四种比较条件和四项结果指标,计划以 Auslan 为首个案例。
SCAD 将长时程智能体的交互组织为规划与有界子任务执行,在局部上下文中蒸馏执行过程,并通过跨 rollout 的子任务前缀树优化规划信用分配。在全部评测基准上,SCAD 的宏平均准确率较最强训练基线在文本任务上提升 4.48 个百分点、多模态任务上提升 4.19 个百分点。
研究提出 DAU(Draft、Ask、Update)流程,检验 LLM 能否自动完成临床文档专员向医生发起的澄清提问闭环。团队审计 3000 次真实就诊、分析 2.1 万轮真实对话澄清轮次,并基于公开数据构建五个转录降级基准;发现有用提问的预测因子因任务而异,约 9% 的轮次反而损害性能,多由冗余提问和仍触发改写的非回答造成。
研究者提出 SkillEvoLean,一种变异增强的技能自进化框架,用于构建技能增强的 Lean 证明器,在不更新模型参数的前提下联合进化高层求解策略与参考知识。
研究提出"洞见溯源"(Insight Provenance)任务,判断审稿洞见来自人类、LLM 还是二者混合,并基于 4,057 篇论文和 12,660 条人类审稿构建 InsightProv-v0,用 GPT-4o、Gemini 和 DeepSeek 模拟不同 LLM 参与程度并做句级标注。
研究者提出 SELF-POT 基准与评估框架,在竞赛数学、竞技编程和智能体工作流中衡量模型的测试时潜力,并按美元计费所有模型调用(含选择与评判)。在 350 个密封任务、五个低成本推理模型上,以 Claude Opus 5.5 Direct 为参照,收益取决于领域、选择规则与失败处理。
研究团队推出 Kurate,利用 LLM 评估已发表研究的质量,并结合论文及其试验注册、研究方案等相关文档,将每项判断链接到对应原文段落。该系统对 4,347 篇论文(其中 3,913 篇为随机试验)按统计功效、因果识别、预注册等 8 个维度打分,发现统计功效、选择性报告和分析预注册问题最为常见。
针对损失与约束函数随回合对抗变化、转移未知的片段式对抗线性 CMDP,新提出的 primal-dual 算法将 regret 与累积约束违反从 \widetilde{\mathcal{O}}(K^{3/4}) 降至 \widetilde{\mathcal{O}}(\sqrt{K}),且无需 Slater 条件。
研究者提出一种仅以奖励和动作为条件的奖励策略,可在观测空间完全不同的源环境与目标环境之间实现零样本迁移。该策略在 Pointmass、Cartpole 和 2D Car Racing 三个环境中训练后,可零样本迁移到不同配色、3D 渲染以及 Habitat-Sim 中的 Stretch 机器人导航任务。基于奖励的策略还能进一步引导目标环境中基于观测的策略训练。
研究者用低秩适配器训练模型按隐含线性偏好函数为虚构角色做决策,发现持续微调能让模型在无显式自我报告监督下准确报告自身学到的偏好。权重消融与冻结层实验显示偏好表征随训练前移至更早层,而 attribution patching 发现忠实模型的决策与自我报告任务间归因相似度显著更高,可作为区分忠实与不忠实自我报告的机制特征。
研究者提出 SPARC(Shared Phase and Retention Control for Efficient Adaptive Spectral Recurrence),仅用两个输入相关的标量信号即可在高维复数谱记忆中统一控制记忆保留与相位旋转,无需为每个记忆模式单独分配控制。
JudgeMoE 是一种轻量聚合器,对缓存的 judge 分数分布分配样本级权重并在计算最终分数前融合。在原始 10-cell 基准上,其平均 Spearman 相比 uniform log pooling 提升 +0.079;在 16 个 cell 上相比最强单一 judge 平均提升 +0.0393,12/16 个 cell 为正,单侧 Wilcoxon 符号秩检验 p=0.0091。
针对 LLM 遗忘中固定参数子集的做法,研究者提出 Intervention Score 与选择性动态干预重排(DIR-R),按实际遗忘更新的预测效果对可编辑参数组排序,并在校准探针支持下动态重排。
Turnslide 是一个全自动轻量级多轮工具调用数据合成框架,将每个 API 建模为有限状态机,用单次 LLM 调用把状态合法的工具序列翻译成完整训练样本。在 SLM 微调实验中,其生成轨迹的下游完整准确率达 70.7%,高于对比方法的 63.4% 和 53.7%,且 token 用量减少 3.6-6.6 倍。该工作已被 NeurIPS 2026 SLM-Agents Workshop 接收。
LionMuon 提出每 P 次迭代执行一次 Muon 谱步、其间执行 Lion 符号步,两者共享单一双 EMA 动量缓冲区,使 Muon 的计算与通信开销每 P 步仅支付一次,优化器状态仅为 AdamW 的一半。
WavePrune 通过将 RoPE 每个通道限制在第一个旋转周期内,消除位置混叠带来的注意力干扰,在五个测试模型中的四个上无需额外调优即提升 HELMET 分数(如 Qwen3-8B 从 35.7 升至 40.0)。
ZonoGPT 是一种用于验证大型 Transformer 的抽象域,其空间复杂度与网络深度无关。它采用结构化 zonotope 与生成元约简机制,并为 Attention、LayerNorm 引入分块融合变换、为 GELU 引入仿射变换以保持精度。
KVCMAS 是一个在线 KV cache 修正框架,用紧凑低秩状态表示跨智能体缓存偏差,并沿智能体工作流无缝串联修正,无需额外参考预填充,同时保留精确的首个智能体缓存。
EMODE 是一个情感感知语音语言模型,核心是动态副语义专家(DPSE),将连续语音特征拆分为语义与副语言两条路径并动态路由、融合后再接入语言模型。它采用语义预热、副语言激活、联合精调三阶段课程训练,配合 OEG、SAA 与 GDR 引导。在 SER 测试、共情回复评测及新建双语 MEPA 基准上,EMODE 改善了词汇保真与情感敏感度的平衡。
PReCache 是一个免训练的 KV cache 共享框架,通过 PreLRShared 和 ReBaseShared 两种设计共享基于预训练权重计算的 base cache,并预计算紧凑的智能体专属低秩(LR)cache。
研究提出条件锚定生成蒸馏(CAGD),保留少量旧提示词,用冻结的旧模型重建补全与生成状态,并在学习新任务时匹配其预测分布。在 219M 掩码扩散语言模型的持续适配中,CAGD 将四任务最终留出损失从 2.927 降至 1.114,反向任务顺序下从 2.168 降至 0.891。在教师生成支持相同的情况下,软目标比硬回放的平均损失低 0.055。
SketchSSM 提出"全状态更新、近似读取"方案:每次状态更新时读取一次完整状态,为离线固定的基向量预计算输出并存入紧凑草图,后续解码步骤用查询相关系数组合草图向量重建输出,无需再读全状态。