时间序列基础模型的尺度不变训练(ScaleIn)
时间序列基础模型(TSFM)常用的 ReVIN 等仿射缩放方法会在反变换后计算损失,使每条序列的梯度被乘以 b^p,导致高尺度序列主导训练,作者称之为尺度污染训练(ScaleCon)。
时间序列基础模型(TSFM)常用的 ReVIN 等仿射缩放方法会在反变换后计算损失,使每条序列的梯度被乘以 b^p,导致高尺度序列主导训练,作者称之为尺度污染训练(ScaleCon)。
CG-CTI 将 CAPEv2 沙箱的实时输出转换为 STIX 2.1,并在知识图谱中与其他关键基础设施传感器数据关联,为每个情报对象附加基于来源、跨源印证和观测持续性的显式置信状态。
POLAR 是一个 LLM 驱动的框架,可将厂商公告、漏洞库和威胁情报中的碎片化证据合成为以威胁为中心的评估。它先拆分重叠事件并将威胁锚定到来源证据,再结合严重性指标与按时间排序的利用信号估算近期被利用概率,并将威胁数据关联到权威修复知识以组织缓解措施。在公开资源收集的真实漏洞证据上,POLAR 在异构事件和零日场景中提升了威胁排序与缓解检索效果。
Google 部署了 AI 智能体 FlowAgent,在持续集成系统的提交前外循环流程中自动修复测试失败,集成于内部开发者工具 Critique 和 Cider,采用 ReAct 式生成-验证循环与执行前后弃权过滤器。
FlexiFlow 是一个数据流系统,能在当前模型准确率偏低时动态切换到备选模型,通过多臂老虎机方法对模型进行排序,综合考虑模型运行时间、通过用户自定义断言的概率以及 ML 工作流的计算结构。实验显示,切换模型可将工作流准确率提升最高 23%,运行时复用中间结果相比顺序执行工作流还能带来 48% 的效率提升。
SAFESHIELD 是面向小语言模型的部署时安全系统,将安全决策组织为准入、路由、证据、放行四类职责,并把已提交决策记录为可审计的 Decision Traces。协调消融实验显示,移除准入门控会显著增加误放行,而放行决策缺少上游证据时准确率从 96.0% 降至 69.5%,表明部署时安全不仅取决于单个护栏能力,也取决于决策如何组织与协调。
研究者提出 Analytical Memory Unit(AMU),为每条缓存结果附加完整派生(血缘)图,并只在请求者对所有涉及列均有权限时才返回命中,从而阻止经由合法计算结果泄露敏感列。
研究者提出最小见证强化学习(MWRL),将"找出全部最小充分见证"形式化为最小见证识别问题,仅凭单个黑盒验证器的反馈位即可完成信用分配。该方法从问题定义直接推导,统一了最小性与备选解恢复两项要求,并据此给出可恢复完整见证族的值迭代规划器和可扩展到大语言模型的策略梯度方法。实验中 MWRL 能找回大部分最小见证,而其他方法只返回冗余超集或单一见证。
TIDE 2.0 是一个 MIT 许可的开源引擎,采用可替换识别器与键控匿名器两阶段设计,支持机构本地部署,替代符以密码学生成且不存储关联表,日期按患者做保持间隔的偏移。
RoboCap 是一个 250g、六摄像头、双 IMU 的帽子式设备,用于在真实环境中采集第一人称操作数据,配套的 Grounded API 提供与设备无关的 3D 算法。该平台在公开基准上取得 SOTA 表现,涵盖多场景 SLAM、第一人称深度估计,以及适配第三方设备的手部追踪。
研究者提出 DRMoET,一种将逐层专家视为内生鲁棒分组、优化高损失路由结果的即插即用目标,而非仅均衡流量。在 FLAME-MoE 配方下,10.3B 总参数、67B 训练 token 时,DRMoET 将七任务平均分从 0.6625 提升至 0.6767,无辅助损失均衡基线为 0.6431。强制 mid-k 误路由下超额损失降低 4.3%,专家损失方差下降而均值几乎不变。
研究者提出 FACTRIA 框架,将院校分析(IA)中潜在的偏见因素归为分析流程、院校背景、课程特征和人口统计四类,并以此驱动一个生成式 AI 聊天机器人,在用户分析 IA 时提示其反思这些因素。
一篇立场论文提出 SPEAR 框架,将人机智能体对齐重新定义为持续的交互设计问题,而非部署前的优化问题。
TraceDSE 是一种智能体设计空间探索流程,用于异构边缘 SoC 上 AI 推理的工作负载映射与 PU 配置联合选择,通过 LLM 提议者-批评者循环并借助系统执行轨迹反馈进行迭代优化。
开源对比决策模型 Contrastive-LM/CLM-v0.1-8B 在公开评测基准上表现接近随机:在 RM-Bench 和 JudgeBench 上与抛硬币无统计差异,在 HaluEval 上对所有条目输出同一标签,与 always-first 基线持平于 0.581。
研究者发布首个可端到端评估 Croissant 元数据提取的基准,含 602 篇论文,其中 102 篇有人工验证的 gold 标注、500 篇为 LLM 生成的 silver 标注,覆盖 Croissant 完整 schema 及 RAI 字段。
研究提出 EDI 约束的图摘要方法 AURORA,将用户偏好建模为加权属性二部图,用贪心粗化算法在合并用户节点时强制满足公平差距(ΔE)、列表内多样性(ILD)和群体包容三项结构约束。
研究者推出 PlaySuite,一个基于 5K 多款开源视频游戏构建的交互式视觉智能基准,覆盖 Pygame、HTML5、Godot 和 Unity 等引擎。该基准配套统一的闭环交互框架和 Video-LLM-as-a-judge 评测协议,并评测了 14 个近期开源模型。结果显示存在明显的感知-行动差距:模型虽推理能力较强,但在空间定位、动作执行和自我纠错上持续失败。
研究者提出 Perturbed Embedding Vector(PEV)攻击,仅向提示词的嵌入向量表示中加入独立高斯噪声,即可越狱六种不同规模的常见开放权重 LLM,在 JailbreakBench 上对所有模型、所有提示词均生成不安全回复。PEV 无需梯度计算、逐提示优化或修改模型内部权重,取得首次成功攻击的平均算力成本比此前方法低至多一个数量级,每个测试模型上首次越狱通常在一分钟内出现。
研究发现,LLM 评审在候选回答顺序调换时可能改变判定,而判定前的残差流激活可预测这种位置翻转。在 JudgeBench 的 534 对样本上,针对三个 Qwen3 评审和 Llama-3.1-8B 训练的线性探针 AUROC 达 .621-.850,比结合语言化置信度、判定标签 logits、回答长度和初始选择的基线高 .062-.113。
LiLib 是一种面向 UAV 的轻量级持续学习方案,通过维护一个小型递归最小二乘专家库,用窗口残差检验检测漂移,再经短探测阶段复用或新建专家。
研究提出推荐系统递归自我改进(Rec-RSI)中的"分布式进展"问题,并用跨代优势(CGA)量化跨代与同代模型对的差异。在四个数据集和三种序列推荐编码器上,GRU4Rec 和 SASRec 更适合跨代配对,FMLP 首次更新偏向同代配对、第二次更新后转向跨代配对;秩分离统计在 12/12 首次更新和 5/6 第二次更新设置中选出更强模型族,留出测试中 34/36 条轨迹优于直接后继模型。
研究指出 Muon 优化器对矩阵更新有清晰解释,但卷积核以四维张量存储,标准实现将其 reshape 为矩阵的做法破坏了其理论基础。为此研究者提出 Convolutional Newton-Schulz(Conv-NS),直接在卷积算子几何中逼近极因子并保留核支撑。
T-CCL 是一个基于 Tensor Memory Accelerator(TMA)的节点内集合通信库,将数据搬运与归约操作卸载到 TMA,以流水线式异步 TMA 操作执行集合通信,在保持高带宽的同时降低 SM 资源占用。
研究者提出统一的 trace 级滥用监控形式化方法,并构建约 6,200 条用户、LLM agent 与环境对话记录的基准,覆盖分解攻击与提示注入攻击两类威胁,标注 harm window 并配良性对照与拒绝实例。
SchemaFill 通过槽位并行推测解码加速 LLM 工具调用,在 Glaive 和 BFCL 上端到端吞吐量最高提升 4.05 倍。该框架将多个字段和调用的候选值并发生成后拼接,由目标模型在实际输出前缀下验证,仅提交通过验证的 token,候选不一致时由目标模型提供修正。代码已开源。
一项研究提出仅靠单个前置 RGB 摄像头和图神经网络,将模拟火车司机状态分为警觉、非警觉和紧急三类。消融实验显示,在光照条件下融合面部与骨骼特征的三分类模型准确率达 81%,二分类警觉/非警觉准确率达 99%,优于仅用面部或骨骼特征的模型。研究同时发布了一个涵盖三种光照条件的受控 RGB 视频数据集。
研究者演示了一套由视觉语言模型(VLM)引导的电磁数字孪生在线校准框架,在 Unitree G1 机器人和 NVIDIA Sionna 上运行,通过两次 VLM 调用完成材质分类与路径点规划。在真实室内场景中,该框架在 20 米行程内实现归一化平均绝对电导率误差 1.74×10⁻⁴,随机初始化则始终无法收敛,随机路径点所需行程超过两倍。
研究者提出 macro2mind,用 GRPO 结合预测市场价格信号训练语言模型,将行为推理拆解为推断市场参与者群体、预测其信念更新并聚合为价格的显式步骤。该方法在 SWM-Bench 的 Polymarket 数据上取得 SOTA 方向准确率与相关性,并零样本迁移至 Humanual、OvertonBench、PRISM、CAD 四个用户模拟基准。
TRIAGE 是一种方向感知的稳定方法,通过段级诊断选择性再平衡策略梯度更新,并对残余严重失配做有界修复,从而在采样器和学习器上保留原生 NVFP4 的 W4A4 前向执行。在 Qwen3-4B 与 Qwen3-30B-A3B 上,该方法在整个训练周期内保持稳定优化,在五个数学推理基准上达到全精度水平,rollout 吞吐量较 BF16 最高提升 2.3 倍。
研究将知识蒸馏与量化联合应用于法译英生物医学翻译,蒸馏并量化的学生模型相比原始基线体积缩小69%、推理速度提升98.21%、CO2排放降低98.46%,且未牺牲翻译质量。该工作还开发并比较了多种微调策略,以让压缩后的学生模型适应专业术语密集、平行语料稀缺的低资源领域。
研究者开发了一套故障注入框架,在软件和硬件层面考察大规模 CNN 在 ReRAM 存内计算(PIM)加速器上推理时的脆弱性,通过将 CNN 学习参数映射到 ReRAM 交叉阵列并注入 stuck-at high(SaH)与 stuck-at low(SaL)故障,发现脆弱性受层类型与深度、参数在层内的位置以及故障取值与类型影响,且 SaL 比 SaH 造成更严重的分类精度下降。
研究者提出 Anchor and Adapt 两阶段提示词学习框架,将异常语义获取与目标正常外观适配分离:Stage I 从带标注辅助数据学习可迁移的正常与异常锚点,Stage II 固定锚点并用少量目标正常样本适配额外正常分支。在 MVTec-AD 与 VisA 跨数据集 1-shot、2-shot、4-shot 设置下,该框架取得有竞争力的检测与定位性能,且无需合成异常生成。
一项受控研究在 313 条 StrongREJECT 提示切片上,用五个多模态模型(附录另测 InternVL3.5-8B)剖析图生文越狱中的图像侧因素:纯有害查询即使配无关良性图片,多数模型攻击成功率仍很低,而攻击图像会大幅提升该指标。
研究对 Qwen2-Audio 上的加性音频越狱方法 AdvWave-P 进行频率与解码深度审计,在 520 条 AdvBench 提示上主评判器将 76.7% 的对抗输入标记为越狱。
研究者提出免训练方法 MaskAhead,用单一掩码查询排序机制同时完成块扩散语言模型的 KV 选择与淘汰,当前块掩码指导选择、后续掩码块探测指导淘汰。
针对后门防御排行榜仅凭被投毒模型上的干净准确率下降来判定“移除代价”的问题,研究者提出 TARE:在同一配方、调度与随机种子下,用未被投毒的孪生模型跑同一防御,孪生模型损失的部分即为真实代价。
DART-ES 通过扰动种群通过率估计题目局部可解性并聚合历史观测构建动态难度状态,联合指导难度重加权与稀有可解样本回放,无需额外难度模型或反向传播。它在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率达 49.20%。
CrystalJev 将冻结的原子间势模型当作快速决策者,对未弛豫结构单次前向查询即可输出带校准概率的"稳定"判断,成本仅为弛豫计算的约三十分之一。在 65 个 Matbench Discovery 模型上,该方法用价值信息理论只在决策可能改变处调用慢速计算,并同样回答电子、力学与分子问题。
研究者提出 IAU-FOA,一种结合视觉不变性增强与自适应非平衡最优传输的定向对抗攻击方法,通过在全局与局部 patch 层面同时对齐对抗样本和目标样本,提升对闭源 MLLM 的可迁移性。