SEMAADB:面向连贯多图 SysML 模型的验证数据集与基准
研究者发布 SEMAADB 数据集与基准,包含 3,000 个工程上下文和 15,000 张图,每个上下文含 Requirement、Block Definition、Activity、State Machine、Sequence 五个相互关联的 SysML 视图,其中 100 个上下文经人工核验构成测试集。
研究者发布 SEMAADB 数据集与基准,包含 3,000 个工程上下文和 15,000 张图,每个上下文含 Requirement、Block Definition、Activity、State Machine、Sequence 五个相互关联的 SysML 视图,其中 100 个上下文经人工核验构成测试集。
RELACE 是一个无需 critic 的框架,通过教师强制似然评分对比动作在原始上下文与结果增强上下文中的可能性,生成轨迹归一化的回顾因子,用于重加权折扣任务回报并构建局部优势。
Apple 提出 Stepped MoE 框架,将弹性结构与稀疏门控架构结合,让单一模型可在 1、2、3、4 billion 参数间灵活切换,并保持输入自适应路由。该模型在知识密集型基准上比同规模稠密模型准确率高 2-5%,延迟与稠密模型相当,同时通过共享参数节省设备磁盘空间,适配端侧推理的 DRAM 与算力限制。
针对蛋白质-分子虚拟筛选,研究者提出因果建模方法 CausalBind,通过 V-structure 因果模型和 Heckman 式选择形式化稀疏交互先验,并证明在结构稀疏条件下交互概念可识别。
研究者发布 TC3-VQA 数据集,用于将伤情视觉观察与战术战伤救治(TC3)临床指南相连接。该数据集由公开教学与实战视频及权威 TC3 文档构建,含 581 个条目、11 个概念和 1,860 个问题,覆盖干预识别、教义、临床推理、流程指导及视觉信息不足时的拒答。
研究者推出 Logbook,一个面向小时级音频理解的基准,录音时长从 10 分钟到 6 天,要求系统在给定连续音频和事件标签词表下输出无间隙的分段、标签与描述。团队对比了 52 个端到端与级联系统,并消融微调、上下文长度和推理预算,发现任务可解但最佳系统仍低于人类参考水平,过度分段普遍存在,微调可部分缓解,端到端系统通常优于级联系统但随上下文变长而退化。
研究者提出 SAG(Self-improving Agent with Gated critique),一种成本感知框架,将批评调用建模为长程交互中的逐步决策问题,通过全局熵与局部 top-2 margin 等动作级歧义信号实现免训练门控,近似批评的信息价值(VoI)。
RelayMoE 是一种基于环结构的 MoE 执行模型,通过让专家权重或 token 在环上流转并本地计算,避免构建完整的 top-k 扩展调度缓冲区。在 30B–57B 生产级 MoE 模型上,单层实验较 Megatron-LM 平均提速 2 倍,全模型训练吞吐最高提升 2.02 倍,可训练序列长度最高扩展 2.85 倍。
时间序列基础模型(TSFM)常用的 ReVIN 等仿射缩放方法会在反变换后计算损失,使每条序列的梯度被乘以 b^p,导致高尺度序列主导训练,作者称之为尺度污染训练(ScaleCon)。
CG-CTI 将 CAPEv2 沙箱的实时输出转换为 STIX 2.1,并在知识图谱中与其他关键基础设施传感器数据关联,为每个情报对象附加基于来源、跨源印证和观测持续性的显式置信状态。
POLAR 是一个 LLM 驱动的框架,可将厂商公告、漏洞库和威胁情报中的碎片化证据合成为以威胁为中心的评估。它先拆分重叠事件并将威胁锚定到来源证据,再结合严重性指标与按时间排序的利用信号估算近期被利用概率,并将威胁数据关联到权威修复知识以组织缓解措施。在公开资源收集的真实漏洞证据上,POLAR 在异构事件和零日场景中提升了威胁排序与缓解检索效果。
Google 部署了 AI 智能体 FlowAgent,在持续集成系统的提交前外循环流程中自动修复测试失败,集成于内部开发者工具 Critique 和 Cider,采用 ReAct 式生成-验证循环与执行前后弃权过滤器。
FlexiFlow 是一个数据流系统,能在当前模型准确率偏低时动态切换到备选模型,通过多臂老虎机方法对模型进行排序,综合考虑模型运行时间、通过用户自定义断言的概率以及 ML 工作流的计算结构。实验显示,切换模型可将工作流准确率提升最高 23%,运行时复用中间结果相比顺序执行工作流还能带来 48% 的效率提升。
SAFESHIELD 是面向小语言模型的部署时安全系统,将安全决策组织为准入、路由、证据、放行四类职责,并把已提交决策记录为可审计的 Decision Traces。协调消融实验显示,移除准入门控会显著增加误放行,而放行决策缺少上游证据时准确率从 96.0% 降至 69.5%,表明部署时安全不仅取决于单个护栏能力,也取决于决策如何组织与协调。
研究者提出 Analytical Memory Unit(AMU),为每条缓存结果附加完整派生(血缘)图,并只在请求者对所有涉及列均有权限时才返回命中,从而阻止经由合法计算结果泄露敏感列。
研究者提出最小见证强化学习(MWRL),将"找出全部最小充分见证"形式化为最小见证识别问题,仅凭单个黑盒验证器的反馈位即可完成信用分配。该方法从问题定义直接推导,统一了最小性与备选解恢复两项要求,并据此给出可恢复完整见证族的值迭代规划器和可扩展到大语言模型的策略梯度方法。实验中 MWRL 能找回大部分最小见证,而其他方法只返回冗余超集或单一见证。
TIDE 2.0 是一个 MIT 许可的开源引擎,采用可替换识别器与键控匿名器两阶段设计,支持机构本地部署,替代符以密码学生成且不存储关联表,日期按患者做保持间隔的偏移。
RoboCap 是一个 250g、六摄像头、双 IMU 的帽子式设备,用于在真实环境中采集第一人称操作数据,配套的 Grounded API 提供与设备无关的 3D 算法。该平台在公开基准上取得 SOTA 表现,涵盖多场景 SLAM、第一人称深度估计,以及适配第三方设备的手部追踪。
研究者提出 DRMoET,一种将逐层专家视为内生鲁棒分组、优化高损失路由结果的即插即用目标,而非仅均衡流量。在 FLAME-MoE 配方下,10.3B 总参数、67B 训练 token 时,DRMoET 将七任务平均分从 0.6625 提升至 0.6767,无辅助损失均衡基线为 0.6431。强制 mid-k 误路由下超额损失降低 4.3%,专家损失方差下降而均值几乎不变。
研究者提出 FACTRIA 框架,将院校分析(IA)中潜在的偏见因素归为分析流程、院校背景、课程特征和人口统计四类,并以此驱动一个生成式 AI 聊天机器人,在用户分析 IA 时提示其反思这些因素。
一篇立场论文提出 SPEAR 框架,将人机智能体对齐重新定义为持续的交互设计问题,而非部署前的优化问题。
TraceDSE 是一种智能体设计空间探索流程,用于异构边缘 SoC 上 AI 推理的工作负载映射与 PU 配置联合选择,通过 LLM 提议者-批评者循环并借助系统执行轨迹反馈进行迭代优化。
开源对比决策模型 Contrastive-LM/CLM-v0.1-8B 在公开评测基准上表现接近随机:在 RM-Bench 和 JudgeBench 上与抛硬币无统计差异,在 HaluEval 上对所有条目输出同一标签,与 always-first 基线持平于 0.581。
研究者发布首个可端到端评估 Croissant 元数据提取的基准,含 602 篇论文,其中 102 篇有人工验证的 gold 标注、500 篇为 LLM 生成的 silver 标注,覆盖 Croissant 完整 schema 及 RAI 字段。
研究提出 EDI 约束的图摘要方法 AURORA,将用户偏好建模为加权属性二部图,用贪心粗化算法在合并用户节点时强制满足公平差距(ΔE)、列表内多样性(ILD)和群体包容三项结构约束。
研究者推出 PlaySuite,一个基于 5K 多款开源视频游戏构建的交互式视觉智能基准,覆盖 Pygame、HTML5、Godot 和 Unity 等引擎。该基准配套统一的闭环交互框架和 Video-LLM-as-a-judge 评测协议,并评测了 14 个近期开源模型。结果显示存在明显的感知-行动差距:模型虽推理能力较强,但在空间定位、动作执行和自我纠错上持续失败。
研究者提出 Perturbed Embedding Vector(PEV)攻击,仅向提示词的嵌入向量表示中加入独立高斯噪声,即可越狱六种不同规模的常见开放权重 LLM,在 JailbreakBench 上对所有模型、所有提示词均生成不安全回复。PEV 无需梯度计算、逐提示优化或修改模型内部权重,取得首次成功攻击的平均算力成本比此前方法低至多一个数量级,每个测试模型上首次越狱通常在一分钟内出现。
研究发现,LLM 评审在候选回答顺序调换时可能改变判定,而判定前的残差流激活可预测这种位置翻转。在 JudgeBench 的 534 对样本上,针对三个 Qwen3 评审和 Llama-3.1-8B 训练的线性探针 AUROC 达 .621-.850,比结合语言化置信度、判定标签 logits、回答长度和初始选择的基线高 .062-.113。
LiLib 是一种面向 UAV 的轻量级持续学习方案,通过维护一个小型递归最小二乘专家库,用窗口残差检验检测漂移,再经短探测阶段复用或新建专家。
研究提出推荐系统递归自我改进(Rec-RSI)中的"分布式进展"问题,并用跨代优势(CGA)量化跨代与同代模型对的差异。在四个数据集和三种序列推荐编码器上,GRU4Rec 和 SASRec 更适合跨代配对,FMLP 首次更新偏向同代配对、第二次更新后转向跨代配对;秩分离统计在 12/12 首次更新和 5/6 第二次更新设置中选出更强模型族,留出测试中 34/36 条轨迹优于直接后继模型。
研究指出 Muon 优化器对矩阵更新有清晰解释,但卷积核以四维张量存储,标准实现将其 reshape 为矩阵的做法破坏了其理论基础。为此研究者提出 Convolutional Newton-Schulz(Conv-NS),直接在卷积算子几何中逼近极因子并保留核支撑。
T-CCL 是一个基于 Tensor Memory Accelerator(TMA)的节点内集合通信库,将数据搬运与归约操作卸载到 TMA,以流水线式异步 TMA 操作执行集合通信,在保持高带宽的同时降低 SM 资源占用。
研究者提出统一的 trace 级滥用监控形式化方法,并构建约 6,200 条用户、LLM agent 与环境对话记录的基准,覆盖分解攻击与提示注入攻击两类威胁,标注 harm window 并配良性对照与拒绝实例。
SchemaFill 通过槽位并行推测解码加速 LLM 工具调用,在 Glaive 和 BFCL 上端到端吞吐量最高提升 4.05 倍。该框架将多个字段和调用的候选值并发生成后拼接,由目标模型在实际输出前缀下验证,仅提交通过验证的 token,候选不一致时由目标模型提供修正。代码已开源。
一项研究提出仅靠单个前置 RGB 摄像头和图神经网络,将模拟火车司机状态分为警觉、非警觉和紧急三类。消融实验显示,在光照条件下融合面部与骨骼特征的三分类模型准确率达 81%,二分类警觉/非警觉准确率达 99%,优于仅用面部或骨骼特征的模型。研究同时发布了一个涵盖三种光照条件的受控 RGB 视频数据集。
研究者演示了一套由视觉语言模型(VLM)引导的电磁数字孪生在线校准框架,在 Unitree G1 机器人和 NVIDIA Sionna 上运行,通过两次 VLM 调用完成材质分类与路径点规划。在真实室内场景中,该框架在 20 米行程内实现归一化平均绝对电导率误差 1.74×10⁻⁴,随机初始化则始终无法收敛,随机路径点所需行程超过两倍。
研究者提出 macro2mind,用 GRPO 结合预测市场价格信号训练语言模型,将行为推理拆解为推断市场参与者群体、预测其信念更新并聚合为价格的显式步骤。该方法在 SWM-Bench 的 Polymarket 数据上取得 SOTA 方向准确率与相关性,并零样本迁移至 Humanual、OvertonBench、PRISM、CAD 四个用户模拟基准。
TRIAGE 是一种方向感知的稳定方法,通过段级诊断选择性再平衡策略梯度更新,并对残余严重失配做有界修复,从而在采样器和学习器上保留原生 NVFP4 的 W4A4 前向执行。在 Qwen3-4B 与 Qwen3-30B-A3B 上,该方法在整个训练周期内保持稳定优化,在五个数学推理基准上达到全精度水平,rollout 吞吐量较 BF16 最高提升 2.3 倍。
研究将知识蒸馏与量化联合应用于法译英生物医学翻译,蒸馏并量化的学生模型相比原始基线体积缩小69%、推理速度提升98.21%、CO2排放降低98.46%,且未牺牲翻译质量。该工作还开发并比较了多种微调策略,以让压缩后的学生模型适应专业术语密集、平行语料稀缺的低资源领域。
研究者开发了一套故障注入框架,在软件和硬件层面考察大规模 CNN 在 ReRAM 存内计算(PIM)加速器上推理时的脆弱性,通过将 CNN 学习参数映射到 ReRAM 交叉阵列并注入 stuck-at high(SaH)与 stuck-at low(SaL)故障,发现脆弱性受层类型与深度、参数在层内的位置以及故障取值与类型影响,且 SaL 比 SaH 造成更严重的分类精度下降。