PHBA:前缀状态混合块注意力
研究提出 Prefix-State Hybrid Block Attention(PHBA),用 top-k 块稀疏检索替代固定局部滑动窗口注意力,并将每个检索块与其前缀状态配对,前缀状态由块边界处的门控线性递归构建。
研究提出 Prefix-State Hybrid Block Attention(PHBA),用 top-k 块稀疏检索替代固定局部滑动窗口注意力,并将每个检索块与其前缀状态配对,前缀状态由块边界处的门控线性递归构建。
研究者在 Latent Dynamics Networks(LDNet)基础上提出改进方法,使其能处理初始条件变化的 PDE 系统,同时保留原有端到端训练和无编码器特性。
针对早期阶段数据预测布线后时序的难题,研究者提出 STEP-KD,利用布线后、布局后、floorplan 后各阶段教师模型,通过表征对齐将知识序贯蒸馏到综合后学生模型。实验显示其将 Total Negative Slack 预测的加权平均绝对百分比误差降至 19.78%,而业界标准 STA 工具为 74.84%。
研究者提出 Sparse Segment Reduction(SSR),一种针对三值 LLM 与三值权重网络(TWN)推理的三值矩阵乘法方法,通过专用三值数据格式和随稀疏度扩展的计算树利用稀疏结构。
VETTA 通过共享轻量 critic 上的独立价值头,联合学习回合级与 token 级信用,并将回合优势与响应内中心化的 token 残差结合用于 PPO 更新。
研究提出用占用度量(occupancy measure)将 MDP 重构为线性规划(LP),通过 pivoting 算法识别可行多面体的活跃约束,推导出闭式梯度,替代依赖 Bellman 方程 KKT 条件、需在全状态-动作对上求解线性系统的方法。
研究者提出 EGO(Evolutionary Generators with One-step inference),一种直接在离散输出上训练紧凑生成器的框架,结合分布匹配、结构约束与可选多样性奖励,采用对偶低秩进化策略,无需特定准则的可微代理。
针对脑连接组诊断分类中确定性 GNN 过度自信的问题,该综述系统梳理了 aleatoric 与 epistemic 不确定性来源及 Bayesian 近似、集成方法、证据学习和 conformal prediction 等 UQ 范式。
研究提出结构感知图弃权方法,将实例级可信度与变量间关系一致性视为两条独立可靠性轴,通过可学习稀疏图和 Dirichlet 式结构能量 E_struct 实现后者,并用误差加权图正则化与分数-误差对齐训练。在七个长时程基准和四个骨干模型上,结构门控在相同覆盖率下常比 TEM 降低选择性 MSE,跨变量结构信息更丰富时增益最大,但增益并非普遍存在。
OxiGen 是一种氧化态感知的晶体扩散模型,在生成过程中显式表示氧化态,并通过有限状态自动机精确推理的结构化输出层强制满足全局电荷中性。实验显示,OxiGen 大幅提升了氧化态保真度,在评估方法中生成稳定、唯一且新颖晶体的比例最高,即便在性质条件下也保持高组成有效性。
罗斯托克大学等机构提出 LDTool 和 HLDTool,用于从表格数据中提取并可视化多属性逻辑依赖(LD)与函数依赖(FD)。LDTool 将依赖发现扩展到成对关系之外,HLDTool 通过超图引导的搜索空间缩减实现可扩展提取。在 3 个模拟和 11 个真实数据集上,LDTool 在高维特征空间中以更低运行时间复现了现有 FD 发现方法的相同结果,HLDTool 则支持数百个特征的依赖发现。
针对表演性预测中仅能观测到被接受子集标签的"选择性标签"问题,研究者形式化定义了该场景,并证明仅用观测数据重训练会误导过程、破坏收敛保证。他们提出基于正标签概率置信区间的最坏情况目标,对其实施重复风险最小化(RRM)可将结果保持在真实稳定点的有界距离内。在带公平正则化的借贷实验中,该鲁棒优化方法性能接近拥有完整标签访问权的 RRM。
研究在线性函数逼近下用分段奖励反馈替代逐状态-动作奖励的强化学习。针对等长分段,作者提出 $\bitssegd$、$\edlinucbsegd$ 及统一 $\seglsvits$ 框架,并给出近匹配下界;二元反馈下增加分段数可指数级降低 regret,而求和反馈下分段粒度影响不大。允许任意分段的 $\uneqsegbitsd$ 表明等长分段性能最佳。
研究因果验证了语言模型识别网络基础设施信息(主机名与IP地址配对)的注意力头:在三个架构家族的五个模型中,每个模型仅需1至9个注意力头(候选128至1152个)即可支撑检测器达到99.5–100%的留出准确率。
针对扩散模型的潜空间水印方法,一项理论分析首次解释了这类方法为何对旋转、缩放、平移等图像扰动缺乏不变性,并推导出刻画像素空间扰动与潜空间响应关系的最大扰动界。研究还首次给出覆盖实际检测机制各组件的解析形式,实验验证了理论结论:在当前设计范式下,基于潜空间的水印方法固有地表现出有限鲁棒性。
研究者提出无训练两阶段闭式框架,通过 Fisher 加权非对称对齐与秩约束自然梯度校正,改进极低比特量化大语言模型的低秩误差补偿。在 QuIP# 2-bit 下,该方法将 Qwen3-8B 的 WikiText-2 困惑度从 12.43 降至 10.26,Qwen3-4B 从 21.11 降至 13.22。
研究者提出 Mu-DisCoCat,一个面向 DisCoCat 的多模态变分量子学习框架,用于实现组合概念泛化(CoCoGen)。该框架先从单物体图文对学习稳定的物体表示,再固定这些表示学习多物体场景中的关系;经典模拟中使用 Uhlmann 态保真度计算多模态电路表示的重叠,关系 OOD 准确率高于所评估的 CLIP 基线。
研究在 Hanabi 衍生环境中测试八款 LLM:线性探针识别意图约定的准确率明显高于目标约定,但接收决策并不总与发送方约定一致。将约定转为外部动作建议带来的协作提升平均大于规则陈述,Qwen3-8B 案例中模型对动作建议的敏感度远高于规则陈述。
研究测试了 Chronos-2、TimesFM-2.5 和 TabPFN-TS 在强制工程系统上的反事实辨识能力,发现 TimesFM-2.5 和 TabPFN-TS 通过默认协变量接口表现为无记忆(TimesFM-2.5 的 R²=1.000),Chronos-2 虽能辨识动态但存在衰减,预测效应仅为真实值的 0.33-0.80。
研究者提出 A2D,一个免训练框架,可将 AR 模型的后训练权重更新直接复用到扩散语言模型上。AR 与扩散后训练更新在权重空间近乎正交,却能带来更一致的表示变化,组合两者可同时保留双方收益。
研究者提出"优化编码器"视角,将神经场中的隐变量优化统一为编码过程,并据此推出基于等变 Transformer 的神经场模型 MetaLF。MetaLF 通过自注意力对隐变量点云进行上下文化,在图像与 3D 形状重建中仅需 3 到 5 次梯度更新即可提升保真度,并支持图像、形状与体数据的语义预测。
研究者提出一种专为 LoRA 定制的新黎曼度量,利用 $(B, A) \sim (BG^{-1}, AG^\top)$ 等价关系诱导的商流形,在每次梯度步引入预条件。理论上证明该预条件使 LoRA 的权重更新方向最接近全量微调的梯度方向,且更新后权重矩阵在 Frobenius 范数上比常规预条件和无预条件更接近全量微调。语言与视觉领域的微调实验验证了其有效性与效率。
SepsisLens 通过保留变量索引的时间状态实现可分解的早期脓毒症预警,在风险合成前不压缩变量维度。该模型在三个公开 ICU 队列和一个私立医院队列上均取得强判别性能,并在 MIMIC-IV 上于相同事件召回率下降低告警负担。结构消融支持其设计,输入侧掩码显示排序分量反映了对预测影响更大的变量。
研究评估了 CLOOME、CellCLIP 等基于分子-形态配对数据对比预训练的分子编码器能否作为表型预测的廉价替代方案。在控制预训练边界泄漏和表型活性与细胞毒性相关性两个混杂因素后,六种表征(含匹配 CLOOME 输入与层数的非预训练 MLP 对照)在两个 Cell Painting 筛选中均显示,预训练分子编码器相较普通理化描述符无明显优势,且毒性通常比表型活性更易预测。
研究发现,模型合并中通过额外数据集搜索任务权重更新线性组合系数的标准做法,会引入一种隐式正则化,将候选模型限制在任务权重更新张成的子空间内。实验表明,去掉这一正则化直接优化合并模型权重,可在多种架构和领域显著提升常见合并方法的表现,甚至在每类仅一个样本的极端数据受限场景下依然有效;直接优化预训练模型权重也能超越部分现有合并方法。
研究提出受控的性能归因框架,在保持低阶(成对)信息不变的前提下扰动高阶信息,覆盖三类任务的 25 个常用超图学习基准。结果显示,高阶模型(如超图神经网络)原本优于低阶基线,但在扰动后仍保留大部分优势,说明这部分增益无需高阶信息即可获得。更丰富的成对加权、更多成对特征传播步数和归一化等简单改进可缩小剩余差距,作者呼吁区分性能增益与其解释并采用更强的低阶基线。
研究在 log-concave 噪声的随机效用模型下,从人类比较反馈中恢复物品排序所需的样本量。反馈分完整排序与仅揭示第一名两种类型,作者为二者建立了最坏情况样本复杂度下界,并提出匹配至对数因子的算法,且无需知道噪声分布、仅需方差上界。结果表明仅知胜者反馈的排序问题本质上更难,其样本复杂度取决于物品集合中的最小获胜概率。
研究者推出 DecepEval 基准,包含 3 类任务家族、28 个专业场景共 1,532 个实例,用于评估 LLM 智能体的欺骗行为。该基准基于经典欺诈理论提出 LLM Deception Diamond 框架,刻画压力、激励、机会与冲突四类外部条件,并通过中性版与诱导版配对测量欺骗率变化。
研究者提出 Generalized Matheron Variational Implicit Processes(GMVIP),一种针对隐式过程先验的路径式变分族,用于后验推断。
研究者重新审视了深度强化学习中时间正则化无法提供空间平滑性的假设,证明时间惩罚项能约束共享同一后继状态的当前状态间的期望动作差异,并据此提出 CATS 方法,将时间惩罚与线性递增结合。仿真和真实世界实验显示,CATS 在不降低任务性能的前提下大幅减少动作振荡,计算开销极小。
ApexQuant 是一种无需校准的量化方法,通过递归重量化残差误差,可作为现有量化器的精炼层。该方法在四个开源 LLM 及地球观测和医疗领域验证,4 bit 下接近全精度,并给出所测最佳 2 bit 方案,完全无需数据。每个前缀本身即为有效的低比特模型,单一产物可服务多种精度。
FC-SWE 是一种失败条件化强化学习框架,在补丁验证失败后把失败补丁与验证器反馈作为上下文,让智能体在仓库原始状态下生成恢复轨迹。
研究提出 Negative-Policy OPD(NP-OPD),在 rollout 阶段引入能力更弱的负策略,持续提供负策略偏好但教师不偏好的 token,使其始终处于教师监督之下,从而在保留正向教师监督的同时补充显式负向信号。实验显示 NP-OPD 在多种模型规模、生成模式、推理领域和不同 OPD 变体上均优于 OPD,并能有效抑制负策略偏好的 token、使学生远离负策略。代码将公开。
研究者提出 Tram-FL(Traveling Model Training Mechanism for Decentralized Federated Learning),通过让单个模型在节点间顺序循环训练来实现去中心化联邦学习,以最小化计算与通信开销。
该研究将个体路径复现建模为基于学习到的驾驶员特定隐式路段成本的最短路径问题,提出包含感知模型与约束优化层的神经管线,并采用决策聚焦学习实现端到端训练,通过隐式最大似然估计(iMLE)近似非可微层的梯度。实验表明该框架在路径复现上优于基线路径选择模型,学到的隐式成本可作为感知出行成本的代理,解释异质性路径选择。
研究审计了 BitNet b1.58、Falcon-E 和 BitCPM 三个实验室的三元语言模型导出流程,发现文档化的 bf16 转换步骤会使已发布 checkpoint 中 0.83%-1.77% 的三元码与 fp32 量化结果不一致。
研究用 Qwen2.5-7B 在 9 种特权上下文组合和 3 个数据集上做 On-Policy 自蒸馏(OPSD),考察内容(演示、反馈、改写)与来源(外部、带验证器自生成、无验证器自生成)对策略漂移的影响。
FreshCast 是一个即插即用检索框架,在保持预测模型冻结的前提下,用新观测持续更新非参数记忆,并通过关系核回归生成记忆预测、在验证集上闭式校准其权重。在七个基准和十种预测架构上,FreshCast 对每个模型和输入长度都降低了平均 MSE,输入长度 96 和 720 时分别降低 14.6% 和 5.6%。
CANDLE 是一种学习式电生理源成像(ESI)模型,通过在 T1 加权 MRI 导出的源-传感器映射所诱导的零空间上学习先验,在保留几何约束的同时仅对不可观测源分量建模,从而适配受试者个体化皮层几何。
TTNet 是一种结合 CNN、ResNet 与自注意力机制的多任务深度学习模型,可基于智能乒乓球拍采集的六轴传感器数据,同时预测球员性别、持拍手、球龄和技能水平四项属性。该模型采用两阶段训练策略,引入数据增强与任务专属损失函数以提升不平衡数据上的泛化能力,在 AI CUP 2025 乒乓球智能球拍数据分析竞赛官方榜单上获得第二名。