ApexQuant:无需数据的弹性量化,通过残差重各向同性化实现
ApexQuant 是一种无需校准的量化方法,通过递归重量化残差误差,可作为现有量化器的精炼层。该方法在四个开源 LLM 及地球观测和医疗领域验证,4 bit 下接近全精度,并给出所测最佳 2 bit 方案,完全无需数据。每个前缀本身即为有效的低比特模型,单一产物可服务多种精度。
ApexQuant 是一种无需校准的量化方法,通过递归重量化残差误差,可作为现有量化器的精炼层。该方法在四个开源 LLM 及地球观测和医疗领域验证,4 bit 下接近全精度,并给出所测最佳 2 bit 方案,完全无需数据。每个前缀本身即为有效的低比特模型,单一产物可服务多种精度。
FC-SWE 是一种失败条件化强化学习框架,在补丁验证失败后把失败补丁与验证器反馈作为上下文,让智能体在仓库原始状态下生成恢复轨迹。
研究提出 Negative-Policy OPD(NP-OPD),在 rollout 阶段引入能力更弱的负策略,持续提供负策略偏好但教师不偏好的 token,使其始终处于教师监督之下,从而在保留正向教师监督的同时补充显式负向信号。实验显示 NP-OPD 在多种模型规模、生成模式、推理领域和不同 OPD 变体上均优于 OPD,并能有效抑制负策略偏好的 token、使学生远离负策略。代码将公开。
研究者提出 Tram-FL(Traveling Model Training Mechanism for Decentralized Federated Learning),通过让单个模型在节点间顺序循环训练来实现去中心化联邦学习,以最小化计算与通信开销。
该研究将个体路径复现建模为基于学习到的驾驶员特定隐式路段成本的最短路径问题,提出包含感知模型与约束优化层的神经管线,并采用决策聚焦学习实现端到端训练,通过隐式最大似然估计(iMLE)近似非可微层的梯度。实验表明该框架在路径复现上优于基线路径选择模型,学到的隐式成本可作为感知出行成本的代理,解释异质性路径选择。
研究审计了 BitNet b1.58、Falcon-E 和 BitCPM 三个实验室的三元语言模型导出流程,发现文档化的 bf16 转换步骤会使已发布 checkpoint 中 0.83%-1.77% 的三元码与 fp32 量化结果不一致。
研究用 Qwen2.5-7B 在 9 种特权上下文组合和 3 个数据集上做 On-Policy 自蒸馏(OPSD),考察内容(演示、反馈、改写)与来源(外部、带验证器自生成、无验证器自生成)对策略漂移的影响。
FreshCast 是一个即插即用检索框架,在保持预测模型冻结的前提下,用新观测持续更新非参数记忆,并通过关系核回归生成记忆预测、在验证集上闭式校准其权重。在七个基准和十种预测架构上,FreshCast 对每个模型和输入长度都降低了平均 MSE,输入长度 96 和 720 时分别降低 14.6% 和 5.6%。
CANDLE 是一种学习式电生理源成像(ESI)模型,通过在 T1 加权 MRI 导出的源-传感器映射所诱导的零空间上学习先验,在保留几何约束的同时仅对不可观测源分量建模,从而适配受试者个体化皮层几何。
TTNet 是一种结合 CNN、ResNet 与自注意力机制的多任务深度学习模型,可基于智能乒乓球拍采集的六轴传感器数据,同时预测球员性别、持拍手、球龄和技能水平四项属性。该模型采用两阶段训练策略,引入数据增强与任务专属损失函数以提升不平衡数据上的泛化能力,在 AI CUP 2025 乒乓球智能球拍数据分析竞赛官方榜单上获得第二名。
模型合并需搜索最优合并系数,随模型规模和数量增长成本极高。αTransfer 发现同一模型族内不同规模模型的合并系数性能分布高度一致,可先在小代理模型上搜索系数再直接迁移到大模型。实验显示,该方法在视觉 Transformer 上提速 6 倍、内存降低 70%,在大语言模型上提速 20 倍、内存降低 85%,性能相当。
Airbnb 提出 SIFT(Search Intent-to-Filter Transformer),直接从未经处理的用户行为序列学习偏好,取代人工特征工程,并统一支持预订概率、筛选器互动和房型数量阈值等多任务预测。
MASKerade 是一种稠密到 MoE 训练方法,将专家学习为冻结预训练 FFN 的稀疏子网络,每个专家由学习到的二值掩码定义,并由 token 级路由器选择执行与组合,路由器和掩码分数联合优化而 FFN 权重保持不变。
TRACE 是面向 MoE 语言模型 RL 训练的 FP4 量化框架,用 rollout 侧量化结果引导训练侧 FP4 舍入决策,直接缩小训练与 rollout 两条量化执行路径的差异。
研究者提出 BAR,一个面向医疗知识图谱的预算感知 LLM 推理框架,通过 plan-navigate-verify 循环在患者特定预算下检索证据并支持引用溯源。
研究者提出 Neuromotor Hierarchy Network(NHN),从任务监督中学习紧凑的潜在神经运动状态,以表示与任务相关的神经肌肉协调。
研究提出一种对抗强化学习框架用于论辩挖掘(AM)的合成数据生成,生成器产出结构化 AM 实例,判别器通过区分真实与合成数据提供学习信号,二者在对抗循环中联合优化。实验表明,该框架在三个基准数据集的全数据和低资源设置下均持续提升 AM 性能。该工作已被 EMNLP 2026 Findings 接收。
对高分辨率模型逆向攻击(MIA)的标准评估显著低估了训练数据隐私泄露:在 FaceScrub 上对攻击做简单自适应调整后,MixUp、对抗训练等防御及无防御模型的图像泄露率提升 1.16 至 6.59 倍,声称隐私最强的防御增幅最大。
研究团队提出心电基础模型 MS-ECG-FM,通过对比对齐 ECG、超声心动图、放射和出院报告等多种临床记录类型进行训练,突破以往仅依赖 ECG 解读报告作为监督的局限。在扩展的 ECG 检测基准上,该模型在 ECG 可检测的全部病症范围内全面超越现有方法,在减少导联配置下同样表现优异。不同报告分别提升不同诊断领域的表征,多源对齐则捕捉其互补信息,在临床多样化任务上保持稳定强劲表现。
研究提出 Co-Train 与 Dual-Space Retrieval 两个与骨干无关的框架,将自监督表征(SSL)作为监督表征的互补信号,用于 OOD 节点分类。
研究者将在线主动特征获取(AFA)建模为带背包的组合 Bandits(BwK)问题,在全局预算约束下同时决定特征获取与预测,并给出优于标准 BwK 的 regret 上界。为规避指数级动作空间,他们提出 LP-Chain,以随特征数线性增长的代价感知特征子集链进行搜索。在合成数据上,LP-Chain 优于基于 HEDGE 的 BwK 和深度 RL 的在线 AFA 基线,并能更好地扩展到更多特征。
针对半监督学习中标注与未标注数据在类别分布和标签空间上双重失配的问题,研究者提出 hub-spoke 隐空间几何结构,让已知类均匀分布在中心 hub 周围并各自围绕原型形成紧凑簇,hub 同时作为高不确定性未知类样本的低证据区域锚点。该方法结合基于证据的分类器,通过结构化特征组织缓解多数类主导,提升特征判别力与不确定性分离能力。实验显示其优于现有 SOTA 方法,在不同设置下最高提升 3.25%。
TAFFY 是一个结合 In-Context Diversity Prior 与 Task-Conditioned Looped Transformer 的表格基础模型,通过从共享因果过程经受控干预和分布偏移生成的多个相关环境中采样来构建合成预训练上下文,并迭代地选择性应用共享 Transformer 块进行任务自适应精炼。在六个分类和五个回归基准数据集上,TAFFY 取得最低平均排名。
研究者提出 Global Transport(GT),一种不依赖类别标签的全局类别无关最优传输耦合,用于条件流模型的训练。GT 单独使用会因将不同条件关联到源噪声不同区域而降低性能,但与无分类器引导(CFG)结合后,在离散类别和连续文本条件的图像生成中,跨模型规模和采样预算均稳定提升生成效果。该结果表明耦合设计应在推理时的引导流下评估,可作为无需改动架构、采样器或引导机制的训练期优化手段。
研究指出,JEPA 世界模型仅靠下一步预测加防坍缩正则,无法保证保留可控的不稳定模态,训练损失最小化时这些模态仍可能被坍缩。为此作者在世界模型训练中加入动作重建目标(逆动力学损失),并证明精确动作重建可使编码器在有限时域可达子空间上单射。在 CartPole、Walker2D 和 PointMaze 上的实验表明,该控制感知表示学习方法在非线性视觉控制任务中同样有效。
一项针对混合 Fourier 神经算子的数值案例研究表明,在模拟相干 4f 处理器上,定向搜索找到的器件在 120 个模型中的留出误差达到 200 个随机 Monte Carlo 器件最大值的 1.08-3.10 倍。
针对并行量化误差沿残差流累积的问题,研究者提出"激活去噪"方法,将上游误差建模为噪声,通过预处理加度量加权舍入进行正则化,在保持全并行量化的同时恢复串行量化的大部分收益,耗时仅为后者一小部分。该方法形成的深度累积平滑惩罚可抑制量化误差放大,且与量化中常用的正交旋转互补、效果叠加。
研究者提出 CARAT,将模型依赖度估计与运行时损坏检测解耦,通过源训练阶段的不对称模态 dropout 课程学习缺失鲁棒的主干网络,并基于窗口输入投影梯度范数导出冻结的依赖度代理。
研究提出掩码频带功率预测(MBP)作为 EEG 自监督预训练目标,对掩码通道-时间块预测固定窄带对数谱能量,避免相位敏感的波形重建和学习式码本。
研究者提出一种有限深度框架,通过近似策略 Hessian 和混合导数来估计策略敏感性,从而适应其他智能体行为变化,无需大量新交互数据。该方法具有可调节的传播深度,并推导了截断误差界,深度越大误差越小,全时域传播时误差消失。在信念驱动的追逃博弈中,该方法估计精度和策略适应均优于基线,基于敏感性的初始化提升了零样本回报及后续微调效果。
SemARC 将序列模态聚合器(SeMA)与自适应运行时控制器(ARC)结合,在编码器运行前就选定下一个模态,只执行被选中的编码与融合分支。在六个多模态分类数据集和十一个基线上,SemARC 平均宏 F1 提升 3.2%、总推理 GFLOPs 降低 61.4%,端到端延迟在 GPU 与 CPU 上下降 44.0%、Android INT8 上下降 47.2%。
研究者提出超图神经加性网络(HGNAN),将经典神经加性模型扩展到高阶关系数据,通过特征级非线性分解与超图感知结构聚合,实现节点级和超边级任务的可解释预测。在基准数据集上,HGNAN 性能与当前最优超图学习方法相当,同时提供内在且有意义可解释性。
研究发现,同一 Autoresearch 智能体在相同任务上的独立运行常停滞在分数差异明显的「想法盆地」中,即使追加大量算力差距仍持续。为此提出的 fork-and-flush 方法将智能体分叉为多条并行轨迹,各自继承累积工作区但使用全新对话上下文,运行固定时长后从得分最高的轨迹继续。
研究在 Android in the Wild 上用 LoRA 微调 Qwen2-VL-2B,比较五种向小型 GUI grounding 模型注入动作类型的方式。
StaFIR 是一种因果有限脉冲响应滤波器,通过可学习的非负指数滞后剖面混合,以凸优化目标在经验平稳性与输入相似度之间取得平衡。在 ARFIMA–GARCH 和滚动金融序列实验中,它能随序列持续性调整滤波强度,并在平稳状态下减少不必要的变换。下游预测中其精度与固定半阶差分无明显差异,但对原始信号的相似度更高。
研究提出一个面向 EEG 脑机接口解码的在线自适应基准,在时间有序的 prequential(先测后训)评估下比较 CSP 与黎曼协方差两类流水线。在四个数据集(三个运动想象、一个运动解码)上,标签揭示的在线更新在两个最大数据流中改善了 14 个模型/数据集组合中的 13 个,相对冻结模型准确率提升最高约 18%。
研究者提出可学习频谱激活函数(LSA),用残差截断傅里叶级数替代固定的神经元级非线性,谐波幅值在训练中学习。LSA 不扩展渐近函数类,而是改变表示的因子分解方式,使线性权重选择特征、激活系数控制频谱整形,两者由独立梯度更新。在音频、图像、神经辐射场和神经声场任务上,LSA 均提升了重建质量。
研究提出用 prior-data fitted networks(PFN)从有限离线数据中学习和评估主动特征获取策略。作者发现,在离线数据覆盖不均衡时,以总预测熵为奖励会引入认知偏差,惩罚对稀疏观测特征的获取,因为它把认知不确定性与偶然不确定性混为一谈。
一项被 NeurIPS 2026 预训练到后训练 Workshop 接收的研究指出,pass@k 只依赖问题被答对的概率,无法反映答案分布。用 GRPO 和 RFT 训练 Qwen2.5-1.5B-Instruct 后,三项多样性指标走向相反,GRPO 正确解的词法多样性低 15%,但 pass@8 和 pass@32 在 GSM8K 上无一致赢家,仅在低 k 时出现分离。
Fed-BRDECS 是一个隐私保护且异构感知的联邦深度嵌入聚类框架,用本地可计算的样本稳定性损失替代全局归一化聚类目标,避免传输本地软分配分布。它引入预测均衡采样和质心级重启来应对非 IID 客户端分布,在图像与文本聚类基准的 IID 和非 IID 划分下均优于代表性联邦聚类与深度聚类基线。该框架还可用于联邦时间序列异常检测,在不增加推理成本的情况下提升基于重构的检测器。