MemFLoRA:面向边缘端 CNN 适配的内存下限 LoRA
MemFLoRA 是一种面向 CNN 边缘适配的低秩适配器,采用内存优先设计而非直接套用面向 Transformer 的 LoRA。它冻结下投影、训练尺度匹配的上投影,并将保存状态压缩到低秩分支,在三个 HAR 数据集和两个 CNN 骨干上,相比全量微调减少 98.5-98.7% 的激活内存和 94.9-97.3% 的峰值训练状态内存,同时匹配或超过 CNN PEFT 基线。
MemFLoRA 是一种面向 CNN 边缘适配的低秩适配器,采用内存优先设计而非直接套用面向 Transformer 的 LoRA。它冻结下投影、训练尺度匹配的上投影,并将保存状态压缩到低秩分支,在三个 HAR 数据集和两个 CNN 骨干上,相比全量微调减少 98.5-98.7% 的激活内存和 94.9-97.3% 的峰值训练状态内存,同时匹配或超过 CNN PEFT 基线。
研究者提出 Selective-RL,通过隔离强化学习阶段的参数更新、保留其主导矩阵方向并保持幅度,将其迁移至 VLM 的语言模块。在三个模型家族、五个视觉推理基准上,该方法在 15 项对比中有 12 项优于完整更新插值,其中 Qwen 接收模型的 MathVision 提升 8.55 个百分点。对照实验显示,仅靠更新幅度或任意低秩无法复现该增益。
研究者提出"特征信息动力学"框架,用信息论方法定位扩散模型中每个特征在何时被生成,借助 I-MMSE 恒等式将特征互信息变化率与最优无条件去噪损失和特征条件去噪损失之间的差距关联,给出特征信息密度的实用估计器。
研究者提出一种从短程试点训练中选择 Adam 共享记忆参数 β₁=β₂=β 的方法,选定后在全量训练中保持固定。该方法基于 Adam 归一化方向的局部模型,在采样波动与梯度平均延迟之间取得平衡,导出三次记忆规则,其系数由少量试点检查点的梯度探测估计。
研究揭示模型的学习方式会显著影响其后续的遗忘(unlearning)表现:以泛化为主的模型在遗忘时对保留集的性能损伤更大。作者通过模块加法中的 grokking 现象区分记忆型与泛化型模型,并引入分桶模块加法在记忆-泛化连续谱上精细控制两种策略的贡献,发现该趋势近乎单调。这一关系在 LLM 的逐字回忆与事实回忆遗忘场景中同样成立。
FedDermaSeg 用联邦学习实现隐私保护的皮肤病变分割,在 ISIC 2018 训练与验证集上模拟分布式环境训练,并在 ISIC 2018 测试集和 PH2 数据集上评估。结果显示其性能与集中式训练相当,且持续优于各本地训练模型,无需集中聚合医学图像即可协同分割。
针对非线性记忆网络在序列测试时训练中难以单遍优化、串行 TTT 反而不如固定基座并行 TTT 的问题,研究者提出 DeltaTTT,将两层记忆网络的联合内循环优化改为逐层学习,每层分配局部预测目标并通过状态相关的 delta 规则更新。该方法保留非线性读出并支持分块并行计算,在 DeltaNet 和 LaCT 骨干上提升了语言建模与检索表现。
研究者提出一种可扩展的客户感知概率负荷预测框架,通过共享模型学习共性需求行为,仅适配一小组低维参数,让每个负荷按自身特征组合这些适配组件。在 SMART-DS 数据集 590 条负荷曲线上,该方法在确定性精度和概率质量上均优于统计、神经网络、Transformer 及预训练时间序列基线,同时保持较低的存储与推理成本。
一项预注册研究用 880 个语言模型评分者对 189 份访谈做八项 Patient Health Questionnaire 评估,发现模型选择解释了汇总症状得分方差的 30.0%,稳定的参与者差异仅占 10.5%。
MetaLearnNCA 提出一种去中心化少样本元学习框架,通过耦合神经细胞自动机(NCA)的动力学交互完成任务适配,推理时无需计算解析梯度。该框架由 Active-NCA 和 Meta-NCA 组成,后者作为去中心化细胞优化器在局部邻域扩散空间误差残差以动态更新空间程序。
跨分词器在线策略蒸馏(OPD)中,严格 1:1 对齐已覆盖大部分学生生成 token,将 reverse KL 限制在共享词表 top-16 子集即可达到与全共享词表 OPD 相当的准确率,优于所评估的跨分词器基线。
NVIDIA 提出 NeMo-DCR(Delta-Compressed Refit),只传输权重变化量却保持比特精确,接收端得到与全量重配完全相同的参数和 buffer 位。
研究团队构建了一个轮次标注的多轮基准(423 段对话、1,661 个标注轮次状态)和带模拟用户的评估框架,用 6 个数据集与 6 个开源权重 LLM 测试不可回答性探针的迁移能力。
Atom-JEPA 是一个自监督预训练框架,通过原子级和子结构级的互补目标,从无标注 3D 结构中学习潜在表示。该模型在大规模分子与晶体数据集上预训练,经微调后在分子 ADMET 与量子化学性质预测任务上达到 SOTA,在晶体材料物理性质预测上也极具竞争力。代码与预训练模型 checkpoint 已公开。
Corbion 与 Intrepid 将 PURASORB 生物可吸收聚合物库与 Intrepid Labs 的 AI 算法 ANDROMEDA 1 结合,用于治疗性多肽的原位成型缓释制剂开发。
研究者提出用传感器坐标构建 k 近邻图,并以该图 Laplacian 的 graph-Matérn 函数作为流匹配模型的源协方差,使生成从空间相干模式而非通道独立噪声出发,且不增加可学习参数。
针对自动驾驶远程操控的预测性 QoS(pQoS),研究者基于实测数据提出预测框架,预测上行数据速率与往返时延两项网络 KPI。该框架将历史数据纳入预测流程,以缓解概念漂移导致的机器学习模型在未见数据上的性能退化,并引入关键场景检测指标专门评估远程操控场景下的预测表现。
VOMMI 是一个可携带的移动操作演示采集与学习框架,通过离线轨迹重建和在线视觉-运动条件化,将便携 RGB 演示接入 VLA 后训练。其 R2-VO 用稀疏几何锚点精修轨迹,使身体与手部流的绝对轨迹误差平均降低 24.6%。仅用便携演示后训练的策略基座速度误差比机器人采集演示低 18.2%,在三项真机任务上平均成功率较 OpenPI 0.5 提升 8.3 个百分点。
STRUCTURALCOST 是一个自定速阅读数据集,包含 475 名参与者和 40,800 条观测,用于分离长距离主谓依存解析的处理成本。研究发现,主句动词处的人类阅读时间随依存长度增加,由句法嵌套而非线性距离驱动;n-gram、SSM 和 Transformer 等语言模型仅部分反映这一难度曲线,且低估了人类的工作记忆整合成本,该差距在不同架构和模型规模下持续存在。
研究者提出 CoRP(Compressed Representation Policy),一个仅 48.9M 参数、不含视觉语言模型和视频生成先验的紧凑策略,在 LIBERO 上达到 97.0%,在 RoboTwin 2.0 Clean/Randomized 上达到 75.78%/73.36%,匹配比它大 40.9-163.6 倍的系统。
研究团队发布 MedConv 多语言数据集,包含英语、丹麦语和德语共 300 例临床问诊,并结合 ACI-BENCH 基准,将临床 AI 平台 Corti 与两款基于通用 AI 的 ambient scribe 软件进行对比。
研究将 Hough 变换与单应性估计引入目标检测模型,对超市货架倾斜拍摄的图像进行矫正,以提升商品识别准确率。团队为此构建了新数据集,并在多种目标检测模型上验证:图像矫正能提高倾斜图像中商品的检测精度,但效果受拍摄角度和单图物体密度限制。
研究者提出一种基于查询的代价学习框架,为动态可达的自车轨迹查询估计有界代价,而非密集 BEV 网格或少量回归轨迹。在 nuScenes 上,该方法碰撞率优于 ST-P3、NMP 及多数回归基线,L2 保持竞争力;在真实驾驶日志上无需微调即比 SparseDrive 和 Alpamayo 降低碰撞率。该工作已被 ACCV 2026 接收。
研究评估了声学导向与内容导向攻击者对多语言匿名语音的说话人验证(ASV)效果,发现攻击效果取决于匿名语音的语言可用性。整体上声学导向攻击者表现更好,但当语言信息保留较好时,内容导向与声学导向攻击者的性能差距会缩小。研究还构建了多语言语音转换数据集,可提升性能并部分缩小跨语言差距。
SAGE 是一个面向医疗问答的数据合成框架,利用 MeSH 等公开分类体系作为语义锚点,让本地部署的小模型通过原子与关联合成交替迭代,从极少种子数据生成高质量医疗训练数据。在多个医疗问答基准上,用 SAGE 合成数据微调的模型持续优于自生成或传统文档式方法,且无需大量医疗文档或外部 API。代码已开源,论文被 EMNLP 2026 收录。
针对语义查询引擎中查询计划同时影响成本与结果的问题,研究者给出了成本-精度优化的形式化定义,以决策模型(如 Jev)的校准置信度计算每个决策的期望误差,并按各决策对输出的贡献加权,无需标注数据即可估计计划的期望输出质量。
TICDA 通过 TFM 潜在嵌入上训练的线性代理模型,单次前向传播即可测出上下文中每条演示样本的影响,成本可忽略。该方法在标注错误检测、上下文筛选、跨 TFM 归因迁移和主动学习采集四项任务上取得优于对比方法的效果。
研究者提出 ReGraph——一种带生物归纳偏置的循环双流图模型,包含视网膜驱动的分流编码、背侧到腹侧调制和动态侧向连接,在 Something-Something V2 动作基准上训练。结果显示,上下文不变编码与网格样空间基仅沿扩展背侧通路共同涌现,单流、无调制变体和标准基线中均不出现。事后分析表明这些网格样基可作为可复用的路由模板,提示泛化能力在感觉信息被分解为层级化分流时便已成形。
针对循环语言模型重复堆叠层导致 KV cache 扩大 T 倍的问题,研究者提出 Hybrid Latent Attention(HLA),在滑动窗口内保留精确 key/value,窗口外旧 token 压缩为 latent 供各轮循环的 query 直接读取。
研究提出多模态知识蒸馏(MKD)框架,用低秩多模态融合(LMF)结合预训练WSI图像编码器与临床文本编码器,教师模型学习图像-文本融合表示,学生模型蒸馏后仅凭图像即可推理。在PatchGastric基准上平均准确率比SOTA至少高3.35%,且不依赖Transformer融合、多任务学习或大语言模型,源代码已开源。
针对视频生成中运动定制的内容泄漏问题,研究者提出 Control-based Motion Customization(CMC)训练框架,用随机最优控制(SOC)引导生成动态朝向目标运动、避免向参考视频坍缩。该方法去除显式奖励并引入仅作用于生成早期阶段的时间步自适应运动代价,训练速度提升 2.5 倍,在缓解内容泄漏的同时保持运动保真度与基座模型的多样性。
IEEE 802.11 正在定义 802.11bx 修正案 WLAN Intelligent Networking(WIN),目标是让 Wi-Fi 9 不仅承担通信,还提供感知与计算等新服务。
研究提出视觉弃权概念,即模型在请求的视觉变换不可能完成时应识别并拒绝生成。为此构建了 Draw-or-Decline 基准,包含 7 类任务的 1,050 对可行-不可行请求,评测 8 个统一多模态模型发现编辑能力与弃权能力相互独立,最强编辑器编辑准确率 68.4% 却仅拒绝 0.4% 的不可行请求。
一项多数据集基准研究显示,经自监督预训练和半监督微调的深度学习模型在 ECG 波形分割上全面超越常用工具,在心律多样数据集上 mIoU 达 71.3%,而最强工具仅为 54.8%。
研究团队提出自学习科学智能体 Gan Jiang,基于 XMatcher、XQueryer、XDecomposer 和 WPEM 组成的粉末 X 射线衍射分析生态,通过诊断失败、修订技能指令与代码并验证后复用,无需重训语言模型或改动物理模型。
研究者提出 PEFT 方法 DyPAM(Dynamic Positional Attention Modulation),直接作用于 query 和 key 表示,通过输入条件化的维度级调制与 head 级、layer 级结构调制,在不改动预训练主干的前提下对齐 RoPE 引发的位置结构。
研究者提出 ServeLearnBench,用于评估 LLM 智能体从服务经验中持续学习的能力,覆盖零售客服、银行和销售话术生成,包含 53 个环境窗口和 7,718 个任务。
研究者提出属性图聚类基础模型 OFAG,基于 Prior-data Fitted Networks 从合成属性图中学习可复用的聚类推理策略,无需针对单个图训练、微调或调参。
一项基于英国出生队列 National Child Development Study 的研究发现,用 11 岁作文预测 23 岁抑郁症状时,仅依赖六项童年协变量的逻辑回归基线 AUC-ROC 达 0.737,优于所有只看作文的文本模型,包括七个微调 Transformer、词袋模型、冻结嵌入和四个零样本大语言模型,其中最佳 Transformer 仅为 0.670。
研究者提出一种单参数、后期集中的幂律 token 削减调度,在无额外推理成本下持续提升视觉 Transformer 的分布外准确率。在 ImageNet-C 上用 DeiT-S,该调度在削减 26% 计算量时弥补了 83% 的精度差距(+1.17pp),在削减 7% 时弥补 99%(+0.26pp)。