ReRAM 存内计算 CNN 加速器的故障脆弱性实证研究
研究者开发了一套故障注入框架,在软件和硬件层面考察大规模 CNN 在 ReRAM 存内计算(PIM)加速器上推理时的脆弱性,通过将 CNN 学习参数映射到 ReRAM 交叉阵列并注入 stuck-at high(SaH)与 stuck-at low(SaL)故障,发现脆弱性受层类型与深度、参数在层内的位置以及故障取值与类型影响,且 SaL 比 SaH 造成更严重的分类精度下降。
研究者开发了一套故障注入框架,在软件和硬件层面考察大规模 CNN 在 ReRAM 存内计算(PIM)加速器上推理时的脆弱性,通过将 CNN 学习参数映射到 ReRAM 交叉阵列并注入 stuck-at high(SaH)与 stuck-at low(SaL)故障,发现脆弱性受层类型与深度、参数在层内的位置以及故障取值与类型影响,且 SaL 比 SaH 造成更严重的分类精度下降。
DART-ES 通过扰动种群通过率估计题目局部可解性并聚合历史观测构建动态难度状态,联合指导难度重加权与稀有可解样本回放,无需额外难度模型或反向传播。它在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率达 49.20%。
CrystalJev 将冻结的原子间势模型当作快速决策者,对未弛豫结构单次前向查询即可输出带校准概率的"稳定"判断,成本仅为弛豫计算的约三十分之一。在 65 个 Matbench Discovery 模型上,该方法用价值信息理论只在决策可能改变处调用慢速计算,并同样回答电子、力学与分子问题。
研究测量小语言模型仅凭判决结果后训练时的证据恢复能力,在 ContractNLI 上人类证据跨度留至评估阶段。纯标签训练达到准确率 0.896、跨度 F1 0.564,逐字引用率从 0.597 升至 0.729;拒绝采样达到 0.797 和 0.556,逐字引用率升至 0.701。两种方法都能在无人标注证据的情况下改善证据质量,但单一语料单一种子尚无法判定哪种更优。
研究者提出一种通过行为克隆训练的 System-1 决策算子,默认版本仅用 330K 参数即匹配 1.33M 参数的强化学习算子,并将 3,685-token 的推理压缩为 6-token 决策且不损失准确率。
AttSVD 提出一种免训练的低秩 KV Cache 压缩方法,通过对每个提示词自身的注意力几何做在线截断 SVD,只保留注意力真正读取的方向,将每头持久 KV 内存按保留秩成比例削减。
研究者提出零样本可视化(ZSV)任务,用户用自然语言指定概念,文档被映射到对应概念轴上以便可视化探索。团队建立基准,对比嵌入相似度、直接语义判断和条件似然估计三类方法,发现基于 next-token 概率的打分在语义忠实度、分数保真度和计算成本间取得最佳实用权衡。研究还发现分级轴配合二元相关性过滤的设计要点,并揭示离题文档中存在组合式情感偏差。
研究提出预算自适应神经算子求解框架,用全局 Fourier 神经算子推进全场、局部算子提出分块残差修正,并由 set-aware 选择器决定精修位置,宏观策略决定何时花掉剩余精修预算。
一项对比综述评估了 13 种建筑热需求短期预测混合模型,基于苏格兰家庭历史热需求与天气预报数据,EMD-LSTM-Markov 对次日供暖和热水(DHW)功率曲线预测精度最高,但会低估高功率峰值。SVM-SA 与 RF-ISSA-LSTM 则倾向预测平滑曲线,同样低估多数功率峰值。
研究将 Random Forest + XGBoost + Logistic Regression 集成做中智学分解,在 CWRU 和 JNU 两个轴承基准(600-1000 rpm)上以留一工况协议评估 T-hat、F-hat、预测熵 I1-hat 与决策分歧 I2-hat 四项指标。
研究团队基于英国门诊肿瘤语料(290,026 份笔记、21,564 名肺癌与头颈癌患者)开发了肿瘤专用 BERT 编码器 OncoNoteBERT,采用肿瘤 WordPiece 分词器从零训练。
多轮强化学习框架 Sherpa 通过构建多种具有不同学习偏好的学生原型,训练教师模型直接最大化学生学习效果,使其所教学生在所有原型上平均提升 20.5 个百分点。在 MathTutorBench 评测中,Sherpa 将整体教学法得分从 52.5% 提升至 79.2%;人类研究显示,其训练出的教师模型在 79.6% 的成对比较中优于基座模型。
研究团队提出 ScienceClaw,将 AI-for-Science 智能体的自进化形式化为固定参数的程序自进化,统一任务求解、科学验证与程序更新。配套的 ScienceClaw-Eval 覆盖 23 个学科,通过顺序任务流与独立重置评测衡量科学正确性、进化增益、保持能力、跨数据集迁移和进化成本。
MINDSET 是一种将对话存为不可变 episode、并通过最小能量状态转移组织成版本化 schema 的记忆控制器,每个新 episode 可强化、取代、拆分或新建 schema。
AnyBottle 提出一种构建紧凑、任务专用概念瓶颈模型(CBM)的方法,仅需冻结骨干网络和无监督概念池(如稀疏自编码器),由黑盒教师模型引导逐轮筛选概念,候选限定在师生分歧区域。
研究提出对齐扩展定律框架,将对齐负担建模为 B_r(N)=a_rN^alpha_r,并给出三种负担操作化方式,区分观测、审计与真实对齐。预注册再分析显示,Pythia 分类器把攻击成功率压到 10% 以下所需算力按 N^0.60 增长;Qwen2.5 0.5B-72B 试点中,真实性指数为 -0.05、陈述倾向为 0.48,谄媚与植入后门尚未确定。
研究提出 Effective-Evidence Self-Distillation(EESD),将执行相关性支持与证据量分开表示,用 Dirichlet 后验生成不确定性惩罚权重用于 KL 锚定的纠错学习。
研究者提出柱面测地线流匹配(cylindrical geodesic flow matching),用于成对心血管波形的准周期生理信号变换。该方法用相位—振幅柱面上的闭式测地线替代流匹配中的标准仿射路径,消除插值时的振幅与瞬时频率失真,并将每个训练对转化为稠密的速度监督。
SCOPE 用语言模型规划算子、符号引擎执行数值、编译器渲染证明,在 218 题测试集上以 135M 主干模型通过 191/218(87.6%)。相比之下,7B 的 DeepSeek-Prover-V1.5-RL 仅通过 18/218,且消耗 27.5 倍 token 与 37.5 倍耗时;DeepSeek-Prover-V2-7B 在双向对偶测试集上通过为零。
针对预训练表格基础模型(TFM)是否采用固定权重解释上下文学习,研究者提出两种仅依赖标准化标签预测的认证方法,可排除固定权重预测和独立非线性标签变换之和两种解释。在评估的五个公开 TFM 上,认证结果显示改变一个上下文标签会改变其他标签对预测的影响,即"联合处理",且该行为随训练出现,注意力分数承载了大部分测得的交互。
针对 O-LoRA 等正交投影方法在 LLM 持续学习中引发的"正交性困境",研究者提出免回放方法 CoDe-LoRA,将学习过程解耦为通用知识巩固与任务专属知识分离,并借助自适应零空间投影与语义路由平衡知识积累和任务适配。在四个骨干模型和三个持续学习基准上,CoDe-LoRA 取得最佳平均准确率,论文已被 EMNLP 2026 主会接收,代码已开源。
研究者提出 MASC,一个结合构念引导生成、协作精炼、一致性验证与基于记忆修订的多智能体自校准框架,用于心理咨询中保持客户角色扮演的心理一致性。团队同时发布 CRPC-Bench 基准,包含 38 个动机式访谈客户画像及人格与情绪标注,覆盖会话级画像、大五人格与轮次级心理状态、沟通行为和情绪表达。实验显示 MASC 在画像、人格、接受度与轮次级一致性上均优于现有方法,异构配置整体表现最强。
研究者提出 Sensor-Language-Action(SLA)建模框架,以语言作为感知与行动之间的语义接口,将多模态传感器观测、自然语言和动作统一在一个模型中。
研究者提出量子纠缠多模态融合网络(QEMFN),将预训练视觉与文本特征投影为角度参数化量子态,经模态内与跨模态纠缠电路测量后生成融合表示。在参数预算匹配且冻结同一 CLIP 骨干的条件下,QEMFN 在 COCO-5k 和 Flickr30k 上优于多层感知机、张量融合、FiLM、交叉注意力、紧凑 Transformer 及去量子化的配对拓扑对照等经典融合基线。
研究者提出 Local-First Heuristic Evolution(LFHE),一种表示驱动的重连框架,其候选发现与打分仅使用 ego-neighborhood 和 friend-of-friend(FoF)信息,用于去中心化学习中的有界局部拓扑搜索。
研究用107组镁合金挤压条件(14种合金)的数据,比较传统晶粒与织构统计、预训练图像编码器视觉嵌入和晶粒网络图神经网络三种描述符,反推合金成分与工艺参数。5折交叉验证下,传统描述符对留出条件识别正确合金的准确率为65%,而随机猜最常见合金仅17%,学习嵌入低于30%;微观结构可将温度误差较仅用成分大致减半。
QRAKEN 是一个免训练、本体无关的神经符号流水线,通过离线蒸馏生成的 TTQL(含多跳模式、条件频率与路径条件字面量示例)引导 LLM 生成 SPARQL 查询。
研究提出 Self-Retrospection Distillation(SRD),将智能体完成轨迹后的事后经验蒸馏为同一策略在交互前的预见预测,该预见仅作训练目标、推理时无需显式生成。
DAEDALUS 提出一种无需既有任务或 oracle 验证器、从自生成练习中引导可复用智能体记忆的方法,由生成任务的 explorer 与尝试任务的 solver 配对,将 solver 反复验证成功的启发式规则沉淀为记忆库。
一项研究提出重复运行评估框架,用主题流失率和数量分歧两项指标衡量 AI 智能体处理非结构化数据的可重复性。在 Claude Opus 4.8 与 1000 条记录语料固定条件下,基于分类体系的智能体(TGA)相比原始生成和分层分解将主题流失率降低 86–88%,匹配主题的数量分歧为零。该框架面向客户反馈、财报、法律文档等重复性知识工作场景。
研究者为完整十英雄 MOBA(206 个单位、每 tick 全英雄行动、单局最长 6,000 tick)学习结构化多智能体世界模型,仅用 1,400-tick 自由推演想象回合训练策略,再在真实对局中评测。
HMED(Hindsight Meta-Experience Distillation)通过从同一恢复的发现状态重新执行原版与修订版 Meta-Skills,在共享条件下观察修订带来的变化,并将每次对比蒸馏为可复用的 Meta-Experience。
研究者提出 Continuous Memory Machine(CMM),一种在 Continuous Thought Machine(CTM)基础上构建的循环架构,用矩阵值的短期与长期记忆状态承担不同功能,并由 Transformer 联合更新两个记忆存储,实现双向读写。
研究提出信息论分解,将输入歧义、表征损失与读出失配分离,并构建可恢复视图证明完美一致与联合各向同性高斯性可同时与零目标信息共存。基于此提出非自回归框架 CANOPE,在 40,000 条验证序列上,latent-agreement(PL0)与 token-grounded(PL2)池化排名几乎相同,但位置 Recall@1 分别为 13.5% 和 98.8%。
研究将区域多步海表温度(SST)预报建模为条件数值生成,用历史 SST 与异常序列、日期对齐的环境记录和静态海洋知识构成文本上下文,并通过图神经网络生成连续的空间前缀注入 LLM 输入。在南海 SST 预报的十个预测步上,完整配置取得对比方法中最佳 MAE 和 R²。配套的规则模块将预测趋势与环境因子方向匹配知识条目,返回带来源的事后上下文解释。
ThinkFuse 是一种免训练的测试时融合框架,通过对比片段级不确定性与轨迹级不确定性趋势来识别不稳定推理点,并将辅助推理路径融合进主模型轨迹。在数学与知识密集型推理基准上,它优于现有基线,跨模型组合均有稳定提升,且主模型更小时仍保持稳健。该方法所需融合触发次数更少、生成 token 更少,代码已开源,论文被 EMNLP 2026 Findings 接收。
一项针对三层智能体架构的测量显示,将长上下文推理分解到多个协作智能体可将单次查询的峰值 KV cache 降至 14.3 MiB,而单次推理和检索增强基线分别为 35.5 和 35.3 MiB。
研究对比 Llama-3.1-8B-Instruct 与 Qwen2.5-7B-Instruct 的 8-bit 和 4-bit 量化版本在 20 个确定性工具任务、5 种提示词下的故障恢复表现,发现 8-bit 与 4-bit 的恢复差异会随提示词和评测目标改变方向。
研究者发布开放电信 AI 资源 OTel,包含面向检索、重排序、指令微调与安全/拒答的衍生电信数据集,以及 30 个全参数后训练基线,覆盖 10 个嵌入模型、3 个重排序器和 17 个语言模型。截至 2026 年 5 月 3 日,相关模型下载量超 1600 万次。后训练后嵌入检索达 93.1% NDCG@10,重排序达 0.947 MRR@10,语言模型正确率达 87.8%。
AgentMemGate 是一种写入时门控机制,可将提取的陈述分类为推测、已完成事件、更正或其他,阻止未确认的计划进入记忆存储。在 147 组对话的留出集上,Mem0 和 Graphiti 分别将 35.2% 和 27.3% 的未决计划断言为当前状态;AgentMemGate 在核心基准上将污染从 87.5% 降至零,任务准确率从 65% 提升至 95%。