用共形机器学习做算法验证:企业“漂绿”如何被市场定价
研究融合美国 SEC 财务数据与 EPA 设施级温室气体登记数据,用梯度提升架构和 Mondrian Conformal Prediction 构建企业实际排放的算法基线,并据此提出 Conformal-Weighted Continuous Divergence(CWCD)指标,量化企业自报排放与算法基线之间的差距。
研究融合美国 SEC 财务数据与 EPA 设施级温室气体登记数据,用梯度提升架构和 Mondrian Conformal Prediction 构建企业实际排放的算法基线,并据此提出 Conformal-Weighted Continuous Divergence(CWCD)指标,量化企业自报排放与算法基线之间的差距。
研究提出用 O'PRIOR 合成任务生成器构建可验证的归因测试台,每个预训练任务都带有结构机制、缺失、混杂、捷径和分布偏移的显式来源标注。在留出真实任务上,移除归因排名前 5% 的合成任务使平均 ROC-AUC 下降 0.013,随机移除仅下降 0.002±0.004,移除末位任务则提升 0.003。
研究者提出 OEB(Open-Endedness Bench),一种只读取智能体执行记录、不依赖参考答案或结果分数的基准方法,将记录编译为认知事件图,从证据、实验、修正、无奖励黑客四个维度打分。在三个基准的 12 项任务、119 次已有运行中,智能体声称的改进只有 16-29% 属实;10 项任务中有 9 项的最佳运行在后半程尝试了更多新想法。
MintFlow 是一个免训练的受限采样框架,将约束满足建模为对预训练流轨迹的最小干预,通过伴随公式得到扰动的闭式解,无需迭代优化。该方法还能自适应选择干预时机,在生成视觉与物理系统建模任务中,约束满足效果与 SOTA 受限方法相当,同时更好地保留预训练生成分布。
SatisDive 是一种免训练的推理时方法,通过批次相对奖励阈值区分高低奖励候选,在满足奖励下限的同时保证批次多样性。在 Pick-a-Pic 上,以 FLUX.1-dev 为基座模型、HPSv3 为奖励时,最差候选奖励较 FK steering 提升最高 0.43;以 SANA-1.6B 为基座、ImageReward 为奖励时提升最高 0.70。
研究者将仅作用于查询的低秩适配器 SampoTron 与 Nemotron-3-Embed-1B 模型结合,并按查询与索引语言做确定性路由:跨语言查询走适配器,同语言查询走原编码器。在采样的金融基准上,六个英/芬/瑞方向的 nDCG@10 均值从 0.241 提升至 0.291,相对增益 20.9%,且路由保留了原有同语言性能。
研究者提出特征追踪型物理信息神经网络 FT-PINN,将解网络定义在固定参考域上并与参数化非线性流形上的微分同胚变形映射复合,通过联合训练使配点自动聚集在激波等特征附近。在含合并激波的 Burgers 方程、Euler 激波管和二维正则激波反射四个测试问题上,FT-PINN 在有限配点预算下准确定位激波,而相同架构与预算的普通 PINN 则定位错误或无法形成激波。
用 Claude Opus 等前沿模型作为元智能体生成终端任务与验证器用于 RL 训练时,可运行 Docker 镜像和可执行测试套件并不保证端到端流程可靠,研究诊断出基准无效、harness 脆弱、奖励错位三类失败。
针对 Agentic Text-to-SQL 系统过早终止澄清、静默做出未验证假设的问题,研究者提出 PlanPool,将澄清计划外化为可变问题池,每个计划问题必须显式提问或丢弃后才能提交,交互中新发现的歧义可随时加入。在 BIRD-Interact 和 Spider 衍生的三个基准上,PlanPool 持续提升歧义覆盖率并减少静默失败,同时保持有竞争力的执行准确率。
Latent-MOPD 是首个面向 LLM 的表征级多教师同策略蒸馏(OPD)方法,同时利用专家的预测结果和计算这些预测所用的隐藏状态,无需额外教师训练。在同家族设置下,它在数学、代码和逻辑共 9 个基准上均优于仅 token、仅表征和均匀平均基线,参数量与各教师相同时多数基准超过单基准最佳教师;跨家族教师下也在全部基准上超过单通道基线。
研究者提出 MIRA,一种将研究分配与执行分离的分层架构:外层元推理器从持久研究记录中整理上下文并生成下一步调查的工作指令,内层执行器逐条执行。无需策略训练,MIRA 在定理证明和开放式神经网络架构研究中提升了长时程推理并更有效分配额外算力。基于该先验初始化的生成式 actor-critic MIRA-AC 在四个 autoresearch 环境中提升了 gold 表现。
DeReAct 是一种模块化智能体架构,将动作校验与完成判定外置为 Critic 和 Context Manager 两个门控策略。在 GAIA 和 SWE-bench Verified 上,Qwen3-Coder-480B 的 Pass@1 提升 6.5–7.0 分,Claude Sonnet 4.5 提升 4.2–5.2 分,模型越弱增益越明显。
研究者提出 ExecCert(Executable Release Certification),一个在发布时对候选模型产物进行认证的层,可闭合方法原生证书或通过 Retraining-Reference Release Verification(RRV)验证其对当前保留集重训练的保真度。
TRACE 是一个可复现的电价预测基准,包含美国某主要市场五个区域的 7,300 个区域-日实例,将电价与预测截止时点可获取的官方运营文本配对,并在每个截止点重建文本以避免信息泄漏。在时序基础模型上,TRACE 使上尾 pinball loss 中位数降低 7.4%;跨日文本错配消融实验则使增益反转,低于无文本基线。
APDMem 是一种分层长期记忆架构,将对话历史表示为主题摘要、个性化关键事实、轮级证据笔记和原始消息四层,推理时由控制器先读高层摘要、按需深入细节。在 LongMemEval 上,它仅访问 8% 的对话内容即取得强劲的长上下文记忆推理表现。该工作已被 EMNLP 2026(Industry Track)接收。
针对交叉拟合中忽略交叉折依赖的置信区间在非正则场景下覆盖不足的问题,研究者利用新的局部性条件证明一大类交叉拟合估计量仍满足中心极限定理,但渐近方差需按交叉折相关性调整。随后提出估计该相关性并构造达到渐近名义覆盖率的置信区间,在随机森林与神经网络的模拟研究中取得近似名义覆盖率。
研究提出一套自动化头皮分析与临床决策支持框架,结合毛囊单位定位、可见毛干计数、校准毛干宽度估计、区域聚合与可解释规则层,用于雄激素性脱发(AGA)评估。临床队列含 243 名患者(127 例 AGA、116 例非 AGA),计算机视觉实验使用 160 名专家标注患者、2,400 张毛发镜图像及约 158,000 条毛囊单位标注。
针对大语言模型强化学习通常最大化期望回报、概率求和无法指出哪条解法真正有效的问题,研究者提出 Tropical Reinforcement Learning,用取最大值的热带半环替代概率相加,使状态价值对应最可能被验证解法的对数概率并附带可复用路径。
研究提出"世界编辑"概念,即对已有可执行世界进行干预并保留不应改变的部分,同时引入干预深度这一维度。作者基于 Minecraft 和 Terraria 的游戏模组构建了 IGMWorld 与 IGMBench,包含 110 项任务和超 1.1K 条可执行状态与行为标准。
Ψ-Resilience 是一种无模型特征重要性方法,通过估计类条件密度并沿特征轴取逐点绝对差构建类分歧景观,再用该一维信号的 0 维持续同调定义韧性泛函,聚合在用户设定稳健尺度内幸存的拓扑特征。
对四个开放权重类型化决策模型的研究发现,模型返回的概率主要取决于选项标签而非其定义,即存在"选项标签偏差"。删除全部定义后准确率几乎不变(laya-td:0.8559 对 0.8487),而将选项改名为 A、B 后准确率提升 +0.1511。
研究对正则化经验风险加入随机线性项 z~N(0,σ²I_d) 后,释放确定性梯度下降第 N 次迭代所得有限计算的差分隐私性质。在强凸、光滑且 Hessian 满足 Lipschitz 条件下,证明 z↦w_N 在隐私论证所用有界域上是 C¹ 微分同胚,并给出 Jacobian 最小奇异值的定量下界。
研究者提出 Calibrated User Embeddings(CUE)框架,无需训练即可将观测会话编码为连续表示并解码为 persona 指令,驱动 LLM 模拟用户。
研究团队提出 DeskForge,一个通过组合和探索真实应用生成大规模监督数据的可控桌面环境,并据此构建了包含 120 万条标注桌面观测、1.597 亿个元素实例的 DeskForge-1M 语料。
推荐理由:论文给出可控桌面环境与 120 万条标注数据,并展示四个视觉语言模型在 GUI 定位基准上的提升幅度。
研究在每轮仅有一个无偏随机次梯度、且条件 p 阶噪声矩未知(1<p≤2)的在线凸优化中,提出一种无需知道 G、σ、p、I、P_I 的算法,对任意长度 n 的固定区间 I 取得区间动态遗憾上界,同时保留均值梯度与噪声各自的指数项。该分析在期望层面控制校准,其一般定理与基于非均匀先验的相对熵专家分布相比较,在给定统计量下区间代价为 1+log(T/n),并包含最优的全时域静态速率。
GRAFT 是一个持续多教师蒸馏框架,让统一骨干网络从开放序列的基础模型中逐步获取能力,新增教师时只需一次蒸馏而非全量重蒸馏。它引入 Teacher Specific Readout Tokens 为每个教师提供独立读出,并用 Geometry Agnostic Relational Loss 对齐视觉语言教师。
研究者提出 HXAI,一个在分布式能源系统中兼顾隐私与可解释性的分层框架,由本地模型在安全环境内生成细粒度解释、区域模型聚合解释以支持电网级分析两部分组成。该框架通过灵活的隐私预算管理限制重复查询下的累积隐私暴露,在模拟和真实能源数据集上实现了区域负载管理的有用洞察,同时家电级用电数据始终保留在本地、不传输给电网运营商。
研究团队推出 CourseChat,一个部署在校园网关后、面向本科商科教育的本地化多课程 RAG 辅导系统,六个课程实例共享由 Ollama 提供本地 LLM 服务的双边缘 AI 主机。
研究将行为评估扩展到潜空间,在全部 11 个开放权重 LLM 中发现了专门的临床概念中心,这些中心可解释、仅对对齐的临床叙事激活,并在受限与开放式场景中因果驱动模型行为。在对抗性角色提示下模型仍保持内部一致并持续使用相关概念中心,而对齐提示可提升下游临床表现;沿这些中心进行引导也能带来下游改进。盲法临床医生验证显示,这些概念中心的激活与使用可预测临床医生的偏好。
FactorSplat 是一种逐场景的 N 维高斯泼溅(N-DGS)代理,可在推理时接受区域特定的强度到 RGBA 曲线,让图像训练的高斯代理不再把单一传递函数烘焙进外观。
研究者提出 Spatial Memory Intelligence(SMI),首个系统性地用理解模型为长视频世界模型管理空间记忆的框架。SMI 包含空间聚类、簇内稀疏化、动作感知检索和可靠性感知过滤四项协同原子操作,在多个基线、benchmark 和世界模型骨干上实现了记忆稀疏度、生成稳定性与空间一致性的全面提升。
针对全模态大模型音视频联合推理成本高的问题,研究提出以文本为中心的后训练范式:先用纯文本训练做主推理优化,再用缩减数据的原生音视频 RL 精修感知。最佳纯文本配置下,SFT 加 RL 使 Qwen2.5-Omni-7B 九项推理得分的几何均值较基座提升 25.83%,GPU 时长比完整原生音视频路线少 56.6%。
一项 arXiv 研究用可解析的线性-softmax 策略,对分类任务中 SFT 与 RFT 的更新做了语义与风格分解:在相同策略和提示词下,两者语义更新平行,但风格动态不同。RFT 用精确策略梯度可保持类内风格对称,而 SFT 在非均匀教师下会产生偏离轴的风格漂移。该漂移在显式条件下导致分离:从同一完美拟合检查点做群体更新时,SFT 的遗忘在有限训练区间内有严格正下界,RFT 则保持零语义误差。
多模态大模型能正确报告空间事实,却未必在后续推理中使用该事实。研究者提出 SpaceConflict 基准,含 23,196 条输入,覆盖 L1 局部事实绑定到 L4 变换下状态判断四个层级,揭示"可用性—利用率"鸿沟:Qwen3.5-9B 在 100 条正确恢复初始状态的序列中有 50 条无法完成完整变换,显式提供状态可修复全部 50 条。
研究者提出 MACTS-EM 多智能体协作时间序列预测框架,通过领域专用预测智能体、元认知层动态分配、涌现记忆机制、多模态上下文整合与对抗鲁棒性组件协同工作。在金融市场、气候模式、能源消耗和疫情传播等场景评测中,该框架预测准确率提升 8-12%,零样本迁移能力提升 22-27%,regime shifts 期间韧性增强 16-21%,分布偏移后恢复速度加快 15-18%。
英国医护人员常依赖 Google Translate 与患者沟通,但一项针对 21 名不同岗位医护人员的访谈研究显示,他们对机器翻译在医疗场景中的风险认知有限。研究以医学缩写为用例,将临床语料库中的法语和西班牙语数据经 Google Translate 翻译后展示给受访者,发现此类高风险翻译可能危及患者安全。
针对一致性模型(CM)多步采样中步数对样本质量影响难以解释的问题,研究者将多步 CM 采样建模为加噪与近似去噪算子的复合,在可验证的稳定性假设下推导出非渐近误差界,将初始化误差的收缩与近似误差的累积分离。该误差界表明:早期大噪声水平驱动收缩,后期小噪声水平控制残余偏差;对强对数凹与半对数凹目标还给出显式常数。实验显示误差界中的收缩与近似曲线可被可靠测量,并与预测的函数形式吻合。
研究者提出由编码智能体驱动、带人工验证的转换流程,将 BIRD 的 Text-to-SQL 基准转为面向文档数据库的 AptMQL-Bench,包含 21 个数据库、3,186 条自然语言请求及对应 MQL 查询,迁移自 SQLite 且无数据丢失。
Ian Osband 提出 horizon loss,将交叉熵视为"耐心的准确率",并按剩余训练量截断,从而在训练后期向精确策略梯度过渡。在 MNIST 及 ImageNet 上使用 ResNet-50、ResNet-101 和 ViT-S/16 测试,该方法在固定学习率下提升 top-1 准确率,且标签噪声越大增益越明显。
研究对固定 YOLOv8s 行人检测器的后置解释在 PIE 与 JAAD 数据集上进行审计,发现基于删除的忠实度与解释时的检测强度强相关,D-RISE 的 Spearman 相关系数达 0.70 至 0.82,使朴素置信度分层比较不可靠。