研究:LLM 评审在职业 AI 测量中排序一致但接受率严重失准
研究团队发布 O*NET-BENCH 审计套件,基于 45,796 份工人评分调查,在 4,501 条测试评分上评估了 6 个模型家族的 33 种评审配置。25 种配置的 pair accuracy 达到 0.60 以上,但评审给出的可接受回答比例在 3.0%-97.9% 之间,而职业匹配工人的接受率为 61.1%。
研究团队发布 O*NET-BENCH 审计套件,基于 45,796 份工人评分调查,在 4,501 条测试评分上评估了 6 个模型家族的 33 种评审配置。25 种配置的 pair accuracy 达到 0.60 以上,但评审给出的可接受回答比例在 3.0%-97.9% 之间,而职业匹配工人的接受率为 61.1%。
EpiWorld 是一个闭环框架,将 LLM 政策智能体锚定在动作条件流行病学世界模型和分层技能库上,通过反事实推演为政策选择提供反馈。在 COVID-19 和 Influenza 回顾性数据集上,该世界模型取得所有预测基线中最佳的分布外 Peak-MAE,闭环框架将累计住院率最多降低 59%,在六个 LLM 骨干上平均降低约 16%,优于强化学习和最优控制基线。
针对 Classifier-free guidance(CFG)缺乏显式判据、难以判断引导轨迹是否按预期推进的问题,研究者提出 Spectral Correction Guidance,通过将中间状态频谱与扩散前向过程的解析参考频谱对齐来校正采样偏差。
DeepStratNet 将地震层位追踪从稠密语义分割改为有界坐标回归,模型直接预测每个横向位置处目标层位的时间/深度坐标。该框架由兼容任意预训练视觉骨干的轻量回归头与 LSTM 模块组成,用于建模切片间上下文并生成连续层位面,训练采用 L1 与 L2 损失并结合地质先验正则约束相邻道连续性。
一项针对8个模型的研究发现,在剂量1000的虚假文档训练下,模型直接注入选择率高达95.8%–100%,但决策任务中的注入选择仅比真实对照训练高出1.7–14.4个百分点,形成"审计缺口"。在2019–20澳大利亚山火虚假帖文案例中,模型即使未复现被夸大的数字,仍会断言有人因纵火被捕。研究表明,正确的事实回答不能保证正确的决策,纠正事实也无法消除误导性叙事。
CHASE-VLA 是一种面向 VLA 模型的 chunk 感知训练后量化(PTQ)方法,利用策略生成的动作 chunk 作为因果上下文,结合去噪步分组信息自适应调整动作专家(AE)的激活缩放,无需修改预训练策略即可实现 AE 中 MLP 与注意力投影的 W4A4 量化。
研究者提出 Multilingual Distractor Interference(MDI)评测协议,在 TruthfulQA 和 TriviaQA 上对五个指令微调 LLM 进行 40,000 次评测。
研究提出 gamma-CUBV 统一框架,用累积量包络 gamma(lambda) 控制泛化差距的矩生成函数,将 Hoeffding、Bernstein、依赖感知、PAC-Bayesian 与异构源融合等风险界纳入同一体系。
研究评估了 21 个自然可见图(NVG)拓扑指标,用 SHAP、分组 Permutation Importance、Boruta 和 RFE 四种方法经 Consensus Ranking 整合,在 CICIDS2018 数据集与 CNN 分类器上测试。
针对文本到图像生成的免训练安全防护,研究揭示全局不安全假设存在覆盖度与选择性的权衡:紧凑不安全子空间无法覆盖异构的不安全语义,而更广的聚合会扭曲安全邻近的良性提示词。
针对流匹配模型统计泛化保证不足的问题,研究者推导出学习生成分布的有限样本误差界,以 Wasserstein-p 距离度量(p≥1)。在 n 个 i.i.d. 样本下,当维度 d 超过目标测度的 Wasserstein-p 维度时,学习分布以至少 1-ξ 的概率满足误差上界 n^{-1/d}+n^{-1/(2p)}(log(1/ξ))^{1/(2p)}。
研究以保留概率 p 随机保留边的 ReLU 网络逼近 W^{n,∞}([0,1]^d) 单位球,构造出常数深度、规模为 Õ_{n,d}(p^{-9}ε^{-max{d/n,2}} log(1/δ)) 的网络,并以至少 1-δ 的概率保证一致逼近。
TerrainForge 能从重建的多车驾驶片段中生成以道路几何为核心的反事实场景,其统一道路模型将场景形变与四轮车辆动力学相连,使坡顶、坡谷、减速带和摩擦变化传导至车辆运动、相机视角与车间距。
多模态基准 TasteBench 发布,用于可持续蛋白的感官预测,包含基于 215 种植物基食品、21K+ 人类评估构建的食品级排序任务(935 个同类别排序对)和覆盖 15K 风味分子的分子级味觉分类任务。
研究者提出秩感知投机采样(RASS),一种基于秩感知列表耦合的扩散草稿树验证规则,按提议-目标均值位移对草稿候选排序并采样秩权重,以最小化所选提议与目标分布的总变差。
ArrivalBench 不再只对智能体生成的数据管道做单次快照评测,而是在迟到、重复、乱序和重试等可重放的投递调度下重新执行管道,并要求最终状态等于完整日志的批量重算结果。
研究系统考察了深度序列模型在时间序列共形预测中的三种用法:条件分位数回归、条件分位数函数估计与局部化共形预测。作者给出理论分析,证明这三种方法在适当假设下均具备渐近条件覆盖率保证,并在真实数据集上验证了其有效性。
研究者用语音语言模型自身完整与部分波形的翻译结果构造 prefix 监督,无需转录文本或人工翻译,即可适配端到端同声传译。在 FLEURS 和 CoVoST2 三个翻译方向上,prefix 训练改善了质量—延迟前沿,置信度阈值提供了最稳定的操作区间;多轮 append-only 解码在低延迟下更强,其提交校准误差整体下降 63–68%,早期 prefix 下降 68–80%。
研究提出 SBERT2S1,将 Sentence-Transformers 编码器转换为双编码器、cross-head(C)与 prior-fused residual(PFR)决策模型,并发布生物医学类型化决策套件 BIODECIDE 及源自 NLM 索引的 243k 条训练决策 MEDLINE-S1。
SpectralCache 是一种免训练谱缓存框架,利用扩散世界模型特征在相邻去噪步间奇异子空间高度稳定的特性,复用稳定子空间并通过线性外推估计低维奇异值,从而跳过部分主干网络计算。在 HunyuanWorld-Voyager-13B 上,它实现 5.22 倍加速,静态场景 WorldScore 保持 65.90,推理效率显著优于现有免训练缓存方法。
研究融合美国 SEC 财务数据与 EPA 设施级温室气体登记数据,用梯度提升架构和 Mondrian Conformal Prediction 构建企业实际排放的算法基线,并据此提出 Conformal-Weighted Continuous Divergence(CWCD)指标,量化企业自报排放与算法基线之间的差距。
研究提出用 O'PRIOR 合成任务生成器构建可验证的归因测试台,每个预训练任务都带有结构机制、缺失、混杂、捷径和分布偏移的显式来源标注。在留出真实任务上,移除归因排名前 5% 的合成任务使平均 ROC-AUC 下降 0.013,随机移除仅下降 0.002±0.004,移除末位任务则提升 0.003。
研究者提出 OEB(Open-Endedness Bench),一种只读取智能体执行记录、不依赖参考答案或结果分数的基准方法,将记录编译为认知事件图,从证据、实验、修正、无奖励黑客四个维度打分。在三个基准的 12 项任务、119 次已有运行中,智能体声称的改进只有 16-29% 属实;10 项任务中有 9 项的最佳运行在后半程尝试了更多新想法。
MintFlow 是一个免训练的受限采样框架,将约束满足建模为对预训练流轨迹的最小干预,通过伴随公式得到扰动的闭式解,无需迭代优化。该方法还能自适应选择干预时机,在生成视觉与物理系统建模任务中,约束满足效果与 SOTA 受限方法相当,同时更好地保留预训练生成分布。
SatisDive 是一种免训练的推理时方法,通过批次相对奖励阈值区分高低奖励候选,在满足奖励下限的同时保证批次多样性。在 Pick-a-Pic 上,以 FLUX.1-dev 为基座模型、HPSv3 为奖励时,最差候选奖励较 FK steering 提升最高 0.43;以 SANA-1.6B 为基座、ImageReward 为奖励时提升最高 0.70。
研究者将仅作用于查询的低秩适配器 SampoTron 与 Nemotron-3-Embed-1B 模型结合,并按查询与索引语言做确定性路由:跨语言查询走适配器,同语言查询走原编码器。在采样的金融基准上,六个英/芬/瑞方向的 nDCG@10 均值从 0.241 提升至 0.291,相对增益 20.9%,且路由保留了原有同语言性能。
研究者提出特征追踪型物理信息神经网络 FT-PINN,将解网络定义在固定参考域上并与参数化非线性流形上的微分同胚变形映射复合,通过联合训练使配点自动聚集在激波等特征附近。在含合并激波的 Burgers 方程、Euler 激波管和二维正则激波反射四个测试问题上,FT-PINN 在有限配点预算下准确定位激波,而相同架构与预算的普通 PINN 则定位错误或无法形成激波。
用 Claude Opus 等前沿模型作为元智能体生成终端任务与验证器用于 RL 训练时,可运行 Docker 镜像和可执行测试套件并不保证端到端流程可靠,研究诊断出基准无效、harness 脆弱、奖励错位三类失败。
针对 Agentic Text-to-SQL 系统过早终止澄清、静默做出未验证假设的问题,研究者提出 PlanPool,将澄清计划外化为可变问题池,每个计划问题必须显式提问或丢弃后才能提交,交互中新发现的歧义可随时加入。在 BIRD-Interact 和 Spider 衍生的三个基准上,PlanPool 持续提升歧义覆盖率并减少静默失败,同时保持有竞争力的执行准确率。
Latent-MOPD 是首个面向 LLM 的表征级多教师同策略蒸馏(OPD)方法,同时利用专家的预测结果和计算这些预测所用的隐藏状态,无需额外教师训练。在同家族设置下,它在数学、代码和逻辑共 9 个基准上均优于仅 token、仅表征和均匀平均基线,参数量与各教师相同时多数基准超过单基准最佳教师;跨家族教师下也在全部基准上超过单通道基线。
研究者提出 MIRA,一种将研究分配与执行分离的分层架构:外层元推理器从持久研究记录中整理上下文并生成下一步调查的工作指令,内层执行器逐条执行。无需策略训练,MIRA 在定理证明和开放式神经网络架构研究中提升了长时程推理并更有效分配额外算力。基于该先验初始化的生成式 actor-critic MIRA-AC 在四个 autoresearch 环境中提升了 gold 表现。
DeReAct 是一种模块化智能体架构,将动作校验与完成判定外置为 Critic 和 Context Manager 两个门控策略。在 GAIA 和 SWE-bench Verified 上,Qwen3-Coder-480B 的 Pass@1 提升 6.5–7.0 分,Claude Sonnet 4.5 提升 4.2–5.2 分,模型越弱增益越明显。
研究者提出 ExecCert(Executable Release Certification),一个在发布时对候选模型产物进行认证的层,可闭合方法原生证书或通过 Retraining-Reference Release Verification(RRV)验证其对当前保留集重训练的保真度。
TRACE 是一个可复现的电价预测基准,包含美国某主要市场五个区域的 7,300 个区域-日实例,将电价与预测截止时点可获取的官方运营文本配对,并在每个截止点重建文本以避免信息泄漏。在时序基础模型上,TRACE 使上尾 pinball loss 中位数降低 7.4%;跨日文本错配消融实验则使增益反转,低于无文本基线。
APDMem 是一种分层长期记忆架构,将对话历史表示为主题摘要、个性化关键事实、轮级证据笔记和原始消息四层,推理时由控制器先读高层摘要、按需深入细节。在 LongMemEval 上,它仅访问 8% 的对话内容即取得强劲的长上下文记忆推理表现。该工作已被 EMNLP 2026(Industry Track)接收。
针对交叉拟合中忽略交叉折依赖的置信区间在非正则场景下覆盖不足的问题,研究者利用新的局部性条件证明一大类交叉拟合估计量仍满足中心极限定理,但渐近方差需按交叉折相关性调整。随后提出估计该相关性并构造达到渐近名义覆盖率的置信区间,在随机森林与神经网络的模拟研究中取得近似名义覆盖率。
研究提出一套自动化头皮分析与临床决策支持框架,结合毛囊单位定位、可见毛干计数、校准毛干宽度估计、区域聚合与可解释规则层,用于雄激素性脱发(AGA)评估。临床队列含 243 名患者(127 例 AGA、116 例非 AGA),计算机视觉实验使用 160 名专家标注患者、2,400 张毛发镜图像及约 158,000 条毛囊单位标注。
针对大语言模型强化学习通常最大化期望回报、概率求和无法指出哪条解法真正有效的问题,研究者提出 Tropical Reinforcement Learning,用取最大值的热带半环替代概率相加,使状态价值对应最可能被验证解法的对数概率并附带可复用路径。
研究提出"世界编辑"概念,即对已有可执行世界进行干预并保留不应改变的部分,同时引入干预深度这一维度。作者基于 Minecraft 和 Terraria 的游戏模组构建了 IGMWorld 与 IGMBench,包含 110 项任务和超 1.1K 条可执行状态与行为标准。
Ψ-Resilience 是一种无模型特征重要性方法,通过估计类条件密度并沿特征轴取逐点绝对差构建类分歧景观,再用该一维信号的 0 维持续同调定义韧性泛函,聚合在用户设定稳健尺度内幸存的拓扑特征。