合成调研验证新框架:LLM 合成受访者应验证后果性行为与表征公平性
针对业界和学界用 LLM 驱动的合成受访者替代真人样本的做法,研究者提出一套验证框架,要求每项效度声明明确与人类数据的对应层级,并覆盖 location、dispersion、response process、structure 四项诊断及实验效应对比。框架还要求报告子群体效度,并将分布、程序与承认三个公平维度操作化为可测量指标,最后以电动汽车充电电价为例演示并给出报告清单。
针对业界和学界用 LLM 驱动的合成受访者替代真人样本的做法,研究者提出一套验证框架,要求每项效度声明明确与人类数据的对应层级,并覆盖 location、dispersion、response process、structure 四项诊断及实验效应对比。框架还要求报告子群体效度,并将分布、程序与承认三个公平维度操作化为可测量指标,最后以电动汽车充电电价为例演示并给出报告清单。
研究者基于英文 WinoQueer 基准构建了荷兰语数据集 WinoQueer-NL,最终包含 42,906 条句子,用于评估荷兰语及多语言模型对 LGBTQ+ 群体的偏见。经 43 名荷兰酷儿参与者调查,171 条刻板印象中 145 条被确认具有文化相关性,并新增 22 条偏见。模型平均偏见分约 50%,但部分模型对跨性别身份有高达 97% 的概率偏向刻板句子,对男同性恋相关句对仅 6%。
研究者提出免训练方法 TwinKV,用非局部 post-RoPE key 频率对 value energy 打折,在精确存储预算下保留原始 key 和 value。
研究者发布德语开放问答临床基准 MedQADE,含 3,800 组问答、10 位医生标注和 9 个 LLM 评审。医生对答案正确性一致性中等偏强(Cohen's kappa = 0.612),Gemini 3 Flash 接近留一医生参考(kappa = 0.694 vs 0.709)。
研究者将对话情感识别(ERC)任务引入手语视频分析,并提出基于 STUDIES 语料库脚本构建的 eJSL Dialog 数据集,包含 1,920 个视频样本、480 段对话。在该数据集上的系统基准测试表明,将对话式 ERC 框架扩展到手语对话在当前基准设定下可行,但现有视觉表征在捕捉手语特有的情感线索方面仍存在局限。
研究团队用回译与微调模型,从少量种子语料生成 170 万条法语合成推文及合成推理轨迹,训练出 600M 参数、支持英法双语推理的模型,在人工标注评测数据上达到 77-79% 准确率,追平或超过 SOTA 专有 LLM 与专用编码器。该流程在降低标注成本的同时避免暴露敏感用户数据,可迁移至其他场景和语言。
研究者发布 TabiBERT,一个基于 ModernBERT 架构、从零预训练的土耳其语单语编码器,训练数据为 1 万亿 token,来自 86.58B token 的多领域语料(网页文本 72%、科学出版物 19%、源代码 6%、数学内容 0.3%),支持 8,192 token 上下文,是现有土耳其语 BERT 模型的 16 倍。
研究者发布 Infinity-Chat,一个包含 26K 条真实开放式用户查询的大规模数据集,并首次提出覆盖 6 大类别、17 个子类别的开放式提示词分类体系。
Common Corpus 是迄今最大的开放 LLM 预训练数据集,数据均为无版权或开放许可内容,总量约两万亿 token,涵盖从高资源欧洲语言到低资源语言及大量代码数据。研究团队在该数据集上训练了两个小型语言模型,性能与同规模模型相当,表明其适合多语言预训练。该数据集已被 ICLR 2026 接收为 Oral 论文。
Pleias 发布 Pleias-RAG-350m 和 Pleias-RAG-1B 两款小型推理模型,原生支持引用与字面引文溯源,并整合查询路由、查询改写和来源重排等 RAG 工作流功能。
一项系统性研究提出统一框架,将 Product Quantization(PQ)与 Residual Quantization(RQ)及其混合变体纳入同一设计空间,用于分析生成式信息检索中数值型 DocID 的层次与并行结构、DocID 长度和码本大小等超参数的影响。
在 NQ320K 和 MS300K 上,研究者用残差量化、乘积量化和随机标识符分别训练自回归、掩码扩散和块扩散模型,固定标识符长度与训练预算后对比多种解码方式。
一项基于 130 个软件修复原子状态转换的研究发现,基于身份的时间记忆在普通转换条件下模型判定准确率达 98.5%,但追加对旧陈述的逐字重读后准确率降至 10.8%,陈旧值比率升至 88.5%。一个拒绝重新激活已退役值的防护机制可将准确率恢复到 97.7%、陈旧值比率降至 0.8%,但无法在没有额外变更溯源的情况下识别合法的回滚。
研究者提出一种基于 Koopmanism Response 框架的校准式、按模式分解的测试方法,用于检验学习型随机模拟器能否正确响应外部强迫。
研究将虚假信息早期分诊建模为"延续预测"问题:仅凭前30分钟活动预测传播树后续增长。在FibVID数据集352棵测试树上,结合节点数与结构深度熵、时间到达熵的模型将log变换后未来增长的R²从0.307提升至0.323,log-MAE降低2.4%;在97棵高活跃度树上R²从0.248升至0.395,Spearman's ρ从0.394升至0.529。
一种量子原生加载器只需学习数据集的低维描述,即可用一组固定电路加载每个信号。在五个公开数据集的七种视图上,它以相同门成本达到最强结构化加载器的精度,且每个信号所需参数少数倍。预注册盲复现显示,信号规模扩大十六倍时,达到全信号精度十个百分点以内所需的随机子集大小保持稳定,而结构化加载器所需子集持续增长。
Nord-Parl-TTS 是一个面向芬兰语和瑞典语的开放 TTS 数据集,从北欧议会演讲录音中提取了 900 小时芬兰语和 5090 小时瑞典语语音,采用改编版 Emilia 数据处理流程构建,并包含统一评测集。该数据集旨在缩小高资源与低资源语言之间的 TTS 资源差距,已被 ICASSP 2026 接收。
研究者将 Embedded Language Flows(ELF)扩展至数学推理与代码生成,提出 ELF-REG,用冻结的 AR 教师模型监督中间去噪特征并提供与响应联合去噪的全局表示。
研究基准测试了13个量子与经典生成模型,在最高30 qubits的基数约束数据集和基因组单核苷酸变异数据集上直接采样。结果显示,将MMD²等矩匹配损失收敛到相同值的模型,对未见有效集的覆盖差异巨大,说明收敛的损失不能可靠衡量泛化能力。"经典训练、量子部署"流程必须通过采样来测量泛化,而这在目标规模下被认为需要量子设备。
一项针对 K-12 数学辅导对话的探索性研究发现,LLM 对五种学生失败模式(不确定性、错误归因、算子选择、概念缺口、程序失误)的分类中,人机一致性仅为中等(kappa = .524-.597),而跨模型一致性显著更高(kappa = .755-.781;alpha = .769)。这表明跨模型共识可能制造正确性的假象,模型间的一致不能替代对推断构念有效性的独立证据。
研究者提出神经语义验证框架,将放射组学测量转化为可寻址证据记录与机器可检验声明,在 611 例 UPenn 病例上定义语义状态,外部证据账本覆盖 331 名患者的 1,655 条模型关联记录。
一篇综述系统梳理了在部署阶段为 LLM 增强"参数内记忆"的方法:将承载记忆的参数对象在推理时接入前向传播,以补充 ICL 消耗上下文容量、重复离散编码成本随上下文增长的问题。
研究提出 InterCorrect,针对基于 Speech-LLM 的公平 ASR 做人口统计感知模型合并:在 SLAM-ASR 上仅微调 connector,再按子群 WER 与 task-vector 冲突定位跨轴人口统计对,施加交叉群体校正向量。
研究者提出 Token 级离策略标注(TOPL),将后训练重构为 token 级正确性预测任务,通过让模型区分回复中的好 token 与坏 token 来引导生成。
一项针对地震指令文本英译中、英译西的实验显示,使用话语特定提示词可显著提升生成式 AI 译文的可理解性与可操作性,但译者仍可能不信任这些译文。研究指出人工修订依然必要,既为发现错误,也因这类信息需有人对错误或延误承担责任。
研究测试了 LLM 对患者就诊无关信息的敏感性:在 576 段医患对话中,前沿模型把闲聊写进 35% 的病历,3.7% 的病例中模型误用或误归属这些题外话。在 57 段模拟录音中,-10 dB 的另一场就诊背景语音泄漏进 48.2% 的转录文本,四个开源权重模型生成的病历有 5.3% 被检出污染。作者提出临床推理与干扰的双重编码假说,建议临床使用前评估模型对无关信息的抵抗力。
研究首次探索粒子喷流生成任务中是否存在缩放定律,成功复现了模型规模缩放的对数缩放行为。研究发现切片 Wasserstein 距离与下一 token 预测验证损失单调相关,表明该损失是物理性能的良好代理指标。数据集规模和计算量的缩放行为明显较弱,作者通过引入可学习窗口概念分析这一现象,认为喷流成分的自回归预测相比语言模型更快饱和。
ForcingDAS 是一个基于 Diffusion Forcing 的统一数据同化框架,为每帧分配独立噪声水平,学习联合轨迹先验而非逐帧转移,从而捕捉长程时序依赖并减少误差累积。
研究用 EverMemBench 评估 LLM 长期对话记忆中结构深度与上下文宽度的交互,测试深度 D1-D4、1,024/2,048/4,096 token 核心预算及 Production、Oracle 条件。
研究团队基于 Fields of The World(FTW)基准首次系统评测了 18 个分割模型与地理空间基础模型(GFM),发现 U-Net 语义分割模型在性能与部署指标上优于实例分割和 GFM 方案。
DirectSpeech2LLM 是一个端到端框架,用于缓解 Speech-LLM 的提示词过拟合问题——仅在 ASR 指令上训练的模型难以泛化到语音翻译等新指令。
一项覆盖 96 种语言的研究发现,自监督语音模型(S3M)的表示空间中存在对应音系特征的线性方向,且这些音系向量的尺度与对应特征的声学实现程度连续相关。例如 [d] 与 [t] 的差构成清浊向量,将其加到 [p] 上得到 [b],缩放该向量则产生清浊连续谱。这表明 S3M 以音系可解释且可组合的向量编码语音,实现音系向量算术。代码与交互演示已公开。
研究将无监督与监督学习结合,用短无序纳米线中 Majorana 分裂的无标签模拟数据,区分"拓扑"与"平庸"相并定位二者在参数空间中的交叉点。该方法有望用于在实验 Majorana 纳米线中识别拓扑,论文发表于 Phys. Rev. B 114, 165418。
研究用两个意大利语二选一伪词实验测试五款 LLM,并与人类行为基线对比。当选项含真实词提供的词汇熟悉度线索时,LLM 与人类的一致性更高;在纯伪词条件下则明显低于字符 n-gram 模型 fastText。驱动人类与 fastText 一致的亚词汇余弦相似度线索未能稳定迁移到人类与 LLM 的对齐上,推理 token 消耗也与人类处理难度无稳定关系。
研究人员开发了 DRTool,一个通过 R 包提供的交互式工具箱,用于帮助分析人员识别高维聚类中的虚假簇。该工具包含可视化评估和假设检验等新的聚类验证技术,可辅助识别数据过度聚类现象,并更好地解读高维聚类结果。
AEGIS 是一个面向共享多 GPU 服务器的运行时调度系统,通过将内存可行性、放置后观测、运行时压力过滤、放置与 OOM 感知恢复整合进单一调度循环,实现深度学习训练工作负载的可控共置。
研究将 LLM 应用于真实加密货币交易图,以 Bitcoin 为案例,提出三层评估框架及 LLM4TG 图表示格式与 CETraS 采样算法,显著降低 token 需求。实验显示节点级基础信息识别准确率超 98.50%,有效特征获取比例达 95.00%,分类任务 top-3 准确率在少量标注数据下达 72.43% 并附带解释。
研究者用机器学习模型在专有 Nasdaq 数据上训练,将可观测的高频交易活动映射到公开日内变量,从而为 2010 至 2023 年全部美股生成每日的流动性供给型与需求型高频交易指标。
研究者提出图基础模型 Wander,将图学习统一建模为部分观测图的补全,并通过随机游走这一通用接口,让单个预训练 checkpoint 同时适配同构图与多关系图,覆盖不同特征、标签和关系模式。
受 Jev 模型启发的预填充决策模型单次前向即可为候选菜单打分,成本比同规模生成式语言模型低一到两个数量级。当干预只改变候选菜单而输入文本不变时,其干预后准确率可由缓存的首次前向分布预测,无需标签和第二次前向,在七个模型族、十个数据集上误差在 4.2 分以内。