跳到正文
10月5日周一
  1. arXiv stat.ML13

    高维渐近理论与隐私迁移学习的数据集选择

    研究提出一种基于高维回归与加权岭估计器的数据集选择方法,仅依赖汇总统计量即可判断外部数据能否改善预测,并给出在标签或特征与标签联合上的ρ-零集中差分隐私保证。其核心技术贡献是测试误差的确定性等价,刻画了样本量、协方差结构、模型偏移、正则化与隐私噪声之间的交互,可在不访问数据本身的情况下优化超参数并判断私有外部数据集是否有用。

  2. arXiv cs.CL27

    TPBench:面向对话压缩的转折点基准

    研究者提出 TPBench,用于评估对话压缩中的"转折点驱逐"失败:压缩器可能保留事实却丢掉改变事实的那一轮对话。TPBench 在相同名义保留预算下评测三个信息目标,P1 为用户初始目标,P2 为用户修改后槽位的当前值,P3 为两者兼有,答案取自 MultiWOZ 与 SGD 的人工对话状态标注。

  3. arXiv cs.LG20

    Co-design Gym:面向具身与策略协同优化的统一基准

    研究者推出 Co-design Gym,一套用于联合优化具身设计与控制策略的基准环境套件,覆盖机器人操作与运动、多机器人协作、软体动力学、电子游戏、电网、无线网络、F1 赛车、多智能体仓库和最优控制等领域,共 20 个环境族、超过 85 个协同设计预设。该工作还对代表性协同设计算法做了系统评测,刻画了当前 SOTA 水平。

  4. arXiv cs.LG29

    LINEUP:将个性化与逐用户适配解耦,每个用户只需优化 8 个标量

    LINEUP 将个性化能力与逐用户可训练状态解耦,每个目标用户只需优化 8 个标量,而对比的 private-LoRA 配置每用户需 419 万参数。该方法学习一组可复用的低秩个性化因子,通过用户条件召回与查询相关校准组合,并把目标用户适配限制在共享修正空间上的极小用户编码中。

  5. arXiv cs.CV12

    4DFEID:4D 面部表情强度数据集发布

    研究者构建了 4D 面部表情强度数据集 4DFEID,基于参数化人脸模型生成 2,869 条网格序列,并通过众包平台收集超过 90,000 条 Likert 量表主观强度评分。基线实验显示,时空图模型在片段强度估计上持续优于传统帧聚合方法。该数据集以动态 3D 刺激替代现有 2D 静态图像,为情感计算与人机交互中的表情强度感知研究提供资源。

  6. arXiv stat.ML13

    ResTGP:面向高维数据的残差树高斯过程建模框架

    研究者提出贝叶斯残差树高斯过程方法 ResTGP,用于处理多维域中具有异质结构的大规模空间数据。该方法沿二进树在多个分辨率上迭代分解预测过程与残差过程,实现灵活的多尺度协方差建模与分治计算,并基于递归消息传递的贝叶斯推断策略使计算量在给定树下随样本量线性增长。论文还证明了非参数回归框架下连续函数估计的后验一致性,数值实验与风暴潮应用验证了其优势。

  7. arXiv cs.AI31

    AI Risk Observatory:用 LLM 分析英国上市公司年报中的 AI 风险披露

    研究用两阶段分类流水线处理 1,362 家英国上市公司 2020-2025 年的 9,821 份年报,发现提及 AI 风险的报告占比从 2.8% 升至 41.2%,AI 采用披露从 13.8% 升至 45.2%,供应商提及集中在以 Microsoft 为首的少数厂商。2025 年 41.2% 的报告提及 AI 风险,但仅 4.3% 属于实质性披露,危害披露全语料仅 7 份。

  8. arXiv cs.LG20

    固定目标异常检测器的收敛坍缩问题:用核锚定局部性正则化(KAR)缓解

    研究揭示固定目标异常检测器存在"收敛坍缩":优化越好、检测越差,因收敛后残差信号在异常与正常数据上同时消失。作者提出闭式、免训练、CPU 高效的 Kernel Contraction Matching(KCM),并在此基础上引入 Kernel-Anchored Regularizer(KAR),惩罚神经预测偏离训练目标的核加权平均。

  9. arXiv cs.CL22

    心理健康污名自动评估基准:LLM 常过度预测污名,除非给出明确操作规则

    研究者提出一个基于理论的心理健康污名自动评估基准,包含真实网络新闻与社交媒体文本,并按污名模式、领域及具体成分进行细粒度标注,覆盖六种心理健康状况。结果显示,检测情感、毒性和仇恨言论的模型无法很好捕捉心理健康污名,LLM 在缺乏明确操作规则时往往过度预测污名。基准的公开部分、标注、典型示例与代码已发布。

10月4日周日
10月3日周六
10月2日周五
10月1日周四
9月30日周三
  1. Google DeepMind62

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入水印

    Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使其在数字模型和合成出的实体蛋白质上均可验证,同时实验室测试显示不损害生物功能。

    推荐理由:DeepMind 把水印从数字内容扩展到合成生物,读者可了解其如何在不影响蛋白功能的前提下嵌入可验证信号。

9月29日周二
  1. Microsoft Research65

    微软研究院推出面向生物学复杂性的 AI 研究系统 Quine

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型与连接科学工具、文献和湿实验的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。

9月24日周四
  1. NVIDIA Blog62

    NVIDIA 联合 Google DeepMind 等开放 2800 多种病毒的蛋白复合物结构数据集

    NVIDIA 加入由 Google DeepMind、EMBL-EBI 等组成的全球研究联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供任何科学家免费使用。

    推荐理由:NVIDIA 联合 Google DeepMind 等机构开放 2800 多种病毒的蛋白复合物预测结构,读者可了解开放科学在疫情准备中的具体做法。

9月21日周一
9月8日周二
  1. Google DeepMind74

    Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单碱基变异预测

    Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上。

    推荐理由:AlphaGenome Atlas 把 90 亿个单碱基变异的预测结果做成可检索资源,读者可了解基因组变异解读的规模化路径。

9月1日周二
8月21日周五
  1. Microsoft Research38

    微软 Skala 1.1 发布:训练数据增至 2.5 倍,并集成进 CP2K 等主流 DFT 软件

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。

7月26日周日
  1. Berkeley AI Research32

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的信念评分(belief grading)奖励能重建最新观测的信念。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也低于全上下文设置。

7月7日周二
  1. Berkeley AI Research40

    智能免费之后怎么办?面向智能体、由智能体运行、由智能体构建的数据系统

    GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间、中位数约 50x。UC Berkeley 的 Aditya G. Parameswaran 等人提出近零推理成本下的三大数据系统挑战:为智能体设计的数据系统、运行智能体集群的数据系统、由智能体合成并需可验证的数据系统。

3月13日周五