用交叉注意力条件化学习爵士钢琴家风格
研究者基于钢琴 MIDI 预训练的 16 层 Transformer 模型 Aria,在 PiJAMA 数据集中十二位爵士钢琴家的独奏上微调,并在最后八层插入门控交叉注意力层,读取每位钢琴家的学习嵌入向量。生成片段被分类器判定为对应钢琴家的比例为 70%,无条件下仅为 37%;仅用生成音乐训练的第二个分类器识别真实录音的准确率达 95%。
研究者基于钢琴 MIDI 预训练的 16 层 Transformer 模型 Aria,在 PiJAMA 数据集中十二位爵士钢琴家的独奏上微调,并在最后八层插入门控交叉注意力层,读取每位钢琴家的学习嵌入向量。生成片段被分类器判定为对应钢琴家的比例为 70%,无条件下仅为 37%;仅用生成音乐训练的第二个分类器识别真实录音的准确率达 95%。
Opus 5.5 智能体通过密度泛函理论计算发现两种室温磁性半导体候选材料。其一是全新设计的 Luttinger 补偿磁体 YBaMnFeO₅,预测带隙 2.35 eV,空穴自旋窗口 1.0 eV、电子自旋窗口 1.4 eV;另一种是 1999 年首次合成的已知材料,计算预测其具备目标性质。
研究提出 SBERT2S1,将 Sentence-Transformers 编码器转换为双编码器、cross-head(C)与 prior-fused residual(PFR)决策模型,并发布生物医学类型化决策套件 BIODECIDE 及源自 NLM 索引的 243k 条训练决策 MEDLINE-S1。
研究者发布 SymCE,包含 4,707 道本科代数与实分析假猜想,每题配有可执行的逐定理 Python 验证器,验证器同时充当奖励函数。
FlashSinkhorn 2(FS2)是一款面向低维点云平方欧氏代价的熵正则最优传输(EOT)GPU 求解器,通过粗粒度质心求解与块稀疏精修两阶段耦合,在单张 A100 上求解两个 1.34×10^8 粒子测度间的离散 EOT 问题,全粒子边际残差低于 0.01,耗时不到 2.5 小时。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软团队系统测量了机器人端侧与卸载推理的差异,并给出可复用的 Kubernetes 卸载工具链。
微软研究院在 Nature 发表逆合成预测框架 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,通过学习式重排序整合两者互补预测,在盲测中化学家对其单步反应预测的偏好超过此前模型与文献反应。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:读者可以看到 CUDA 优化经验如何被结构化迁移到 Apple Silicon,以及翻译层对最终性能差距的具体影响。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融达到 SPEX 的性能。
伯克利 AI Research 提出基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化系统信息量,在彩色摄影、射电天文、无镜头成像和显微成像四个领域验证其能预测解码器性能。该方法优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器。相关论文发表于 NeurIPS 2025。