OpenWAM:面向可组合世界-动作模型的开放框架
OpenWAM 是一个可组合世界-动作模型的开放框架,支持在模型内部及模型之间灵活组合视频与动作的生成顺序和注意力方式。其共享架构将 Wan2.2-5B 视频专家与 2B 动作专家组成 Mixture-of-Transformers,在约 334 万条轨迹、14.64k 小时视频上预训练,使用 32 块 NVIDIA B200 GPU 训练 14 天。
OpenWAM 是一个可组合世界-动作模型的开放框架,支持在模型内部及模型之间灵活组合视频与动作的生成顺序和注意力方式。其共享架构将 Wan2.2-5B 视频专家与 2B 动作专家组成 Mixture-of-Transformers,在约 334 万条轨迹、14.64k 小时视频上预训练,使用 32 块 NVIDIA B200 GPU 训练 14 天。
研究团队提出 VLAct,一种面向 VLA 模型的 VLM 骨干,通过 VLM 先验保持、多头连续动作协同监督和部分统一的跨具身动作布局,在广泛异构多具身机器人数据上进行持续预训练。
PointZero 提出以 3D 点轨迹补全作为预训练目标,无需机器人动作标签即可学习可迁移的 3D 动态先验。研究团队构建了包含 290 万合成帧、覆盖可变形、铰接与刚性物体的数据集,并训练出基于 Transformer 的 PointZero,在相同数据上优于此前方法。
RIGOR 是一个面向重力对齐全景视频的大规模三维重建管线,保留冻结的前馈透视骨干网络,将每张全景图当作四视角虚拟装置使用。该装置结构可检测并修复局部不一致预测,通过四视角循环一致性检索回环,并在全局优化前对候选重访进行几何验证,最终以 Sim(3) 位姿图修正旋转、平移与尺度漂移。在施工场地序列上,其轨迹精度与重建几何均优于前馈基线,代码已开源。
UniPose9D 是一个类别无关的 9D 物体位姿估计统一模型,仅凭实例 mask/ROI 加 RGB-D 或带预测深度的 RGB 图像,即可在无类别标签、CAD 模型、平均形状先验和参考视图的情况下估计旋转、平移与度量尺寸。
VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,保持基础 VLA 模型完全冻结,让剪枝后上下文产生的动作与全上下文教师模型保持一致。在 LIBERO 和真实机器人操作任务上,该方法最多剪掉 87.5% 的视觉 token,计算量降低最多 75%,推理提速 1.5 倍,性能仍具竞争力。代码已开源。
基于 Wan2.2-5B 构建的开放世界-动作模型框架 OpenWAM 发布,通过共享 Mixture-of-Transformers 架构集成动作专家,支持联合、先视频后动作、先动作后视频及解耦四种生成方式。
Sparse2comm 是一个带宽高效且鲁棒的协同 3D 目标检测框架,将不可靠协同视为对退化协同特征的渐进式修复。它通过稀疏特征编码以随机掩码采样的前景特征实现超低带宽通信与丢包恢复,再用延迟感知对齐补偿延迟消息、自校准融合估计残余空间偏移。
研究提出相位速度蒸馏(PVD),将生成过程分为粗、细两个阶段,各用一个半尺寸专家模型建模平均速度,累计计算量仅相当于一次完整骨干前向。
LARK 是一套基于消费级 RGB 硬件与多视角冗余融合的多相机光学跟踪系统,在五相机与自适应卡尔曼滤波下,加工网格上的点定位中位目标配准误差为 0.64 mm,轨迹跟踪为 0.73 mm。相机子集实验显示,可用视角减少时自适应位姿融合精度平缓下降。其跟踪硬件成本低于 1,000 美元,硬件设计与软件已公开,数据集同步开放。
SimCortex v2 是一个从 T1 加权 MRI 同时重建左右脑 WM 与 pial 表面的深度学习框架,在 14 个队列 560 例(13 个训练中未见)上平均对称表面距离 0.253 mm,与最强基线持平。92.14% 的病例未检测到表面间碰撞,自交比例 0.044% 为学习类方法中最低,而所有基线在每个病例中均至少产生一次碰撞。源代码、配置、预训练权重、预处理数据与评测划分已公开。
MoonGS 是首个面向月球场景的前馈式 3D Gaussian Splatting 框架,仅需两张输入图像即可单次前向预测像素对齐的高斯图元,无需逐场景优化。在 LuSNAR 基准和弱纹理 MoonBlender 数据集上,其 PSNR 比 SOTA 前馈 NeRF/3DGS 基线高 +4.9 dB、SSIM 高 +0.29、LPIPS 低 40%,并保持亚秒级推理。代码与数据集已公开。
研究者构建了 Wikidata Search Traces 数据集,包含 10,235 条单实体与多跳问题的求解轨迹,以及生成这些轨迹的递归语言模型(RLM)harness。
研究者发布 TabiBERT,一个基于 ModernBERT 架构、从零预训练的土耳其语单语编码器,训练数据为 1 万亿 token,来自 86.58B token 的多领域语料(网页文本 72%、科学出版物 19%、源代码 6%、数学内容 0.3%),支持 8,192 token 上下文,是现有土耳其语 BERT 模型的 16 倍。
Pleias 发布 Pleias-RAG-350m 和 Pleias-RAG-1B 两款小型推理模型,原生支持引用与字面引文溯源,并整合查询路由、查询改写和来源重排等 RAG 工作流功能。
研究者提出 PPG2Speech,一个基于扩散模型的多说话人音素后验图到语音(PPG-to-Speech)模型,无需文本对齐即可编辑单个音素,用于将母语语音编辑为近似二语(L2)语音。该模型以 Matcha-TTS 的流匹配解码器为骨干,引入无分类器引导(CFG)和 Sway Sampling,并提出音素对齐一致性(PAC)评估指标。在芬兰语约 60 小时数据上验证,代码已开源。
RIPE++ 提出一种仅从正样本对中同时导出奖励与惩罚的强化学习奖励机制,无需构造负样本对即可学习判别性关键点检测器与描述子。该方法将同一 RL 目标扩展至匹配阶段,通过适配 LightGlue 将 MegaDepth1500 上的 AUC@5 从 56.58 提升至 59.65,并支持部分视觉重叠图像对的弱监督全流程训练。在低纹理医学视频序列等相机位姿缺失场景下同样可训练,结果与全监督方法相当。
PyDPF 是一个基于 PyTorch 的可微粒子滤波(DPF)Python 包,用统一 API 实现了多种通过改造重采样步骤实现可微的粒子滤波方法。该框架复现了多项已有研究的实验,并展示 DPF 如何应对状态空间建模中的常见挑战,论文共 46 页,正投稿于 Journal of Statistical Software,代码与文档已公开。
研究者提出 Nucleus Speculative Decoding(NSD),一种将目标模型合理性纳入验证的宽松投机解码方法:草稿 token 满足标准接受规则或落入目标模型 nucleus 即被接受。实验显示 NSD 相比自回归解码吞吐最高提速 5.16×,相比标准投机解码最高提速 3.15×,同时保持有竞争力的任务表现,并带来更长的接受长度。
针对大规模推荐系统中哈希索引的嵌入向量碰撞问题,研究者提出基于线性探测的 Multi-Probe Zero Collision Hash(MPZCH),在合理表规模下可完全消除碰撞。
HARL-A 是一个基于 IsaacLab 构建的开源异构多智能体对抗强化学习基准框架,支持任意数量队伍及每队任意机器人形态组合的对抗策略训练与评测。该框架扩展了 HARL 算法库与 IsaacLab,提供模块化架构、Sumo/Soccer/3D Galaga 三个基准环境,以及十余个覆盖同构与异构队伍配置的预训练策略,已公开于 Hugging Face。代码、环境、策略与文档均已开放获取。
Scen-Opt 是一个开源 Python 工具箱,将凸规划与数据样本结合,并提供基于场景理论的统计保证,支持数据驱动的线性、二次与半定规划。它提供基于 Python 的 Web 应用和图形界面,可在线使用或本地安装,支持 CSV、JSON、TXT、TSV、MAT、Excel、NPY、NPZ、Parquet 等文件上传。该工具在多个代表性基准上验证了其数据驱动凸优化的实际效果。
BiGym 2.0 将 BiGym 适配到 Unitree G1,用统一全身控制器覆盖 20 项家务任务,并为每项任务提供 60 条人类 VR 演示,含同步多视角与全身执行记录。
REViT-v2 是一种基于窗口化群卷积自注意力和层级特征架构的可扩展旋转-反射群等变视觉 Transformer,可扩展至数百万参数规模并在 ImageNet 等大尺寸图像数据集上训练。该模型的代码与预训练权重已公开,相关论文被 NeurIPS NeurREPS workshop 2026 接收。
Fiorillo v0.5 是一个开放模型,基于 Qwen3-4B-Base 加低秩适配器和决策头,仅用 2,657 篇训练文章中许可允许复用的 1,431 篇针对 Evidence Inference 2.0 微调,回答干预对结局的显著影响方向并给出概率。
研究者提出 Best-of-N Guidance(BoNG),将 BoN 采样直接融入反向扩散过程,通过去噪粒子间的非对称引导交互,把粒子群导向更高奖励区域。在 36 项对比中 BoNG 有 29 项表现最佳,对 SMC 和 Vanilla BoN 的胜率达 80.56%。该方法支持多输出,ImageReward 分数为最新基于采样的引导方法的 1.3 倍,速度提升 1.6 倍,代码已开源。
研究团队发布 FineART 双臂操作数据集,含 40,543 条轨迹(1,718 小时)、533,913 个子任务,覆盖 151 项任务,并推出可预测下一子任务的视觉-语言-动作策略 FineART-VLA。
SAE++ 是一种级联稀疏自编码器架构,通过在初级 SAE 的解码器权重上训练二级 SAE,学习多模态 LLM 中的层级视觉概念,避免嵌套式共享前缀耦合与朴素堆叠的瓶颈。在 Qwen3-VL、Gemma-3 和 LLaVA 上的多组视觉数据集实验中,SAE++ 在层级概念一致性上优于当前最优 SAE 基线,并支持对 MLLM 输出进行组级概念干预。代码已开源。
NVIDIA 提出 NeMo-DCR(Delta-Compressed Refit),只传输权重变化量却保持比特精确,接收端得到与全量重配完全相同的参数和 buffer 位。
研究指出 Muon 优化器对矩阵更新有清晰解释,但卷积核以四维张量存储,标准实现将其 reshape 为矩阵的做法破坏了其理论基础。为此研究者提出 Convolutional Newton-Schulz(Conv-NS),直接在卷积算子几何中逼近极因子并保留核支撑。
arXiv 论文提出开源个人智能体 nanoMuse,采用 GPL-3.0 许可,让用户拥有的每台设备共享同一段对话,并通过任何人都能运行的 relay 连接。
开源工具包 Transect 发布,基于 Inspect Scout 构建,用于分析长周期 LLM 智能体评测记录。它通过可复用的评测族配置指定任务上下文与行为词汇,将事件、token 用量、子智能体活动和模型生成的行为标签对齐到统一的回合时间线上,支持标签溯源与数据表导出。
研究者为完整十英雄 MOBA(206 个单位、每 tick 全英雄行动、单局最长 6,000 tick)学习结构化多智能体世界模型,仅用 1,400-tick 自由推演想象回合训练策略,再在真实对局中评测。
研究者发布开放电信 AI 资源 OTel,包含面向检索、重排序、指令微调与安全/拒答的衍生电信数据集,以及 30 个全参数后训练基线,覆盖 10 个嵌入模型、3 个重排序器和 17 个语言模型。截至 2026 年 5 月 3 日,相关模型下载量超 1600 万次。后训练后嵌入检索达 93.1% NDCG@10,重排序达 0.947 MRR@10,语言模型正确率达 87.8%。
BluffJAX 是一个基于 JAX 的开源对抗性不完美信息博弈套件,包含 Texas Hold'Em Poker、Kuhn Poker 等经典基准,以及此前未被强化学习研究过的 Bluff、Stud Poker 和 Kemps。其在单 GPU 和多 GPU 设置下实现每秒数亿样本的吞吐量扩展,并提供了强化学习、树搜索和博弈求解算法的基线结果。
MemMux 是一个本地运行时,为并行编码智能体集群提供可检查的资源治理信号,包括按智能体归属、完整回收、逃逸进程可见性等。在 Linux 内存预算约束下,MemMux 将集群控制在 7.5 GiB 且零 swap,而未治理工具会超出预算 2 倍并溢出约 2 GiB 到 swap;它还能 100% 回收终止智能体的进程子树,并检测出全部 10 个逃逸子进程。
PhAI Labs 联合斯坦福、牛津、普林斯顿的研究者提出 JEPA-Anything,把 JEPA 的预测状态拆成四个正交因子、各由独立预测模块处理,再重组为完整世界状态,从而在物理、机器人、天气、单细胞和临床等七个领域共用一套架构。
研究者基于钢琴 MIDI 预训练的 16 层 Transformer 模型 Aria,在 PiJAMA 数据集中十二位爵士钢琴家的独奏上微调,并在最后八层插入门控交叉注意力层,读取每位钢琴家的学习嵌入向量。生成片段被分类器判定为对应钢琴家的比例为 70%,无条件下仅为 37%;仅用生成音乐训练的第二个分类器识别真实录音的准确率达 95%。
Opus 5.5 智能体通过密度泛函理论计算发现两种室温磁性半导体候选材料。其一是全新设计的 Luttinger 补偿磁体 YBaMnFeO₅,预测带隙 2.35 eV,空穴自旋窗口 1.0 eV、电子自旋窗口 1.4 eV;另一种是 1999 年首次合成的已知材料,计算预测其具备目标性质。
研究提出 SBERT2S1,将 Sentence-Transformers 编码器转换为双编码器、cross-head(C)与 prior-fused residual(PFR)决策模型,并发布生物医学类型化决策套件 BIODECIDE 及源自 NLM 索引的 243k 条训练决策 MEDLINE-S1。