跳到正文
今天10月7日周三36 条
  1. arXiv cs.CV22

    RIGOR:面向全景视频重建的虚拟四目装置几何方法

    RIGOR 是一个面向重力对齐全景视频的大规模三维重建管线,保留冻结的前馈透视骨干网络,将每张全景图当作四视角虚拟装置使用。该装置结构可检测并修复局部不一致预测,通过四视角循环一致性检索回环,并在全局优化前对候选重访进行几何验证,最终以 Sim(3) 位姿图修正旋转、平移与尺度漂移。在施工场地序列上,其轨迹精度与重建几何均优于前馈基线,代码已开源。

  2. arXiv cs.CV22

    VLA-ACL:面向高效 Vision-Language-Action 模型的动作一致性视觉 token 剪枝

    VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,保持基础 VLA 模型完全冻结,让剪枝后上下文产生的动作与全上下文教师模型保持一致。在 LIBERO 和真实机器人操作任务上,该方法最多剪掉 87.5% 的视觉 token,计算量降低最多 75%,推理提速 1.5 倍,性能仍具竞争力。代码已开源。

  3. arXiv cs.CV23

    LARK:低成本、高精度、抗遮挡的卡尔曼滤波辅助图像引导手术跟踪系统

    LARK 是一套基于消费级 RGB 硬件与多视角冗余融合的多相机光学跟踪系统,在五相机与自适应卡尔曼滤波下,加工网格上的点定位中位目标配准误差为 0.64 mm,轨迹跟踪为 0.73 mm。相机子集实验显示,可用视角减少时自适应位姿融合精度平缓下降。其跟踪硬件成本低于 1,000 美元,硬件设计与软件已公开,数据集同步开放。

  4. arXiv cs.CV18

    SimCortex v2:近乎零碰撞与自交的联合皮层表面重建

    SimCortex v2 是一个从 T1 加权 MRI 同时重建左右脑 WM 与 pial 表面的深度学习框架,在 14 个队列 560 例(13 个训练中未见)上平均对称表面距离 0.253 mm,与最强基线持平。92.14% 的病例未检测到表面间碰撞,自交比例 0.044% 为学习类方法中最低,而所有基线在每个病例中均至少产生一次碰撞。源代码、配置、预训练权重、预处理数据与评测划分已公开。

  5. arXiv cs.CV24

    MoonGS:用图像对鲁棒深度特征实现月表高质量高斯泼溅重建

    MoonGS 是首个面向月球场景的前馈式 3D Gaussian Splatting 框架,仅需两张输入图像即可单次前向预测像素对齐的高斯图元,无需逐场景优化。在 LuSNAR 基准和弱纹理 MoonBlender 数据集上,其 PSNR 比 SOTA 前馈 NeRF/3DGS 基线高 +4.9 dB、SSIM 高 +0.29、LPIPS 低 40%,并保持亚秒级推理。代码与数据集已公开。

  6. arXiv cs.CL25

    TabiBERT:基于 ModernBERT 的土耳其语大规模基础模型与统一基准 TabiBench

    研究者发布 TabiBERT,一个基于 ModernBERT 架构、从零预训练的土耳其语单语编码器,训练数据为 1 万亿 token,来自 86.58B token 的多领域语料(网页文本 72%、科学出版物 19%、源代码 6%、数学内容 0.3%),支持 8,192 token 上下文,是现有土耳其语 BERT 模型的 16 倍。

  7. arXiv cs.CL22

    基于音素后验图的芬兰语语音发音编辑:PPG2Speech 模型

    研究者提出 PPG2Speech,一个基于扩散模型的多说话人音素后验图到语音(PPG-to-Speech)模型,无需文本对齐即可编辑单个音素,用于将母语语音编辑为近似二语(L2)语音。该模型以 Matcha-TTS 的流匹配解码器为骨干,引入无分类器引导(CFG)和 Sway Sampling,并提出音素对齐一致性(PAC)评估指标。在芬兰语约 60 小时数据上验证,代码已开源。

  8. arXiv cs.LG22

    RIPE++:仅用正样本对的强化关键点学习

    RIPE++ 提出一种仅从正样本对中同时导出奖励与惩罚的强化学习奖励机制,无需构造负样本对即可学习判别性关键点检测器与描述子。该方法将同一 RL 目标扩展至匹配阶段,通过适配 LightGlue 将 MegaDepth1500 上的 AUC@5 从 56.58 提升至 59.65,并支持部分视觉重叠图像对的弱监督全流程训练。在低纹理医学视频序列等相机位姿缺失场景下同样可训练,结果与全监督方法相当。

  9. arXiv cs.LG22

    PyDPF:基于 PyTorch 的可微粒子滤波 Python 包

    PyDPF 是一个基于 PyTorch 的可微粒子滤波(DPF)Python 包,用统一 API 实现了多种通过改造重采样步骤实现可微的粒子滤波方法。该框架复现了多项已有研究的实验,并展示 DPF 如何应对状态空间建模中的常见挑战,论文共 46 页,正投稿于 Journal of Statistical Software,代码与文档已公开。

  10. arXiv cs.CL22

    Nucleus Speculative Decoding:超越精确分布的合理性感知验证

    研究者提出 Nucleus Speculative Decoding(NSD),一种将目标模型合理性纳入验证的宽松投机解码方法:草稿 token 满足标准接受规则或落入目标模型 nucleus 即被接受。实验显示 NSD 相比自回归解码吞吐最高提速 5.16×,相比标准投机解码最高提速 3.15×,同时保持有竞争力的任务表现,并带来更长的接受长度。

  11. arXiv cs.LG31

    HARL-A:基于 IsaacLab 的可扩展异构多智能体对抗强化学习基准框架

    HARL-A 是一个基于 IsaacLab 构建的开源异构多智能体对抗强化学习基准框架,支持任意数量队伍及每队任意机器人形态组合的对抗策略训练与评测。该框架扩展了 HARL 算法库与 IsaacLab,提供模块化架构、Sumo/Soccer/3D Galaga 三个基准环境,以及十余个覆盖同构与异构队伍配置的预训练策略,已公开于 Hugging Face。代码、环境、策略与文档均已开放获取。

  12. arXiv cs.LG21

    Scen-Opt:面向数据驱动凸规划的场景优化工具箱

    Scen-Opt 是一个开源 Python 工具箱,将凸规划与数据样本结合,并提供基于场景理论的统计保证,支持数据驱动的线性、二次与半定规划。它提供基于 Python 的 Web 应用和图形界面,可在线使用或本地安装,支持 CSV、JSON、TXT、TSV、MAT、Excel、NPY、NPZ、Parquet 等文件上传。该工具在多个代表性基准上验证了其数据驱动凸优化的实际效果。

  13. arXiv cs.AI26

    BoNG:面向测试时扩散模型对齐的 Best-of-N 引导方法

    研究者提出 Best-of-N Guidance(BoNG),将 BoN 采样直接融入反向扩散过程,通过去噪粒子间的非对称引导交互,把粒子群导向更高奖励区域。在 36 项对比中 BoNG 有 29 项表现最佳,对 SMC 和 Vanilla BoN 的胜率达 80.56%。该方法支持多输出,ImageReward 分数为最新基于采样的引导方法的 1.3 倍,速度提升 1.6 倍,代码已开源。

  14. arXiv cs.AI22

    SAE++:级联稀疏自编码器学习多模态 LLM 的多层级视觉概念

    SAE++ 是一种级联稀疏自编码器架构,通过在初级 SAE 的解码器权重上训练二级 SAE,学习多模态 LLM 中的层级视觉概念,避免嵌套式共享前缀耦合与朴素堆叠的瓶颈。在 Qwen3-VL、Gemma-3 和 LLaVA 上的多组视觉数据集实验中,SAE++ 在层级概念一致性上优于当前最优 SAE 基线,并支持对 MLLM 输出进行组级概念干预。代码已开源。

  15. arXiv cs.AI24

    OTel:开放电信 AI 数据集、基准与模型发布

    研究者发布开放电信 AI 资源 OTel,包含面向检索、重排序、指令微调与安全/拒答的衍生电信数据集,以及 30 个全参数后训练基线,覆盖 10 个嵌入模型、3 个重排序器和 17 个语言模型。截至 2026 年 5 月 3 日,相关模型下载量超 1600 万次。后训练后嵌入检索达 93.1% NDCG@10,重排序达 0.947 MRR@10,语言模型正确率达 87.8%。

  16. arXiv cs.AI26

    BluffJAX:JAX 中的对抗性不完美信息博弈开源套件

    BluffJAX 是一个基于 JAX 的开源对抗性不完美信息博弈套件,包含 Texas Hold'Em Poker、Kuhn Poker 等经典基准,以及此前未被强化学习研究过的 Bluff、Stud Poker 和 Kemps。其在单 GPU 和多 GPU 设置下实现每秒数亿样本的吞吐量扩展,并提供了强化学习、树搜索和博弈求解算法的基线结果。

  17. arXiv cs.AI32

    MemMux:面向并行编码智能体集群的运行时验证与资源归属

    MemMux 是一个本地运行时,为并行编码智能体集群提供可检查的资源治理信号,包括按智能体归属、完整回收、逃逸进程可见性等。在 Linux 内存预算约束下,MemMux 将集群控制在 7.5 GiB 且零 swap,而未治理工具会超出预算 2 倍并溢出约 2 GiB 到 swap;它还能 100% 回收终止智能体的进程子树,并检测出全部 10 个逃逸子进程。

  18. Google DeepMind71

    Google DeepMind 发布 EmbeddingGemma 2 开源多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,参数量 740M,可将文本、图像、音频、视频映射到统一嵌入空间。

    推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一进同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于评估本地多模态检索的可行性。

10月5日周一