CHASE-VLA:面向视觉-语言-动作模型的 chunk 感知训练后量化框架
CHASE-VLA 是一种面向 VLA 模型的 chunk 感知训练后量化(PTQ)方法,利用策略生成的动作 chunk 作为因果上下文,结合去噪步分组信息自适应调整动作专家(AE)的激活缩放,无需修改预训练策略即可实现 AE 中 MLP 与注意力投影的 W4A4 量化。
CHASE-VLA 是一种面向 VLA 模型的 chunk 感知训练后量化(PTQ)方法,利用策略生成的动作 chunk 作为因果上下文,结合去噪步分组信息自适应调整动作专家(AE)的激活缩放,无需修改预训练策略即可实现 AE 中 MLP 与注意力投影的 W4A4 量化。
SpectralCache 是一种免训练谱缓存框架,利用扩散世界模型特征在相邻去噪步间奇异子空间高度稳定的特性,复用稳定子空间并通过线性外推估计低维奇异值,从而跳过部分主干网络计算。在 HunyuanWorld-Voyager-13B 上,它实现 5.22 倍加速,静态场景 WorldScore 保持 65.90,推理效率显著优于现有免训练缓存方法。
研究团队推出 CourseChat,一个部署在校园网关后、面向本科商科教育的本地化多课程 RAG 辅导系统,六个课程实例共享由 Ollama 提供本地 LLM 服务的双边缘 AI 主机。
FlashSinkhorn 2(FS2)是一款面向低维点云平方欧氏代价的熵正则最优传输(EOT)GPU 求解器,通过粗粒度质心求解与块稀疏精修两阶段耦合,在单张 A100 上求解两个 1.34×10^8 粒子测度间的离散 EOT 问题,全粒子边际残差低于 0.01,耗时不到 2.5 小时。
WakeKV 是一种响应式 KV 驻留策略,将"冷却"的注意力头状态移入可恢复的 CPU 存储池,而非冻结或永久驱逐。研究在 1.5B-8B 三个模型、三种场景下测得多数注意力头在生成过程中至少改变一次读取行为,WakeKV 在匹配内存或预算下持续优于冻结分类与破坏性驱逐,并在 Mistral-7B 的 FlexiCache/vLLM 实现上验证了吞吐提升且保持 LongBench 质量。
FUSEye 将冻结骨干的 COCO 预训练 YOLO26-x 转为鱼眼检测器,仅新增约 227k 参数,在 WoodScape 环视鱼眼基准上把 mAP50 从 0.148 提升至 0.266,并保留全量微调 84.3% 的精度。
TRAC 是一个无需训练的自回归视频生成加速框架,通过鲁棒累积调度(RCS)、自回归轨迹感知引导调度(ATGS)和频谱结构校正(SSC)三个组件,解决分块去噪轨迹中近似误差累积传播的问题。在 SkyReels-V2 和 FramePack-F1 上的实验显示,TRAC 相比现有方法同时实现了最高的推理效率和最佳生成质量。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报及变电站所在地的纬度与地质电导率数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险预估。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软团队系统测量了机器人端侧与卸载推理的差异,并给出可复用的 Kubernetes 卸载工具链。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:读者可以看到 CUDA 优化经验如何被结构化迁移到 Apple Silicon,以及翻译层对最终性能差距的具体影响。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、直接向状态迭代加入随机性以探索、并重塑梯度避免高维视觉模型中的脆弱"状态-输入"梯度,使世界模型的长时程规划变得可行。现代世界模型长时程规划常因优化病态、非贪心结构导致的局部极小值和高维隐空间失败模式而脆弱。