召回优化:为什么纯向量检索不够用,Hybrid Search 怎么配
纯向量检索在专有名词、数字版本号、代码命令等精确匹配场景下召回率往往只有 60-70%,需要 Hybrid Search 即向量检索加 BM25 关键词检索互补。
纯向量检索在专有名词、数字版本号、代码命令等精确匹配场景下召回率往往只有 60-70%,需要 Hybrid Search 即向量检索加 BM25 关键词检索互补。
CHASE-VLA 是一种面向 VLA 模型的 chunk 感知训练后量化(PTQ)方法,利用策略生成的动作 chunk 作为因果上下文,结合去噪步分组信息自适应调整动作专家(AE)的激活缩放,无需修改预训练策略即可实现 AE 中 MLP 与注意力投影的 W4A4 量化。
SpectralCache 是一种免训练谱缓存框架,利用扩散世界模型特征在相邻去噪步间奇异子空间高度稳定的特性,复用稳定子空间并通过线性外推估计低维奇异值,从而跳过部分主干网络计算。在 HunyuanWorld-Voyager-13B 上,它实现 5.22 倍加速,静态场景 WorldScore 保持 65.90,推理效率显著优于现有免训练缓存方法。
研究团队推出 CourseChat,一个部署在校园网关后、面向本科商科教育的本地化多课程 RAG 辅导系统,六个课程实例共享由 Ollama 提供本地 LLM 服务的双边缘 AI 主机。
FlashSinkhorn 2(FS2)是一款面向低维点云平方欧氏代价的熵正则最优传输(EOT)GPU 求解器,通过粗粒度质心求解与块稀疏精修两阶段耦合,在单张 A100 上求解两个 1.34×10^8 粒子测度间的离散 EOT 问题,全粒子边际残差低于 0.01,耗时不到 2.5 小时。
WakeKV 是一种响应式 KV 驻留策略,将"冷却"的注意力头状态移入可恢复的 CPU 存储池,而非冻结或永久驱逐。研究在 1.5B-8B 三个模型、三种场景下测得多数注意力头在生成过程中至少改变一次读取行为,WakeKV 在匹配内存或预算下持续优于冻结分类与破坏性驱逐,并在 Mistral-7B 的 FlexiCache/vLLM 实现上验证了吞吐提升且保持 LongBench 质量。
FUSEye 将冻结骨干的 COCO 预训练 YOLO26-x 转为鱼眼检测器,仅新增约 227k 参数,在 WoodScape 环视鱼眼基准上把 mAP50 从 0.148 提升至 0.266,并保留全量微调 84.3% 的精度。
TRAC 是一个无需训练的自回归视频生成加速框架,通过鲁棒累积调度(RCS)、自回归轨迹感知引导调度(ATGS)和频谱结构校正(SSC)三个组件,解决分块去噪轨迹中近似误差累积传播的问题。在 SkyReels-V2 和 FramePack-F1 上的实验显示,TRAC 相比现有方法同时实现了最高的推理效率和最佳生成质量。
BlackGit 提供按需下载仓库文件的服务端文件锁定功能,由客户端和服务器两部分组成,前后端解耦可分开使用。其 CLI 以 blob:none 克隆仓库,再用 sparse-checkout 设置 !/*、!/*/* 实现初始不下载任何文件,包括根目录文件。
马斯克 10 月 3 日在 X 上确认正与台积电讨论 Terafab 芯片制造合作,称只是讨论但可能会有结果。Terafab 是 Tesla、SpaceX 与 xAI 共同推进的超大规模垂直整合芯片制造项目,一期投资 168 亿美元,长期潜在总投资可达 1190 亿美元,目标年产约 1TW AI 算力。
量子位访谈了六位 FDE(前线部署工程师)从业者,发现他们的工作内容差异很大:有人驻场梳理企业 Ontology,有人基本不驻场只做线上技术对接,也有独立开发者一人接单做企业 AI 改造。
Simon Willison 呼吁按量付费的 API 和服务默认设置硬性预算上限,即达到每月 $X 后直接切断并返回错误,而非仅发警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出限额功能,项目用量触顶后当月暂停,目前仅向有限客户开放;Google Cloud 则在 7 月推出 Spend Caps。
Google 一颗冰箱大小的卫星于 10 月 1 日搭载 SpaceX Falcon 9 升空,用于测试太空 AI 数据中心的可行性,项目名为 Project Suncatcher。
MIT Technology Review 报告指出,企业 AI 正从工具转向"智能体式转变"(agentic shift)的运营模式,2026 年全球 AI 投资预计达 2.5 万亿美元,同比增长 44%。报告认为企业 AI 的规模化问题是结构性的,领先企业把流程重设计放在模型选型之前,并以数据就绪而非数据规模取胜。报告建议重建数据基础设施、用可组合架构替代固定技术栈,并解决 AI 主权问题。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性(非 AI)规则引擎完成。
通过 Amazon Bedrock AgentCore Gateway,可将 Claude Desktop 接入由 Amazon 网页索引支持的 Web Search,覆盖数百亿文档,查询流量全程留在 AWS 内、无需外部 API key。
Airbnb CTO Ahmad Al-Dahle 接受 Latent Space 采访,介绍其把 Airbnb 改造成 AI-native 公司的做法:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 DGX Spark 64GB 配置,保留 GB10 Grace Blackwell 超级芯片、DGX OS 和完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 新配置的价格、可跑模型规模与双机集群方式,便于判断本地跑智能体的门槛。
openJiuwen 团队开源智能路由框架 model-router,并首发 x-router 算法,在 Agent 与模型之间增加一层按任务复杂度动态选模的决策能力。
Earendil 旗下 Pi 发布 1.0 版本,新增对 MCP、Jev 和图像模型的原生支持、虚拟模型扩展、延迟工具加载、Anthropic 模型缓存预热、对话中途系统消息、新 TUI 主题以及默认全屏模式。
GPT-6 Astra Ultrafast 已在 OpenAI API 上线,并向符合条件的 ChatGPT Work 和 Codex 用户开放,运行在 NVIDIA Blackwell GPU 上。
推荐理由:原文给出 Ultrafast 相对标准模式的加速倍数与开放入口,读者可据此判断它对编码智能体循环的实际影响。
Simon Willison 的纯 Python WebAssembly 引擎 pwasm 在 Claude Opus 5.5 接手后经 42 次提交升级至 0.2a0,现已支持几乎全部 WASM 规范。PyPI 上的 wheel 包同时捆绑了 MicroPython、QuickJS 和 Micro QuickJS 的可用 WASM 构建。该版本仍为 alpha,作者表示完全不可信任。
作者开源了 Zentrola,用于解决团队使用 Codex 和 Claude Code 时的 API Key 与模型权限管理问题。原文指出,从个人到团队后,真实 API Key 是否分发、新成员可用哪些模型、成员离职后如何撤销权限、上游服务商故障时如何通知,都会变成管理问题。
NVIDIA 提出 AI 工厂投资回报取决于三个因素:每兆瓦产出能力、硬件使用寿命和 token 需求。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
Latent Space 在 OpenAI DevDay 后采访了负责 Computer Use 产品与工程的 Ari Weinstein 和 OpenAI API 产品负责人 Nikunj Handa。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报及变电站所在地的纬度与地质电导率数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险预估。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 上线,Cognition 成为首个在生产负载上运行该系统的客户。
推荐理由:原文给出 Vera Rubin NVL72 上线 CoreWeave 云及 Cognition 实测吞吐数据,可据此判断智能体编码负载的算力选择。
Blueking Lite 本周更新中,智能体问答现可展示知识库中的图片。该平台为 AI First 的轻量版运维产品,主打部署资源要求低、使用成本低。此次更新还新增 API 调用日志查看、CMDB 物理服务器 Redfish 采集,作业平台脚本库支持 ZIP 批量导入导出。
MateClaw 2.3.0 于 2026 年 9 月 20 日发布,为 Persistent Goal 引入用户配置的托管 JSON 验收:Agent 发布不可变产物版本,服务端将检查结果绑定到当前要求与具体 generation,全部绑定有效后才允许完成目标。该版本还新增观察模式执行证据、Team Worker 受控干预以及 Skill 文档和文件夹上传。
DeepSeek 于 9 月 30 日正式开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库和分布式通信库,与此前面向英伟达平台的开源组件一一对应。其中 TileLang 昇腾版本被描述为最重的一块,DeepSeek 称要建立新一代自主可控的 GPU 软件生态,需先有通用且编程简单的工具。
开源可自部署的知识库工具 KnowForge 发布 v2026.0.7,新增会员运营、开放平台、双向链接、读者问题洞察和多实例部署等能力。该版本围绕知识库的持续更新、内容互连与工具接入等运营需求进行更新。
HPE 提出,当 AI 从试验走向生产、形成客服与 IT 等智能体驱动的常态化负载后,企业需重新权衡按 token 消费与自建算力的经济性。Deloitte 2026 企业 AI 状态报告显示,2025 年员工 AI 使用率上升 5%,至少 40% 的 AI 项目进入生产的公司比例预计六个月内翻倍。HPE 建议企业按实际负载测算自有算力的盈亏平衡点,并通过采用、治理与用例扩展保持产能利用率。
GitHub Copilot 提出 chat 大多数时候是错误的 AI 交互界面,应改用 canvas——一种运行在 GitHub Copilot app 内、无浏览器外壳的全栈应用,可与 agent 双向通信并在本地执行代码。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 做验证。它把文档高度拆成确定性的代码几何与动态评论块两套体系,代码行高提前算好,评论高度按需测量并锚定到文件、行和侧,避免滚动跳变。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软团队系统测量了机器人端侧与卸载推理的差异,并给出可复用的 Kubernetes 卸载工具链。
Google DeepMind 公布 Private AI Compute 平台的新技术能力,将私密的服务端持久记忆引入该平台,使 AI 助手能在多设备间保留上下文,同时维持接近端侧处理的隐私标准。
推荐理由:Google 公开了云端持久记忆的隐私架构,读者可了解跨设备 AI 记忆如何在加密与安全隔区下实现。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 pull request 增量合入 main,而非一次性切换。
推荐理由:作者以亲历者身份给出把 80 万行运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。
OpenClaw 发布 2.0 版,共有 933 位贡献者、合并 16000 个 PR,而全职团队仅 9 人、兼职 26 人,作者据此判断这些 PR 未经代码审查、由 AI 合并。该版本源于 8 月改动,发布节奏已从每日一版改为每月一版。作者仍建议不要在办公电脑上运行 OpenClaw,而应放在独立物理机、虚拟机或云端。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为迄今最先进、最准确的全球天气模型,直接学习实时观测数据,可每小时生成一次预报。
推荐理由:原文给出分辨率、更新频率和降水精度等具体指标,读者可据此判断 AI 天气预报在 Google 产品中的落地程度。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:读者可以看到 CUDA 优化经验如何被结构化迁移到 Apple Silicon,以及翻译层对最终性能差距的具体影响。