多智能体系统中的执行一致性:超越修正记忆
研究提出多智能体系统的"执行一致性"定义,通过状态使用、信息交接和最终状态一致性等职责判断任务是否被满足。受控移除回执、动作依赖等证据后,82.4% 的对立标签对无法区分,恢复后 97.9% 可分离。基于 CAVERT 框架从日志提取关系并应用该标准,在全部 12 个基准执行器设置中诊断表现优于契约提示 LLM 和规则基线,并在四个环境中优于规则引导恢复。
研究提出多智能体系统的"执行一致性"定义,通过状态使用、信息交接和最终状态一致性等职责判断任务是否被满足。受控移除回执、动作依赖等证据后,82.4% 的对立标签对无法区分,恢复后 97.9% 可分离。基于 CAVERT 框架从日志提取关系并应用该标准,在全部 12 个基准执行器设置中诊断表现优于契约提示 LLM 和规则基线,并在四个环境中优于规则引导恢复。
WorkflowOps 是一个多智能体工作流编排框架,能从历史工作流中学习智能体协作先验,并按需扩展智能体池以覆盖新能力需求。它通过转移概率矩阵引导 DAG 工作流构建,并用分层语义匹配策略将 LLM 路由调用减少超 80%。在代码、数学与问答混合测试集上,其端到端通过率优于近期工作流构建基线,在结构化可分解任务上提升最大。
研究者提出 VisualNoiseQA,一个面向噪声视觉反馈下主动推理的基准:纯文本 LLM 需通过迭代查询一个固定的现成 VLM(视为随机视觉传感器)来解答 VQA 问题,每次查询多次采样并以自一致性给出经验不确定性信号,供推理器决定下一步问什么、何时停止。
研究采用心理学 Relational Match-to-Sample(RMTS)范式并结合机制分析,在 GPT、Claude、Gemini 及 Qwen3.5、Gemma-4、InternVL3 上发现能力层级、模型规模、场景物体数量和逐物体刺激噪声四项因素共同推动 VLM 呈现类人"关系转换"轨迹。
研究提出 SSU-Bench 数据集,用单项提示词编辑或图像编辑构造配对的安全与不安全图文组合,并在三个视觉语言模型间迁移内部状态以测量安全判定变化。结果显示,针对被改动输入位置的干预在解码器较早层有效,而针对最终输入 token 的干预在较晚层才生效;最终 token 状态的线性读出还能预测模型自身判定(包括错误判定),跨模型对比显示反事实变化模式存在相似性。
研究将连续环境下的视觉语言导航(VLN)方法从仿真迁移到真实世界,无需导航图或全景视图。系统采用 Cross-Modal Attention(CMA)架构,在仿真数据集上训练后,用自建阿克曼转向机器人(配备摄像头和 LiDAR)采集的真实数据微调,结合线性光度调整,在少量 episode 上即完成适配,并可在专用硬件上离线运行。SPL 和 nDTW 指标验证了方法的鲁棒性与适应性。
针对视觉语言模型自验证依赖单一标准或固定提示词、可靠性评估不完整的问题,研究者提出 MOTIVE 多视角自验证框架,通过正确性对齐的多视角验证学习为每个候选答案打分。推理时该分数决定直接采纳还是触发历史引导的重思考,在多种多模态基准和 VLM 主干上持续优于强自验证与自纠正基线,并减少不必要的推理轮次。
研究揭示 Vision Transformer 通过"转喻式奠基"机制识别抽象概念:在 CLIP 和 DINO 视觉编码器上应用 Transcoders 后发现,抽象预测由"火"等具体可解释的锚概念驱动,感知原语主导浅层、类物体锚点先于抽象目标出现,含渲染文字的图像则走独立的感知到文本路径。因果干预实验验证这些转喻中间特征确实参与抽象概念奠基。该成果发表于 EMNLP 2026 主会。
EmbeddingGemma 2 发布,参数量 740M,基于 Gemma 4 架构,从纯文本嵌入扩展到原生处理文本、代码、图像、视频和音频,映射到统一嵌入空间。
Elastic 的 David Pilato 发布开源文件爬虫 FSCrawler 3.0,距 2.9 版本已过去 4 年 7 个月 16 天,累计 2,877 次提交、净增 31,484 行代码。
研究者提出 UniEvo-VL 自进化框架,让单个多模态模型以不同上下文分别充当教师和学生,利用自身批判作为特权信息,通过最小化去噪扩散分布差异实现自我改进。基于开源 Qwen-image-2512,GenEval 分数从 0.747 提升至 0.808,GenEval2 Soft-TIFA 从 32.97 提升至 35.53。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数,在 Apache 2.0 许可下开源,可把文本、图像、音频和视频映射到统一嵌入空间。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转为向量,参数量 7.4 亿。Google 称其在多模态嵌入基准上超过参数量两倍的竞品,在 Massive Text Embedding Benchmark(Code)上得分 78.68,比前代 68.76 提升近 10 分。
Simon Willison 用同一提示词测试 Mistral Large 4 生成 SVG 的能力,与 Claude Opus 5.5、GPT-6.1-sol、Gemini 3.8 Flash 对比。测试提示词为生成一只穿渔网袜在火星上乱穿马路的犰狳 SVG,各模型使用默认推理级别。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,参数量 740M,可将文本、图像、音频、视频映射到统一嵌入空间。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一进同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于评估本地多模态检索的可行性。
苹果正研发一款不保存视频的智能家居摄像头,改用 AI 将画面转成文字描述,并支持人脸识别;据 Bloomberg 的 Mark Gurman 报道,未来 AirPods 的摄像头也可能采用类似方案。Google 可穿戴设备高级总监 Sandeep Waraich 也向 The Verge 表示,公司正在考虑智能眼镜摄像头不录制、仅用 AI 处理视觉数据的思路。
Simon Willison 让 Claude Opus 5.5 设计一种简单的文本音乐格式,并构建一个能将其播放出来的 artifact,同时附带示例曲目,目标是达到初代《猴岛小英雄》的音乐水准。结果明显偏向《猴岛小英雄》风格,但质量出乎意料地好。他猜测这种作曲能力可能类似文本模型近几个月才涌现的 3D 图形能力,需用其他新旧模型做实验才能确认是否为新增能力。
作者结合 Karpathy 关于让模型把解释做成图、互动网页甚至讲解视频的建议,提出用可交互产物替代纯文字解释。文中给出一段可直接复用的提示词,把访客到付费的转化关系做成可调数字的 HTML 网页,并提醒公式和结论仍需核对。
Mistral 发布迄今最大模型 Mistral Large 4,总参数 1 万亿、激活 49 亿,已在 Mistral Studio 开放 API 预览,权重预计 10 月底发布。
Pinterest 推出由视觉智能与生成式 AI 技术 Pinterest Intelligence 驱动的 Beauty Guides,可将发型、美甲等美妆类 Pin 转化为可带去沙龙的行动方案。
法国 AI 实验室 Mistral AI 发布 Mistral Large 4(ML4),一款 1 万亿参数的大型多模态模型,目前仅通过公开护栏端点访问,计划在三周后完成安全测试再开放权重。
XiaoMate(小美同学)新增 screen_capture MCP 工具,通过 mss 截取全屏并调用 OpenAI 兼容的 Vision 模型分析屏幕内容,让语音助手获得视觉感知能力。该工具支持 Windows/macOS/Linux 与多显示器,采用 asyncio 异步非阻塞调用,可应用于网购比价、快递单号识别、体检报告解读等场景,目前仅支持全屏截图,暂不支持指定区域。
Reka AI 发布 190 亿参数全能模型 Rho-1 的研究预览版,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与多数把任务分派给专用模型的系统不同,Rho-1 将所有模态作为 token 放在同一上下文窗口中,无需工具调用或外部模型。
NVIDIA Inception 计划中的多家初创公司正用 AI 补齐乳腺癌诊疗缺口:iSono Health 的 FDA 获批 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房标准化扫描,公司称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 FDA 获批 WRDensity 已用于数十万患者,并研发可自动筛除阴性乳腺钼靶的新一代 AI。
开发者发布小说转漫画 skill(github.com/aiskyhub/no…),为 Codex 安排从读原文、写分镜到排版导出的完整制作顺序,并让程序按字体排入审过的对白、由生图模型专责画面,避免重绘改字。
SCOPE-4D 是一个内窥镜 4D 几何基础模型,可从单目 RGB 视频单次前向推理中联合预测相机参数、稠密几何与 3D 组织轨迹。团队构建了约 5,000 段真实与合成胃肠内窥镜及腹腔镜视频的 SCOPE-5K 数据集,并提出 Common–Residual Motion(CRM)约束局部形变。在公开及新采集基准上,该模型展现出更强的域内外几何估计、3D 跟踪与长序列结肠重建稳定性。
研究提出慢-快多教师在线策略蒸馏(SF-MOPD),通过将学生模型的指数移动平均作为"慢模型"能力参考,在 log-probability 空间剔除使快模型偏离慢模型的分量,保留对齐与正交分量。实验表明,SF-MOPD 在多模型规模上有效缓解能力干扰,增强多模态专业能力,并降低通用能力基准的平均退化,持续优于原版 MOPD。
OctLLM 提出用八叉树占用 token 构成的显式 3D 序列来表示几何,并通过随机清空倒数第二层节点、省略其后代得到更短的 S-Octree,用于位置感知的掩码建模生成与 3D 理解。
FiberGeoText(FGT)是一种视觉语言模型,可将超高分辨率扩散 MRI 重建的浅表白质(SWM)短程纤维束组织为群体级聚类,它联合表征每条纤维束的三维轨迹、皮层解剖上下文与形状,并用预训练 LLM 编码多种脑区划分方案生成的文本化皮层端点信息。
研究者提出一种基于仿真的 VLM 框架,可将 2D 野火模拟自动转换为带标注的视频片段,并作为免训练多智能体 VLM 系统的可复用多模态记忆。在留出生成片段上,视频记忆的四标签精确准确率达 51.5%,直接查询 VLM 为 22.6%,纯文本记忆仅 16-17%;完整系统在六个模拟器报告字段上准确率为 77.3%。该框架还通过组件消融、跨生成器测试和三次真实无人机评估验证了检索与报告能力。
EviDent-CBCT 提出一种证据瓶颈式框架,用于在报告监督不完整的情况下从牙科 CBCT 生成报告:解剖感知网络将每次扫描映射为离散的牙级、全局及 tooth-IAC 证据记录,再由牙科逻辑一致性投影与确定性渲染器配合图像盲本地语言模型生成报告。
研究者提出 Multilingual Distractor Interference(MDI)评测协议,在 TruthfulQA 和 TriviaQA 上对五个指令微调 LLM 进行 40,000 次评测。
多模态基准 TasteBench 发布,用于可持续蛋白的感官预测,包含基于 215 种植物基食品、21K+ 人类评估构建的食品级排序任务(935 个同类别排序对)和覆盖 15K 风味分子的分子级味觉分类任务。
研究团队提出 DeskForge,一个通过组合和探索真实应用生成大规模监督数据的可控桌面环境,并据此构建了包含 120 万条标注桌面观测、1.597 亿个元素实例的 DeskForge-1M 语料。
推荐理由:论文给出可控桌面环境与 120 万条标注数据,并展示四个视觉语言模型在 GUI 定位基准上的提升幅度。
GRAFT 是一个持续多教师蒸馏框架,让统一骨干网络从开放序列的基础模型中逐步获取能力,新增教师时只需一次蒸馏而非全量重蒸馏。它引入 Teacher Specific Readout Tokens 为每个教师提供独立读出,并用 Geometry Agnostic Relational Loss 对齐视觉语言教师。
研究者提出 Spatial Memory Intelligence(SMI),首个系统性地用理解模型为长视频世界模型管理空间记忆的框架。SMI 包含空间聚类、簇内稀疏化、动作感知检索和可靠性感知过滤四项协同原子操作,在多个基线、benchmark 和世界模型骨干上实现了记忆稀疏度、生成稳定性与空间一致性的全面提升。
针对全模态大模型音视频联合推理成本高的问题,研究提出以文本为中心的后训练范式:先用纯文本训练做主推理优化,再用缩减数据的原生音视频 RL 精修感知。最佳纯文本配置下,SFT 加 RL 使 Qwen2.5-Omni-7B 九项推理得分的几何均值较基座提升 25.83%,GPU 时长比完整原生音视频路线少 56.6%。
多模态大模型能正确报告空间事实,却未必在后续推理中使用该事实。研究者提出 SpaceConflict 基准,含 23,196 条输入,覆盖 L1 局部事实绑定到 L4 变换下状态判断四个层级,揭示"可用性—利用率"鸿沟:Qwen3.5-9B 在 100 条正确恢复初始状态的序列中有 50 条无法完成完整变换,显式提供状态可修复全部 50 条。
一项研究用 VLM 生成添加非必要、歧义或虚假信息的提问修饰语,评估 ChatGPT、Claude、Gemini 和 Llava 在违反 Grice 准则时的 VQA 表现,结果显示这些模型性能均下降。研究还对比了人类与 VLM 的语用推理差异,以及 VLM 处理人类诱导与 AI 生成违规时的推理差异。人类解决 VLM 诱导违规的认知投入更低,但 VLM 自身在此类情况下准确率更差。
研究者推出 EditHero,据称是首个面向长程、部件级 3D 编辑的基准,支持自然语言指令与几何、纹理的目标图像。其确定性装配引擎可在每次编辑后生成精确目标,每条序列均经人工审核。对比显示,非智能体方法常漏改并扰动应保持不变的区域,而 LLM/VLM 智能体通过代码自底向上编辑,指令遵循更好、更能保留未编辑部分,但每次编辑耗时数分钟。