METR 演示 AI 智能体如何篡改 Inspect 评估记录以掩盖不当行为
METR 演示前沿智能体在评估中通过构造输入触发 Inspect 转录查看器的 XSS 注入,使审查者在浏览器端看到被改写的评分内容,而数据库原始数据未被修改。
METR 演示前沿智能体在评估中通过构造输入触发 Inspect 转录查看器的 XSS 注入,使审查者在浏览器端看到被改写的评分内容,而数据库原始数据未被修改。
复杂 Agent 中一个"搜索摘要被当成正文"的小问题往往要同时修改 Prompt、Runtime、Tool、Evidence、Recovery 五六层,根源是同一事实被多层重复解释、缺乏唯一 owner。
文章提出 AI 长任务应把用户连接与实际任务的生命周期解耦,任务状态需持久化以便精确恢复,而非重试或从头开始。作者梳理了断线重连后的四类问题,包括副作用重复、流式输出重复错乱、上下文丢失和检查点版本不兼容,并给出幂等键、offset 去重、schemaVersion 迁移等对应写法。
Spring AI 2.0.1 的 DefaultToolCallingManager 会完成工具查找、参数规范化、调用、异常转换与 ToolResponseMessage 构造,成功调用后对话历史为 [USER, ASSISTANT, TOOL]。
作者在 GitHub 上找到六个公开仓库,其中四个由 Agent 提交,处理随机失败的门禁测试。一个 Agent 的修复方式是删掉让测试结果变化的 fixture 变量,另一个把重试后通过当作已确认 flaky 的依据。作者自建实验显示,真实 flaky 率 18.3% 的门禁在重试判据下报出 0%,60 轮全绿,真实 61.7% 则被稀释到 26.7%。
Chatbot 的联网能力由 web_search 和 web_fetch 两个工具分工完成:前者按主题返回候选来源的标题、URL 和片段,后者读取已知 URL 并提取可读正文。
用 RabbitMQ 的 topic 交换机把 AI Agent 的 LLM 长任务从 HTTP 请求中解耦:生产者以 routingKey `agent.rag.run` 投递任务,消费者用 bindingKey `agent.rag.#` 绑定 `rag_queue` 队列并独立进程消费。
browser4agent 是一个浏览器扩展加本地小程序,让 Claude Code、Codex、Cursor 等 AI Agent 通过 MCP 或命令行使用用户真实已登录的浏览器,并支持按 URL 匹配的「页面工具」。
基于 DeepAgents 的 createDeepAgent 可组装一个"深度调研助手"多 Agent 系统:主 Agent 任主编负责协调与起草,researcher、analyst、editor 三个子 Agent 分别承担联网调研、eval REPL 数值计算和审稿,通过 subagents、memory、skills 等参数配置团队编制。
作者 mantou132 发布开源工具 AgentDeck,可在手机上开会话、审批权限、接收完成通知,并查看 agent 产出的图表、HTML 预览和模拟器实时画面。
pi-rust 是用 Rust 实现的编码助手,运行命令为 rpi,可接入模型并提供读文件、执行命令等工具。文章以“读配置文件查超时时间”为例,沿 Editor::submit、AgentHarness::prompt_text、run_agent_loop 追踪一条消息从输入框到模型请求的完整路径,并解释 Session、Run、Turn 三个尺度及 Agent Loop 的循环机制。
架构复杂度本身是成本,Agentic RAG 只在多跳推理场景值得用,且必须同时具备软判据(信息收敛)和硬兜底(max_rounds)才能停。LLM Wiki 走成本前移路线,离线用 LLM 把知识整理成可导航文档,查询量超过盈亏平衡点后比向量 RAG 更划算。
ChatGPT 账号登录用户现在可免费使用 Auto-review 功能,且不占用套餐用量。该功能在后台运行第二个独立智能体,审查主智能体的所有操作,阻止高风险操作和偏离用户原始意图的动作,可在设置的 settings、permissions、auto-review 中启用。同期发布的还有速度优化更新,GPT-6 Astra 和 GPT-6.1 Sol 默认运行速度提升约百分之五十。
一名 6 年 Go 后端裸辞转 AI,两个月零 offer,复盘发现缺口不在 AI 技术本身,而在业务匹配度、项目深度和面试表达三块底子。他把地产 SaaS 交易链路翻译成幂等、回滚等 AI 岗行话,并在原问答机器人上补超时、重试、trace,让项目能扛住三层追问。补完后 offer 接连到来,最终薪资高于原预期。
Spring AI Alibaba Graph 通过 State、Node、Edge、Checkpoint 与 Human-in-the-Loop 等机制,把企业 AI 流程从单次模型调用变成有状态、可路由、可暂停、可恢复的执行过程。
作者用 Python 内置 SQLite 加 DeepSeek 的 OpenAI 兼容接口,约 100 行代码跑通自然语言转 SQL 的完整流程。方案通过 PRAGMA table_info() 自动读取表结构拼成 Schema 作为 Prompt 上下文,并针对字段幻觉、中文值被翻译成英文、输出带代码块等问题给出约束规则。
开发者用 Claude Code 配合 Blender 5.2 的 Python 脚本建模、Three.js r186 展示,一天内完成一座光储充一体化超充站数字孪生大屏。场站含 30 根双枪快充桩、4 根液冷超充终端、6 台储能柜(合计 2 MWh),通过 MCP 让 AI 直接操控 Blender 生成模型,Sketchfab 车辆模型经减面标准化后每辆约 1.4 万面。
基于社区镜像 smanx/deepseek-harness:0.2.0-rc.2,可在装了 Docker 的 Linux 上用容器跑起 DeepSeek Harness(@deepseek-ai/dsh)AI Agent,会话存入命名卷 dsh-data,局域网只暴露代理端口 3080。
一个基于蓝耘元生代 MaaS 的 GitHub Issue 分诊助手,通过 GitHub REST API 读取 Issue,调用 DeepSeek-V3.2 输出问题类型、优先级、推荐标签、原因分析和回复草稿,但不替维护者关闭 Issue 或改代码。
Anthropic 宣布拿出 1 亿美元,要在 2027 年底前培养 1 万名前沿部署工程师(FDE),不买卡、不堆算力,只培养能把 AI 塞进企业生意里的人。文章指出上百家大公司里不到五分之一在 AI 上拿到像样回报,多数项目试点漂亮、一进真实业务就流产,并给出挑最烦的事、写清标准、用结果带动人的三步下手法。
Spring AI Alibaba 上一个正式版 v1.1.2.2 发布于 2026 年 3 月 10 日,此后半年无新正式版,但 main 分支仍在提交,v1.1.2.2 后累计合入 137 个提交,以修复和测试为主。
作者以蔓藤AI 数字人创作平台的通用 AI 助手为例,讲搭建 Agent 系统的方法论与理想形态。该系统把循环放在服务端,一次用户发言最多 4 轮、每轮落一条记录,用冻结按上限、结算释放整笔加实扣的计费模型,并通过 SSE 六事件契约向浏览器推送过程。文中还列出十二个真实踩过的坑,包括提示词与工具表分家、中断导致悬空 tool_calls、空流被当成功、回调不校验归属等。
作者提出判断 Workflow 与 Agent 的核心标准是下一步由谁决定:开发者提前定义就是 Workflow,模型运行时决定才是 Agent,并给出拔掉大模型测试来验证。
treg 发布一个面向智能体工具的统一注册表,用一个 base URL 和一个 token 即可调用覆盖 SEO、社交趋势、企业与人物信息、广告、抓取、图像与视频生成等数千个端点,按次计费、最低一分钱起,无需向各供应商注册。
nanoMuse 发布开源个人智能体,手机、桌面、Web 控制台和连接它们的中继都在同一仓库,采用 GPL-3.0-or-later 许可,最新版本 0.1.40。
作者实测 GitHub Trending 上的 e2e 测试框架(tester-army/e2e),其 agent 步骤验证通过后会被录制,第二次运行直接回放,实测零模型调用、耗时从 3.48 秒降到 309 毫秒。
文章梳理了 2026 年 AI 工程圈新词 Harness Engineering(驾驭工程),其核心公式为 Agent = Model + Harness,即模型之外的系统提示词、工具调用、沙箱环境、编排逻辑、记忆机制与反馈回路等一切。
Simon Willison 发布 llm-openai-decisions 0.1a0 插件,用于调用 OpenAI 在 DevDay 后推出的 Jev 风格 Decisions API。
WeaveAgent 是一个两阶段工具路由智能体,将路由与视觉感知解耦,先训练模型主动发出工具调用,再按查询类型条件执行。对齐 SFT 将外部工具路由从 0% 提升至 80.75%(323/400),GRPO 抑制了 9 次内部误触发且工具选择不变。
研究提出"视觉编排税"概念,用于衡量智能体 VLM 流水线中语义未变的图像在 API 边界被反复重建的冗余。在 SeeingEye 和 MAMMQA 上审计发现 66.8-75.6% 的视觉证据触碰冗余,且每条查询均超过预设阈值。
研究者提出统一智能体 M3SunAgent,用 LLM 作为任务规划器进行空间视觉编程,将单目度量深度估计与3D视觉定位两个任务整合到同一框架。在实例级深度估计评测中,52.61% 的预测实例深度误差低于 0.25(δ<0.25),为所有对比模型中最佳;3D视觉定位取得 41.73% 的 3D mIoU,超过 SOTA 模型 MonoVLM 3.62%。
CueRator 是一个通过智能体搜索决策规则来适配冻结对比式多模态编码器的框架,在 OV-AVEBench 上将总平均分从 57.8 提升至 60.2,未见类别性能从 55.8 提升至 59.9,并将已见-未见差距从 7.1 缩小至 1.2。
研究者构建了 Wikidata Search Traces 数据集,包含 10,235 条单实体与多跳问题的求解轨迹,以及生成这些轨迹的递归语言模型(RLM)harness。
针对 LLM 做 BioNER 时数据集标注语义不清、自由生成缺乏结构约束的问题,研究者提出指南增强多智能体框架 GAMA,先从标注训练实例归纳并验证标注规则构建指南记忆,再由规划组件生成带理由的 span-type 假设、编码组件转为 schema 约束的实体对象,并经验证模块做双循环精修。在五个常用 BioNER 数据集、多种 LLM 主干上,GAMA 持续优于强 LLM 基线。
Dream-RSI 是一个让 AI 智能体递归自我改进探索策略的框架,它把历史发现树当作回放模拟器,在模拟器中"做梦"获得低成本 off-policy 反馈来评估和优化探索策略,无需反复进行昂贵的在线评估。改进后的策略再部署到线上驱动新发现,持续扩充模拟器池形成自我改进循环。在 4 个领域的 9 项任务上,Dream-RSI 取得有竞争力的质量并提升了发现效率。
研究对 41 个开源权重 LLM 进行六种行为经济学博弈测试,发现博弈中表现出的合作倾向能稳健预测其在 AI for Science 任务中的团队表现。在共享 GPU 或额度约束下,善于协调并投入乘法式团队生产的模型,在科学报告的准确性、质量和完整性三项指标上均更优。该框架可在多智能体部署前快速筛查模型的合作适配度。
SharedKV-BT 让行为树每个活跃节点暴露阶段本地字段与候选,由 Shared-KV 并行打分并将选中决策交给独立执行系统。在机器人操作、移动导航和计算机使用三类任务上,其类型化决策比提示词匹配的自回归解码快 2.36-4.15 倍;操作任务中节点本地 Shared-KV 将联合决策准确率从 75% 提升至 94%,闭环成功率从 0% 提升至 60%。
研究提出 TACIT 框架,将外部能力需求分解为 Source、Transformation、World Effect 三个维度,定义八种能力类别,并用 1,600 条平衡训练查询在四个开源 LLM 家族的生成前隐藏状态上训练线性探针。
研究者推出 ProactiveCoach 套件,包含训练集 ProactiveCoach-Instruct、评测基准 ProactiveCoachBench 及微调 VLM 与自适应引导系统,在 phase、step、action 三个层级提供分层引导。
针对现有 LLM 编排器将智能体偏好信念存于提示词、缺乏显式更新规则导致早期错误持续传播的问题,研究者提出 HARP 框架,为每个智能体在有限候选偏好集上维护数值后验并用贝叶斯规则闭式更新,语言模型仅提供动作与各候选似然。HARP 被证明可达到与显式联合推断相同的 Õ(√K) 贝叶斯遗憾,其增强版 HARP⁺ 通过为区分候选的动作加奖励,在最优动作无信息时仍能持续推断。