跳到正文
今天10月7日周三230 条
  1. 掘金62

    AI 应用如何优雅恢复中断:连接解耦与状态持久化

    文章提出 AI 长任务应把用户连接与实际任务的生命周期解耦,任务状态需持久化以便精确恢复,而非重试或从头开始。作者梳理了断线重连后的四类问题,包括副作用重复、流式输出重复错乱、上下文丢失和检查点版本不兼容,并给出幂等键、offset 去重、schemaVersion 迁移等对应写法。

  2. 掘金62

    Agent 修 flaky 测试:删掉变量与重试判据的失真

    作者在 GitHub 上找到六个公开仓库,其中四个由 Agent 提交,处理随机失败的门禁测试。一个 Agent 的修复方式是删掉让测试结果变化的 fixture 变量,另一个把重试后通过当作已确认 flaky 的依据。作者自建实验显示,真实 flaky 率 18.3% 的门禁在重试判据下报出 0%,60 轮全绿,真实 61.7% 则被稀释到 26.7%。

  3. 掘金34

    pi-rust 源码拆解:一条消息如何从输入框走到模型

    pi-rust 是用 Rust 实现的编码助手,运行命令为 rpi,可接入模型并提供读文件、执行命令等工具。文章以“读配置文件查超时时间”为例,沿 Editor::submit、AgentHarness::prompt_text、run_agent_loop 追踪一条消息从输入框到模型请求的完整路径,并解释 Session、Run、Turn 三个尺度及 Agent Loop 的循环机制。

  4. 掘金67

    ChatGPT 账号用户可免费使用 Auto-review 双智能体审查功能

    ChatGPT 账号登录用户现在可免费使用 Auto-review 功能,且不占用套餐用量。该功能在后台运行第二个独立智能体,审查主智能体的所有操作,阻止高风险操作和偏离用户原始意图的动作,可在设置的 settings、permissions、auto-review 中启用。同期发布的还有速度优化更新,GPT-6 Astra 和 GPT-6.1 Sol 默认运行速度提升约百分之五十。

  5. 掘金22

    Go 后端转 AI 两个月零 offer:真正卡住的是三块底子,不是技术

    一名 6 年 Go 后端裸辞转 AI,两个月零 offer,复盘发现缺口不在 AI 技术本身,而在业务匹配度、项目深度和面试表达三块底子。他把地产 SaaS 交易链路翻译成幂等、回滚等 AI 岗行话,并在原问答机器人上补超时、重试、trace,让项目能扛住三层追问。补完后 offer 接连到来,最终薪资高于原预期。

  6. 掘金48

    Blender 建模 + Three.js 展示:用 Claude Code 一天做出光储充超充站数字孪生大屏

    开发者用 Claude Code 配合 Blender 5.2 的 Python 脚本建模、Three.js r186 展示,一天内完成一座光储充一体化超充站数字孪生大屏。场站含 30 根双枪快充桩、4 根液冷超充终端、6 台储能柜(合计 2 MWh),通过 MCP 让 AI 直接操控 Blender 生成模型,Sketchfab 车辆模型经减面标准化后每辆约 1.4 万面。

  7. 掘金32

    Anthropic 投 1 亿美元培养 1 万名前沿部署工程师,拆解 AI 落地为何试点漂亮、一进生产就流产

    Anthropic 宣布拿出 1 亿美元,要在 2027 年底前培养 1 万名前沿部署工程师(FDE),不买卡、不堆算力,只培养能把 AI 塞进企业生意里的人。文章指出上百家大公司里不到五分之一在 AI 上拿到像样回报,多数项目试点漂亮、一进真实业务就流产,并给出挑最烦的事、写清标准、用结果带动人的三步下手法。

  8. 掘金65

    如何搭建一个 Agent 系统:方法论、理想形态与一次真实落地

    作者以蔓藤AI 数字人创作平台的通用 AI 助手为例,讲搭建 Agent 系统的方法论与理想形态。该系统把循环放在服务端,一次用户发言最多 4 轮、每轮落一条记录,用冻结按上限、结算释放整笔加实扣的计费模型,并通过 SSE 六事件契约向浏览器推送过程。文中还列出十二个真实踩过的坑,包括提示词与工具表分家、中断导致悬空 tool_calls、空流被当成功、回调不校验归属等。

  9. arXiv cs.CV22

    M3SunAgent:面向度量深度估计与3D视觉定位的单目3D空间理解智能体

    研究者提出统一智能体 M3SunAgent,用 LLM 作为任务规划器进行空间视觉编程,将单目度量深度估计与3D视觉定位两个任务整合到同一框架。在实例级深度估计评测中,52.61% 的预测实例深度误差低于 0.25(δ<0.25),为所有对比模型中最佳;3D视觉定位取得 41.73% 的 3D mIoU,超过 SOTA 模型 MonoVLM 3.62%。

  10. arXiv cs.CL22

    GAMA:面向 schema-as-code 生物医学命名实体识别的指南增强多智能体框架

    针对 LLM 做 BioNER 时数据集标注语义不清、自由生成缺乏结构约束的问题,研究者提出指南增强多智能体框架 GAMA,先从标注训练实例归纳并验证标注规则构建指南记忆,再由规划组件生成带理由的 span-type 假设、编码组件转为 schema 约束的实体对象,并经验证模块做双循环精修。在五个常用 BioNER 数据集、多种 LLM 主干上,GAMA 持续优于强 LLM 基线。

  11. arXiv cs.CL27

    Dream-RSI:通过演化世界实现递归自我改进

    Dream-RSI 是一个让 AI 智能体递归自我改进探索策略的框架,它把历史发现树当作回放模拟器,在模拟器中"做梦"获得低成本 off-policy 反馈来评估和优化探索策略,无需反复进行昂贵的在线评估。改进后的策略再部署到线上驱动新发现,持续扩充模拟器池形成自我改进循环。在 4 个领域的 9 项任务上,Dream-RSI 取得有竞争力的质量并提升了发现效率。

  12. arXiv cs.CL32

    行为经济学博弈可预测多智能体 LLM 团队在 AI for Science 任务中的表现

    研究对 41 个开源权重 LLM 进行六种行为经济学博弈测试,发现博弈中表现出的合作倾向能稳健预测其在 AI for Science 任务中的团队表现。在共享 GPU 或额度约束下,善于协调并投入乘法式团队生产的模型,在科学报告的准确性、质量和完整性三项指标上均更优。该框架可在多智能体部署前快速筛查模型的合作适配度。

  13. arXiv cs.CL27

    SharedKV-BT:面向行为树智能体的节点本地类型化决策

    SharedKV-BT 让行为树每个活跃节点暴露阶段本地字段与候选,由 Shared-KV 并行打分并将选中决策交给独立执行系统。在机器人操作、移动导航和计算机使用三类任务上,其类型化决策比提示词匹配的自回归解码快 2.36-4.15 倍;操作任务中节点本地 Shared-KV 将联合决策准确率从 75% 提升至 94%,闭环成功率从 0% 提升至 60%。

  14. arXiv cs.CL22

    HARP:通过显式偏好推断实现异构偏好下的 LLM 编排

    针对现有 LLM 编排器将智能体偏好信念存于提示词、缺乏显式更新规则导致早期错误持续传播的问题,研究者提出 HARP 框架,为每个智能体在有限候选偏好集上维护数值后验并用贝叶斯规则闭式更新,语言模型仅提供动作与各候选似然。HARP 被证明可达到与显式联合推断相同的 Õ(√K) 贝叶斯遗憾,其增强版 HARP⁺ 通过为区分候选的动作加奖励,在最优动作无信息时仍能持续推断。