跳到正文
今天10月7日周三231 条
  1. arXiv cs.AI22

    TopoPlanner:面向 LLM 智能体的拓扑一致任务规划框架

    TopoPlanner 将工具依赖图提升为 cellular workflow complexes,作为拓扑感知上下文供 LLM 进行工具规划,通过 cosheaf 一致检索获取请求相关的闭合子复形,并对检索到的拓扑做多维结构推理后生成工具序列。在四个工具规划基准上,针对 loop、merge 及 loop-merge 工作流,该方法在不同本地 LLM 骨干上均优于基于提示词和图增强的基线。

  2. arXiv cs.AI34

    EPOCH:通过证据治理搜索实现可靠发现

    EPOCH 是一种证据治理架构,通过显式任务契约、类型化记忆、主动证伪、准入检查和独立重放构建发现循环,让每个候选方案按其支撑主张的强度与范围接受评估。它在 AlgoTune 上取得 SOTA 聚合表现,平均归一化得分 0.65 对最强基线 0.53,并在内部 Math14 套件上取得最高平均分 0.57。在十个发现问题上,EPOCH 产出可执行构造、优化算法、反例和带证明支持的结果。

  3. arXiv cs.AI31

    SAGA:通过知识抽象实现 LLM 智能体自我进化

    针对 LLM 智能体难以从经验中持续进化的问题,研究者提出 SAGA 框架,将交互轨迹逐步抽象为情景描述、可复用流程和带明确适用条件的原理,并保留与执行证据的关联。检索到的原理会被实例化为任务专属指导,通过纠正反馈与重采样优化候选动作,形成执行—抽象反馈闭环。在 ScienceWorld 和 ALFWorld 上的实验显示任务表现提升,消融研究验证了上下文实例化与动作调控对利用原理级知识的重要性。

  4. arXiv cs.AI36

    GameGo:用真实资产锚定的合成轨迹训练游戏开发智能体

    研究团队提出 GameGo 框架,将简短游戏创意系统化转化为基于行业实践的产品需求文档,并构建了覆盖 2D、2.5D、3D 游戏的 55,060 条开发轨迹数据集 GameGoData 及含 124 个游戏查询的 GameGoBench。基于该数据训练的 GameGoCoder 在游戏开发基准上超越同类基线,性能接近前沿模型。代码、数据集与模型将全部公开。

  5. 掘金45

    当 Spec 遇见遗留系统:用 LangGraph 构建带人工审核节点的长任务 Agent

    一次用 LangGraph 把"写 Spec、生成、验证、人工把关"落成真实系统的实践:流程拆成 Spec 构建、代码生成、自动验证、风险分级人审、部署上线五个阶段,构成可暂停、可恢复的状态机。高风险改动才暂停等待人工批准,checkpointer 把状态持久化到数据库,进程可安全退出后由外部轮询器从暂停点唤醒。作者强调重试与重新规划必须分开处理,并给重新规划设上限,避免循环空转。

  6. 掘金27

    一句“帮我看看我基金组合”,怎样走过 ETF Agent 的六层系统

    ETF Agent 用六层系统处理“我的组合主要暴露在哪些行业”这类提问:从会话与请求身份、入口决策、原生研究循环,到统一 Projector 装配模型输入,再经工具执行、证据计算、正文交付与 Langfuse 观测。系统将消息身份与运行身份分开管理,同一消息重发复用原运行,正文冲突则拒绝覆盖已有执行。

  7. 掘金50

    给 AI 助手加能力,规则文件和 Skill 到底该用哪个?

    针对 Roo Code / Cursor / Claude Code 等 AI 助手,作者提出「意图 vs 执行」双层模型:规则文件管「什么时候、必须做什么」,Skill 管「具体怎么做」。实测把所有规范塞进 rules 会让系统提示词涨到 3000+ Token,抽离执行逻辑后 rules 可瘦身到 200 Token 左右,并避免「Lost in the Middle」导致的注意力失焦。

  8. 掘金34

    AI 复盘技能从 49 分钟压到 43 秒:主流程洁癖与时间盒三纪律实战

    一次晨间复盘技能跑了 49 分钟,作者当场定下 5 分钟硬上限,把 kb 推送、钉钉修复等非主流程活甩出主线,并用 tools/jihua_collect.py 一条命令并行抓完八项数据源,实测全链 43 秒。其中 collector 抓数 0.4 秒,判断加写盘约 40 秒,kb 收尾 8.5 秒转入后台不阻塞主流程。

  9. TechCrunch · AI58

    Hark 发布主打隐私的 AI 个人助手 Hark Pro

    初创公司 Hark 正式发布 AI 个人助手 Hark Pro,可免费使用并提供面向重度用户的订阅档。该产品基于专门为电脑操作训练的模型,能接入邮件、日历、硬盘和信用卡等数字生活数据,代为执行数字任务;界面为全屏主页,含中央对话框、操作提示流和被称为 panels 的迷你仪表盘。

  10. Microsoft Research22

    Microsoft 研究员 Jennifer Neville:AI 评测如何暴露模型的“意外失败”

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月6日周二
  1. 掘金80

    DeepSeek Harness 底层揭秘:一切皆插件,脚手架如何变成产品

    DeepSeek 于 8 月 13 日随 V4-Pro 一同开源 MIT 许可证的 Agent 运行框架 DeepSeek Harness(dsh),模型、工具、沙箱乃至 Agent Loop 都可像插件一样替换,上线两天 GitHub Star 突破 9 万。

    推荐理由:拆解 DeepSeek Harness 的插件化架构与首批实测数据,可对照自身 Agent 技术栈判断取舍。

  2. 掘金26

    SaaS 的三层挣钱逻辑,正在被 AI 从第一层击穿

    AI Agent 可能从第一层击穿传统 SaaS 的挣钱逻辑:用户不再直接操作 CRM、ERP 等软件,只需下达任务,由 AI 背后调用数据库、邮件、支付等系统完成。软件从用户直接使用的产品变成 AI 背后的能力,即从"人使用 SaaS"转向"AI 使用 SaaS"。文章认为 AI 不一定消灭 SaaS,但可能消灭其作为用户入口的价值,商业模式或从卖"软件使用权"转向卖"任务完成权"。