跳到正文
今天10月7日周三7 条
  1. arXiv cs.CL26

    如何用四象限方法评估 Redpine Science

    Redpine Science 通过 MCP 和 API 为模型与智能体提供同行评审文献的统一访问入口。在 ScholarQABench SciFact 上,接入 Redpine Science 的智能体正确回答 94.4% 的论断,无检索时为 87.6%;在专家验证问题集上,其陈述所需论断的比例为 80.1%,仅用网页搜索的智能体为 70.2%。

  2. arXiv cs.AI32

    LLM 智能体为何过度调用工具:诊断内在过度调用偏差

    研究提出内在偏差假说(IBH),指出 LLM 智能体的调用/不调用决策映射中存在与激活无关的调用偏移,使其在激活持平时仍倾向调用工具。在 When2Call 基准上,三个家族六个模型调用准确率高但不调用准确率明显偏低,整体准确率仅 55%-70%。团队用稀疏自编码器(SAE)提取决策特征并估计该偏移,再以 AMCS 因果校正,缓解过度调用并提升整体准确率,调用准确率几乎不降。

  3. arXiv cs.AI42

    MiniScope:用最小权限为 AI 智能体授权

    研究者提出任务中心的分层权限模型 MiniScope,将智能体视为任务角色下的委托方,自动发现权限层级并在运行时执行上下文最小权限。评估显示,相比逐工具提示,MiniScope 对谨慎型和典型用户分别减少 43.4%-89.4% 的模拟权限确认,并缓解全部权限提升攻击,对效用和运行时影响可忽略。在真实部署中,它还在 ChatGPT 和 Claude 中发现 6 处过度授权的连接器配置。

  4. arXiv cs.AI37

    APEX:面向 LLM 智能体的执行边界主动防护

    APEX 是一种针对 LLM 智能体间接提示注入(IPI)的主动防御方案,将防护点从攻击模式识别转移到执行边界,通过执行前编译的授权契约同时实现证据门控预防与欺骗式暴露。在六项基准中,APEX 对 13 个基线取得五项 0% 攻击成功率、第六项 0.56%,并在三类能力单元(Tools、MCP servers、Skills)的自适应攻击下保持 0%。代码已开源。

10月5日周一