跳到正文
今天10月7日周三26 条
  1. arXiv cs.CL26

    如何用四象限方法评估 Redpine Science

    Redpine Science 通过 MCP 和 API 为模型与智能体提供同行评审文献的统一访问入口。在 ScholarQABench SciFact 上,接入 Redpine Science 的智能体正确回答 94.4% 的论断,无检索时为 87.6%;在专家验证问题集上,其陈述所需论断的比例为 80.1%,仅用网页搜索的智能体为 70.2%。

  2. arXiv cs.CL24

    NavTree:无需 LLM 摘要的树导航,长文档 QA 的匹配成本分层检索研究

    NavTree 是一种仅用叶节点的检索器,在 chunk 上构建确定性平衡线段树,索引阶段零 LLM 调用,仅将树作为导航骨架,通过词法与稠密混合的前沿游走从根节点下行并只向阅读器输出叶 chunk。在匹配成本评估中,它是所评测网格里最强的分层检索器,并与最强扁平基线持平;在长文档多跳 QA 上,它是唯一在类对类比较中显著优于 BM25 的分层方法。

  3. arXiv cs.LG29

    Agentic AutoRAG:用推理驱动的智能体优化 RAG 流水线

    Agentic AutoRAG 是一个面向多目标 RAG 超参数优化的 LLM 智能体优化器,可区分检索与生成阶段的失败归因。在三个多跳 QA 基准上,它的 LLM 评判准确率超过所有对比基线,并在前 10 次试验内追平或超越统计基线完整 30 次试验的准确率。在真实医疗语料库的成本感知模式下,它以约 58% 的单次查询成本达到 77% 的中位准确率,高于最强基线的 71.5%。

  4. arXiv cs.AI22

    KadiAssistant:面向 Kadi4Mat 信息检索的对话式 AI 智能体

    KadiAssistant 是一款集成于 Kadi 科研数据生态的隐私设计 AI 助手,结合自托管大语言模型与隐私保护语义搜索,可访问 Kadi 上的文件与记录元数据,帮助研究人员检索、聚合和结构化异构科研数据。该助手遵循 Kadi 的细粒度访问权限控制,旨在打通材料科学等跨学科领域的术语与标准壁垒,并强化 FAIR 原则中的可发现性。

  5. arXiv cs.AI24

    重新思考面向生成的知识检索:RAG 架构与应用综述

    一篇综述系统梳理了 RAG(检索增强生成)的三大基础组件——检索、生成与增强,涵盖稠密与稀疏检索器、融合策略、嵌入向量优化及基于强化学习的检索策略。文章围绕效率、安全、以用户为中心的交互和复杂推理四条新兴轴线对近期创新进行分类,并回顾了 Naïve RAG、Advanced RAG 和 Modular RAG 等架构变体及评估协议与领域应用进展。

  6. arXiv cs.AI22

    Foresight-over-Graph:面向知识库问答的远见感知证据检索框架

    针对 LLM 引导的图推理中逐跳贪心剪枝过于短视、易过早丢弃关键证据分支的问题,研究者提出远见感知证据检索框架 Foresight-over-Graph(FoG),通过远到近反馈引导路径探索并维护紧凑记忆子图。在常用 KBQA 基准上 FoG 达到 SOTA,CWQ 的 Hit 指标提升 16.58%,同时减少 LLM 调用与 token 消耗。代码已开源,论文被 NeurIPS 2026 接收。

  7. arXiv cs.AI22

    ShanLiangRen:面向个性化每日膳食规划的 AI 营养智能体

    研究团队提出个性化全量化多目标膳食规划问题(MDP),并开发营养智能体 ShanLiangRen。该系统将饮食规格、营养数据、用户属性与自然语言需求转化为个性化约束规划实例,通过精确检索增强生成缩小候选食材与食谱范围,再由 LLM 在确定性营养计算和约束校验反馈下按 Pareto 原则迭代优化方案。系统输出含明确食材与分量的全量化餐食计划及营养合规报告,已以微信小程序形式上线。

  8. arXiv cs.AI29

    ProbeGuard:基于医疗 LLM 共识形成过程的认证弃答框架

    ProbeGuard 是一个认证弃答框架,通过追踪共识形成过程而非仅看最终一致性来判断医疗 LLM 是否应弃答。在 MedQA 上,13.4% 的一致投票是错误的,过程信号将正确与错误共识的区分度从随机水平提升至 0.696 AUROC。该认证规则能以 9.0% 的观测选择性风险回答六成一致层问题,积累域内校准数据后可覆盖九成。

  9. arXiv cs.AI24

    长期记忆智能体的检索可采性验证:RHELM 与 MemOps 基准上 Top-20 锚点召回率从 0.432 提升至 0.533

    研究者提出检索可采性验证框架,为每个记忆-查询对分配可采、不可采或未决三种状态,并在 RHELM 和 MemOps 两个公开长期记忆基准的 3,767 条查询上做 Top-20 事后重分析,锚点召回率从 0.432 升至 0.533,80% 召回可行性从 0.237 升至 0.311,精确相似度评估减少 98.3%。

10月5日周一
  1. arXiv cs.CL22

    基于查询感知路由的编码器跨语言检索性能提升

    研究者将仅作用于查询的低秩适配器 SampoTron 与 Nemotron-3-Embed-1B 模型结合,并按查询与索引语言做确定性路由:跨语言查询走适配器,同语言查询走原编码器。在采样的金融基准上,六个英/芬/瑞方向的 nDCG@10 均值从 0.241 提升至 0.291,相对增益 20.9%,且路由保留了原有同语言性能。

  2. arXiv cs.CL29

    APDMem:面向查询自适应的智能体渐进式披露长期记忆架构

    APDMem 是一种分层长期记忆架构,将对话历史表示为主题摘要、个性化关键事实、轮级证据笔记和原始消息四层,推理时由控制器先读高层摘要、按需深入细节。在 LongMemEval 上,它仅访问 8% 的对话内容即取得强劲的长上下文记忆推理表现。该工作已被 EMNLP 2026(Industry Track)接收。

10月2日周五
9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解 AI 热门观点:该不该读 AI 生成的代码、RAG 是否已死、Skills 是否杀死了 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者为智能体提供连接工具和数据的标准接口;RAG 也并未消亡,它让模型基于训练数据之外的信息作答,减少 token 浪费并降低答案不完整的概率。