EC-RAG:面向长视频理解的事件链检索增强生成框架
EC-RAG 是一个免训练框架,先将视频切分为语义连贯的片段并链接成保留时序的事件链,再针对查询定位相关事件、聚合语音文本与视觉等多模态证据。它在 Video-MME、MLVU 和 LongVideoBench 上持续优于帧级检索基线,并可即插即用兼容现有 LVLM 主干,无需额外训练或依赖闭源模型。
EC-RAG 是一个免训练框架,先将视频切分为语义连贯的片段并链接成保留时序的事件链,再针对查询定位相关事件、聚合语音文本与视觉等多模态证据。它在 Video-MME、MLVU 和 LongVideoBench 上持续优于帧级检索基线,并可即插即用兼容现有 LVLM 主干,无需额外训练或依赖闭源模型。
Pleias 发布 Pleias-RAG-350m 和 Pleias-RAG-1B 两款小型推理模型,原生支持引用与字面引文溯源,并整合查询路由、查询改写和来源重排等 RAG 工作流功能。
一项系统性研究提出统一框架,将 Product Quantization(PQ)与 Residual Quantization(RQ)及其混合变体纳入同一设计空间,用于分析生成式信息检索中数值型 DocID 的层次与并行结构、DocID 长度和码本大小等超参数的影响。
在 NQ320K 和 MS300K 上,研究者用残差量化、乘积量化和随机标识符分别训练自回归、掩码扩散和块扩散模型,固定标识符长度与训练预算后对比多种解码方式。
研究用 EverMemBench 评估 LLM 长期对话记忆中结构深度与上下文宽度的交互,测试深度 D1-D4、1,024/2,048/4,096 token 核心预算及 Production、Oracle 条件。
Redpine Science 通过 MCP 和 API 为模型与智能体提供同行评审文献的统一访问入口。在 ScholarQABench SciFact 上,接入 Redpine Science 的智能体正确回答 94.4% 的论断,无检索时为 87.6%;在专家验证问题集上,其陈述所需论断的比例为 80.1%,仅用网页搜索的智能体为 70.2%。
NavTree 是一种仅用叶节点的检索器,在 chunk 上构建确定性平衡线段树,索引阶段零 LLM 调用,仅将树作为导航骨架,通过词法与稠密混合的前沿游走从根节点下行并只向阅读器输出叶 chunk。在匹配成本评估中,它是所评测网格里最强的分层检索器,并与最强扁平基线持平;在长文档多跳 QA 上,它是唯一在类对类比较中显著优于 BM25 的分层方法。
研究者提出 SeedER(Seed-Expand-Retrieve),一种基于 Graph Transformer 和强化学习的一阶段知识图谱检索器,推理时可在 CPU 上运行,训练时每次只需少量节点的反馈。该方法在检索效果上可与微调 LLM 的方案竞争,同时显著降低内存与计算开销。
研究者提出 UNREAL,一种模型原生的证据选择框架,从冻结 LLM 的内部表示直接编码 chunk 并生成检索 query,仅新增不到 500K 可训练参数且不改动主干。
Agentic AutoRAG 是一个面向多目标 RAG 超参数优化的 LLM 智能体优化器,可区分检索与生成阶段的失败归因。在三个多跳 QA 基准上,它的 LLM 评判准确率超过所有对比基线,并在前 10 次试验内追平或超越统计基线完整 30 次试验的准确率。在真实医疗语料库的成本感知模式下,它以约 58% 的单次查询成本达到 77% 的中位准确率,高于最强基线的 71.5%。
研究者提出 HARP(Hard-budget Allocation with Reflow for Predictive calibration),一种在硬资源约束下满足预算并自适应重分配未用预算的 LLM 评测预算分配方法。
研究者提出 Retrieval-Augmented Interpretable Learning(RAIL),一种概率元学习框架,可从自然语言任务描述和已学预测器记忆中合成系数空间结构,零样本生成任务特定的可解释模型。
KadiAssistant 是一款集成于 Kadi 科研数据生态的隐私设计 AI 助手,结合自托管大语言模型与隐私保护语义搜索,可访问 Kadi 上的文件与记录元数据,帮助研究人员检索、聚合和结构化异构科研数据。该助手遵循 Kadi 的细粒度访问权限控制,旨在打通材料科学等跨学科领域的术语与标准壁垒,并强化 FAIR 原则中的可发现性。
一篇综述系统梳理了 RAG(检索增强生成)的三大基础组件——检索、生成与增强,涵盖稠密与稀疏检索器、融合策略、嵌入向量优化及基于强化学习的检索策略。文章围绕效率、安全、以用户为中心的交互和复杂推理四条新兴轴线对近期创新进行分类,并回顾了 Naïve RAG、Advanced RAG 和 Modular RAG 等架构变体及评估协议与领域应用进展。
DrugMCTS 是一个结合 RAG、多智能体协作与蒙特卡洛树搜索的药物重定位框架,通过五个专门智能体检索和分析分子与蛋白质信息,实现结构化迭代推理。在 DrugBank 和 KIBA 数据集上,其召回率与鲁棒性显著优于通用 LLM 和深度学习基线。
RAG-PIBench 是一个面向 RAG 提示注入检测的基准,包含 4,876 条上下文样本,划分为冻结的训练、验证与受保护测试集,并采用防泄漏构建流程与严格评测协议。
针对 LLM 引导的图推理中逐跳贪心剪枝过于短视、易过早丢弃关键证据分支的问题,研究者提出远见感知证据检索框架 Foresight-over-Graph(FoG),通过远到近反馈引导路径探索并维护紧凑记忆子图。在常用 KBQA 基准上 FoG 达到 SOTA,CWQ 的 Hit 指标提升 16.58%,同时减少 LLM 调用与 token 消耗。代码已开源,论文被 NeurIPS 2026 接收。
在 KyGround 基准(198 道题,来自希腊 Kythera 农业平台记录,每题最多 9 种问法)上,以 Claude Haiku 4.5 作为路由与回答模型,向量 RAG 对标准希腊语问题正确率 95.3%,工具调用智能体仅 71.6%,相差 23.6 个百分点。
PixelTriage 是一个置于检索之后的小模型插件,不生成文本,仅凭对话、简短笔记和每张检索记忆的缩略图,就能在回答模型运行前预测该记忆的像素能带来多少增益。
研究者提出 RELER(REinforcement Learning for Retrieval),一个让现有嵌入模型在嵌入向量空间中直接学习检索并对齐任务奖励的强化学习框架,通过从以归一化编码器输出为中心的 von Mises-Fisher 分布采样查询和文档嵌入,并用 RLOO 更新编码器。
QRAKEN 是一个免训练、本体无关的神经符号流水线,通过离线蒸馏生成的 TTQL(含多跳模式、条件频率与路径条件字面量示例)引导 LLM 生成 SPARQL 查询。
研究团队提出个性化全量化多目标膳食规划问题(MDP),并开发营养智能体 ShanLiangRen。该系统将饮食规格、营养数据、用户属性与自然语言需求转化为个性化约束规划实例,通过精确检索增强生成缩小候选食材与食谱范围,再由 LLM 在确定性营养计算和约束校验反馈下按 Pareto 原则迭代优化方案。系统输出含明确食材与分量的全量化餐食计划及营养合规报告,已以微信小程序形式上线。
ProbeGuard 是一个认证弃答框架,通过追踪共识形成过程而非仅看最终一致性来判断医疗 LLM 是否应弃答。在 MedQA 上,13.4% 的一致投票是错误的,过程信号将正确与错误共识的区分度从随机水平提升至 0.696 AUROC。该认证规则能以 9.0% 的观测选择性风险回答六成一致层问题,积累域内校准数据后可覆盖九成。
研究者提出检索可采性验证框架,为每个记忆-查询对分配可采、不可采或未决三种状态,并在 RHELM 和 MemOps 两个公开长期记忆基准的 3,767 条查询上做 Top-20 事后重分析,锚点召回率从 0.432 升至 0.533,80% 召回可行性从 0.237 升至 0.311,精确相似度评估减少 98.3%。
一篇 arXiv 论文提出面向生成式 AI 的生产级内容抽取系统,将内容抽取作为独立生命周期阶段,包含选择性 OCR 路由、基于参考的抽取评分器、确定性结构感知父子分块器和只读检索评估器。
基于开源智能体系统 OpenClaw 和 Amazon Bedrock AgentCore runtime,可构建具备持久记忆的上下文感知 AI 助手,AgentCore memory 将一次性对话转为持久知识。
Amazon Bedrock Managed Knowledge Base 现已支持智能体检索,通过 AgenticRetrieveStream API 将多部分问题拆解为子查询、执行并判断证据是否充分,不足时再次检索,langchain-aws 包同时暴露智能体与标准两种检索方式。
研究者将仅作用于查询的低秩适配器 SampoTron 与 Nemotron-3-Embed-1B 模型结合,并按查询与索引语言做确定性路由:跨语言查询走适配器,同语言查询走原编码器。在采样的金融基准上,六个英/芬/瑞方向的 nDCG@10 均值从 0.241 提升至 0.291,相对增益 20.9%,且路由保留了原有同语言性能。
APDMem 是一种分层长期记忆架构,将对话历史表示为主题摘要、个性化关键事实、轮级证据笔记和原始消息四层,推理时由控制器先读高层摘要、按需深入细节。在 LongMemEval 上,它仅访问 8% 的对话内容即取得强劲的长上下文记忆推理表现。该工作已被 EMNLP 2026(Industry Track)接收。
研究团队推出 CourseChat,一个部署在校园网关后、面向本科商科教育的本地化多课程 RAG 辅导系统,六个课程实例共享由 Ollama 提供本地 LLM 服务的双边缘 AI 主机。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性(非 AI)规则引擎完成。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者为智能体提供连接工具和数据的标准接口;RAG 也并未消亡,它让模型基于训练数据之外的信息作答,减少 token 浪费并降低答案不完整的概率。