GitHub Podcast 拆解 AI 热门观点:该不该读 AI 生成的代码、RAG 是否已死、Skills 是否杀死了 MCP
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者为智能体提供连接工具和数据的标准接口;RAG 也并未消亡,它让模型基于训练数据之外的信息作答,减少 token 浪费并降低答案不完整的概率。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者为智能体提供连接工具和数据的标准接口;RAG 也并未消亡,它让模型基于训练数据之外的信息作答,减少 token 浪费并降低答案不完整的概率。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 pull request 增量合入 main,而非一次性切换。
推荐理由:作者以亲历者身份给出把 80 万行运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:两款实时语音模型同时给出语音质量与智能体任务完成度基准,并列出开发者与企业接入路径。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的信念评分(belief grading)奖励能重建最新观测的信念。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也低于全上下文设置。
GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间、中位数约 50x。UC Berkeley 的 Aditya G. Parameswaran 等人提出近零推理成本下的三大数据系统挑战:为智能体设计的数据系统、运行智能体集群的数据系统、由智能体合成并需可验证的数据系统。