LangChain 之八:流式与透传
LangChain 源码系列第八篇解析流式与透传机制,源码基于 langchain-core 1.3.2。BaseChatModel 在 chat_models.py:710 覆写 stream,逐格吐出 AIMessageChunk,并在流尾补一个 content 为空、chunk_position 为 last 的空 token 作为终止信号。
LangChain 源码系列第八篇解析流式与透传机制,源码基于 langchain-core 1.3.2。BaseChatModel 在 chat_models.py:710 覆写 stream,逐格吐出 AIMessageChunk,并在流尾补一个 content 为空、chunk_position 为 last 的空 token 作为终止信号。
一篇 LangChain 教程把检索、记忆、工具调用、流式输出和回调可观测五个零件,用 Runnable 和竖线 `|` 拼成一个可运行的电商客服助手,并用免 key 脚本完整跑通。
开发者通过 LLM 逆向工程 iChat 的 SNATMAP 协议,自建 UDP 服务器并修改 /etc/hosts,让运行 Leopard 或 Snow Leopard 的老 Mac 重新实现 iChat 音视频通话。
手写 Claude Code 复刻项目 codeAgent 在并行工具调用回喂时踩坑:按 OpenAI 习惯逐条回喂 tool 结果,切到 Anthropic 端点直接 400,因为 Anthropic 要求所有 tool_result 装在同一条 user 消息里且不允许两条 user 消息相邻。
dots 是一个 3 天斩获 2.4K Star 的 Web AI Agent 项目,核心卖点是对 Firefox 引擎做 C++ 源码补丁,使指纹在引擎层生成而非 JS 注入,从而规避反爬检测。
向量数据库与普通数据库的核心差异不在存储而在检索:普通库只能全表扫描做 O(N) 暴力遍历,向量库靠 HNSW、IVFFlat 等 ANN 索引把复杂度降到 O(log N),RAG 端到端延迟可控制在 10ms~50ms。
针对 Agent 流式输出中 Nginx 缓冲截留、多节点 SSE 连接孤岛、事件类型混乱三大生产环境问题,该方案基于 Spring Boot 3 的 SseEmitter 构建会话管理器,配合 Redis Pub/Sub 实现跨集群节点的事件广播。
一位开发者用业余时间从零搭建了 YOLO 训练管理平台,技术栈为 FastAPI + SQLite + Vue 3,训练通过 subprocess 调用 ultralytics 的 yolo CLI,支持数据集导入、在线标注、版本快照、串行训练队列和模型管理,Windows 优先部署。
一位开发者用 FastAPI + SQLite 单进程后端、Vue 3 + Vite 前端和 subprocess 调用 ultralytics yolo CLI 的方式,把 YOLO 训练管理平台做成网页版,覆盖素材库、在线标注、数据集版本快照、在线训练、模型版本管理、试模型和两级权限七项功能。
作者开源了一个 MCP server,让 Claude Desktop、Cursor、Cline 等 MCP 宿主里的 AI 以可见形象进入其浏览器多人 3D 世界,真人可在 30m 内看到 AI 走动、说话并与之对话。
一位不懂编程的物料计划人员用 WorkBuddy(豆包桌面端)通过9轮对话,把每天40分钟的手工导出汇总流程做成双击一次38秒完成的自动化工具,全程未写一行代码。文中给出提需求四层法(目的、步骤、文件与规则、边界与例外)、报错三步法(截图、复制原文、说明操作)和三条底线(先备份、交代禁区、密码别写在聊天里),并附可直接填空的模板。
Cloudflare 于 9 月 28 日发布全新命令行工具 cf,覆盖其接近 3000 项公开 API 操作,并支持用自然语言搜索命令、默认返回 JSON。官方统计显示,2026 年 3 月 AI Agent 已贡献 Wrangler 四分之一使用量,到 cf 发布前一周升至 48%。
一个声称对拍 CPU 参考实现的 WebGPU 数学同源审计门禁,实际对拍的是 JavaScript 模拟内核,真正的 WGSL 文本从未被 GPU 编译执行过。
文章以 Codex Rust 版 commit 2685e3a4 源码为证据,梳理编程 Agent 的提示词注入面,包括 README、代码注释、测试 fixture、commit/PR 文本、issue 正文、依赖包、MCP 工具返回和 web 搜索结果八个入口。
JeeWMS 给出中小企业分批上线 WMS 的清单:第一批只做“账做准”,含基础配置层、收货上架、拣货出库复核、库内调整与盘点,PDA 仅做收货和拣货;第二批补效率与稽核,第三批才接 RFID/AGV 设备与 ERP、MES 集成。该系统基于 Spring Cloud 微服务与 Vue 前端,采用 GPL-3.0 协议,官方仓库为 gitee.com/erzhongxmu/JEEWMS。
一份实践思路指出,用 Ollama 等工具在本机部署 AI Agent,可让代码、文档、日志全部留在本地,16GB 内存即可流畅运行 7B 级别量化模型,且开源模型一次部署长期复用、不按次计费。
Anthropic 的 Felix Rieseberg 表示,新版 Cowork 将模型推理和 VM 都放到云端运行,每个会话拥有独立沙箱、不与其他会话共享状态。旧版在云端做模型推理、但把 Anthropic 提供的 VM 装到用户电脑上执行工具调用,用户不满其磁盘、电池和性能开销,以及合上笔记本就中断工作。当 VM 需要访问用户设备上的文件时,由桌面应用负责该文件访问的工具调用。
Agency Agents 是一套支持多平台、跨工具安装的 AI 智能体协作系统,包含 230 余个专业化角色,覆盖工程、营销、销售、运营等 8 大部门。它提供针对 Claude Code、Cursor、GitHub Copilot、Gemini CLI、OpenCode、Kimi Code 等 14 种 AI 编码助手的安装脚本,可通过一行命令部署并交互式选择工具与代理群组。
Agency Agents 是一个跨平台桌面应用与脚本套件,可将超过 230 个专业化 AI 智能体安装到 Claude Code、Cursor、GitHub Copilot、Gemini CLI 等主流编程工具中。
文章围绕多租户 LLM 应用的 Prompt 隔离问题,提出从 Layer 0 平台级 System Prompt 到用户输入的四层 Prompt 架构,并给出 Jinja2 SandboxedEnvironment 渲染。
作者实测用开源客户端 Cherry Studio 搭配硅基流动、阿里云百炼的免费 API Key(DeepSeek-V3、DeepSeek-R1、Qwen2.5-7B)和 BAAI/bge-m3 向量模型,在本地搭建支持联网搜索与文档检索的 RAG 知识库,数据与向量索引全部保存在本地。
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。
推荐理由:原文给出 GLM 5.3 在 Bedrock 上的接入方式与提示词缓存用法,可据此评估自建推理与托管调用的取舍。
荷兰 NCSC 警告 macOS 高危漏洞 CVE-2026-65400(严重性 7.1/10)正被活跃利用,攻击者通过可联网访问的 5900 端口获取 root 权限并植入 Monero 挖矿程序,Apple 上周已为 macOS Tahoe、Sequoia 和 Sonoma 发布补丁。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Sonnet 5 已上线 AWS GovCloud (US) 区域的 Amazon Bedrock。
Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体具备推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。
Amazon Quick 的 Quick Resource Migrator 是一个托管在 Amazon Bedrock AgentCore 上的示例 MCP 服务器,可通过单次工具调用把 chat agents、action connectors、knowledge bases、flows 和 spaces 从开发账户迁移到生产 AWS 账户。
Amazon Bedrock Managed Knowledge Base 现已支持智能体检索,通过 AgenticRetrieveStream API 将多部分问题拆解为子查询、执行并判断证据是否充分,不足时再次检索,langchain-aws 包同时暴露智能体与标准两种检索方式。
Amazon Quick 控制台无法直接将用户从 Admin 降为 Reader 或从 Author 降为 Reader,update-user API 也会以“You cannot downgrade a user role”报错拒绝。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,可衡量多智能体系统的准确性、任务成功率与行为表现,并将可解释性作为一等评估维度。
TechCrunch Disrupt 2026 将于 10 月 13-15 日在旧金山 Moscone West 举行,多场议程聚焦 AI 创始人在开源与闭源模型间的选择。
作者用 Claude Code 的多代理工作流(模型 Opus 5.5),仅凭一段未修改的需求、不使用任何外部素材,做出了浏览器端第三人称 3D 动作解谜游戏《云海神殿》,含五个章节和一个 Boss。
JavaManus 是一个纯 Java 实现的 ReAct Agent 框架,基于 Spring AI 1.1.0 和 Spring Boot 3.4,默认接入火山引擎 Ark(豆包),整体不到 30 个 Java 文件。
michael-denyer 的 pstack-claude 项目将 Lauren Tan 在 Cursor 上构建的技能栈移植到 Claude Code、Codex、Pi 等代理框架,通过基础原语翻译机制保持跨框架语义一致。
当工厂里机器人从几十台增至几百台,生产能力并不会自动翻倍,核心问题从"单台机器人能做什么"变成"如何把分散能力组织成整体"。文章提出AI负责理解与判断、系统负责组织与调度、机器人负责落地执行,三者连接才构成完整的机器生产能力,系统让机器人围绕同一生产目标形成可运行的整体。
文章对比 Agentic RAG 的三种架构演进形态:基础检索自纠错(本地循环重搜)、标准 CRAG(双阈值打分加联网兜底与句子级去噪)和带回环的 Self-RAG(前置门控加本地与网络两段式加质检回环)。文中给出三者的状态流转逻辑、核心实现代码与生产避坑指南,并建议将 CRAG 作为企业主力架构,仅在法律、医疗等场景开启带计数器的 Self-RAG 质检回环。
掘金「deepseek实战」第 28 期用造物台四轮对话、约 186 积分做出倒计时看板,可同屏盯多个事件,每个事件一个环形进度并按秒刷新,支持按天/按小时全局切换。
开源项目 workbuddy-to-dsh 通过只监听 127.0.0.1 的本地桥,把本机 WorkBuddy 桌面端已登录的模型能力暴露成 OpenAI 兼容接口,任何支持自定义 Base URL 的客户端都能直接调用。
纯向量检索在专有名词、数字版本号、代码命令等精确匹配场景下召回率往往只有 60-70%,需要 Hybrid Search 即向量检索加 BM25 关键词检索互补。
CHASE-VLA 是一种面向 VLA 模型的 chunk 感知训练后量化(PTQ)方法,利用策略生成的动作 chunk 作为因果上下文,结合去噪步分组信息自适应调整动作专家(AE)的激活缩放,无需修改预训练策略即可实现 AE 中 MLP 与注意力投影的 W4A4 量化。
SpectralCache 是一种免训练谱缓存框架,利用扩散世界模型特征在相邻去噪步间奇异子空间高度稳定的特性,复用稳定子空间并通过线性外推估计低维奇异值,从而跳过部分主干网络计算。在 HunyuanWorld-Voyager-13B 上,它实现 5.22 倍加速,静态场景 WorldScore 保持 65.90,推理效率显著优于现有免训练缓存方法。