LLM 上下文满了别直接报错:Context Eviction 工程实践,5 种淘汰策略的生产对比
文章针对 LLM 长对话触发 context_length_exceeded 的问题,设计并对比了 FIFO、LRU-Token、Priority-Weighted、Semantic Clustering 和 Hybrid 五种 Context Eviction 策略,给出每种策略的实现代码与实测数据。
文章针对 LLM 长对话触发 context_length_exceeded 的问题,设计并对比了 FIFO、LRU-Token、Priority-Weighted、Semantic Clustering 和 Hybrid 五种 Context Eviction 策略,给出每种策略的实现代码与实测数据。
大模型内部处理的是向量而非文字或图片,GPT-4V、Qwen-VL、Gemini 走联合训练路线实现原生多模态。DeepSeek 提出 Harness 作为套在模型外的运行时框架,以"一切皆插件"理念管理工具注册、调度、上下文、循环与权限。
Simon Willison 记录了如何用 Codex 摸索出运行 Parseable 并接收 Datasette traces 的方法。Parseable 是兼容 OpenTelemetry 的新可观测性工具,提供 AGPL 协议的 Rust 开源版(单个约 180MB 二进制文件)、企业版和云托管选项。
基于开源智能体系统 OpenClaw 和 Amazon Bedrock AgentCore runtime,可构建具备持久记忆的上下文感知 AI 助手,AgentCore memory 将一次性对话转为持久知识。
基于 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases,可搭建一套语音旅行助手,让旅客通过语音查询行程、改座位、更新餐食偏好并转接人工客服。
Amazon SageMaker HyperPod 通过 SageMaker Unified Studio 连接项目后,团队可在项目工作区启动训练与微调工作负载,同时由基础设施团队继续通过 SageMaker AI 接口和 API 管理集群。文章提出组织、项目、集群、工作负载四层控制模型,并说明如何跨层设计身份、容量与可观测性策略,在共享加速器算力时保留底层治理控制。
AWS 发文解读国际标准 ISO/IEC 42005:2025,说明如何将 AI 系统影响评估整合进企业风险管理体系。该标准覆盖评估全生命周期,Annex D 用于与既有 IT 影响评估流程协同去重,Annex E 提供独立实施模板,并给出轻量级 triage 分类以判断是否需要完整评估。
作者结合 Karpathy 关于让模型把解释做成图、互动网页甚至讲解视频的建议,提出用可交互产物替代纯文字解释。文中给出一段可直接复用的提示词,把访客到付费的转化关系做成可调数字的 HTML 网页,并提醒公式和结论仍需核对。
DeepSeek 于 8 月 13 日随 V4-Pro 一同开源 MIT 许可证的 Agent 运行框架 DeepSeek Harness(dsh),模型、工具、沙箱乃至 Agent Loop 都可像插件一样替换,上线两天 GitHub Star 突破 9 万。
推荐理由:拆解 DeepSeek Harness 的插件化架构与首批实测数据,可对照自身 Agent 技术栈判断取舍。
针对 LangChain Agent、LangGraph、LlamaIndex 与 Spring AI 的选型,文章提出把 AI 助手拆成调用组织、状态与执行控制、数据处理与检索三类职责,再按实际缺口选择最小增量组件。
学习率负责缩放梯度给出的更新幅度,方向合适不代表任意大的改动都合适。以单参数平方损失 L(w)=(w-3)² 为例,学习率 0.1 时参数从 0 经 0.6、1.08 逐步接近 3;0.8 时左右交替但收敛,1 时在 0 与 6 之间往返,1.1 时发散。该例收敛条件为 0<η<1,若损失整体乘 10,收敛范围变为 0<η<0.1。
A2A 1.0 与 MCP 并非替代关系:MCP 负责 Agent 调用工具与资源,A2A 负责 Agent 之间的发现与任务委托。作者用 a2a-java 1.4.0.Final 的 Client 连接本地 mock Server,跑通 Agent Card 发现、SendMessage、GetTask、状态迁移,以及同一 context_id 下创建第二个 Task。
HarmonyOS 7.0 的 CoreVisionKit 新增 textSearchImage 端侧文搜图能力,推理在本地 NPU 运行、照片不上传、离线可用、延迟毫秒级,通过 init() 加载模型并构建索引、search(query, scope) 按业务数据域隔离检索。
OpenAI Agents SDK Python v0.22.1 把工具审批拆成入口、恢复与副作用三层契约:local MCP Server 转换出的每个工具都需经过 Server 级 Guardrail,可调用 needs_approval 策略遇到参数缺失(None)或空字符串时 fail-closed。
Agent 可靠性评测需区分 pass@k(k 次至少成功一次)与 pass^k(k 次全部成功)两类指标,前者适合可挑候选的场景,后者衡量重复交付的稳定性。故障恢复应单独建回归集,按故障类型和位置组织用例,不能与自然任务混算统一成功率。成本与延迟须随结果一并记录,包括输入输出 token、工具调用数、实际费用和失败尝试消耗的资源。
作者以宠物全生命周期管理 App 为例,演示如何用 Claude Code 的 Memory、Rules、Skills、Commands、MCP、SubAgents、Hooks、Headless、Agent SDK、Plugins 十项能力从零搭建项目。
Agent Skills 的工程价值来自可发现、可校验、可渐进加载的约定,而非把系统提示词拆成一个 Markdown 文件。
文章提出用 cost-per-success(总花费除以成功次数)替代榜单分数做模型选型,并给出可复现的 OpenAI 兼容接口评测脚本。
Mindcraft 把作者运行 3 个月的 AI 工作台经验提炼为可复用模式集,涵盖技能生命周期、结构完整性、验证体系、需求到落地、协调协议 5 个维度。其中结构完整性维度提供 1,600 行 Python 脚本,基于 11 天实际数据实现 6 个数据模块全部纳管、平均索引健康度 93%、154 个数据点 89% 验证通过率、0 次手动索引编辑。
ReAct 智能体是一种将思维链(CoT)推理与外部工具调用相结合的 AI 智能体框架,通过"思考、行动、观察"循环交替运行,让大语言模型动态调整任务处理方案。该框架最早在 ReAct 原始论文中提出,可减少模型幻觉并提升输出准确性,其效果高度依赖核心大语言模型的推理与指令遵循能力。
从零构建 Agent 系列第 10 章讲解如何为 Agent 增加会话持久化:退出前把 agent.state.messages 中的完整消息按顺序写入 JSONL 文件,重启后读回并交给新 Agent 的 initialState.messages,使其能基于原历史继续提问。
LangChain 的 createMiddleware 中间件可挂载 beforeAgent、beforeModel、afterModel、afterAgent 四个钩子,并通过 stateSchema 声明自己的状态字段,如 modelCallCount 记录模型调用次数。
一位开发者将 AI 客服链路迁到 TypeScript 5.7 后,线上问题明显减少,核心是用类型收窄加 schema 校验、satisfies 固定工具协议、可判别联合类型建模流式事件,分别解决模型返回结构不稳定、Tool Calling 字段漂移和流式响应状态混乱三类边界问题。
MiniMind 训练笔记第 07 篇拆解了 6400 万参数模型从随机初始化到学会猜词的全过程:前向传播后经交叉熵损失打分,再由 PyTorch autograd 反向传播算出每个参数的梯度。
面对资料冲突,可靠做法是事先定好一条七层优先级链、每条资料的版本身份和一套固定处置流程,而非"谁新信谁"。优先级链从公司定位与边界、对外标准口径、报价交付验收标准,逐层降到验证计划与实际结果,外部资料与学习笔记不能覆盖任何一层。冲突处置固定四步:先停用可疑版本,再回到对应层级确认,然后更新来源与条目,最后同步所有使用位置。
文章用 Unsloth + QLoRA 把 Gemma-3-4B 微调成按格式产出(问题, 推理, 答案)三元组的合成数据生成器,全程单卡 24GB 可跑,并给出可直接复制的训练与生成脚本。
MiniMind 学习笔记第 04 篇拆解了 Transformer 块中注意力之外的六块组件:RoPE 旋转位置编码、Flash Attention、KV Cache、GQA、FFN 以及残差与 RMSNorm。
作者用 Claude Opus 5.5 生成动画代码、再由渲染工具合成视频,跑通了从口播稿到成片的全流程。做法是先由导演 Skill 完成分镜设计,再搭配主题模板 Skill 交给 Claude 生成固定风格动画,满意后封装成模板 Skill 批量产出。目前未放开变现,核心原因是剪辑一个视频的 token 成本太高。
这篇教程梳理了 Qwen3.8-27B 的本地部署选型:该模型为 Apache-2.0 开源的 27B 稠密原生视觉语言模型,BF16 权重 51.75 GB,4-bit 量化后约 15.33 GB,可落在单张 16GB 显卡的承载边界内。
开发者用一部安卓手机通过 SSH 登录无桌面的 Linux 服务器,让终端里的 Agent 完成编码、构建、安装与测试,再切到 AScrcpy 查看并操作服务器模拟器上的画面完成验收。
LangChain 源码系列第八篇解析流式与透传机制,源码基于 langchain-core 1.3.2。BaseChatModel 在 chat_models.py:710 覆写 stream,逐格吐出 AIMessageChunk,并在流尾补一个 content 为空、chunk_position 为 last 的空 token 作为终止信号。
一篇 LangChain 教程把检索、记忆、工具调用、流式输出和回调可观测五个零件,用 Runnable 和竖线 `|` 拼成一个可运行的电商客服助手,并用免 key 脚本完整跑通。
开发者通过 LLM 逆向工程 iChat 的 SNATMAP 协议,自建 UDP 服务器并修改 /etc/hosts,让运行 Leopard 或 Snow Leopard 的老 Mac 重新实现 iChat 音视频通话。
手写 Claude Code 复刻项目 codeAgent 在并行工具调用回喂时踩坑:按 OpenAI 习惯逐条回喂 tool 结果,切到 Anthropic 端点直接 400,因为 Anthropic 要求所有 tool_result 装在同一条 user 消息里且不允许两条 user 消息相邻。
dots 是一个 3 天斩获 2.4K Star 的 Web AI Agent 项目,核心卖点是对 Firefox 引擎做 C++ 源码补丁,使指纹在引擎层生成而非 JS 注入,从而规避反爬检测。
向量数据库与普通数据库的核心差异不在存储而在检索:普通库只能全表扫描做 O(N) 暴力遍历,向量库靠 HNSW、IVFFlat 等 ANN 索引把复杂度降到 O(log N),RAG 端到端延迟可控制在 10ms~50ms。
针对 Agent 流式输出中 Nginx 缓冲截留、多节点 SSE 连接孤岛、事件类型混乱三大生产环境问题,该方案基于 Spring Boot 3 的 SseEmitter 构建会话管理器,配合 Redis Pub/Sub 实现跨集群节点的事件广播。
一位开发者用业余时间从零搭建了 YOLO 训练管理平台,技术栈为 FastAPI + SQLite + Vue 3,训练通过 subprocess 调用 ultralytics 的 yolo CLI,支持数据集导入、在线标注、版本快照、串行训练队列和模型管理,Windows 优先部署。
一位开发者用 FastAPI + SQLite 单进程后端、Vue 3 + Vite 前端和 subprocess 调用 ultralytics yolo CLI 的方式,把 YOLO 训练管理平台做成网页版,覆盖素材库、在线标注、数据集版本快照、在线训练、模型版本管理、试模型和两级权限七项功能。
XiaoMate(小美同学)新增 screen_capture MCP 工具,通过 mss 截取全屏并调用 OpenAI 兼容的 Vision 模型分析屏幕内容,让语音助手获得视觉感知能力。该工具支持 Windows/macOS/Linux 与多显示器,采用 asyncio 异步非阻塞调用,可应用于网购比价、快递单号识别、体检报告解读等场景,目前仅支持全屏截图,暂不支持指定区域。