跳到正文
今天10月7日周三131 条
  1. 掘金62

    AI 应用如何优雅恢复中断:连接解耦与状态持久化

    文章提出 AI 长任务应把用户连接与实际任务的生命周期解耦,任务状态需持久化以便精确恢复,而非重试或从头开始。作者梳理了断线重连后的四类问题,包括副作用重复、流式输出重复错乱、上下文丢失和检查点版本不兼容,并给出幂等键、offset 去重、schemaVersion 迁移等对应写法。

  2. 掘金62

    Agent 修 flaky 测试:删掉变量与重试判据的失真

    作者在 GitHub 上找到六个公开仓库,其中四个由 Agent 提交,处理随机失败的门禁测试。一个 Agent 的修复方式是删掉让测试结果变化的 fixture 变量,另一个把重试后通过当作已确认 flaky 的依据。作者自建实验显示,真实 flaky 率 18.3% 的门禁在重试判据下报出 0%,60 轮全绿,真实 61.7% 则被稀释到 26.7%。

  3. 掘金22

    从鸿蒙搬到 iOS 和 Android:仓颉棋盘游戏《驿路巡点》为何最终选择 CJMP

    仓颉棋盘游戏《驿路巡点》从鸿蒙迁移到 iOS 和 Android 时,先尝试仓颉 1.1.3 交叉编译加原生壳方案,只跑通 1 关,且发现 Canvas 在 iOS/Android 的引擎构建中未编入。团队随后转向 CJMP,使用 OpenSDK 0.2.2(内置 cjc 1.1.0),求解器层面 100 关全通,94 关测试在模拟器上完成。

  4. 开源中国26

    SonnetDB 4.0.0 发布:完善 SQL 与多模型协作,强化部署和恢复边界

    开源多模型数据引擎 SonnetDB 4.0.0 已在 GitHub 发布,基于 C# / .NET 10 构建,采用 MIT 许可证,支持嵌入式运行和独立 Server 部署。本次更新完善了 SQL 与关系数据能力,扩展 CTE 等功能,并强化了部署与恢复边界。该引擎以数据库目录为持久化边界,为时序、关系表、KV、JSON 文档、全文、向量、对象、消息队列和 Graph 提供各自原生语义。

  5. 掘金22

    Go 后端转 AI 两个月零 offer:真正卡住的是三块底子,不是技术

    一名 6 年 Go 后端裸辞转 AI,两个月零 offer,复盘发现缺口不在 AI 技术本身,而在业务匹配度、项目深度和面试表达三块底子。他把地产 SaaS 交易链路翻译成幂等、回滚等 AI 岗行话,并在原问答机器人上补超时、重试、trace,让项目能扛住三层追问。补完后 offer 接连到来,最终薪资高于原预期。

  6. 掘金48

    Blender 建模 + Three.js 展示:用 Claude Code 一天做出光储充超充站数字孪生大屏

    开发者用 Claude Code 配合 Blender 5.2 的 Python 脚本建模、Three.js r186 展示,一天内完成一座光储充一体化超充站数字孪生大屏。场站含 30 根双枪快充桩、4 根液冷超充终端、6 台储能柜(合计 2 MWh),通过 MCP 让 AI 直接操控 Blender 生成模型,Sketchfab 车辆模型经减面标准化后每辆约 1.4 万面。

  7. 掘金62

    KV Cache 精讲:AI 越聊越慢的原因与长上下文的显存成本

    文章从自回归生成机制讲起,解释大模型推理中预填充与解码是两种不同负载,前者计算密集决定首字延迟,后者访存密集决定出字速度。作者给出 KV Cache 显存估算公式,以 8B 模型(32 层、KV 头 8 个、每头 128 维、fp16)为例算出约 128 KB/token,128K 上下文下单请求缓存约 16 GB,与模型权重相当。

  8. 掘金22

    从"算子"到"AI Infra":大模型背后看不见的那群人在忙什么

    大模型运行依赖算子与 AI Infra 两层支撑:算子是最基本的计算步骤,如 MatMul、ReLU、Softmax,同一算子优化前后速度可差几十倍,FlashAttention 通过重排计算顺序让注意力计算快了好几倍。AI Infra 则覆盖从芯片到上线服务的整套系统,解决跑得起、跑得快、跑得省的问题,常用指标 MFU 能做到一半左右已算不错。

  9. 掘金20

    即时通讯系统的关键设计:消息同步、定序与投递可靠性

    即时通讯的核心是让不可靠、可离线的多端与服务端就"发生了哪些事、以什么顺序"达成一致,集合与序需分别保证。消息经幂等键去重、分配 seq 定序后落库投递,ACK 仅表示已受理,服务端回显才确认发送成功。同步侧通过会话链与收件箱游标实现跨会话增量拉取,写扩散适合单聊小群,读扩散适合超大群与聊天室。

  10. 掘金65

    如何搭建一个 Agent 系统:方法论、理想形态与一次真实落地

    作者以蔓藤AI 数字人创作平台的通用 AI 助手为例,讲搭建 Agent 系统的方法论与理想形态。该系统把循环放在服务端,一次用户发言最多 4 轮、每轮落一条记录,用冻结按上限、结算释放整笔加实扣的计费模型,并通过 SSE 六事件契约向浏览器推送过程。文中还列出十二个真实踩过的坑,包括提示词与工具表分家、中断导致悬空 tool_calls、空流被当成功、回调不校验归属等。

  11. arXiv cs.CV22

    VLA-ACL:面向高效 Vision-Language-Action 模型的动作一致性视觉 token 剪枝

    VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,保持基础 VLA 模型完全冻结,让剪枝后上下文产生的动作与全上下文教师模型保持一致。在 LIBERO 和真实机器人操作任务上,该方法最多剪掉 87.5% 的视觉 token,计算量降低最多 75%,推理提速 1.5 倍,性能仍具竞争力。代码已开源。

  12. arXiv cs.CV27

    BASA:面向快速高分辨率视觉生成的后端无关稀疏注意力

    研究者提出 BASA,一种后端无关的稀疏注意力机制,用移位局部窗口注意力替代视觉自注意力,通过跨 DiT 块的结构化窗口移位实现全局信息交换,消除窗口边界造成的网格状伪影。BASA 无需定制算子即可部署在现有注意力后端,在 FLUX 上实测加速超过理论估计的 90%,在 Wan 上实现 4.52 倍注意力加速,并保持有竞争力的生成质量。

  13. arXiv cs.CV31

    TSRN-RTVD:实时视频去模糊系统

    TSRN-RTVD 是一个实时视频去模糊系统,通过显式重建曝光期间的相机运动轨迹来引导画面复原。该系统在单块消费级 GPU 上以 30 FPS 运行,在 GoPro 数据集上达到 30.08 dB PSNR,并可在消费设备上实时并排展示模糊输入与去模糊输出及恢复的相机轨迹。

  14. arXiv cs.CL27

    SharedKV-BT:面向行为树智能体的节点本地类型化决策

    SharedKV-BT 让行为树每个活跃节点暴露阶段本地字段与候选,由 Shared-KV 并行打分并将选中决策交给独立执行系统。在机器人操作、移动导航和计算机使用三类任务上,其类型化决策比提示词匹配的自回归解码快 2.36-4.15 倍;操作任务中节点本地 Shared-KV 将联合决策准确率从 75% 提升至 94%,闭环成功率从 0% 提升至 60%。

  15. arXiv cs.LG17

    AID:一个 AI 推理基础设施动力学框架

    研究者提出 AID(AI Infrastructure Dynamics)框架,用于描述物理、计算、网络与服务耦合过程中的 AI 推理基础设施学习问题,支持结构化可变状态、异步观测、多物理时间尺度和随服务变化的需求。该框架区分了现有策略下的预测表示与动作变化下保持服务结果的表示,并给出观测无法区分模型时预测误差下界及精确受控状态约简的充分条件两项分析结果。

  16. arXiv cs.CL29

    DLoop:循环式投机解码

    DLoop 是一种循环式投机解码方法,在验证前自适应执行多轮起草,让草稿模型在保持置信时持续生成 token,再统一验证所有累积的草稿 token。该方法在 EAGLE-3、DFlash、Domino、DSpark 及多 token 预测模块上把实际加速提升 5% 至 41%,同时保持无损解码。配套的循环感知训练让草稿模型接触未验证草稿 token 的自身隐藏状态,从而在额外起草阶段保持可靠。