跳到正文
今天10月7日周三131 条
  1. arXiv cs.AI22

    FlexiFlow:基于多臂老虎机的 ML 工作流模型动态切换

    FlexiFlow 是一个数据流系统,能在当前模型准确率偏低时动态切换到备选模型,通过多臂老虎机方法对模型进行排序,综合考虑模型运行时间、通过用户自定义断言的概率以及 ML 工作流的计算结构。实验显示,切换模型可将工作流准确率提升最高 23%,运行时复用中间结果相比顺序执行工作流还能带来 48% 的效率提升。

  2. arXiv cs.AI23

    SAFESHIELD:面向小语言模型部署时安全的决策组织框架

    SAFESHIELD 是面向小语言模型的部署时安全系统,将安全决策组织为准入、路由、证据、放行四类职责,并把已提交决策记录为可审计的 Decision Traces。协调消融实验显示,移除准入门控会显著增加误放行,而放行决策缺少上游证据时准确率从 96.0% 降至 69.5%,表明部署时安全不仅取决于单个护栏能力,也取决于决策如何组织与协调。

  3. arXiv cs.AI22

    OSFP4:面向 NVFP4 量化的对角平滑与块缩放联合优化

    研究者提出 NVFP4 量化方案 OSFP4,对每个线性投影使用对角平滑矩阵,在 NVFP4 下联合优化平滑项与块缩放以最小化矩阵乘量化误差,并兼容 round-to-nearest 与 GPTQ 式逐次干扰消除。实验显示 OSFP4 在对应量化设置下取得所评估方案中最高的平均精度,同时保留约 94-97% 的厂商 NVFP4 prefill 吞吐,代码已开源。

  4. arXiv cs.AI26

    BluffJAX:JAX 中的对抗性不完美信息博弈开源套件

    BluffJAX 是一个基于 JAX 的开源对抗性不完美信息博弈套件,包含 Texas Hold'Em Poker、Kuhn Poker 等经典基准,以及此前未被强化学习研究过的 Bluff、Stud Poker 和 Kemps。其在单 GPU 和多 GPU 设置下实现每秒数亿样本的吞吐量扩展,并提供了强化学习、树搜索和博弈求解算法的基线结果。

  5. arXiv cs.AI22

    VALSE:面向大语言模型高效推理的垂直自适应层跳过方法

    VALSE 是一种按样本、非连续的层跳过方法,用轻量难度估计器从前几层为每个输入打分,再通过逐层门控选择性跳过冗余层,包括任意中间层而保留更深层,只为每个输入激活必要深度。论文同时给出期望 FLOPs 闭式公式、跳层模型函数空间为全层函数空间真子集的证明,以及与 MoE 架构的结构对偶关系,可行性已在原型规模初步验证。

  6. arXiv cs.AI22

    Trajectory-Retrieval Speculative Decoding:模型自身历史何时有用?

    研究提出 Trajectory-Local Adaptive Retrieval(TLAR),从当前推理轨迹中检索近似匹配的续写,并结合近期验证结果自适应调整检索激活与候选宽度。TLAR 将检索续写与模型生成草稿合并到共享候选树,通过精确验证保持目标模型输出分布。在代码调试、数学和开放式写作任务中,TLAR 结合强检索基线在相同验证预算下提升 token 接受率,并较草稿模型基线提高端到端吞吐。

  7. arXiv cs.AI32

    MemMux:面向并行编码智能体集群的运行时验证与资源归属

    MemMux 是一个本地运行时,为并行编码智能体集群提供可检查的资源治理信号,包括按智能体归属、完整回收、逃逸进程可见性等。在 Linux 内存预算约束下,MemMux 将集群控制在 7.5 GiB 且零 swap,而未治理工具会超出预算 2 倍并溢出约 2 GiB 到 swap;它还能 100% 回收终止智能体的进程子树,并检测出全部 10 个逃逸子进程。

  8. 掘金45

    当 Spec 遇见遗留系统:用 LangGraph 构建带人工审核节点的长任务 Agent

    一次用 LangGraph 把"写 Spec、生成、验证、人工把关"落成真实系统的实践:流程拆成 Spec 构建、代码生成、自动验证、风险分级人审、部署上线五个阶段,构成可暂停、可恢复的状态机。高风险改动才暂停等待人工批准,checkpointer 把状态持久化到数据库,进程可安全退出后由外部轮询器从暂停点唤醒。作者强调重试与重新规划必须分开处理,并给重新规划设上限,避免循环空转。

  9. 掘金27

    一句“帮我看看我基金组合”,怎样走过 ETF Agent 的六层系统

    ETF Agent 用六层系统处理“我的组合主要暴露在哪些行业”这类提问:从会话与请求身份、入口决策、原生研究循环,到统一 Projector 装配模型输入,再经工具执行、证据计算、正文交付与 Langfuse 观测。系统将消息身份与运行身份分开管理,同一消息重发复用原运行,正文冲突则拒绝覆盖已有执行。

  10. 掘金22

    NapCat 接入 QQ 机器人反复掉线排查:根因是守护脚本抢 Token

    用 NapCat 把 QQ 接入自动化系统时反复掉线,排查二十来次后发现主因不是网络或腾讯风控,而是自己挂的守护脚本偷偷拉起桌面注入版,抢走 Shell 无头模式的登录 Token。作者在 Windows 11 + NapCat Shell + QQ 9.9.33-52230 环境下给出端口与日志交叉验证、失败熔断、进程树清理等加固方案,并称文末附有彻底断根的「终极重构版」。

  11. 掘金50

    给 AI 助手加能力,规则文件和 Skill 到底该用哪个?

    针对 Roo Code / Cursor / Claude Code 等 AI 助手,作者提出「意图 vs 执行」双层模型:规则文件管「什么时候、必须做什么」,Skill 管「具体怎么做」。实测把所有规范塞进 rules 会让系统提示词涨到 3000+ Token,抽离执行逻辑后 rules 可瘦身到 200 Token 左右,并避免「Lost in the Middle」导致的注意力失焦。

  12. 掘金34

    AI 复盘技能从 49 分钟压到 43 秒:主流程洁癖与时间盒三纪律实战

    一次晨间复盘技能跑了 49 分钟,作者当场定下 5 分钟硬上限,把 kb 推送、钉钉修复等非主流程活甩出主线,并用 tools/jihua_collect.py 一条命令并行抓完八项数据源,实测全链 43 秒。其中 collector 抓数 0.4 秒,判断加写盘约 40 秒,kb 收尾 8.5 秒转入后台不阻塞主流程。

  13. Simon Willison22

    llm-mistral 0.16 发布

    Simon Willison 发布 llm-mistral 0.16,这是 llm 命令行工具接入 Mistral 模型的插件更新。该版本属于其 llm 项目(累计 637 篇相关文章)与 mistral 系列(68 篇)的持续迭代,具体功能变更原文未披露。