RelayMoE:面向分布式 MoE 训练的内存高效专家路由
RelayMoE 是一种基于环结构的 MoE 执行模型,通过让专家权重或 token 在环上流转并本地计算,避免构建完整的 top-k 扩展调度缓冲区。在 30B–57B 生产级 MoE 模型上,单层实验较 Megatron-LM 平均提速 2 倍,全模型训练吞吐最高提升 2.02 倍,可训练序列长度最高扩展 2.85 倍。
RelayMoE 是一种基于环结构的 MoE 执行模型,通过让专家权重或 token 在环上流转并本地计算,避免构建完整的 top-k 扩展调度缓冲区。在 30B–57B 生产级 MoE 模型上,单层实验较 Megatron-LM 平均提速 2 倍,全模型训练吞吐最高提升 2.02 倍,可训练序列长度最高扩展 2.85 倍。
FlexiFlow 是一个数据流系统,能在当前模型准确率偏低时动态切换到备选模型,通过多臂老虎机方法对模型进行排序,综合考虑模型运行时间、通过用户自定义断言的概率以及 ML 工作流的计算结构。实验显示,切换模型可将工作流准确率提升最高 23%,运行时复用中间结果相比顺序执行工作流还能带来 48% 的效率提升。
SAFESHIELD 是面向小语言模型的部署时安全系统,将安全决策组织为准入、路由、证据、放行四类职责,并把已提交决策记录为可审计的 Decision Traces。协调消融实验显示,移除准入门控会显著增加误放行,而放行决策缺少上游证据时准确率从 96.0% 降至 69.5%,表明部署时安全不仅取决于单个护栏能力,也取决于决策如何组织与协调。
TraceDSE 是一种智能体设计空间探索流程,用于异构边缘 SoC 上 AI 推理的工作负载映射与 PU 配置联合选择,通过 LLM 提议者-批评者循环并借助系统执行轨迹反馈进行迭代优化。
T-CCL 是一个基于 Tensor Memory Accelerator(TMA)的节点内集合通信库,将数据搬运与归约操作卸载到 TMA,以流水线式异步 TMA 操作执行集合通信,在保持高带宽的同时降低 SM 资源占用。
SchemaFill 通过槽位并行推测解码加速 LLM 工具调用,在 Glaive 和 BFCL 上端到端吞吐量最高提升 4.05 倍。该框架将多个字段和调用的候选值并发生成后拼接,由目标模型在实际输出前缀下验证,仅提交通过验证的 token,候选不一致时由目标模型提供修正。代码已开源。
研究者提出免训练方法 MaskAhead,用单一掩码查询排序机制同时完成块扩散语言模型的 KV 选择与淘汰,当前块掩码指导选择、后续掩码块探测指导淘汰。
针对并行多智能体系统常比单智能体更慢的问题,研究者提出 SquidAgent,将并行决策标准从难以校准的墙钟时间改为预测输出 token 数,并通过从编排者会话直接 fork 每个 worker 消除重探索成本、用预生成共享约定块把对齐成本前置为有界开销。
研究者提出 NVFP4 量化方案 OSFP4,对每个线性投影使用对角平滑矩阵,在 NVFP4 下联合优化平滑项与块缩放以最小化矩阵乘量化误差,并兼容 round-to-nearest 与 GPTQ 式逐次干扰消除。实验显示 OSFP4 在对应量化设置下取得所评估方案中最高的平均精度,同时保留约 94-97% 的厂商 NVFP4 prefill 吞吐,代码已开源。
STEPGATE 是一种不确定性感知的步骤级交接框架,对本地小语言模型的每个动作打分,将困难步骤选择性升级到更强模型。在 52 项 BFCL 单步测试中,Qwen2.5-1.5B/7B 组合以 30.8% 升级率取得 82.7% 任务成功率,高于纯本地的 67.3% 和随机升级的 75.4%。
BluffJAX 是一个基于 JAX 的开源对抗性不完美信息博弈套件,包含 Texas Hold'Em Poker、Kuhn Poker 等经典基准,以及此前未被强化学习研究过的 Bluff、Stud Poker 和 Kemps。其在单 GPU 和多 GPU 设置下实现每秒数亿样本的吞吐量扩展,并提供了强化学习、树搜索和博弈求解算法的基线结果。
VALSE 是一种按样本、非连续的层跳过方法,用轻量难度估计器从前几层为每个输入打分,再通过逐层门控选择性跳过冗余层,包括任意中间层而保留更深层,只为每个输入激活必要深度。论文同时给出期望 FLOPs 闭式公式、跳层模型函数空间为全层函数空间真子集的证明,以及与 MoE 架构的结构对偶关系,可行性已在原型规模初步验证。
研究者发布 LOGIC,一个用于航空航天电气设计变更影响分析的 LLM 基准与评估框架,包含 168 个场景(144 个选择案例、24 个弃答案例),让本地部署模型先在确定性候选变更清单中完成意图定位,再经类型化电气追溯图传播。
研究提出 Trajectory-Local Adaptive Retrieval(TLAR),从当前推理轨迹中检索近似匹配的续写,并结合近期验证结果自适应调整检索激活与候选宽度。TLAR 将检索续写与模型生成草稿合并到共享候选树,通过精确验证保持目标模型输出分布。在代码调试、数学和开放式写作任务中,TLAR 结合强检索基线在相同验证预算下提升 token 接受率,并较草稿模型基线提高端到端吞吐。
MemMux 是一个本地运行时,为并行编码智能体集群提供可检查的资源治理信号,包括按智能体归属、完整回收、逃逸进程可见性等。在 Linux 内存预算约束下,MemMux 将集群控制在 7.5 GiB 且零 swap,而未治理工具会超出预算 2 倍并溢出约 2 GiB 到 swap;它还能 100% 回收终止智能体的进程子树,并检测出全部 10 个逃逸子进程。
Cascadia 在十一台 Intel Core Ultra X7 358H AI PC 上常驻运行 975B 总参数、41B 激活参数的 MoE 模型 Inkling,每台配 64 GB 内存、Arc B390 核显与千兆以太网。
一篇 arXiv 论文提出面向生成式 AI 的生产级内容抽取系统,将内容抽取作为独立生命周期阶段,包含选择性 OCR 路由、基于参考的抽取评分器、确定性结构感知父子分块器和只读检索评估器。
离线 AI 模块工作流发布语音优先的完全离线部署方案,包含模块化架构、低成本硬件 BOM 和面向 2-5B 参数指令微调模型的可复现量化与基准测试流程。
AegisFlow 是一个基于 LLM 的多智能体框架,通过 Watchdog 与 Repair 智能体自动生成、测试并部署代码补丁,在五类常见故障场景下将 MTTR 从平均 170 分钟降至 3.2 分钟,补丁成功率达 92%。
FluidPD 是一个面向 SLO 的 P/D 分离 LLM 服务系统,通过 FluidToken 将部分预填充计算卸载到空闲的解码 worker 以应对瞬时失衡,并用 FluidRole 原地切换运行中 worker 的预填充/解码角色以应对持续失衡,避免模型重载与引擎重启。
Text2Dashboard 是面向 DataBrain 的原型系统,通过可安装 Codex 插件与独立 Agent Runtime,将自然语言分析请求转化为可审查的仪表盘,由确定性软件控制执行并记录状态变更。
一次用 LangGraph 把"写 Spec、生成、验证、人工把关"落成真实系统的实践:流程拆成 Spec 构建、代码生成、自动验证、风险分级人审、部署上线五个阶段,构成可暂停、可恢复的状态机。高风险改动才暂停等待人工批准,checkpointer 把状态持久化到数据库,进程可安全退出后由外部轮询器从暂停点唤醒。作者强调重试与重新规划必须分开处理,并给重新规划设上限,避免循环空转。
Cohere 发布企业级 AI 平台 North 2,定位为可对接任意模型的 AI Agent 控制中枢,支持接入 Slack、SharePoint、Jira 等工具,并可通过提示词生成演示文稿、仪表盘和简单应用。
ETF Agent 用六层系统处理“我的组合主要暴露在哪些行业”这类提问:从会话与请求身份、入口决策、原生研究循环,到统一 Projector 装配模型输入,再经工具执行、证据计算、正文交付与 Langfuse 观测。系统将消息身份与运行身份分开管理,同一消息重发复用原运行,正文冲突则拒绝覆盖已有执行。
Yu Markdown v0.1.3 发布,这是一款采用 Apache 2.0 协议开源的原生 Markdown 编辑器,已提供 macOS 与 Windows 安装包。
开发者用 Codex 配合自建的 disk-usage-excel Skill 统计 C 盘占用,8 分 14 秒后生成 Excel 报表,显示 C:\Users 占 117.94 GB,其中 AppData 达 87.81 GB。
Personal AI Agent 的关键分水岭不是模型参数,而是系统是否具备 Identity、Long-term Memory、Task State、Authorization、Approval 与 Audit 等完整执行层。
一项无 LLM 智能体的 Jev 驱动诊断管线在 21 个 SREGym-Lite 故障上完成 105 次诊断,通过 80 次(76.2%),中位诊断时间 14.6 秒。
用 NapCat 把 QQ 接入自动化系统时反复掉线,排查二十来次后发现主因不是网络或腾讯风控,而是自己挂的守护脚本偷偷拉起桌面注入版,抢走 Shell 无头模式的登录 Token。作者在 Windows 11 + NapCat Shell + QQ 9.9.33-52230 环境下给出端口与日志交叉验证、失败熔断、进程树清理等加固方案,并称文末附有彻底断根的「终极重构版」。
Elastic 的 David Pilato 发布开源文件爬虫 FSCrawler 3.0,距 2.9 版本已过去 4 年 7 个月 16 天,累计 2,877 次提交、净增 31,484 行代码。
针对 Roo Code / Cursor / Claude Code 等 AI 助手,作者提出「意图 vs 执行」双层模型:规则文件管「什么时候、必须做什么」,Skill 管「具体怎么做」。实测把所有规范塞进 rules 会让系统提示词涨到 3000+ Token,抽离执行逻辑后 rules 可瘦身到 200 Token 左右,并避免「Lost in the Middle」导致的注意力失焦。
这篇 RAG 教程从一次企业内部知识库事故讲起:文档解析、切片、Embedding、向量检索、Hybrid Search、Reranker 都正常,Top-10 里也有正确答案。
这篇教程针对国内直连 huggingface.co 不稳定、大文件下载易中断的问题,给出 HuggingFace、hf-mirror、ModelScope 三种可复制的模型下载方案。
一次晨间复盘技能跑了 49 分钟,作者当场定下 5 分钟硬上限,把 kb 推送、钉钉修复等非主流程活甩出主线,并用 tools/jihua_collect.py 一条命令并行抓完八项数据源,实测全链 43 秒。其中 collector 抓数 0.4 秒,判断加写盘约 40 秒,kb 收尾 8.5 秒转入后台不阻塞主流程。
一篇面试复盘拆解了 LLM 工具调用(Tool Use)的完整技术链路:从工具分类与能力边界、意图识别到结果注入的 9 步调用流程,再到工具描述工程。文中给出天气查询工具的 JSON Schema 示例,并指出可选工具超过 20 个时工具选择准确率会显著下降。
文章对比了以 Cursor、Windsurf 为代表的图形 IDE 与以 Claude-Code、AGY、Codex 为代表的 CLI 智能体两条 AI 编程路线。
作者在一台同时使用 Claude Code 与 Codex 的开发机上盘点 skill 管理,发现 50 多个 skill 中 13 个同名副本内容不一致,最多相差 58 行,且版本记录分散在五个来源。
Simon Willison 发布 llm-mistral 0.16,这是 llm 命令行工具接入 Mistral 模型的插件更新。该版本属于其 llm 项目(累计 637 篇相关文章)与 mistral 系列(68 篇)的持续迭代,具体功能变更原文未披露。
文章针对 LLM 长对话触发 context_length_exceeded 的问题,设计并对比了 FIFO、LRU-Token、Priority-Weighted、Semantic Clustering 和 Hybrid 五种 Context Eviction 策略,给出每种策略的实现代码与实测数据。
Berthd 发布 Berth,可在用户自己的开发机上运行 Claude Code、Codex 等编码智能体,合上笔记本后任务仍继续执行。用户按 ⌘N 指定需求,Berth 会在所选机器上创建 worktree 并启动智能体,命令与读取折叠成行、编辑以 diff 呈现,Claude 提问可就地回复。