FineART:细粒度标注机器人轨迹数据集与双臂操作视觉-语言-动作模型
研究团队发布 FineART 双臂操作数据集,含 40,543 条轨迹(1,718 小时)、533,913 个子任务,覆盖 151 项任务,并推出可预测下一子任务的视觉-语言-动作策略 FineART-VLA。
研究团队发布 FineART 双臂操作数据集,含 40,543 条轨迹(1,718 小时)、533,913 个子任务,覆盖 151 项任务,并推出可预测下一子任务的视觉-语言-动作策略 FineART-VLA。
SAE++ 是一种级联稀疏自编码器架构,通过在初级 SAE 的解码器权重上训练二级 SAE,学习多模态 LLM 中的层级视觉概念,避免嵌套式共享前缀耦合与朴素堆叠的瓶颈。在 Qwen3-VL、Gemma-3 和 LLaVA 上的多组视觉数据集实验中,SAE++ 在层级概念一致性上优于当前最优 SAE 基线,并支持对 MLLM 输出进行组级概念干预。代码已开源。
NVIDIA 提出 NeMo-DCR(Delta-Compressed Refit),只传输权重变化量却保持比特精确,接收端得到与全量重配完全相同的参数和 buffer 位。
研究指出 Muon 优化器对矩阵更新有清晰解释,但卷积核以四维张量存储,标准实现将其 reshape 为矩阵的做法破坏了其理论基础。为此研究者提出 Convolutional Newton-Schulz(Conv-NS),直接在卷积算子几何中逼近极因子并保留核支撑。
arXiv 论文提出开源个人智能体 nanoMuse,采用 GPL-3.0 许可,让用户拥有的每台设备共享同一段对话,并通过任何人都能运行的 relay 连接。
开源工具包 Transect 发布,基于 Inspect Scout 构建,用于分析长周期 LLM 智能体评测记录。它通过可复用的评测族配置指定任务上下文与行为词汇,将事件、token 用量、子智能体活动和模型生成的行为标签对齐到统一的回合时间线上,支持标签溯源与数据表导出。
研究者为完整十英雄 MOBA(206 个单位、每 tick 全英雄行动、单局最长 6,000 tick)学习结构化多智能体世界模型,仅用 1,400-tick 自由推演想象回合训练策略,再在真实对局中评测。
研究者发布开放电信 AI 资源 OTel,包含面向检索、重排序、指令微调与安全/拒答的衍生电信数据集,以及 30 个全参数后训练基线,覆盖 10 个嵌入模型、3 个重排序器和 17 个语言模型。截至 2026 年 5 月 3 日,相关模型下载量超 1600 万次。后训练后嵌入检索达 93.1% NDCG@10,重排序达 0.947 MRR@10,语言模型正确率达 87.8%。
BluffJAX 是一个基于 JAX 的开源对抗性不完美信息博弈套件,包含 Texas Hold'Em Poker、Kuhn Poker 等经典基准,以及此前未被强化学习研究过的 Bluff、Stud Poker 和 Kemps。其在单 GPU 和多 GPU 设置下实现每秒数亿样本的吞吐量扩展,并提供了强化学习、树搜索和博弈求解算法的基线结果。
MemMux 是一个本地运行时,为并行编码智能体集群提供可检查的资源治理信号,包括按智能体归属、完整回收、逃逸进程可见性等。在 Linux 内存预算约束下,MemMux 将集群控制在 7.5 GiB 且零 swap,而未治理工具会超出预算 2 倍并溢出约 2 GiB 到 swap;它还能 100% 回收终止智能体的进程子树,并检测出全部 10 个逃逸子进程。
EmbeddingGemma 2 发布,参数量 740M,基于 Gemma 4 架构,从纯文本嵌入扩展到原生处理文本、代码、图像、视频和音频,映射到统一嵌入空间。
Yu Markdown v0.1.3 发布,这是一款采用 Apache 2.0 协议开源的原生 Markdown 编辑器,已提供 macOS 与 Windows 安装包。
Strands 发布 Strands Decider 2B,一个 20 亿参数的开源决策模型,可在本地 CPU 或 GPU 上运行,权重、训练数据和脚本均已开源。
Elastic 的 David Pilato 发布开源文件爬虫 FSCrawler 3.0,距 2.9 版本已过去 4 年 7 个月 16 天,累计 2,877 次提交、净增 31,484 行代码。
LightCraft 是一个用 Rust 从零实现的开源 RAW 照片开发与管理工具,对标 Adobe Lightroom,支持桌面原生应用与浏览器 WebAssembly 运行。
作者在一台同时使用 Claude Code 与 Codex 的开发机上盘点 skill 管理,发现 50 多个 skill 中 13 个同名副本内容不一致,最多相差 58 行,且版本记录分散在五个来源。
2026-10-07 GitHub 趋势榜显示,Rust 图像编辑器 storytold/photocraft 以 24h +4,415 Star 登顶,同作者的 Rust 视频编辑器 filmcraft 以 +984 位列第二。
Penguin Mail 发布 1.0.0 版,这是一款面向 x86_64 Linux 的开源邮件客户端,采用 Rust 编写、GPL-3.0-or-later 许可,支持 Gmail、Microsoft、IMAP、POP3 账户及日历、联系人和 OpenPGP/S/MIME 加密。
Berthd 发布 Berth,可在用户自己的开发机上运行 Claude Code、Codex 等编码智能体,合上笔记本后任务仍继续执行。用户按 ⌘N 指定需求,Berth 会在所选机器上创建 worktree 并启动智能体,命令与读取折叠成行、编辑以 diff 呈现,Claude 提问可就地回复。
Musubi 发布轻量级决策模型 PolicyLM-1.7B,以开放权重形式公开,可将纯英文写成的内容政策应用于消息审核,耗时低于 50 毫秒。该模型成本与速度接近主流社交平台的 AI 分类器,但具备现代 LLM 的灵活性,无需专门训练即可执行复杂政策,政策变更时也无需重新训练。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数,在 Apache 2.0 许可下开源,可把文本、图像、音频和视频映射到统一嵌入空间。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转为向量,参数量 7.4 亿。Google 称其在多模态嵌入基准上超过参数量两倍的竞品,在 Massive Text Embedding Benchmark(Code)上得分 78.68,比前代 68.76 提升近 10 分。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,参数量 740M,可将文本、图像、音频、视频映射到统一嵌入空间。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一进同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于评估本地多模态检索的可行性。
ArtCraft 团队发布 PhotoCraft,一个用纯 Rust 从公开规范洁净室重写的开源图像编辑器,支持图层、蒙版、调整图层、图层样式、文字、矢量、笔刷和真实 PSD 文件。
openTPU 是一个开源 AI 加速器项目,硬件设计、指令集、模拟器、内核语言与编译器、主机软件都放在一个可通读的 monorepo 中,并在 Inspur YPCB-00338 卡(Xilinx Kintex-7 xc7k480t,两路 DDR3)上跑通十款模型,输出 token 与模拟器逐位一致。
Parseable 是一个开源可观测性数据湖,宣称每分钟可处理 1 亿条时间序列,采用列式设计与对象存储原生架构应对高基数问题。它在单一二进制内集成日志、指标、分布式追踪、告警、Dashboard 与 AI 分析,支持 SQL 和自然语言查询,并提供 MCP、Slack Bot、PAI、PB CLI、OTex 等工具。
Tapo 库 v0.11.1 新增对 TP-Link TPAP 协议的支持,用户可在 Tapo app 的“Third-Party Compatibility”开关关闭状态下连接灯具、插座、排插、H100 hub 及部分摄像头,无需修改代码。该版本于 4 日发布,此前 v0.10.0(9 月 28 日)和 v0.11.0(10 月 2 日)已加入新设备家族并移除旧的 AES 协议。
用 MoonBit 编写的 Linux 进程管理器 bm2 发布 0.6.0 版本,可管理 Node.js 和 Bun 应用,编译后为两个原生二进制共 5.5 MB,无运行时依赖。
DeepSeek 于 8 月 13 日随 V4-Pro 一同开源 MIT 许可证的 Agent 运行框架 DeepSeek Harness(dsh),模型、工具、沙箱乃至 Agent Loop 都可像插件一样替换,上线两天 GitHub Star 突破 9 万。
推荐理由:拆解 DeepSeek Harness 的插件化架构与首批实测数据,可对照自身 Agent 技术栈判断取舍。
Polars 2.0 发布,LazyFrame 的 collect 默认走流式引擎,out-of-core 落盘默认开启,内存约 80% 时开始溢写,默认磁盘预算 64GB。
PhAI Labs 联合斯坦福、牛津、普林斯顿的研究者提出 JEPA-Anything,把 JEPA 的预测状态拆成四个正交因子、各由独立预测模块处理,再重组为完整世界状态,从而在物理、机器人、天气、单细胞和临床等七个领域共用一套架构。
AI 公司 Reflection 发布首个免费开放模型 Beam,面向编码、逻辑推理和智能体任务,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿。
Reflection AI 发布首个开放权重模型 Beam,采用稀疏激活架构,总参数 501B、每 token 激活 23B,在 23.8 万亿 token 上预训练,4 周内完成且 Goodput 达 92.3%。
OctaFuse Gateway 2.13.0 将路由计价拆分为供应商倍率、计费倍率和成本倍率,供应商倍率支持按有效期和分时时段生效,未开始或已到期按 1 计算。新版本支持在路由编辑窗口内直接发起快速测试,无需先保存,但不会保存草稿、扣减额度或写入请求日志。用量分析拆为概览、费用与用量、性能与质量视图,并新增转移请求占比和成功流式样本指标。
开发者发布 WebGPU 封装库 moxwebgpu,用链式调用替代两百多行样板代码,如 gpu.tensor([1,2,3,4]).add(1).relu().mul(10).sum().item() 即可完成计算。
文章用 Unsloth + QLoRA 把 Gemma-3-4B 微调成按格式产出(问题, 推理, 答案)三元组的合成数据生成器,全程单卡 24GB 可跑,并给出可直接复制的训练与生成脚本。
MiniMind 学习笔记第 04 篇拆解了 Transformer 块中注意力之外的六块组件:RoPE 旋转位置编码、Flash Attention、KV Cache、GQA、FFN 以及残差与 RMSNorm。
作者开源了 kshell,一个用 Go 1.23+、Wails v2、React 19 和 Bubbletea 构建的 AI 编程 CLI 统一工作台,自动扫描本机已装工具并汇总其会话、工作区、终端与远程服务器,支持 Windows、macOS、Linux,MIT 协议,当前版本 v0.1.3。
开发者用一部安卓手机通过 SSH 登录无桌面的 Linux 服务器,让终端里的 Agent 完成编码、构建、安装与测试,再切到 AScrcpy 查看并操作服务器模拟器上的画面完成验收。
Reflection 发布 Beam,一个面向编码、智能体和科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 协议在本月开放。