nanoMuse 发布开源个人智能体,覆盖手机、电脑与自建中继
nanoMuse 发布开源个人智能体,手机、桌面、Web 控制台和连接它们的中继都在同一仓库,采用 GPL-3.0-or-later 许可,最新版本 0.1.40。
nanoMuse 发布开源个人智能体,手机、桌面、Web 控制台和连接它们的中继都在同一仓库,采用 GPL-3.0-or-later 许可,最新版本 0.1.40。
一套完全离线的语音到语音翻译流水线可在 4 GB 显存的 Jetson Nano 上运行,无需重训练即可自我修正弱翻译。系统由 Whisper-tiny ASR 与 Opus-MT 翻译器组成,多语言 BERT 余弦相似度作为质量估计(QE)门控,在置信度低于阈值 τ 时触发二次修正。
研究提出双 IDS 框架,由量化 LSTM 的 QLSTM-IDS 与 8-bit 量化卷积自编码器的 QCAE-IDS 组成,分别检测已知与未知 CAN 总线攻击。
研究者提出 CARAT,将模型依赖度估计与运行时损坏检测解耦,通过源训练阶段的不对称模态 dropout 课程学习缺失鲁棒的主干网络,并基于窗口输入投影梯度范数导出冻结的依赖度代理。
研究者提出知识蒸馏框架 MemKD,通过专门的损失函数捕捉教师与学生模型在时间序列子序列上的记忆保留差异,让紧凑循环神经网络更有效地模仿教师行为。实验显示 MemKD 显著优于现有 SOTA 知识蒸馏方法,并能在多种压缩比例下匹配教师模型性能,大幅减少参数量和内存占用而精度损失不显著。
针对移动边缘设备上 MoE 大语言模型联邦微调中的数据异构问题,研究者提出联邦聚合对齐框架 FedAlign-MoE,通过一致性加权对齐路由分布、分布正则优化本地门控网络,并量化同索引专家的语义一致性以选择性聚合。实验显示,该框架在非 IID 联邦环境下收敛更快、精度更高,且计算轻量、通信高效。
MemFLoRA 是一种面向 CNN 边缘适配的低秩适配器,采用内存优先设计而非直接套用面向 Transformer 的 LoRA。它冻结下投影、训练尺度匹配的上投影,并将保存状态压缩到低秩分支,在三个 HAR 数据集和两个 CNN 骨干上,相比全量微调减少 98.5-98.7% 的激活内存和 94.9-97.3% 的峰值训练状态内存,同时匹配或超过 CNN PEFT 基线。
研究提出 Micro Neural Policies(MNP),将 Evolution Strategy 与基于 Statistical Model Checking 的验证结合用于策略搜索,大幅压缩神经网络规模。
研究者提出 Quantizer-Aligned Recalibration(QuAR),一种面向量化 ViT 的单次前向 TTA 方法,不反向传播也不更新任何模型参数,而是在冻结量化器输入端重校准激活值。
Apple 提出 Stepped MoE 框架,将弹性结构与稀疏门控架构结合,让单一模型可在 1、2、3、4 billion 参数间灵活切换,并保持输入自适应路由。该模型在知识密集型基准上比同规模稠密模型准确率高 2-5%,延迟与稠密模型相当,同时通过共享参数节省设备磁盘空间,适配端侧推理的 DRAM 与算力限制。
LiLib 是一种面向 UAV 的轻量级持续学习方案,通过维护一个小型递归最小二乘专家库,用窗口残差检验检测漂移,再经短探测阶段复用或新建专家。
arXiv 论文提出开源个人智能体 nanoMuse,采用 GPL-3.0 许可,让用户拥有的每台设备共享同一段对话,并通过任何人都能运行的 relay 连接。
STEPGATE 是一种不确定性感知的步骤级交接框架,对本地小语言模型的每个动作打分,将困难步骤选择性升级到更强模型。在 52 项 BFCL 单步测试中,Qwen2.5-1.5B/7B 组合以 30.8% 升级率取得 82.7% 任务成功率,高于纯本地的 67.3% 和随机升级的 75.4%。
Cascadia 在十一台 Intel Core Ultra X7 358H AI PC 上常驻运行 975B 总参数、41B 激活参数的 MoE 模型 Inkling,每台配 64 GB 内存、Arc B390 核显与千兆以太网。
研究评估轻量级开源语言模型在资源受限的边缘环境下,将输入数据实体匹配到最合适的智能数据模型(SDM)的表现,系统基准测试了通用、推理专用和代码专用三类架构在多个领域数据集上的效果。实验还将所调研的大语言模型与 TF-IDF 和轻量级句子编码器两种近零成本相似度基线在同一任务上对比,为判断 LLM 分类在边缘平台的实际价值提供参考。
离线 AI 模块工作流发布语音优先的完全离线部署方案,包含模块化架构、低成本硬件 BOM 和面向 2-5B 参数指令微调模型的可复现量化与基准测试流程。
EmbeddingGemma 2 发布,参数量 740M,基于 Gemma 4 架构,从纯文本嵌入扩展到原生处理文本、代码、图像、视频和音频,映射到统一嵌入空间。
Strands 发布 Strands Decider 2B,一个 20 亿参数的开源决策模型,可在本地 CPU 或 GPU 上运行,权重、训练数据和脚本均已开源。
Penguin Mail 发布 1.0.0 版,这是一款面向 x86_64 Linux 的开源邮件客户端,采用 Rust 编写、GPL-3.0-or-later 许可,支持 Gmail、Microsoft、IMAP、POP3 账户及日历、联系人和 OpenPGP/S/MIME 加密。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数,在 Apache 2.0 许可下开源,可把文本、图像、音频和视频映射到统一嵌入空间。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,参数量 740M,可将文本、图像、音频、视频映射到统一嵌入空间。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一进同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于评估本地多模态检索的可行性。
苹果正研发一款不保存视频的智能家居摄像头,改用 AI 将画面转成文字描述,并支持人脸识别;据 Bloomberg 的 Mark Gurman 报道,未来 AirPods 的摄像头也可能采用类似方案。Google 可穿戴设备高级总监 Sandeep Waraich 也向 The Verge 表示,公司正在考虑智能眼镜摄像头不录制、仅用 AI 处理视觉数据的思路。
openTPU 是一个开源 AI 加速器项目,硬件设计、指令集、模拟器、内核语言与编译器、主机软件都放在一个可通读的 monorepo 中,并在 Inspur YPCB-00338 卡(Xilinx Kintex-7 xc7k480t,两路 DDR3)上跑通十款模型,输出 token 与模拟器逐位一致。
HarmonyOS 7.0 的 CoreVisionKit 新增 textSearchImage 端侧文搜图能力,推理在本地 NPU 运行、照片不上传、离线可用、延迟毫秒级,通过 init() 加载模型并构建索引、search(query, scope) 按业务数据域隔离检索。
Meta 旗下个人智能体 Muse 冲上美国 App Store 生产力效率榜第一名,获超 10 万条评价、评分 4.9,并同步在 GitHub 开源 Muse Gadget SDK,提供针对 ESP32 与 Linux 的设备端源码与通信固件。
这篇教程梳理了 Qwen3.8-27B 的本地部署选型:该模型为 Apache-2.0 开源的 27B 稠密原生视觉语言模型,BF16 权重 51.75 GB,4-bit 量化后约 15.33 GB,可落在单张 16GB 显卡的承载边界内。
一款命令行工具可从 macOS 27 中移除 Apple Intelligence,并释放超过 12GB 存储空间。
开源命令行工具 RemoveMacAI 能一键关闭 Apple Intelligence 的 Siri、Writing Tools、Genmoji、Image Playground、ChatGPT 扩展及各类摘要功能,删除其基础模型并阻止 macOS 重新下载。
iOS 27 新增「通知自动化」,任何能发送通知的 App 都可作为快捷指令触发器,并支持按通知标题、副标题、正文筛选内容。该功能还提供 App 名称、通知日期等输出变量,可实现重要消息着重提醒、自定义角标、联系人专属铃声、英文通知翻译、自动记账等十种用法。需开启 App 系统通知并在锁屏或通知中心显示,仅选横幅无法运行。
一项基准测试用 5,070 个禁用推理的案例检验本地 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词完成正整数加法,禁用推理时数值准确率为 23.57%,格式合规率 96.17%。准确率随位数增加从一至三位数的 97.04% 降至十至十三位数的 6.44%。启用推理后,169 次配对测试中答对 167 次。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 DGX Spark 64GB 配置,保留 GB10 Grace Blackwell 超级芯片、DGX OS 和完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 新配置的价格、可跑模型规模与双机集群方式,便于判断本地跑智能体的门槛。