browser4agent 发布:让 Claude Code、Codex 等 Agent 通过 MCP 使用已登录浏览器
browser4agent 是一个浏览器扩展加本地小程序,让 Claude Code、Codex、Cursor 等 AI Agent 通过 MCP 或命令行使用用户真实已登录的浏览器,并支持按 URL 匹配的「页面工具」。
browser4agent 是一个浏览器扩展加本地小程序,让 Claude Code、Codex、Cursor 等 AI Agent 通过 MCP 或命令行使用用户真实已登录的浏览器,并支持按 URL 匹配的「页面工具」。
作者 mantou132 发布开源工具 AgentDeck,可在手机上开会话、审批权限、接收完成通知,并查看 agent 产出的图表、HTML 预览和模拟器实时画面。
pi-rust 是用 Rust 实现的编码助手,运行命令为 rpi,可接入模型并提供读文件、执行命令等工具。文章以“读配置文件查超时时间”为例,沿 Editor::submit、AgentHarness::prompt_text、run_agent_loop 追踪一条消息从输入框到模型请求的完整路径,并解释 Session、Run、Turn 三个尺度及 Agent Loop 的循环机制。
开发者 @xianyu110 整理的开源合集 awesome-nano-banana-2.1 已收录 21 条 Nano Banana 2.1(API ID:gemini-nano-banana-2.1,Google Flow 内代号 beluga)案例,每条均要求封面图与作者公开提示词齐全,并提供可筛选、可搜索、一键复制提示词的在线画廊。
OpenCode 2.0 发布后,插件架构从 V1 Hooks 迁移到 V2 Plugin SDK / Transforms,但按官方文档编写的双版本插件在本地调试时会静默失败。
AuthX 正式更名为 GrantForge,并重新做了一遍权限管理系统。原架构已无法承载其想实现的能力,团队在功能持续增加、多角色授权等场景下遇到瓶颈,因此选择重构而非继续叠加功能。
开源多模型数据引擎 SonnetDB 4.0.0 已在 GitHub 发布,基于 C# / .NET 10 构建,采用 MIT 许可证,支持嵌入式运行和独立 Server 部署。本次更新完善了 SQL 与关系数据能力,扩展 CTE 等功能,并强化了部署与恢复边界。该引擎以数据库目录为持久化边界,为时序、关系表、KV、JSON 文档、全文、向量、对象、消息队列和 Graph 提供各自原生语义。
Spring AI Alibaba Graph 通过 State、Node、Edge、Checkpoint 与 Human-in-the-Loop 等机制,把企业 AI 流程从单次模型调用变成有状态、可路由、可暂停、可恢复的执行过程。
开发者用 Claude Code 配合 Blender 5.2 的 Python 脚本建模、Three.js r186 展示,一天内完成一座光储充一体化超充站数字孪生大屏。场站含 30 根双枪快充桩、4 根液冷超充终端、6 台储能柜(合计 2 MWh),通过 MCP 让 AI 直接操控 Blender 生成模型,Sketchfab 车辆模型经减面标准化后每辆约 1.4 万面。
OpenWAM 是一个可组合世界-动作模型的开放框架,支持在模型内部及模型之间灵活组合视频与动作的生成顺序和注意力方式。其共享架构将 Wan2.2-5B 视频专家与 2B 动作专家组成 Mixture-of-Transformers,在约 334 万条轨迹、14.64k 小时视频上预训练,使用 32 块 NVIDIA B200 GPU 训练 14 天。
Shaders 发布 WebGPU 特效组件库,提供 200+ 可直接嵌入的组件,覆盖 React、Vue、Svelte、Solid 和 JavaScript,统一 props 并支持 TypeScript 与 SSR。
treg 发布一个面向智能体工具的统一注册表,用一个 base URL 和一个 token 即可调用覆盖 SEO、社交趋势、企业与人物信息、广告、抓取、图像与视频生成等数千个端点,按次计费、最低一分钱起,无需向各供应商注册。
nanoMuse 发布开源个人智能体,手机、桌面、Web 控制台和连接它们的中继都在同一仓库,采用 GPL-3.0-or-later 许可,最新版本 0.1.40。
作者实测 GitHub Trending 上的 e2e 测试框架(tester-army/e2e),其 agent 步骤验证通过后会被录制,第二次运行直接回放,实测零模型调用、耗时从 3.48 秒降到 309 毫秒。
开源项目 DeskWorlds 的桌面版仅支持 macOS,作者用 ZCode 拆解后发现鱼缸场景本身是运行在浏览器里的 Three.js + WebGL2 3D 世界,与 macOS 绑定的只是最外层壁纸宿主。
研究团队提出 VLAct,一种面向 VLA 模型的 VLM 骨干,通过 VLM 先验保持、多头连续动作协同监督和部分统一的跨具身动作布局,在广泛异构多具身机器人数据上进行持续预训练。
PointZero 提出以 3D 点轨迹补全作为预训练目标,无需机器人动作标签即可学习可迁移的 3D 动态先验。研究团队构建了包含 290 万合成帧、覆盖可变形、铰接与刚性物体的数据集,并训练出基于 Transformer 的 PointZero,在相同数据上优于此前方法。
RIGOR 是一个面向重力对齐全景视频的大规模三维重建管线,保留冻结的前馈透视骨干网络,将每张全景图当作四视角虚拟装置使用。该装置结构可检测并修复局部不一致预测,通过四视角循环一致性检索回环,并在全局优化前对候选重访进行几何验证,最终以 Sim(3) 位姿图修正旋转、平移与尺度漂移。在施工场地序列上,其轨迹精度与重建几何均优于前馈基线,代码已开源。
UniPose9D 是一个类别无关的 9D 物体位姿估计统一模型,仅凭实例 mask/ROI 加 RGB-D 或带预测深度的 RGB 图像,即可在无类别标签、CAD 模型、平均形状先验和参考视图的情况下估计旋转、平移与度量尺寸。
VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,保持基础 VLA 模型完全冻结,让剪枝后上下文产生的动作与全上下文教师模型保持一致。在 LIBERO 和真实机器人操作任务上,该方法最多剪掉 87.5% 的视觉 token,计算量降低最多 75%,推理提速 1.5 倍,性能仍具竞争力。代码已开源。
基于 Wan2.2-5B 构建的开放世界-动作模型框架 OpenWAM 发布,通过共享 Mixture-of-Transformers 架构集成动作专家,支持联合、先视频后动作、先动作后视频及解耦四种生成方式。
Sparse2comm 是一个带宽高效且鲁棒的协同 3D 目标检测框架,将不可靠协同视为对退化协同特征的渐进式修复。它通过稀疏特征编码以随机掩码采样的前景特征实现超低带宽通信与丢包恢复,再用延迟感知对齐补偿延迟消息、自校准融合估计残余空间偏移。
研究提出相位速度蒸馏(PVD),将生成过程分为粗、细两个阶段,各用一个半尺寸专家模型建模平均速度,累计计算量仅相当于一次完整骨干前向。
LARK 是一套基于消费级 RGB 硬件与多视角冗余融合的多相机光学跟踪系统,在五相机与自适应卡尔曼滤波下,加工网格上的点定位中位目标配准误差为 0.64 mm,轨迹跟踪为 0.73 mm。相机子集实验显示,可用视角减少时自适应位姿融合精度平缓下降。其跟踪硬件成本低于 1,000 美元,硬件设计与软件已公开,数据集同步开放。
SimCortex v2 是一个从 T1 加权 MRI 同时重建左右脑 WM 与 pial 表面的深度学习框架,在 14 个队列 560 例(13 个训练中未见)上平均对称表面距离 0.253 mm,与最强基线持平。92.14% 的病例未检测到表面间碰撞,自交比例 0.044% 为学习类方法中最低,而所有基线在每个病例中均至少产生一次碰撞。源代码、配置、预训练权重、预处理数据与评测划分已公开。
MoonGS 是首个面向月球场景的前馈式 3D Gaussian Splatting 框架,仅需两张输入图像即可单次前向预测像素对齐的高斯图元,无需逐场景优化。在 LuSNAR 基准和弱纹理 MoonBlender 数据集上,其 PSNR 比 SOTA 前馈 NeRF/3DGS 基线高 +4.9 dB、SSIM 高 +0.29、LPIPS 低 40%,并保持亚秒级推理。代码与数据集已公开。
研究者构建了 Wikidata Search Traces 数据集,包含 10,235 条单实体与多跳问题的求解轨迹,以及生成这些轨迹的递归语言模型(RLM)harness。
研究者发布 TabiBERT,一个基于 ModernBERT 架构、从零预训练的土耳其语单语编码器,训练数据为 1 万亿 token,来自 86.58B token 的多领域语料(网页文本 72%、科学出版物 19%、源代码 6%、数学内容 0.3%),支持 8,192 token 上下文,是现有土耳其语 BERT 模型的 16 倍。
Pleias 发布 Pleias-RAG-350m 和 Pleias-RAG-1B 两款小型推理模型,原生支持引用与字面引文溯源,并整合查询路由、查询改写和来源重排等 RAG 工作流功能。
研究者提出 PPG2Speech,一个基于扩散模型的多说话人音素后验图到语音(PPG-to-Speech)模型,无需文本对齐即可编辑单个音素,用于将母语语音编辑为近似二语(L2)语音。该模型以 Matcha-TTS 的流匹配解码器为骨干,引入无分类器引导(CFG)和 Sway Sampling,并提出音素对齐一致性(PAC)评估指标。在芬兰语约 60 小时数据上验证,代码已开源。
RIPE++ 提出一种仅从正样本对中同时导出奖励与惩罚的强化学习奖励机制,无需构造负样本对即可学习判别性关键点检测器与描述子。该方法将同一 RL 目标扩展至匹配阶段,通过适配 LightGlue 将 MegaDepth1500 上的 AUC@5 从 56.58 提升至 59.65,并支持部分视觉重叠图像对的弱监督全流程训练。在低纹理医学视频序列等相机位姿缺失场景下同样可训练,结果与全监督方法相当。
PyDPF 是一个基于 PyTorch 的可微粒子滤波(DPF)Python 包,用统一 API 实现了多种通过改造重采样步骤实现可微的粒子滤波方法。该框架复现了多项已有研究的实验,并展示 DPF 如何应对状态空间建模中的常见挑战,论文共 46 页,正投稿于 Journal of Statistical Software,代码与文档已公开。
研究者提出 Nucleus Speculative Decoding(NSD),一种将目标模型合理性纳入验证的宽松投机解码方法:草稿 token 满足标准接受规则或落入目标模型 nucleus 即被接受。实验显示 NSD 相比自回归解码吞吐最高提速 5.16×,相比标准投机解码最高提速 3.15×,同时保持有竞争力的任务表现,并带来更长的接受长度。
针对大规模推荐系统中哈希索引的嵌入向量碰撞问题,研究者提出基于线性探测的 Multi-Probe Zero Collision Hash(MPZCH),在合理表规模下可完全消除碰撞。
HARL-A 是一个基于 IsaacLab 构建的开源异构多智能体对抗强化学习基准框架,支持任意数量队伍及每队任意机器人形态组合的对抗策略训练与评测。该框架扩展了 HARL 算法库与 IsaacLab,提供模块化架构、Sumo/Soccer/3D Galaga 三个基准环境,以及十余个覆盖同构与异构队伍配置的预训练策略,已公开于 Hugging Face。代码、环境、策略与文档均已开放获取。
Scen-Opt 是一个开源 Python 工具箱,将凸规划与数据样本结合,并提供基于场景理论的统计保证,支持数据驱动的线性、二次与半定规划。它提供基于 Python 的 Web 应用和图形界面,可在线使用或本地安装,支持 CSV、JSON、TXT、TSV、MAT、Excel、NPY、NPZ、Parquet 等文件上传。该工具在多个代表性基准上验证了其数据驱动凸优化的实际效果。
BiGym 2.0 将 BiGym 适配到 Unitree G1,用统一全身控制器覆盖 20 项家务任务,并为每项任务提供 60 条人类 VR 演示,含同步多视角与全身执行记录。
REViT-v2 是一种基于窗口化群卷积自注意力和层级特征架构的可扩展旋转-反射群等变视觉 Transformer,可扩展至数百万参数规模并在 ImageNet 等大尺寸图像数据集上训练。该模型的代码与预训练权重已公开,相关论文被 NeurIPS NeurREPS workshop 2026 接收。
Fiorillo v0.5 是一个开放模型,基于 Qwen3-4B-Base 加低秩适配器和决策头,仅用 2,657 篇训练文章中许可允许复用的 1,431 篇针对 Evidence Inference 2.0 微调,回答干预对结局的显著影响方向并给出概率。
研究者提出 Best-of-N Guidance(BoNG),将 BoN 采样直接融入反向扩散过程,通过去噪粒子间的非对称引导交互,把粒子群导向更高奖励区域。在 36 项对比中 BoNG 有 29 项表现最佳,对 SMC 和 Vanilla BoN 的胜率达 80.56%。该方法支持多输出,ImageReward 分数为最新基于采样的引导方法的 1.3 倍,速度提升 1.6 倍,代码已开源。