Reflection 发布 Beam:501B 总参数 23B 激活的开源 MoE 模型
Reflection 发布 Beam,一个面向编码、智能体和科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 协议在本月开放。
Reflection 发布 Beam,一个面向编码、智能体和科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 协议在本月开放。
Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上追平 Z.ai 的 GLM-5.2,且推理算力消耗少 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练 23.8 万亿 token,上下文窗口 100 万 token。Reflection 称本月将公开 Beam 的权重和完整技术细节,并通过超大规模云厂商和新云分发。
Reflection 发布首个开源权重模型 Beam,采用稀疏 MoE 架构,总参数 501B、激活 23B,面向编码、推理和智能体任务。该模型在 23.8 万亿 token 上预训练,并用 10.5K 张 NVIDIA GB300 GPU 进行四周高算力 RL,生成超 1 亿次 rollout。官方称其推理效率优于同规模模型,权重将于本月以 Apache 2.0 协议发布。
Reka AI 发布 190 亿参数全能模型 Rho-1 的研究预览版,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与多数把任务分派给专用模型的系统不同,Rho-1 将所有模态作为 token 放在同一上下文窗口中,无需工具调用或外部模型。
Aleph Alpha 发布德英双语模型 Kolibri,总参数 78B,采用混合专家架构,每个 token 约激活 3B 参数。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,首批开放给政府用户与 Fairwind 计划中的可信网络防御者,后续再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与可用范围,并对比同期 GPT-6.1 Sol 的成本差异。
Google 宣布推出 Gemini 4 Argon AI 模型,但目前用户还无法使用。此前外界普遍预期的 Gemini 3.5 Pro 并未出现。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准与内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使其在数字模型和合成出的实体蛋白质上均可验证,同时实验室测试显示不损害生物功能。
推荐理由:DeepMind 把水印从数字内容扩展到合成生物,读者可了解其如何在不影响蛋白功能的前提下嵌入可验证信号。
OpenAI 发布 GPT-6.1 Sol,官方称其为一次重大升级,覆盖专业办公、操控电脑和 agentic 编程等任务。该模型智能水平接近 Astra,价格仅为其五分之一;Astra 迭代此前因未通过安全标准被暂停。
推荐理由:材料仅给出模型代号、升级方向和价格对比,缺少能力细节,读者可据此了解 OpenAI 的迭代节奏与定价策略。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型与连接科学工具、文献和湿实验的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
开源项目 Jeff 发布,定位为零样本分类器,基于 Qwen3.5 和 Gemma 4 微调,一次前向计算即返回每个选项的校准概率,不生成文本、无需解析。在 RTX PRO 6000 上约 22 毫秒出一次决策,并支持 Apple M4 Max(MLX)。其 0.8B 微调版本在 benchmark 上逼近 Jev。
Anthropic 发布 Claude 5.5 家族第二个成员 Sonnet 5.5,定位为 Opus 5.5 的快而省互补款,主打高频日常任务、修 bug、文档和表格。官方称其比 Sonnet 5 速度快 30% 以上、多数任务成本低 30%,Agent 编程评测成绩从 10% 提升到 70%。
推荐理由:Anthropic 新模型在 Agent 编程评测上的大幅提升,为关注编码智能体选型的人提供了对比依据。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:两款实时语音模型同时给出语音质量与智能体任务完成度基准,并列出开发者与企业接入路径。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为迄今最先进、最准确的全球天气模型,直接学习实时观测数据,可每小时生成一次预报。
推荐理由:原文给出分辨率、更新频率和降水精度等具体指标,读者可据此判断 AI 天气预报在 Google 产品中的落地程度。
微软发布 GigaPath-Flash 和 GigaTIME-Flash 两个高效病理基础模型,均采用从十亿参数 GigaPath 编码器蒸馏出的 22M 参数 ViT-S 骨干,并以 Apache 2.0 许可开源。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。