Spring AI Alibaba 被传停更,Java AI 框架正在分层
Spring AI Alibaba 上一个正式版 v1.1.2.2 发布于 2026 年 3 月 10 日,此后半年无新正式版,但 main 分支仍在提交,v1.1.2.2 后累计合入 137 个提交,以修复和测试为主。
Spring AI Alibaba 上一个正式版 v1.1.2.2 发布于 2026 年 3 月 10 日,此后半年无新正式版,但 main 分支仍在提交,v1.1.2.2 后累计合入 137 个提交,以修复和测试为主。
文章梳理了 2026 年 AI 工程圈新词 Harness Engineering(驾驭工程),其核心公式为 Agent = Model + Harness,即模型之外的系统提示词、工具调用、沙箱环境、编排逻辑、记忆机制与反馈回路等一切。
文章对比了以 Cursor、Windsurf 为代表的图形 IDE 与以 Claude-Code、AGY、Codex 为代表的 CLI 智能体两条 AI 编程路线。
EmbeddingGemma 2 采用 Apache 2.0 开源许可,Simon Willison 认为嵌入模型不应使用闭源、专有、仅托管的形式。嵌入模型应用通常需计算并存储数千乃至数百万条嵌入向量,一旦厂商停供该模型,用户仍需为重新计算这些已存向量付费。他本人不愿自行托管模型,更愿付费使用托管服务,同时保留在厂商停供时自行运行开放权重版本或另寻供应商的余地。
当工厂里机器人从几十台增至几百台,生产能力并不会自动翻倍,核心问题从"单台机器人能做什么"变成"如何把分散能力组织成整体"。文章提出AI负责理解与判断、系统负责组织与调度、机器人负责落地执行,三者连接才构成完整的机器生产能力,系统让机器人围绕同一生产目标形成可运行的整体。
Simon Willison 呼吁按量付费的 API 和服务默认设置硬性预算上限,即达到每月 $X 后直接切断并返回错误,而非仅发警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出限额功能,项目用量触顶后当月暂停,目前仅向有限客户开放;Google Cloud 则在 7 月推出 Spend Caps。
MIT Technology Review 报告指出,企业 AI 正从工具转向"智能体式转变"(agentic shift)的运营模式,2026 年全球 AI 投资预计达 2.5 万亿美元,同比增长 44%。报告认为企业 AI 的规模化问题是结构性的,领先企业把流程重设计放在模型选型之前,并以数据就绪而非数据规模取胜。报告建议重建数据基础设施、用可组合架构替代固定技术栈,并解决 AI 主权问题。
NVIDIA 提出 AI 工厂投资回报取决于三个因素:每兆瓦产出能力、硬件使用寿命和 token 需求。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本低至 45 倍。
HPE 提出,当 AI 从试验走向生产、形成客服与 IT 等智能体驱动的常态化负载后,企业需重新权衡按 token 消费与自建算力的经济性。Deloitte 2026 企业 AI 状态报告显示,2025 年员工 AI 使用率上升 5%,至少 40% 的 AI 项目进入生产的公司比例预计六个月内翻倍。HPE 建议企业按实际负载测算自有算力的盈亏平衡点,并通过采用、治理与用例扩展保持产能利用率。
GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间、中位数约 50x。UC Berkeley 的 Aditya G. Parameswaran 等人提出近零推理成本下的三大数据系统挑战:为智能体设计的数据系统、运行智能体集群的数据系统、由智能体合成并需可验证的数据系统。
伯克利 AI Research 发布综述,梳理并行推理从固定结构走向自适应控制的研究进展,即让推理模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。