为什么 Common Lisp 如今是最佳编程语言
一篇观点文章认为,在 LLM 能快速写代码之后,Common Lisp 因读写期、编译期与运行期无实质区分而成为最佳编程语言:其基于镜像的运行方式可即时替换函数、出错时进入调试器而非崩溃,便于 LLM 修复并继续运行。作者称自己用 Common Lisp 写的应用比 Python 版本短约六到七倍,代码更少意味着 token 更少、更易放进 LLM 上下文窗口。
一篇观点文章认为,在 LLM 能快速写代码之后,Common Lisp 因读写期、编译期与运行期无实质区分而成为最佳编程语言:其基于镜像的运行方式可即时替换函数、出错时进入调试器而非崩溃,便于 LLM 修复并继续运行。作者称自己用 Common Lisp 写的应用比 Python 版本短约六到七倍,代码更少意味着 token 更少、更易放进 LLM 上下文窗口。
arXiv 论文 AgentLens 将 1,136 条通过轨迹分为 Ideal(20.2%)、Solid(69.1%)和 Lucky(10.7%)三档,Lucky Pass 在八个模型后端间跨度达 46 倍,而 pass rate 排名与过程质量排名全部不一致。
gstack 是一个开源工具集,通过 23 个结构化 AI 角色把 Claude Code 转化为虚拟工程团队,覆盖产品设计到部署的全流程。
Agency Agents 是一个跨平台桌面应用与脚本套件,可将超过 230 个专业化 AI 智能体安装到 Claude Code、Cursor、GitHub Copilot、Gemini CLI 等主流编程工具中。
Wavestone 四位研究者发布 83 页论文《Harness Engineering》,逐行阅读 Claude Code、Codex CLI、Gemini CLI。
MIT 开源的 Windows AI 编程工作台 Termexo 发布 v0.10.10,将终端、任务和部分设置开放为 19 个本地 MCP 工具。新版支持在 Termexo 新启动的 Claude Code、Codex、OpenCode、Grok Build 和 Antigravity 终端中自动添加连接,Agent 可查询工作区和终端。
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。
推荐理由:原文给出 GLM 5.3 在 Bedrock 上的接入方式与提示词缓存用法,可据此评估自建推理与托管调用的取舍。
Graphical UI 发布,一套面向编码智能体的设计语言,包含颜色、字体、间距、图标、动效等主题资源,以及基于 Base UI 的 React 组件。它通过 shadcn 安装或直接下载,并提供 GUI.md 主题参考和技能文件,让智能体将主题应用到现有界面并指导新界面开发。产品为一次性买断,含主题构建器和基础组件,可在无限项目中使用。
Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上追平 Z.ai 的 GLM-5.2,且推理算力消耗少 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练 23.8 万亿 token,上下文窗口 100 万 token。Reflection 称本月将公开 Beam 的权重和完整技术细节,并通过超大规模云厂商和新云分发。
Reflection 发布首个开源权重模型 Beam,采用稀疏 MoE 架构,总参数 501B、激活 23B,面向编码、推理和智能体任务。该模型在 23.8 万亿 token 上预训练,并用 10.5K 张 NVIDIA GB300 GPU 进行四周高算力 RL,生成超 1 亿次 rollout。官方称其推理效率优于同规模模型,权重将于本月以 Apache 2.0 协议发布。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Sonnet 5 已上线 AWS GovCloud (US) 区域的 Amazon Bedrock。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线,可对比不同审查系统并提交自己的智能体。基准基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言的 219 个公开 PR,采用多来源 golden set 与统一评分标准,发布前由资深工程师独立复核,与基准判定一致率 96.6%。
推荐理由:GitHub 公开了代码审查基准的构建方法与离线到线上的验证数据,可据此判断评测信号是否可信。
作者用 Claude Code 的多代理工作流(模型 Opus 5.5),仅凭一段未修改的需求、不使用任何外部素材,做出了浏览器端第三人称 3D 动作解谜游戏《云海神殿》,含五个章节和一个 Boss。
开发者发布小说转漫画 skill(github.com/aiskyhub/no…),为 Codex 安排从读原文、写分镜到排版导出的完整制作顺序,并让程序按字体排入审过的对白、由生图模型专责画面,避免重绘改字。
michael-denyer 的 pstack-claude 项目将 Lauren Tan 在 Cursor 上构建的技能栈移植到 Claude Code、Codex、Pi 等代理框架,通过基础原语翻译机制保持跨框架语义一致。
gstack 是 Garry Tan 发布的开源项目,将 Claude Code、OpenAI Codex 等模型能力封装为 23 个专家角色,通过 8 个核心命令覆盖从产品构思、架构设计、代码生成到测试部署的端到端流程。
掘金「deepseek实战」第 28 期用造物台四轮对话、约 186 积分做出倒计时看板,可同屏盯多个事件,每个事件一个环形进度并按秒刷新,支持按天/按小时全局切换。
研究者提出 Sigma,首个大规模(3B/8B)连续扩散语言模型,基于可操控的低维 ODE/SDE 潜轨迹,按块通过似然优化训练,并利用自回归模型预训练权重热启动。
研究者提出生成式测试驱动开发(GTDD),由独立的测试智能体在每次候选实现固定后,依据人类指定的行为契约与历史反馈生成新输入,可信评估器校验并返回精简反例供回归测试。在有状态键值存储的配对实验中,开发过程中重新生成测试的策略平均失败率低于仅用同一语言模型一次性生成测试的策略,而向测试方提供候选源码未带来可检测的额外提升。
TypeSafe 联合创始人兼 CEO Diogo Almeida 在 Latent Space 访谈中回应 Jev 估值 100 亿美元,并称其日处理量已突破一万亿 token。
GitHub 提出 AI 时代开发者需要强化的三项技能:学会指挥 AI 智能体而非仅使用它、不要轻信 AI 的首次答案、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。
Airbnb CTO Ahmad Al-Dahle 接受 Latent Space 采访,介绍其把 Airbnb 改造成 AI-native 公司的做法:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍。
Chatham Financial 借助 OpenAI 的 Codex 和 GPT-5.6 构建技术并重构工作流,将交易验证时间从 30 分钟缩短到 4 分钟以内。这家资本市场咨询公司借此扩展其资本市场专业能力。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准与内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
OpenAI 发布 GPT-6.1 Sol,官方称其为一次重大升级,覆盖专业办公、操控电脑和 agentic 编程等任务。该模型智能水平接近 Astra,价格仅为其五分之一;Astra 迭代此前因未通过安全标准被暂停。
推荐理由:材料仅给出模型代号、升级方向和价格对比,缺少能力细节,读者可据此了解 OpenAI 的迭代节奏与定价策略。
Codeaha v1.0.0 正式发布,这是一款本地优先、对国产大模型友好的 AI 编程 Agent。其会话、消息与代码变更全部落盘本地 SQLite,代码数据不出本机;技术栈基于 GoFrame、Eino、mark3labs/mcp-go 与纯 Go 无 CGO 的 glebarez/go-sqlite 构建,推理由 Eino Graph 驱动。
Anthropic 发布 Claude 5.5 家族第二个成员 Sonnet 5.5,定位为 Opus 5.5 的快而省互补款,主打高频日常任务、修 bug、文档和表格。官方称其比 Sonnet 5 速度快 30% 以上、多数任务成本低 30%,Agent 编程评测成绩从 10% 提升到 70%。
推荐理由:Anthropic 新模型在 Agent 编程评测上的大幅提升,为关注编码智能体选型的人提供了对比依据。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者为智能体提供连接工具和数据的标准接口;RAG 也并未消亡,它让模型基于训练数据之外的信息作答,减少 token 浪费并降低答案不完整的概率。
Shopify 宣布放弃 React Native,改用 Swift 和 Kotlin 开发移动客户端,而六年前它曾高调从原生语言转向 React Native。周刊认为,AI 让语言翻译不再成为障碍,React Native 这类中间层正走向退出历史舞台。本期还提到联合国投票决定废除墨卡托投影,建议改用平等地球投影法绘制世界地图。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 pull request 增量合入 main,而非一次性切换。
推荐理由:作者以亲历者身份给出把 80 万行运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。