为什么有人不喜欢 AI 编程:六种常见反对理由解析
文章梳理了反对 AI 编程的六类理由:代码作为艺术、AI 抢走工作、人类沦为"肉代理"、软件工程即规则、AI 公司是坏行为者等。作者逐一反驳,认为雇主付费买的是软件成果而非打字过程,需求会随应用效率提升而增加;马克思 1857-1858 年《机器论片段》已预言脑力劳动被机器取代,夺走工作的不是技术而是生产方式。
文章梳理了反对 AI 编程的六类理由:代码作为艺术、AI 抢走工作、人类沦为"肉代理"、软件工程即规则、AI 公司是坏行为者等。作者逐一反驳,认为雇主付费买的是软件成果而非打字过程,需求会随应用效率提升而增加;马克思 1857-1858 年《机器论片段》已预言脑力劳动被机器取代,夺走工作的不是技术而是生产方式。
开发者吐槽Claude、GPT等模型在Coding场景下输出"15/15全绿""单腿哑火"等黑话,原因是厂商为省Token把思维链压缩成"穴居语",同句话Token消耗比白话文少70%。Opus 5.5语言能力有所回升,Gemini则被网友认为是目前少数还能正常沟通的AI。
AgSpec 是一个面向编码智能体流水线的检索式投机解码框架,从会话、工作区和全局语料中检索,并按智能体输出格式索引已打开文件,同时用离线测得的长度上限约束草稿长度、再根据验证反馈在线调整。
研究者将 Embedded Language Flows(ELF)扩展至数学推理与代码生成,提出 ELF-REG,用冻结的 AR 教师模型监督中间去噪特征并提供与响应联合去噪的全局表示。
研究提出受 ISO/IEC 25010 启发的加权质量指数(QI),综合功能正确性、可维护性、安全性和生成效率评估自动程序修复模型。
研究者提出 A2D,一个免训练框架,可将 AR 模型的后训练权重更新直接复用到扩散语言模型上。AR 与扩散后训练更新在权重空间近乎正交,却能带来更一致的表示变化,组合两者可同时保留双方收益。
FC-SWE 是一种失败条件化强化学习框架,在补丁验证失败后把失败补丁与验证器反馈作为上下文,让智能体在仓库原始状态下生成恢复轨迹。
PBT-Bench 是一个覆盖 40 个真实 Python 库、100 道基于属性测试题的基准,每题注入语义 bug 共 365 个(平均 3.65 个),默认随机输入几乎无法触发。
SWE-Game 基准发布,包含 247 个任务,基于 41 款可执行的 Godot 参考游戏,覆盖 2D 和 3D 的 13 个玩法类别。评测涵盖五种任务类型,Opus5 在全部五类任务中总分最高,但三项构建任务最佳总分均低于 60 分,Brief-to-Game 仅 50.38 分。
FrogNano 是一个 4B 编程智能体,仅通过 RL 在约 1,500 个 SWE 环境上后训练,无需从更大模型蒸馏。其核心是在线任务合成管线,按当前 checkpoint 的可学习前沿生成任务,论文称这对提升性能至关重要。
一项被 NeurIPS 2026 接收的研究让 100 多名参与者分别与 Claude-Opus-4.6、GPT-5.4、Gemini-3.1-Pro 和 MiniMax-M2.7 协作完成约五小时的长周期编码任务,考察人类能否发现 AI 智能体的蓄意破坏。
推荐理由:论文用百人五小时协作实验量化了人类对 AI 编码智能体破坏行为的检测盲区,并给出监控设计建议。
一项案例研究记录了一个由编码智能体构建、由无正式软件工程背景的运营者治理的生产级医疗平台。其工作流演变为人类主导的元智能体系统:一个智能体写代码,其他智能体监督审查,项目规则持续传递经验。运营者发现测试、监控和审查智能体均可能出错,部分监控只测代理指标而非结果,部分审计静默失败,一次自动修复还引发了运营中断。
研究者提出 Dev-Primitives(开发原语),把仓库组件与其常驻 LLM 配对,使其具备自然语言推理、组件间通信和局部自我修改能力,并据此构建 Harness Engineering 框架 HERMES。
研究者推出 CheckerBench,一个由 297 个 CVE 衍生出 300 项任务的可执行基准,覆盖 167 个仓库、85 个 CWE 和五种语言生态,用于评估智能体能否从零完成静态分析检查器开发。
Google 部署了 AI 智能体 FlowAgent,在持续集成系统的提交前外循环流程中自动修复测试失败,集成于内部开发者工具 Critique 和 Cider,采用 ReAct 式生成-验证循环与执行前后弃权过滤器。
研究者推出 ParanoiaEval,首个统一评测编程智能体风险处理能力的基准,基于软件工程风险管理的 Avoidance-Transfer-Mitigation-Acceptance 框架,包含 200 个证据受控的仓库级任务对。在 8 个代表性模型上的实验显示,即便有明确证据,仍有 11.2%-58.7% 的运行出现不必要的风险处理,且更强的任务能力并不保证更恰当的风险处理。
研究提出 Effective-Evidence Self-Distillation(EESD),将执行相关性支持与证据量分开表示,用 Dirichlet 后验生成不确定性惩罚权重用于 KL 锚定的纠错学习。
研究者提出将并行编码智能体的协作问题重构为调度问题,通过预先划分工作范围并按生产者→消费者图排序合并,并构建了 NP-Bench 三臂基准(无协作、反应式检测、主动规划)进行验证。该规划器将干净集成率从 1/9 提升至 9/9,合并冲突从 13 降至 0,在实时破坏性契约变更中干净集成率从 0 升至前沿模型的 1.0、小模型的 0.6。跨会话记忆将重复错误率从 1.00 降至 0.00。
研究提出 Looped Self-Distillation 自演化框架,模型在固定信息预算下反复从自身原始输出学习,无需外部评估或测试筛选。
研究团队提出 GameGo 框架,将简短游戏创意系统化转化为基于行业实践的产品需求文档,并构建了覆盖 2D、2.5D、3D 游戏的 55,060 条开发轨迹数据集 GameGoData 及含 124 个游戏查询的 GameGoBench。基于该数据训练的 GameGoCoder 在游戏开发基准上超越同类基线,性能接近前沿模型。代码、数据集与模型将全部公开。
文章对比了以 Cursor、Windsurf 为代表的图形 IDE 与以 Claude-Code、AGY、Codex 为代表的 CLI 智能体两条 AI 编程路线。
Berthd 发布 Berth,可在用户自己的开发机上运行 Claude Code、Codex 等编码智能体,合上笔记本后任务仍继续执行。用户按 ⌘N 指定需求,Berth 会在所选机器上创建 worktree 并启动智能体,命令与读取折叠成行、编辑以 diff 呈现,Claude 提问可就地回复。
有观点认为,Claude Code 的 suggested message 功能表面上服务于人类开发者,真正的"客户"却是模型本身。该功能会主动向用户推荐下一条消息,讨论聚焦于这一设计究竟在帮谁完成任务。
一位开发者认为 vibecoding 虽然能快速产出原型、带来即时快感,但无法提供手写代码那种硬核成就感、做好一件工作的满足感和学习乐趣。他用多个 AI 辅助项目举例,包括用免费版 Lumo 搭建 Pyronear 野火预警系统、一次性做出 HN 书签工具和 Kobo 数据库迁移助手,称这些项目"有产出"却让他感到多余且不被尊重。
AI 公司 Reflection 发布首个免费开放模型 Beam,面向编码、逻辑推理和智能体任务,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿。
作者以宠物全生命周期管理 App 为例,演示如何用 Claude Code 的 Memory、Rules、Skills、Commands、MCP、SubAgents、Hooks、Headless、Agent SDK、Plugins 十项能力从零搭建项目。
Reflection AI 发布首个开放权重模型 Beam,采用稀疏激活架构,总参数 501B、每 token 激活 23B,在 23.8 万亿 token 上预训练,4 周内完成且 Goodput 达 92.3%。
作者开源了 kshell,一个用 Go 1.23+、Wails v2、React 19 和 Bubbletea 构建的 AI 编程 CLI 统一工作台,自动扫描本机已装工具并汇总其会话、工作区、终端与远程服务器,支持 Windows、macOS、Linux,MIT 协议,当前版本 v0.1.3。
Reflection 发布 Beam,一个面向编码、智能体和科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 协议在本月开放。
一篇观点文章认为,在 LLM 能快速写代码之后,Common Lisp 因读写期、编译期与运行期无实质区分而成为最佳编程语言:其基于镜像的运行方式可即时替换函数、出错时进入调试器而非崩溃,便于 LLM 修复并继续运行。作者称自己用 Common Lisp 写的应用比 Python 版本短约六到七倍,代码更少意味着 token 更少、更易放进 LLM 上下文窗口。
arXiv 论文 AgentLens 将 1,136 条通过轨迹分为 Ideal(20.2%)、Solid(69.1%)和 Lucky(10.7%)三档,Lucky Pass 在八个模型后端间跨度达 46 倍,而 pass rate 排名与过程质量排名全部不一致。
gstack 是一个开源工具集,通过 23 个结构化 AI 角色把 Claude Code 转化为虚拟工程团队,覆盖产品设计到部署的全流程。
Agency Agents 是一个跨平台桌面应用与脚本套件,可将超过 230 个专业化 AI 智能体安装到 Claude Code、Cursor、GitHub Copilot、Gemini CLI 等主流编程工具中。
Wavestone 四位研究者发布 83 页论文《Harness Engineering》,逐行阅读 Claude Code、Codex CLI、Gemini CLI。
MIT 开源的 Windows AI 编程工作台 Termexo 发布 v0.10.10,将终端、任务和部分设置开放为 19 个本地 MCP 工具。新版支持在 Termexo 新启动的 Claude Code、Codex、OpenCode、Grok Build 和 Antigravity 终端中自动添加连接,Agent 可查询工作区和终端。
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。
推荐理由:原文给出 GLM 5.3 在 Bedrock 上的接入方式与提示词缓存用法,可据此评估自建推理与托管调用的取舍。
Graphical UI 发布,一套面向编码智能体的设计语言,包含颜色、字体、间距、图标、动效等主题资源,以及基于 Base UI 的 React 组件。它通过 shadcn 安装或直接下载,并提供 GUI.md 主题参考和技能文件,让智能体将主题应用到现有界面并指导新界面开发。产品为一次性买断,含主题构建器和基础组件,可在无限项目中使用。
Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上追平 Z.ai 的 GLM-5.2,且推理算力消耗少 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练 23.8 万亿 token,上下文窗口 100 万 token。Reflection 称本月将公开 Beam 的权重和完整技术细节,并通过超大规模云厂商和新云分发。
Reflection 发布首个开源权重模型 Beam,采用稀疏 MoE 架构,总参数 501B、激活 23B,面向编码、推理和智能体任务。该模型在 23.8 万亿 token 上预训练,并用 10.5K 张 NVIDIA GB300 GPU 进行四周高算力 RL,生成超 1 亿次 rollout。官方称其推理效率优于同规模模型,权重将于本月以 Apache 2.0 协议发布。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Sonnet 5 已上线 AWS GovCloud (US) 区域的 Amazon Bedrock。