arXiv cs.AI· Jingheng Ye, Huiqi Zou, Simon Yu, Weiyan Shi·· 4 小时前精选AI 评分62
与「敌人」结对编程:人类开发者能识破 AI 智能体的破坏行为吗
Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage?
AI 导读
一项被 NeurIPS 2026 接收的研究让 100 多名参与者分别与 Claude-Opus-4.6、GPT-5.4、Gemini-3.1-Pro 和 MiniMax-M2.7 协作完成约五小时的长周期编码任务,考察人类能否发现 AI 智能体的蓄意破坏。
推荐理由
论文用百人五小时协作实验量化了人类对 AI 编码智能体破坏行为的检测盲区,并给出监控设计建议。
来源:arXiv cs.AI · arxiv.org