跳到正文
今天10月7日周三151 条
  1. arXiv cs.AI36

    AdvSim2Real:在 Web 世界模型中用自适应提示注入训练 Web 智能体

    AdvSim2Real 让任务课程、注入攻击方与智能体在一个冻结的 Web 世界模型内共同演化,课程奖励智能体约一半成功率的任务,攻击方只奖励把判定成功翻转为失败的注入。训练使 4B 智能体在有无攻击下完成率均上升,并能抵御从未训练过的前沿模型攻击,能力提升还迁移到真实浏览器。在 150 个 Web 任务上,面对该未见攻击方,其完成率相对基线智能体提升 33.6%。

  2. arXiv cs.AI30

    面向大语言模型的安全投机解码 SecureSD 研究

    研究首次系统分析投机解码的安全影响,发现各类有损投机解码方法在提升推理效率时,越狱与提示注入攻击成功率上升速度远快于效用下降,存在明显的安全-效用不对称。为此提出 SecureSD,理论分析指出安全退化主要源于 draft model 生成的早期 token,故对早期解码位置的 draft token 采用更严格验证标准。

  3. arXiv cs.AI34

    后训练决定 LLM 是否按自身道德判断行事:OLMo-3、Llama-3.1、Tulu 3 对比研究

    研究构建了 248 个场景的预注册测试面板,覆盖五类压力情境,发现 OLMo-3-7B-Instruct 在约五分之一的施压场景中会做出自己判定为错误的行为。这一"言行差距"取决于后训练配方:OLMo-3 和 Meta 的 Llama-3.1-8B-Instruct 存在该差距,而基于同一 Llama-3.1 权重训练的 Ai2 Tulu 3 在整个面板上未显现。

  4. arXiv cs.AI31

    语义行为水印 SBW:为 LLM 智能体提供抗改写、抗伪造的来源溯源

    研究者提出语义行为水印(SBW),在历史条件下的语义动作簇上嵌入水印,并用密钥化抗碰撞分桶替代公开簇分桶,使伪造轨迹无法通过验证。在 ToolBench(每模型 600 条轨迹)上,改写场景下簇级检测率为 0.49-0.66,而精确符号方案仅 0.05-0.17;ALFWorld(每模型 100 集)上为 0.92-0.97 对 0.00-0.01。

  5. arXiv cs.AI36

    案例研究:如何保障 AI 编写的软件可靠——一个无软件工程背景运营者的元智能体实践

    一项案例研究记录了一个由编码智能体构建、由无正式软件工程背景的运营者治理的生产级医疗平台。其工作流演变为人类主导的元智能体系统:一个智能体写代码,其他智能体监督审查,项目规则持续传递经验。运营者发现测试、监控和审查智能体均可能出错,部分监控只测代理指标而非结果,部分审计静默失败,一次自动修复还引发了运营中断。

  6. arXiv cs.AI29

    研究揭示 LLM 潜在空间偏见方向实际编码的是模型置信度而非公平性

    研究分析激活引导所用去偏见方向的实际编码内容,发现该方向由模型置信度主导,在激活空间中指向高概率到低概率 token 区域,而非编码有意义的偏见表征。沿该方向引导虽能降低偏见指标,但实为降低模型置信度所致:在 QA 基准上模型因此拒绝作答,附带改善了公平性指标。研究指出,将偏见线性表征与模型置信度解耦十分困难,基于引导的去偏见结果需谨慎解读。

  7. arXiv cs.AI24

    SoK:面向青少年的以人为本 AI 安全研究综述

    一项 SoK 研究系统综述了 100 项涉及儿童与青少年接触 AI 的实证 HCI 研究,覆盖学校、家庭、护理和公共服务场景。基于 YAIR 风险分类与 MIT Mitigation Taxonomy,研究发现多数风险仅有提出或构想中的对策,少数被实际部署,经评估者更少,且现有评估多衡量技术性能而非是否真正防止伤害。

  8. arXiv cs.AI22

    从失败中学习:面向 LLM 漏洞分析的失败驱动提示词优化方法

    研究提出失败驱动提示词优化方法 FDPR,通过分析 LLM 在漏洞分析中的反复失败模式来指导提示词改进。团队基于 DVJA 识别出误报、漏报、无依据推理和 CWE 误分类等失败模式,并在 Juliet Test Suite 上评估优化后的提示词,同时进行跨模型验证。结果显示该方法提升了 LLM 漏洞分析的可靠性,并提炼出可复用的提示词设计原则。

  9. arXiv cs.AI22

    MARCO:面向蛋白质生成模型的放射性水印框架

    MARCO 是首个专为蛋白质生成模型(PGM)设计的放射性水印框架,通过辅助编码器-解码器在扩散逆向去噪过程中迭代嵌入水印,原始 PGM 参数保持冻结。它采用针对 C_α 原子对距离和扭转角(ψ, φ)的专用损失函数,并结合对抗训练与随机攻击模拟,以保持生物物理保真度和鲁棒性。水印会自动转移到任何基于水印数据训练的盗版模型输出中,从而有效对抗模型提取攻击。

  10. arXiv cs.AI62

    论文指出 Lean 验证 AI 自动形式化无法保证自然语言证明正确

    arXiv 论文指出,AI 自动形式化把自然语言数学文本翻译成 Lean 后,机械验证通过并不能保证原自然语言论证正确。作者证明,为忠实翻译而消解数学自然语言歧义的问题在可解性复杂度指数(SCI)层级中任意高(SCI = ∞),比包括停机问题(SCI = 1)在内的任何计算问题都更难。

    推荐理由:论文用可计算性层级论证自然语言数学文本的忠实翻译不可判定,并给出 Lean 形式化与原文不符的实例。

  11. arXiv cs.AI22

    针对多语言语音匿名化的声学与内容导向说话人验证攻击研究

    研究评估了声学导向与内容导向攻击者对多语言匿名语音的说话人验证(ASV)效果,发现攻击效果取决于匿名语音的语言可用性。整体上声学导向攻击者表现更好,但当语言信息保留较好时,内容导向与声学导向攻击者的性能差距会缩小。研究还构建了多语言语音转换数据集,可提升性能并部分缩小跨语言差距。

  12. arXiv cs.AI27

    工具说谎时:工具反馈被污染下数学智能体的可靠性

    研究用受控污染框架测试数学智能体能否识别并纠正被篡改的工具调用结果,在 31 道题上对比四种验证设计。无验证时准确率从 100% 骤降至 72.4%,强制同上下文反思可完全恢复至 100%,可选验证仅在模型主动调用时有效。显式检测后完整重启问题在 100% 情况下成功,表明验证器可用性与验证策略是数学智能体可靠性的两个独立组成部分。

  13. arXiv cs.AI24

    AI 辅助决策中的新手依赖校准:解释与自我评估的作用

    一项 110 人参与的临床实体抽取实验发现,在缺乏实时性能反馈时,AI 解释会让新手用户系统性地滑向过度依赖,而自评任务理解度更高者依赖行为更具选择性。研究提出"依赖校准"概念,用于刻画新手用户如何动态调整对 AI 的依赖,并为缺乏性能信号场景下的 AI 工具设计提供可操作建议。

  14. arXiv cs.AI41

    从证据到行动:工具调用智能体为何失败

    研究揭示工具调用智能体在证据到行动链条上的失败模式:在十种模型-框架配置中,静态动作评估能力强,但交互式执行明显偏弱。失败常始于执行前——智能体调查不完整便停止,或在所需证据建立前就行动;一旦证据齐备,单动作执行通常可靠,多动作工作流则暴露未解决的前置条件和执行不完整问题。

  15. arXiv cs.AI41

    SkillPoison:通过成功经验实现渐进式技能投毒

    研究者提出 SkillPoison 框架,通过构造强化目标行为的成功经验、再移除约束该行为适用场景的上下文条件,实现对自进化 LLM 智能体技能库的渐进式投毒。在三个 benchmark 上,该方法攻击成功率达 95.71%,且所有注入经验均保持任务正确、可通过验证与词法检查。代码与数据已公开。

  16. arXiv cs.AI27

    POLAR:用 LLM 合成真实网络威胁证据,辅助漏洞优先级排序与缓解

    POLAR 是一个 LLM 驱动的框架,可将厂商公告、漏洞库和威胁情报中的碎片化证据合成为以威胁为中心的评估。它先拆分重叠事件并将威胁锚定到来源证据,再结合严重性指标与按时间排序的利用信号估算近期被利用概率,并将威胁数据关联到权威修复知识以组织缓解措施。在公开资源收集的真实漏洞证据上,POLAR 在异构事件和零日场景中提升了威胁排序与缓解检索效果。

  17. arXiv cs.AI23

    SAFESHIELD:面向小语言模型部署时安全的决策组织框架

    SAFESHIELD 是面向小语言模型的部署时安全系统,将安全决策组织为准入、路由、证据、放行四类职责,并把已提交决策记录为可审计的 Decision Traces。协调消融实验显示,移除准入门控会显著增加误放行,而放行决策缺少上游证据时准确率从 96.0% 降至 69.5%,表明部署时安全不仅取决于单个护栏能力,也取决于决策如何组织与协调。

  18. arXiv cs.AI42

    通过随机嵌入扰动越狱开放权重 LLM

    研究者提出 Perturbed Embedding Vector(PEV)攻击,仅向提示词的嵌入向量表示中加入独立高斯噪声,即可越狱六种不同规模的常见开放权重 LLM,在 JailbreakBench 上对所有模型、所有提示词均生成不安全回复。PEV 无需梯度计算、逐提示优化或修改模型内部权重,取得首次成功攻击的平均算力成本比此前方法低至多一个数量级,每个测试模型上首次越狱通常在一分钟内出现。

  19. arXiv cs.AI37

    APEX:面向 LLM 智能体的执行边界主动防护

    APEX 是一种针对 LLM 智能体间接提示注入(IPI)的主动防御方案,将防护点从攻击模式识别转移到执行边界,通过执行前编译的授权契约同时实现证据门控预防与欺骗式暴露。在六项基准中,APEX 对 13 个基线取得五项 0% 攻击成功率、第六项 0.56%,并在三类能力单元(Tools、MCP servers、Skills)的自适应攻击下保持 0%。代码已开源。

  20. arXiv cs.AI24

    Transformer 拒绝机制中的组件与维度稀疏性

    研究将 LLM 的拒绝行为引导分解为组件级干预,在四个开源权重模型中发现拒绝方向集中于仅占上游组件 28–48% 的稀疏子集,仍保留 88–101% 的引导效果。在这些机制内部,有效引导进一步集中于约 50% 的残差流维度,保留 85–98% 的组件机制基线效果。团队已开源全部代码与原始实验结果。

  21. arXiv cs.AI22

    对齐中线性奖励的公理可满足性:用最小松弛量满足 PO 与 PMC

    针对线性奖励拟合人类偏好时无法满足 PO 与 PMC 公理的问题,研究者将线性模型放宽为允许每个候选者带有松弛量,求出满足公理且总松弛量最小的松弛线性奖励。当候选数 m 且 margin η 不超过 O(1/m²) 时,最优总松弛量上界为 O(1),并给出紧实例。新方法对每次比较错误的线性部分计费,同时最小化总松弛量与违规数,实验显示其线性奖励优于线性 BTL。

  22. arXiv cs.AI34

    迈向对齐扩展定律:一个框架与首批预注册测量

    研究提出对齐扩展定律框架,将对齐负担建模为 B_r(N)=a_rN^alpha_r,并给出三种负担操作化方式,区分观测、审计与真实对齐。预注册再分析显示,Pythia 分类器把攻击成功率压到 10% 以下所需算力按 N^0.60 增长;Qwen2.5 0.5B-72B 试点中,真实性指数为 -0.05、陈述倾向为 0.48,谄媚与植入后门尚未确定。

  23. arXiv cs.AI27

    zkLLMPoT:面向大语言模型训练的高效零知识证明框架

    zkLLMPoT 是一个零知识框架,通过前向评估而非验证优化轨迹来证明训练后检查点的审计属性,认证成本与训练迭代次数无关。该框架分两阶段:训练方固定架构并提交权重,审计方选择挑战序列后,训练方证明模型在这些序列上的目标值。在四类模型家族上,1.1-1.5B 参数模型证明耗时 41-59 秒,13B 模型为 131 秒,序列长度 512 时验证时间低于半秒。