跳到正文
今天10月7日周三132 条
  1. arXiv cs.AI29

    研究揭示 LLM 潜在空间偏见方向实际编码的是模型置信度而非公平性

    研究分析激活引导所用去偏见方向的实际编码内容,发现该方向由模型置信度主导,在激活空间中指向高概率到低概率 token 区域,而非编码有意义的偏见表征。沿该方向引导虽能降低偏见指标,但实为降低模型置信度所致:在 QA 基准上模型因此拒绝作答,附带改善了公平性指标。研究指出,将偏见线性表征与模型置信度解耦十分困难,基于引导的去偏见结果需谨慎解读。

  2. arXiv cs.AI24

    SoK:面向青少年的以人为本 AI 安全研究综述

    一项 SoK 研究系统综述了 100 项涉及儿童与青少年接触 AI 的实证 HCI 研究,覆盖学校、家庭、护理和公共服务场景。基于 YAIR 风险分类与 MIT Mitigation Taxonomy,研究发现多数风险仅有提出或构想中的对策,少数被实际部署,经评估者更少,且现有评估多衡量技术性能而非是否真正防止伤害。

  3. arXiv cs.AI22

    从失败中学习:面向 LLM 漏洞分析的失败驱动提示词优化方法

    研究提出失败驱动提示词优化方法 FDPR,通过分析 LLM 在漏洞分析中的反复失败模式来指导提示词改进。团队基于 DVJA 识别出误报、漏报、无依据推理和 CWE 误分类等失败模式,并在 Juliet Test Suite 上评估优化后的提示词,同时进行跨模型验证。结果显示该方法提升了 LLM 漏洞分析的可靠性,并提炼出可复用的提示词设计原则。

  4. arXiv cs.AI22

    MARCO:面向蛋白质生成模型的放射性水印框架

    MARCO 是首个专为蛋白质生成模型(PGM)设计的放射性水印框架,通过辅助编码器-解码器在扩散逆向去噪过程中迭代嵌入水印,原始 PGM 参数保持冻结。它采用针对 C_α 原子对距离和扭转角(ψ, φ)的专用损失函数,并结合对抗训练与随机攻击模拟,以保持生物物理保真度和鲁棒性。水印会自动转移到任何基于水印数据训练的盗版模型输出中,从而有效对抗模型提取攻击。

  5. arXiv cs.AI62

    论文指出 Lean 验证 AI 自动形式化无法保证自然语言证明正确

    arXiv 论文指出,AI 自动形式化把自然语言数学文本翻译成 Lean 后,机械验证通过并不能保证原自然语言论证正确。作者证明,为忠实翻译而消解数学自然语言歧义的问题在可解性复杂度指数(SCI)层级中任意高(SCI = ∞),比包括停机问题(SCI = 1)在内的任何计算问题都更难。

    推荐理由:论文用可计算性层级论证自然语言数学文本的忠实翻译不可判定,并给出 Lean 形式化与原文不符的实例。

  6. arXiv cs.AI22

    针对多语言语音匿名化的声学与内容导向说话人验证攻击研究

    研究评估了声学导向与内容导向攻击者对多语言匿名语音的说话人验证(ASV)效果,发现攻击效果取决于匿名语音的语言可用性。整体上声学导向攻击者表现更好,但当语言信息保留较好时,内容导向与声学导向攻击者的性能差距会缩小。研究还构建了多语言语音转换数据集,可提升性能并部分缩小跨语言差距。

  7. arXiv cs.AI27

    工具说谎时:工具反馈被污染下数学智能体的可靠性

    研究用受控污染框架测试数学智能体能否识别并纠正被篡改的工具调用结果,在 31 道题上对比四种验证设计。无验证时准确率从 100% 骤降至 72.4%,强制同上下文反思可完全恢复至 100%,可选验证仅在模型主动调用时有效。显式检测后完整重启问题在 100% 情况下成功,表明验证器可用性与验证策略是数学智能体可靠性的两个独立组成部分。

  8. arXiv cs.AI24

    AI 辅助决策中的新手依赖校准:解释与自我评估的作用

    一项 110 人参与的临床实体抽取实验发现,在缺乏实时性能反馈时,AI 解释会让新手用户系统性地滑向过度依赖,而自评任务理解度更高者依赖行为更具选择性。研究提出"依赖校准"概念,用于刻画新手用户如何动态调整对 AI 的依赖,并为缺乏性能信号场景下的 AI 工具设计提供可操作建议。

  9. arXiv cs.AI41

    从证据到行动:工具调用智能体为何失败

    研究揭示工具调用智能体在证据到行动链条上的失败模式:在十种模型-框架配置中,静态动作评估能力强,但交互式执行明显偏弱。失败常始于执行前——智能体调查不完整便停止,或在所需证据建立前就行动;一旦证据齐备,单动作执行通常可靠,多动作工作流则暴露未解决的前置条件和执行不完整问题。

  10. arXiv cs.AI41

    SkillPoison:通过成功经验实现渐进式技能投毒

    研究者提出 SkillPoison 框架,通过构造强化目标行为的成功经验、再移除约束该行为适用场景的上下文条件,实现对自进化 LLM 智能体技能库的渐进式投毒。在三个 benchmark 上,该方法攻击成功率达 95.71%,且所有注入经验均保持任务正确、可通过验证与词法检查。代码与数据已公开。

  11. arXiv cs.AI27

    POLAR:用 LLM 合成真实网络威胁证据,辅助漏洞优先级排序与缓解

    POLAR 是一个 LLM 驱动的框架,可将厂商公告、漏洞库和威胁情报中的碎片化证据合成为以威胁为中心的评估。它先拆分重叠事件并将威胁锚定到来源证据,再结合严重性指标与按时间排序的利用信号估算近期被利用概率,并将威胁数据关联到权威修复知识以组织缓解措施。在公开资源收集的真实漏洞证据上,POLAR 在异构事件和零日场景中提升了威胁排序与缓解检索效果。

  12. arXiv cs.AI23

    SAFESHIELD:面向小语言模型部署时安全的决策组织框架

    SAFESHIELD 是面向小语言模型的部署时安全系统,将安全决策组织为准入、路由、证据、放行四类职责,并把已提交决策记录为可审计的 Decision Traces。协调消融实验显示,移除准入门控会显著增加误放行,而放行决策缺少上游证据时准确率从 96.0% 降至 69.5%,表明部署时安全不仅取决于单个护栏能力,也取决于决策如何组织与协调。

  13. arXiv cs.AI42

    通过随机嵌入扰动越狱开放权重 LLM

    研究者提出 Perturbed Embedding Vector(PEV)攻击,仅向提示词的嵌入向量表示中加入独立高斯噪声,即可越狱六种不同规模的常见开放权重 LLM,在 JailbreakBench 上对所有模型、所有提示词均生成不安全回复。PEV 无需梯度计算、逐提示优化或修改模型内部权重,取得首次成功攻击的平均算力成本比此前方法低至多一个数量级,每个测试模型上首次越狱通常在一分钟内出现。

  14. arXiv cs.AI37

    APEX:面向 LLM 智能体的执行边界主动防护

    APEX 是一种针对 LLM 智能体间接提示注入(IPI)的主动防御方案,将防护点从攻击模式识别转移到执行边界,通过执行前编译的授权契约同时实现证据门控预防与欺骗式暴露。在六项基准中,APEX 对 13 个基线取得五项 0% 攻击成功率、第六项 0.56%,并在三类能力单元(Tools、MCP servers、Skills)的自适应攻击下保持 0%。代码已开源。

  15. arXiv cs.AI24

    Transformer 拒绝机制中的组件与维度稀疏性

    研究将 LLM 的拒绝行为引导分解为组件级干预,在四个开源权重模型中发现拒绝方向集中于仅占上游组件 28–48% 的稀疏子集,仍保留 88–101% 的引导效果。在这些机制内部,有效引导进一步集中于约 50% 的残差流维度,保留 85–98% 的组件机制基线效果。团队已开源全部代码与原始实验结果。

  16. arXiv cs.AI22

    对齐中线性奖励的公理可满足性:用最小松弛量满足 PO 与 PMC

    针对线性奖励拟合人类偏好时无法满足 PO 与 PMC 公理的问题,研究者将线性模型放宽为允许每个候选者带有松弛量,求出满足公理且总松弛量最小的松弛线性奖励。当候选数 m 且 margin η 不超过 O(1/m²) 时,最优总松弛量上界为 O(1),并给出紧实例。新方法对每次比较错误的线性部分计费,同时最小化总松弛量与违规数,实验显示其线性奖励优于线性 BTL。

  17. arXiv cs.AI34

    迈向对齐扩展定律:一个框架与首批预注册测量

    研究提出对齐扩展定律框架,将对齐负担建模为 B_r(N)=a_rN^alpha_r,并给出三种负担操作化方式,区分观测、审计与真实对齐。预注册再分析显示,Pythia 分类器把攻击成功率压到 10% 以下所需算力按 N^0.60 增长;Qwen2.5 0.5B-72B 试点中,真实性指数为 -0.05、陈述倾向为 0.48,谄媚与植入后门尚未确定。

  18. arXiv cs.AI27

    zkLLMPoT:面向大语言模型训练的高效零知识证明框架

    zkLLMPoT 是一个零知识框架,通过前向评估而非验证优化轨迹来证明训练后检查点的审计属性,认证成本与训练迭代次数无关。该框架分两阶段:训练方固定架构并提交权重,审计方选择挑战序列后,训练方证明模型在这些序列上的目标值。在四类模型家族上,1.1-1.5B 参数模型证明耗时 41-59 秒,13B 模型为 131 秒,序列长度 512 时验证时间低于半秒。

  19. arXiv cs.AI27

    POLAR:面向工具调用 LLM 智能体的本体引导风险预防框架

    POLAR 是一个面向小型工具调用智能体的护栏框架,通过结构化双层本体评估动作可逆性,为每个动作生成分级可逆性分数,未达阈值的调用会在执行前被剪枝。在 τ²-bench 上对六种智能体模型评测,POLAR 使其中四个模型在 airline 域的平均任务奖励提升 0.11 至 0.18 分,但十八个模型—领域组合中仅八个整体改善,retail 域及更强模型常出现回退。

  20. arXiv cs.AI41

    Llama-3.1-8B-Instruct 研究:财务信息缺失时语言模型用身份替代事实

    一项针对 Llama-3.1-8B-Instruct 的 96,600 条提示词实验显示,当财务信息从 8 项事实减至零时,财务相同但身份不同的两个角色获得的股票配置建议平均差距从 4.78 个百分点升至 10.34 个百分点,比值达 2.16。身份在全披露时仅解释 5% 的配置差异,无披露时升至 96%。无事实时模型还会在理由中引用从未告知的收入、债务和储蓄,且这些虚构财务对大家庭更常转为不利。

  21. arXiv cs.AI38

    研究发现 LLM 存在错觉模式感知,会引发虚假推理

    一项被 NeurIPS 2026 接收的研究首次系统考察了大语言模型(LLM)中的错觉模式感知,发现 LLM 常比人类更易在随机数据中推断出有意义关联。模型倾向于将频繁出现的正面属性过度关联到多数群体或大型组织,并从模糊事件中构建因果叙事。研究基于稀疏自编码器(SAE)的特征可解释性框架,揭示整体频率感知与分析性认知取向与这类错觉的涌现相关。

  22. arXiv cs.AI26

    规则止于何处,裁判始于何处:测量多智能体系统安全中的判断边界

    研究将 LLM 多智能体系统(MAS)的防御组织为五项原则并实现为 DEFER1,包含 28 项检查的级联,能拦截的拦截、其余交给四人评审团。在四个领域的独立测试中,攻击成功率从约 30.0% 降至约 3.0%,78% 被拦截的攻击由确定性检查处理。安全运营领域仅四分之一提案会到达评审团,但风险评分审批门会错误放行多数攻击提案、却只放行少数合法提案。

  23. arXiv cs.AI29

    ProbeGuard:基于医疗 LLM 共识形成过程的认证弃答框架

    ProbeGuard 是一个认证弃答框架,通过追踪共识形成过程而非仅看最终一致性来判断医疗 LLM 是否应弃答。在 MedQA 上,13.4% 的一致投票是错误的,过程信号将正确与错误共识的区分度从随机水平提升至 0.696 AUROC。该认证规则能以 9.0% 的观测选择性风险回答六成一致层问题,积累域内校准数据后可覆盖九成。