跳到正文
10月5日周一
  1. arXiv cs.LG27

    PowerBench:衡量语言模型在权力转移请求中的偏见

    研究者推出 PowerBench,用于评估语言模型在权力转移请求中的偏见,区分自我赋权、去权和夺权三类请求,并设置不涉及权力转移的拒绝诱导请求作为对照。该基准开源了覆盖不同权力领域、情境、受影响方规模和用户原有权力地位的数据集,在三种实验条件下评测了 24 个模型(12 个来自美国、12 个来自中国开发者)。

  2. arXiv cs.CL37

    研究揭示大模型"审计缺口":事实回答正确不等于下游决策正确

    一项针对8个模型的研究发现,在剂量1000的虚假文档训练下,模型直接注入选择率高达95.8%–100%,但决策任务中的注入选择仅比真实对照训练高出1.7–14.4个百分点,形成"审计缺口"。在2019–20澳大利亚山火虚假帖文案例中,模型即使未复现被夸大的数字,仍会断言有人因纵火被捕。研究表明,正确的事实回答不能保证正确的决策,纠正事实也无法消除误导性叙事。

  3. arXiv cs.AI22

    HXAI:分布式能源系统中的分层隐私保护可解释 AI 框架

    研究者提出 HXAI,一个在分布式能源系统中兼顾隐私与可解释性的分层框架,由本地模型在安全环境内生成细粒度解释、区域模型聚合解释以支持电网级分析两部分组成。该框架通过灵活的隐私预算管理限制重复查询下的累积隐私暴露,在模拟和真实能源数据集上实现了区域负载管理的有用洞察,同时家电级用电数据始终保留在本地、不传输给电网运营商。

  4. arXiv cs.AI22

    研究:英国医护人员对机器翻译风险认知不足,Google Translate 翻译医学缩写成隐患

    英国医护人员常依赖 Google Translate 与患者沟通,但一项针对 21 名不同岗位医护人员的访谈研究显示,他们对机器翻译在医疗场景中的风险认知有限。研究以医学缩写为用例,将临床语料库中的法语和西班牙语数据经 Google Translate 翻译后展示给受访者,发现此类高风险翻译可能危及患者安全。

  5. arXiv stat.ML13

    高维渐近理论与隐私迁移学习的数据集选择

    研究提出一种基于高维回归与加权岭估计器的数据集选择方法,仅依赖汇总统计量即可判断外部数据能否改善预测,并给出在标签或特征与标签联合上的ρ-零集中差分隐私保证。其核心技术贡献是测试误差的确定性等价,刻画了样本量、协方差结构、模型偏移、正则化与隐私噪声之间的交互,可在不访问数据本身的情况下优化超参数并判断私有外部数据集是否有用。

  6. arXiv cs.AI22

    如何实现敏感辩论:面向 AI 辩论的实例最优协议

    研究者提出一种新的 AI 辩论协议,针对可稳定分解为子问题的问题类别,在正确性上实现最坏情况保证,并使双方辩手诚实作答成为占优策略均衡,而非 Stackelberg 均衡。该工作还证明了黑盒下界,表明新协议在实例层面最优,仅靠黑盒查询人类判断的任何协议都无法超越它。相关结论通过将稳定问题分解与查询复杂度中的分数块敏感度概念相关联而得到。

  7. arXiv cs.CL22

    心理健康污名自动评估基准:LLM 常过度预测污名,除非给出明确操作规则

    研究者提出一个基于理论的心理健康污名自动评估基准,包含真实网络新闻与社交媒体文本,并按污名模式、领域及具体成分进行细粒度标注,覆盖六种心理健康状况。结果显示,检测情感、毒性和仇恨言论的模型无法很好捕捉心理健康污名,LLM 在缺乏明确操作规则时往往过度预测污名。基准的公开部分、标注、典型示例与代码已发布。

9月30日周三
  1. 开源中国78

    Anthropic 红队评估 GLM-5.3:攻击能力追平 Mythos,拒绝护栏缺失

    Anthropic 前沿红队评估智谱 GLM-5.3,认为它是首个能像五个月前 Claude Mythos Preview 那样自主构建端到端漏洞利用、却几乎未设拒绝护栏就放出的模型。五个月前 Anthropic 发布 Claude Mythos Preview 时,曾称其是首个能自主构建复杂端到端漏洞利用的 AI 模型。

    推荐理由:Anthropic 红队对 GLM-5.3 的评估显示其攻击能力接近 Claude Mythos Preview,但护栏缺失,可对照两份模型的安全策略差异。