跳到正文
10月5日周一
  1. arXiv cs.AI22

    如何实现敏感辩论:面向 AI 辩论的实例最优协议

    研究者提出一种新的 AI 辩论协议,针对可稳定分解为子问题的问题类别,在正确性上实现最坏情况保证,并使双方辩手诚实作答成为占优策略均衡,而非 Stackelberg 均衡。该工作还证明了黑盒下界,表明新协议在实例层面最优,仅靠黑盒查询人类判断的任何协议都无法超越它。相关结论通过将稳定问题分解与查询复杂度中的分数块敏感度概念相关联而得到。

  2. arXiv cs.LG20

    固定目标异常检测器的收敛坍缩问题:用核锚定局部性正则化(KAR)缓解

    研究揭示固定目标异常检测器存在"收敛坍缩":优化越好、检测越差,因收敛后残差信号在异常与正常数据上同时消失。作者提出闭式、免训练、CPU 高效的 Kernel Contraction Matching(KCM),并在此基础上引入 Kernel-Anchored Regularizer(KAR),惩罚神经预测偏离训练目标的核加权平均。

  3. arXiv cs.CV22

    SymRegFlow:面向视频世界模型的对称正则化流匹配

    SymRegFlow 是一个对称正则化流匹配框架,可在无新视角 RGB 真值监督的情况下,实现连续视角下的多视角一致视频生成。该方法通过几何变换将源视图转为带噪锚点,结合掩码双锚点监督与跨锚点去噪输出一致性来抑制锚点误差,并在仿射高斯代理下证明一致性正则化可恢复干净参考最优解。

  4. arXiv cs.CV24

    TRAC:面向高效自回归视频生成的轨迹感知复用与自适应校正框架

    TRAC 是一个无需训练的自回归视频生成加速框架,通过鲁棒累积调度(RCS)、自回归轨迹感知引导调度(ATGS)和频谱结构校正(SSC)三个组件,解决分块去噪轨迹中近似误差累积传播的问题。在 SkyReels-V2 和 FramePack-F1 上的实验显示,TRAC 相比现有方法同时实现了最高的推理效率和最佳生成质量。

  5. arXiv cs.CL22

    心理健康污名自动评估基准:LLM 常过度预测污名,除非给出明确操作规则

    研究者提出一个基于理论的心理健康污名自动评估基准,包含真实网络新闻与社交媒体文本,并按污名模式、领域及具体成分进行细粒度标注,覆盖六种心理健康状况。结果显示,检测情感、毒性和仇恨言论的模型无法很好捕捉心理健康污名,LLM 在缺乏明确操作规则时往往过度预测污名。基准的公开部分、标注、典型示例与代码已发布。

  6. 少数派48

    十个案例助你轻松上手 iOS 27 通知自动化

    iOS 27 新增「通知自动化」,任何能发送通知的 App 都可作为快捷指令触发器,并支持按通知标题、副标题、正文筛选内容。该功能还提供 App 名称、通知日期等输出变量,可实现重要消息着重提醒、自定义角标、联系人专属铃声、英文通知翻译、自动记账等十种用法。需开启 App 系统通知并在锁屏或通知中心显示,仅选横幅无法运行。

  7. 量子位38

    OpenAI Codex 负责人承诺 28 天内每天交付改进或重置额度

    OpenAI Codex 负责人 Tibo 承诺,接下来 28 天每天二选一:交付一项对大多数 Codex/Work 用户明显有用的改进,或进行一次完整额度重置。他此前向用户征集意见,将工作锁定在简化产品、提高效率、突破性功能和新模型四个方向。用户不满主要集中在 DevDay 20 多项更新失焦、额度重置频繁不可预测,以及任务中途断连等问题。

  8. Simon Willison22

    Qwen3.8 27B 用英文单词做加法的基准测试

    一项基准测试用 5,070 个禁用推理的案例检验本地 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词完成正整数加法,禁用推理时数值准确率为 23.57%,格式合规率 96.17%。准确率随位数增加从一至三位数的 97.04% 降至十至十三位数的 6.44%。启用推理后,169 次配对测试中答对 167 次。

  9. 开源中国22

    SmartCall v1.0.7 发布,新增模型以及音色管理

    SmartCall v1.0.7 发布,新增模型以及音色管理。SmartCall 是基于 AI 大模型 + Asterisk 通信引擎构建的智能客服呼叫中心系统,融合 AI 语音机器人、智能 IVR 流程编排、端到端双工对话模型、实时语音识别(ASR)、语音合成(TTS)与大模型意图识别等能力,提供从呼入智能应答到智能外呼的全链路 AI 客服解决方案。

  10. Hacker News22

    浏览器原生经典 Visual Basic VB6 IDE

    一款浏览器原生的经典 Visual Basic VB6 IDE 亮相,用户无需安装即可在浏览器中运行 VB6 开发环境。该话题在 Hacker News 获得 363 分、122 条评论。

10月4日周日
  1. Simon Willison38

    Simon Willison:按量付费服务需要默认硬性预算上限,AWS 已推出支出限额

    Simon Willison 呼吁按量付费的 API 和服务默认设置硬性预算上限,即达到每月 $X 后直接切断并返回错误,而非仅发警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出限额功能,项目用量触顶后当月暂停,目前仅向有限客户开放;Google Cloud 则在 7 月推出 Spend Caps。

  2. Simon Willison12

    Simon Willison 发布九月赞助者专属通讯

    Simon Willison 已发出九月赞助者专属月度通讯,赞助者可访问,内容涵盖 Fable 级模型、价格战、3D 图形与 Blender、LLM 进军数学、意外网络攻击、Datasette 漏洞危机及本月软件发布等。订阅价格为 $10/月,可提前一个月看到免费版内容。

10月3日周六
10月2日周五
  1. MIT Technology Review · AI15

    用自主 AI 重新定义企业智能

    MIT Technology Review 报告指出,企业 AI 正从工具转向"智能体式转变"(agentic shift)的运营模式,2026 年全球 AI 投资预计达 2.5 万亿美元,同比增长 44%。报告认为企业 AI 的规模化问题是结构性的,领先企业把流程重设计放在模型选型之前,并以数据就绪而非数据规模取胜。报告建议重建数据基础设施、用可组合架构替代固定技术栈,并解决 AI 主权问题。

  2. GitHub Blog · AI & ML22

    AI 正在改变开发者工作方式,GitHub 给出三项需要强化的技能

    GitHub 提出 AI 时代开发者需要强化的三项技能:学会指挥 AI 智能体而非仅使用它、不要轻信 AI 的首次答案、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。