BluffJAX:JAX 中的对抗性不完美信息博弈开源套件
BluffJAX 是一个基于 JAX 的开源对抗性不完美信息博弈套件,包含 Texas Hold'Em Poker、Kuhn Poker 等经典基准,以及此前未被强化学习研究过的 Bluff、Stud Poker 和 Kemps。其在单 GPU 和多 GPU 设置下实现每秒数亿样本的吞吐量扩展,并提供了强化学习、树搜索和博弈求解算法的基线结果。
BluffJAX 是一个基于 JAX 的开源对抗性不完美信息博弈套件,包含 Texas Hold'Em Poker、Kuhn Poker 等经典基准,以及此前未被强化学习研究过的 Bluff、Stud Poker 和 Kemps。其在单 GPU 和多 GPU 设置下实现每秒数亿样本的吞吐量扩展,并提供了强化学习、树搜索和博弈求解算法的基线结果。
研究评估了一种"先探索后提交"协议:由大语言模型提出假设、程序化规划器采集测量数据,再用新提示词从固定观测中合成最终定律。
研究者推出 BioStudyBench,用 25 个长周期分析任务评估 AI 智能体能否仅凭公开数据复现 2026 年 7 至 9 月发表的生物医学研究结论,这些研究均晚于被测模型的知识截止时间。
研究提出 LSC-DPO,从损失几何视角将 DPO 损失中的 sigmoid 因子视为刻画目标局部敏感度的学习信号,并动态将其调节至目标区间。在 AlpacaEval 2、MT-Bench 和 Anthropic-HH 上,LSC-DPO 持续优于 DPO 及强偏好优化基线。研究还发现不同系数初始化会产生不同的瞬态学习信号轨迹,据此推导出信号预算补偿规则,显著降低跨初始化的性能波动。
研究提出"个人智能体中介推荐"范式:平台推荐器用本地信息排序候选集,个人 LLM 智能体借助用户授权的跨平台历史对排序进行中介,生成最终 top-K 列表。为此推出 MediateRec 基准,并给出 Personal Attribution Mediation Optimization(PAMO)训练方法,通过反事实遮蔽跨平台历史来估计个人中介支持度。
一项基于3D Mitochondria Shape Library光学显微镜数据的实证研究显示,占用体积比参考网格体积平均高3.665%,尽管组内相关系数达0.994。
研究提出交错参与(SP)下的多智能体强化学习设定,即部分智能体先行动并留下对后续智能体有用的信息,形成跨时间、跨智能体的学习依赖。为此提出训练期增强方法 SPL,通过前瞻性获取监督训练早期智能体、以结果监督训练后续接收方。在 60 组 MPE/RWARE 骨干设置对比中,SPL 每次任务完成度均更高,平均提升 14.1%,并扩展至八智能体团队和 Isaac Lab 的 UAV-UGV 环境。
RouteFlow 将可合成分子设计重构为在连续合成路线隐空间中的搜索,每个隐向量可映射回完整合成路线,从本质上保证可合成性。该框架采用奖励引导的流匹配作为采样器,并引入循环一致性机制稳定微调,防止优化偏离真实合成路线流形。在 Therapeutic Data Commons 的 16 项优化任务中,RouteFlow 在可合成性感知基线中取得最佳样本效率、最高合成可及性与最高逆合成成功率。
研究团队提出 GroundAct,将物理实体作为 grounding 单元,用轻量 reference token 保持每个被选实体的连续状态可被符号推理寻址,仅由被引用实体与演化方案的交互来修正规划,形成从推理依据到规划动作的显式路径。GroundAct 在开环与闭环评测中均表现良好,覆盖正常、分布外与安全关键场景,闭环结果进一步验证了仿真驾驶能力。
研究考察了 11 个不同模型家族与参数规模的 LLM 在信息价值判断上的差异,并构建受控 elicitation 模拟,让不同模型在相同信息空间中使用同一选择规则,从而隔离模型判断对顺序信息搜寻的影响。研究刻画了模型特定偏好所导致的广度-深度行为,并分析了交互历史如何改变对候选信息的评估与选择。项目代码、数据与轨迹文件已公开。
针对 Muon 优化器是否需要细粒度谱整形,研究者提出两带谱重加权框架 BulkBoost,其噪声校准变体利用 split-minibatch 梯度差标定 Marchenko–Pastur 参考边缘,将谱分为 bulk 与 spike 两部分并共享一个增益。
研究用时间卷积分类器对20名参与者进行留一受试者(LOSO)交叉验证,基于角度阈值标注的GOOD/BAD步态周期,平均AUROC达0.948,BAD周期灵敏度0.941,GOOD周期特异度仅0.366。
研究人员推出 2D-FET-Bench V2,一个基于显微薄片轮廓构建的 128 项 FET 版图任务基准,用于测试语言模型智能体能否完成薄片专属的器件构造。
MemCo 是一个记忆中心协作框架,通过维护互补的局部与全局记忆空间,让 LLM 智能体泛化到未见交互环境。它按智能体当前状态和决策阶段路由局部与全局记忆,避免盲目迁移环境特定细节。在交互决策基准上,MemCo 相比孤立记忆和共享记忆基线提升了任务成功率并减少冗余探索。
研究者提出 Rationale-Guided Policy Optimization(RGPO),按模型当前能力自适应利用标准答案中的理由信息,将其作为临时脚手架,仅把更高奖励的模型自生成解回传到原始无引导设置。在纯语言与视觉语言推理任务上,RGPO 均持续优于 RLVR 基线,消融实验显示自适应理由引导是性能提升的关键。该工作已被 NeurIPS 2026 接收。
一篇综述系统梳理了神经符号 AI 中用作符号组件的三类规则语言——Datalog、答案集程序与概率逻辑程序,并沿语义、表达能力、神经集成和求值机制四个维度展开对比。作者分析了 50 余个近期系统与应用,覆盖数据库与编程语言、机器学习、视觉和机器人四个研究领域,并给出将应用场景映射到所需特性的决策矩阵,最后列出开放问题。该文将收录于 RuleML+RR 2026 会议论文集。
研究提出 Diffusion On-Policy Context Distillation(D-OPCD),将智能体改进后的提示词作为特权上下文,把智能体框架的能力蒸馏进扩散模型权重,使其仅凭原始查询也能保留部分框架收益。
研究提出 Looped Self-Distillation 自演化框架,模型在固定信息预算下反复从自身原始输出学习,无需外部评估或测试筛选。
AMBER 是一个让智能体在推理、行动的同时写入自由形式记忆的框架,追加式规则从结构上保证信息不被覆盖删除,可端到端用结果奖励做强化学习,无需大量人工整理的 SFT 数据。
一项针对 170 名大一经济学学生的双队列双重差分研究显示,使用经研究生助教核验的 AI 生成播客、FAQ 和测验学习指南,与 50 分制考核中 2.34 分的成绩优势相关。
研究评估轻量级开源语言模型在资源受限的边缘环境下,将输入数据实体匹配到最合适的智能数据模型(SDM)的表现,系统基准测试了通用、推理专用和代码专用三类架构在多个领域数据集上的效果。实验还将所调研的大语言模型与 TF-IDF 和轻量级句子编码器两种近零成本相似度基线在同一任务上对比,为判断 LLM 分类在边缘平台的实际价值提供参考。
一篇 arXiv 论文提出面向生成式 AI 的生产级内容抽取系统,将内容抽取作为独立生命周期阶段,包含选择性 OCR 路由、基于参考的抽取评分器、确定性结构感知父子分块器和只读检索评估器。
CuratorMAS 是一个多智能体协作框架,将数据集策展拆解为五个可编程执行阶段并组成可并行工作流,通过数据集探索、在线领域知识检索、评估标准推导与指标计算、过滤及技能进化模块完成自动策展。实验显示,该框架将噪声率最多降低 36.03 个百分点,下游模型 F1 分数最多提升 8.88 个百分点。
针对 AlphaFold 3 类共折叠模型输出中链间原子重叠、配体键长键角失真、环不共面及手性反转等物理违规问题,研究者提出两种闭式投影算子,直接作用于扩散模型去噪后的干净坐标估计 x̂₀:链间范德华投影推开冲突最严重的原子对,配体距离几何投影恢复键长、键角、内部接触、共面性与手性。
JIVEAdapter 是一种多任务加性低秩适配器,借鉴统计方法 JIVE,将每次权重更新分解为所有任务共享的 Joint 结构与各任务独有的 Individual 结构,并惩罚 Individual 与 Joint 近似正交以保持可解释性。
离线 AI 模块工作流发布语音优先的完全离线部署方案,包含模块化架构、低成本硬件 BOM 和面向 2-5B 参数指令微调模型的可复现量化与基准测试流程。
研究者提出 SSRFT(Supervised Safe-Role Fine-Tuning),首个将安全对齐重构为"内化预设安全角色"的框架,通过心理测量问题、少量越狱提示词和安全角色描述构建 SRQA 数据集,让模型内化安全价值观而非显式拒绝模式。
基于北京和成都路网速度数据构建的离线代理任务显示,联合校准上界可将路径覆盖率从83.19%提升至92.26%(北京M1)、75.14%至88.33%(成都M1)、74.01%至90.64%(成都M2),但C2策略分别使迟到率增加0.1633、0.7848、0.9200个百分点,平均出行时间增加0.588、3.082、4.418秒。
一项基于安徽宣城 29 天重建需求数据的分层诊断研究显示,入口级和车流级预测相对历史均值分别降低 4.03% 和 3.92% 的平均绝对误差,但因果预测与五秒事件 oracle 在冻结测试日反而使排队车秒数增加 6.09% 和 3.39%。
针对 LLM 智能体难以从经验中持续进化的问题,研究者提出 SAGA 框架,将交互轨迹逐步抽象为情景描述、可复用流程和带明确适用条件的原理,并保留与执行证据的关联。检索到的原理会被实例化为任务专属指导,通过纠正反馈与重采样优化候选动作,形成执行—抽象反馈闭环。在 ScienceWorld 和 ALFWorld 上的实验显示任务表现提升,消融研究验证了上下文实例化与动作调控对利用原理级知识的重要性。
RadOnc-Agent 是一个将放疗流程形式化为四个临床阶段、并通过对话界面提供 26 个可调用函数的智能体框架,由大语言模型控制器将临床意图映射为受 schema 约束的调用。
研究者提出 Anchor Divergences,通过对比学习、指数族与信息几何的相互作用,在固定表示上建立锚点概率分布与 Bregman 几何之间的对应关系,从而为特定语义结构定制几何度量。检索实验显示,该方法能高效指定上下文相关的语义相似度。代码已开源。
研究团队提出 GameGo 框架,将简短游戏创意系统化转化为基于行业实践的产品需求文档,并构建了覆盖 2D、2.5D、3D 游戏的 55,060 条开发轨迹数据集 GameGoData 及含 124 个游戏查询的 GameGoBench。基于该数据训练的 GameGoCoder 在游戏开发基准上超越同类基线,性能接近前沿模型。代码、数据集与模型将全部公开。
OpenAI 公开 722 篇数学手稿,归为 372 组结果,出自一个尚未发布的内部模型,论文、源码和部分 Lean 证明已上传 GitHub。内容涉及准黎曼猜想、霍奇猜想、BSD 猜想、π 的无理性指数等,模型此前尝试约 4000 个研究问题,平均每项结果算力约相当于 ChatGPT Pro 思考 3 小时。
推荐理由:OpenAI 一次性公开 722 篇数学手稿,读者可了解其覆盖范围与数学界对核验进度的保留态度。
2026-10-07 GitHub 趋势榜显示,Rust 图像编辑器 storytold/photocraft 以 24h +4,415 Star 登顶,同作者的 Rust 视频编辑器 filmcraft 以 +984 位列第二。
文章针对 LLM 长对话触发 context_length_exceeded 的问题,设计并对比了 FIFO、LRU-Token、Priority-Weighted、Semantic Clustering 和 Hybrid 五种 Context Eviction 策略,给出每种策略的实现代码与实测数据。
研究者提出 UniEvo-VL 自进化框架,让单个多模态模型以不同上下文分别充当教师和学生,利用自身批判作为特权信息,通过最小化去噪扩散分布差异实现自我改进。基于开源 Qwen-image-2512,GenEval 分数从 0.747 提升至 0.808,GenEval2 Soft-TIFA 从 32.97 提升至 35.53。
Devographics 的 State of Devs 2026 调查(5,463 名开发者)显示,49% 受访者对 AI 持正面态度、42% 持负面态度,近一半认为 AI 未对自身心理状态产生积极影响。62% 开发者称职业生涯中经历过倦怠,与去年持平;近半数受访者遭遇过工作不安全感与薪资不足,约四分之一曾被裁员。
OpenAI 以 722 篇手稿的形式公开了一批数学问题解答,覆盖 372 个结果族,据 AGMAI 称其中包含对“数百个”开放问题的解答。这些结果由一个未发布的前沿模型产出,OpenAI 称“平均结果”相当于 ChatGPT Pro 思考三小时,并同时公布了部分推理摘要、算力估算和尝试问题数量等细节。
OpenAI 在 GitHub 上公开了数学方向的 AI 研究进展,并提供了预印本目录。相关仓库地址为 github.com/openai/math,预印本位于其 preprints 子目录。