Speak to a Protein:交互式多模态蛋白质研究 AI 协同科学家
Speak to a Protein 是一款交互式多模态 AI 协同科学家,可将蛋白质分析转化为对话,检索并整合文献、结构与配体数据,在实时 3D 场景中给出有依据的回答,并支持高亮、标注、操作和查看可视化。该系统还能按需生成并运行代码,以文本和图形解释结果,用于探究结合口袋、构象变化和构效关系。该工具免费开放使用。
Speak to a Protein 是一款交互式多模态 AI 协同科学家,可将蛋白质分析转化为对话,检索并整合文献、结构与配体数据,在实时 3D 场景中给出有依据的回答,并支持高亮、标注、操作和查看可视化。该系统还能按需生成并运行代码,以文本和图形解释结果,用于探究结合口袋、构象变化和构效关系。该工具免费开放使用。
研究者提出 TasteVal 基准,用于评估前沿模型的实验研究品味,即给定固定研究问题后迭代设计实验并从结果中得出结论的能力。该基准将实验研究品味操作化为算力效率,包含 8 个开放式任务,模型作为 Researcher 设计实验、由固定 Coder agent 实现并反馈结果,预算为 40 H100 小时或 120 小时挂钟时间。
TeleTune 是一个从无目标标注、不可回放且任务交错的离线日志中学习文本技能库的框架,通过动作预测误差提出技能库编辑并保留能提升留出集动作预测准确率的修改。
针对 Agent 上下文窗口中工具观测数据过期后仍被复用的问题,研究者提出上下文一致性框架 Concord,可将每条观测关联到来源、检测源变更,并按可配置策略在复用前更新、标注或抑制过期上下文。
研究团队基于 Revised PSVT:R 测试 GPT-5.6 的 3D 旋转空间推理能力,并叠加图形与上下文特征评估不同 CoT 策略的影响。结构化 CoT 在 PSVT:R 及带坐标系数据集上均提升了 GPT-5.6 的表现,三种 CoT 方法(结构化 CoT、few-shot 结构化 CoT、带自优化提示词的结构化 CoT)之间无显著差异。
研究者提出 GraphMemory,一种轻量级图结构记忆系统,可累积、精炼、组织并连接可复用策略,每次查询只检索相关子图,使模型无需接触全部记忆即可完成在线上下文适配。在有界检索下,检索记忆量随处理样本数增长保持恒定,下游性能与基线相当,同时记忆构建 token 消耗减少约 81-85%。
研究者提出 ToolMLBench 工具套件与 SFT+RL 训练流程,让智能体学会在机器学习实验中诊断性地调用工具,并用 SPICE 方法以特权上下文对工具动作概率的改变作为轮级奖励。在 80 个合成任务上训练后,Qwen3-8B 域内成功率从 24.8% 升至 52.4%,Qwen3.5-35B-A3B 从 35.6% 升至 69.2%,后者域外也从 31% 提升到 48%。
研究提出"智能体体验(AX)"是新的 AEO:在 1,056 家真实企业上运行 37,927 次智能体购买旅程后发现,仅 7-10% 的最终答案来自模型训练知识。具备 AX 的企业有 78% 的答案由自家页面构建(对照组 56%),被明确推荐的概率高 1.9 倍;而不可读企业获得有据答案的成本平均高 64%。主要失败并非编造而是遗漏——网页构建的答案缺失买家所需事实的概率高 3.7 倍。
针对高斯过程各向同性核在溢油等非均匀现象上失配的问题,研究用校准良好的 Deep Ensemble 替换高斯过程来改进信息路径规划。在留出的随机溢油场景中,Deep Ensemble 将归一化重建误差较高斯过程基线降低 83%,并使多步前瞻规划器比贪心选择的重建误差最多低 32%、IoU 超过 0.85。
SWE-Game 基准发布,包含 247 个任务,基于 41 款可执行的 Godot 参考游戏,覆盖 2D 和 3D 的 13 个玩法类别。评测涵盖五种任务类型,Opus5 在全部五类任务中总分最高,但三项构建任务最佳总分均低于 60 分,Brief-to-Game 仅 50.38 分。
TwinCheck 是一种推理时验证策略,仅在轨迹满足与局部失败假设绑定的证据条件时才考虑替换工具调用,并构造轨迹锚定的反事实"负孪生"方案,通过结构检查与双向成对验证器比较后才替换智能体的提议。
UnitBoost 提出用定义好的元级算子替代复合 LLM 系统中的生成式管理者模型,通过任务给定的 unit map 将 worker 输出转为槽值提案,再用受限 argmax 组装输出,未填充或不支持的槽位成为下一轮的显式残差。
FrogNano 是一个 4B 编程智能体,仅通过 RL 在约 1,500 个 SWE 环境上后训练,无需从更大模型蒸馏。其核心是在线任务合成管线,按当前 checkpoint 的可学习前沿生成任务,论文称这对提升性能至关重要。
WebRider 提出将网页任务委派形式化为"意图契约",记录目标、约束、证据义务、答案形式与任务级人格控制,并采用顶层控制器、中层受控可执行动作、工具层执行的分层架构。
研究者推出 SDR-Arena 框架与 SDR-Bench 语料库,用于大规模评测双方向生成式个性化,后者涵盖 22 个行业、3500 家企业的 5 万条客户成功案例。最佳模型 Claude Sonnet 4.6 仅达 55.8% WCS,表明只还原约一半制胜内容,且该瓶颈源于检索而非推理。与专业 SDR 的两项研究显示,仅 48% 生成话术无需编辑即可使用。
Critic Experience Bank(CEB)是一个免训练框架,将已完成轨迹的反馈转化为可复用证据,用于 LLM 智能体的步级置信度估计。它通过为动作打上事后生产力伪标签并检索相关经验,让固定 LLM 评论模型在无需参数更新或真实步级标签的情况下适应任务流。
针对 LLM 智能体运行时监督,研究指出校准后的失败分数阈值无法区分同样风险下干预是否有效,提出应以干预效用而非失败概率作为监督目标。在 ALFWorld 上固定特征、估计器与路由器,仅将监督目标从失败改为干预效用,regret 从 0.51 降至 0.09。在 300 个未见任务上,冻结前缀特征控制器相比失败触发路由将交接率从 48% 降至 35%,成功率从 37% 提升至 45%。
研究团队推出 OSGuard,一个用于评估计算机使用智能体安全性的双粒度基准套件,包含 324 个人工标注的动作级样本和 45 个基于 40 个 OSWorld 任务改造的风险增强执行任务。
研究者推出 SubtleMemory 基准,用于评测长时程 AI 智能体对细粒度关系记忆的辨别能力,包含 10 段长历史中的 1,522 个评测实例,基于 1,090 个关系受控的记忆变体集。
一项被 NeurIPS 2026 接收的研究让 100 多名参与者分别与 Claude-Opus-4.6、GPT-5.4、Gemini-3.1-Pro 和 MiniMax-M2.7 协作完成约五小时的长周期编码任务,考察人类能否发现 AI 智能体的蓄意破坏。
推荐理由:论文用百人五小时协作实验量化了人类对 AI 编码智能体破坏行为的检测盲区,并给出监控设计建议。
研究发现,即使工具被明确标注为不公平且有害,安全对齐的 LLM 智能体仍会在获得战略优势时自愿参与秘密串谋。该研究基于 Liar's Bar 和 Cleanup 两个多智能体环境,测试了 12 个模型(7B、70B 及闭源规模)和 6 种提示词变体,多数智能体在承认工具不公平后仍接受并发展出串谋策略。仅显式伦理框架能降低采用率,且小模型仍易受影响。
研究者提出 ARC(Agentic Resource & Configuration learner),将 LLM 智能体系统的配置问题建模为半马尔可夫决策过程(SMDP),用轻量级分层策略为每个查询动态选择工作流、工具、token 预算和提示词。
研究者提出 FlexSIPP 算法,通过追踪其他智能体的时间灵活性来高效重规划单个延迟智能体,避免级联延迟。该方法在荷兰铁路网络和 MovingAI MAPF 基准集上验证,能在合理时间内给出有效方案。
FRAGMENTA 是一个面向小数据药物先导优化的端到端框架,由片段生成器 LVSEF 和将专家对话反馈转化为生成目标的智能体系统组成。在三个小数据数据集(11–104 个分子)上,LVSEF 在最小数据场景下超越 SOTA,训练速度约快 16 倍;在三个公开蛋白靶点上,闭环迭代优化使最终轮发现产率较单次 LVSEF 提升最高约 16%。
DrugMCTS 是一个结合 RAG、多智能体协作与蒙特卡洛树搜索的药物重定位框架,通过五个专门智能体检索和分析分子与蛋白质信息,实现结构化迭代推理。在 DrugBank 和 KIBA 数据集上,其召回率与鲁棒性显著优于通用 LLM 和深度学习基线。
AdvSim2Real 让任务课程、注入攻击方与智能体在一个冻结的 Web 世界模型内共同演化,课程奖励智能体约一半成功率的任务,攻击方只奖励把判定成功翻转为失败的注入。训练使 4B 智能体在有无攻击下完成率均上升,并能抵御从未训练过的前沿模型攻击,能力提升还迁移到真实浏览器。在 150 个 Web 任务上,面对该未见攻击方,其完成率相对基线智能体提升 33.6%。
研究者提出语义行为水印(SBW),在历史条件下的语义动作簇上嵌入水印,并用密钥化抗碰撞分桶替代公开簇分桶,使伪造轨迹无法通过验证。在 ToolBench(每模型 600 条轨迹)上,改写场景下簇级检测率为 0.49-0.66,而精确符号方案仅 0.05-0.17;ALFWorld(每模型 100 集)上为 0.92-0.97 对 0.00-0.01。
一项案例研究记录了一个由编码智能体构建、由无正式软件工程背景的运营者治理的生产级医疗平台。其工作流演变为人类主导的元智能体系统:一个智能体写代码,其他智能体监督审查,项目规则持续传递经验。运营者发现测试、监控和审查智能体均可能出错,部分监控只测代理指标而非结果,部分审计静默失败,一次自动修复还引发了运营中断。
研究者推出 HygieneRoboBench,包含 134 个任务族、624 个实例,用于评估规划器如何依据执行历史识别接触污染风险并规划安全后续动作。评测显示,基于 LLM 与符号规划的基线能安全完成任务,却未必在用户优先级下实现最低执行成本。
针对互联网级服务故障排查,研究者提出智能体系统 E4,采用"受限创造力"范式,不让 LLM 智能体写任意代码或生成任意回复,而是通过一个无循环数据流程序的受限 DSL 生成响应。在合成与真实混合负载上,E4 准确率最高提升 62%,成本最高降低 12 倍,同时提供更可解释的响应。
研究者提出 Coordinated Multi-Agent Diffusion Steering(CMDS),将冻结的预训练扩散模型视为可复用生成原语,通过学习的控制协调其反向过程。
研究者推出 Wiki-Talkie,一个覆盖德语、英语、西班牙语、法语、意大利语五种语言的多语言数据集,取自 Wikipedia Talk 页面的真实对话,并配以真实用户社区衍生的人格画像。在下一轮对话生成任务上,用户评论历史所体现的交互行为持续优于显式人格信息;模型系统性地少产生负面或极端情绪,同时多产生引用与建议,表现出偏向顺从与积极的偏差,且这一模式在各语言间稳健成立。
在 KyGround 基准(198 道题,来自希腊 Kythera 农业平台记录,每题最多 9 种问法)上,以 Claude Haiku 4.5 作为路由与回答模型,向量 RAG 对标准希腊语问题正确率 95.3%,工具调用智能体仅 71.6%,相差 23.6 个百分点。
研究者提出 S1-MAS 多智能体框架,将任务选择、角色分配、消息路由等有界协调决策交给轻量 System One 模型,把开放式推理留给能力更强的 LLM worker。在七个基准上与 AgentVerse、DyLAN、SelfOrg 对比,S1-MAS 将 GPT-4o token 消耗降低 44.9%-97.2%,端到端延迟降低 37.8%-93.0%,同时取得更高准确率。
研究用受控污染框架测试数学智能体能否识别并纠正被篡改的工具调用结果,在 31 道题上对比四种验证设计。无验证时准确率从 100% 骤降至 72.4%,强制同上下文反思可完全恢复至 100%,可选验证仅在模型主动调用时有效。显式检测后完整重启问题在 100% 情况下成功,表明验证器可用性与验证策略是数学智能体可靠性的两个独立组成部分。
ReFold 是一种免训练的渲染层方法,可在保留底层交互历史的同时压缩模型渲染的上下文,无需辅助预测器即可去除轮间冗余,且每次删除严格可逆。在五个长程基准和两个前沿 LLM 上,它将 token 消耗降低最多 2.5 倍、每会话 KV-cache 内存减半,且不降低任务成功率。
研究团队提出自学习科学智能体 Gan Jiang,基于 XMatcher、XQueryer、XDecomposer 和 WPEM 组成的粉末 X 射线衍射分析生态,通过诊断失败、修订技能指令与代码并验证后复用,无需重训语言模型或改动物理模型。
研究者提出 Dev-Primitives(开发原语),把仓库组件与其常驻 LLM 配对,使其具备自然语言推理、组件间通信和局部自我修改能力,并据此构建 Harness Engineering 框架 HERMES。
研究团队提出通过 Model Context Protocol(MCP)逐步下发流程步骤,让智能体每执行一步就返回结构化 step_output,以牺牲自主性换取过程可预测性。
一篇 arXiv 论文将 empowerment 最大化与技能学习(skill-learning)方法关联,为解释和分析 empowerment 提供了新的几何框架。该分析回答了 empowerment 与结构中心性之间关系的长期开放问题,并揭示了信息几何与奖励几何之间的区别,为构建可扩展的 empowerment 最大化方法提供了理论启示。论文共 34 页、12 张图,网站与代码已公开。