CropSentry:群体协同多机器人系统用多模态叶片传感检测农作物早期胁迫
低成本地面多机器人系统 CropSentry 通过多模态叶片传感逐行监测作物健康,两台自主机器人采集叶片颜色与环境数据并上传主机器人,生成实时网页仪表盘。63 次观测实验显示作物健康分类总体准确率 84.12%,其中健康植株 82.60%、营养缺乏植株 88%、患病植株 80%,10 次从机观测的无线通信成功率达 100%。
低成本地面多机器人系统 CropSentry 通过多模态叶片传感逐行监测作物健康,两台自主机器人采集叶片颜色与环境数据并上传主机器人,生成实时网页仪表盘。63 次观测实验显示作物健康分类总体准确率 84.12%,其中健康植株 82.60%、营养缺乏植株 88%、患病植株 80%,10 次从机观测的无线通信成功率达 100%。
研究者提出 Coordinated Multi-Agent Diffusion Steering(CMDS),将冻结的预训练扩散模型视为可复用生成原语,通过学习的控制协调其反向过程。
研究揭示模型的学习方式会显著影响其后续的遗忘(unlearning)表现:以泛化为主的模型在遗忘时对保留集的性能损伤更大。作者通过模块加法中的 grokking 现象区分记忆型与泛化型模型,并引入分桶模块加法在记忆-泛化连续谱上精细控制两种策略的贡献,发现该趋势近乎单调。这一关系在 LLM 的逐字回忆与事实回忆遗忘场景中同样成立。
FedDermaSeg 用联邦学习实现隐私保护的皮肤病变分割,在 ISIC 2018 训练与验证集上模拟分布式环境训练,并在 ISIC 2018 测试集和 PH2 数据集上评估。结果显示其性能与集中式训练相当,且持续优于各本地训练模型,无需集中聚合医学图像即可协同分割。
RAG-PIBench 是一个面向 RAG 提示注入检测的基准,包含 4,876 条上下文样本,划分为冻结的训练、验证与受保护测试集,并采用防泄漏构建流程与严格评测协议。
研究分析激活引导所用去偏见方向的实际编码内容,发现该方向由模型置信度主导,在激活空间中指向高概率到低概率 token 区域,而非编码有意义的偏见表征。沿该方向引导虽能降低偏见指标,但实为降低模型置信度所致:在 QA 基准上模型因此拒绝作答,附带改善了公平性指标。研究指出,将偏见线性表征与模型置信度解耦十分困难,基于引导的去偏见结果需谨慎解读。
一项 SoK 研究系统综述了 100 项涉及儿童与青少年接触 AI 的实证 HCI 研究,覆盖学校、家庭、护理和公共服务场景。基于 YAIR 风险分类与 MIT Mitigation Taxonomy,研究发现多数风险仅有提出或构想中的对策,少数被实际部署,经评估者更少,且现有评估多衡量技术性能而非是否真正防止伤害。
针对非线性记忆网络在序列测试时训练中难以单遍优化、串行 TTT 反而不如固定基座并行 TTT 的问题,研究者提出 DeltaTTT,将两层记忆网络的联合内循环优化改为逐层学习,每层分配局部预测目标并通过状态相关的 delta 规则更新。该方法保留非线性读出并支持分块并行计算,在 DeltaNet 和 LaCT 骨干上提升了语言建模与检索表现。
针对可解释性探针得分缺乏固定含义的问题,研究者提出用 floor(简单输入已能预测的部分)和 ceiling(完整输入可预测的部分)两个参照点来解读探针得分,二者之间的 headroom 才是模型真正计算出的信息。
研究提出 Micro Neural Policies(MNP),将 Evolution Strategy 与基于 Statistical Model Checking 的验证结合用于策略搜索,大幅压缩神经网络规模。
研究者提出一种可扩展的客户感知概率负荷预测框架,通过共享模型学习共性需求行为,仅适配一小组低维参数,让每个负荷按自身特征组合这些适配组件。在 SMART-DS 数据集 590 条负荷曲线上,该方法在确定性精度和概率质量上均优于统计、神经网络、Transformer 及预训练时间序列基线,同时保持较低的存储与推理成本。
FlowCF 是一种模型无关的生成式反事实解释方法,将反事实生成建模为从事实类到目标类的稀疏传输,并用流匹配求解,通过新型混合流算子扩展到混合特征类型。在六个基准数据集上,FlowCF 取得最佳数值稀疏性与接近度,仅改变 29% 的数值特征(最佳基线为 89%),位移小 70%。该工作已被 NeurIPS 2026 GDDL Workshop 接收。
MedCORE 是一个将临床推理结构化的视觉-语言诊断框架,把诊断过程拆解为临床标准、定位对应图像区域,并用 Graph Attention Network 建模标准间依赖。
研究者推出 Wiki-Talkie,一个覆盖德语、英语、西班牙语、法语、意大利语五种语言的多语言数据集,取自 Wikipedia Talk 页面的真实对话,并配以真实用户社区衍生的人格画像。在下一轮对话生成任务上,用户评论历史所体现的交互行为持续优于显式人格信息;模型系统性地少产生负面或极端情绪,同时多产生引用与建议,表现出偏向顺从与积极的偏差,且这一模式在各语言间稳健成立。
X-OPM 提出一种可解释的数字片上功耗建模框架,用树模型捕捉特征交互、线性模型完成预测,并引入 human-in-the-loop 流程平衡精度与建模成本。在商用 C906 向量处理器上,采样窗口小于 8 cycles 时全部工作负载均达 R² > 0.93,而 APOLLO、COBIT 和标准 MLP 均无法在所有测试用例上泛化。
一项预注册研究用 880 个语言模型评分者对 189 份访谈做八项 Patient Health Questionnaire 评估,发现模型选择解释了汇总症状得分方差的 30.0%,稳定的参与者差异仅占 10.5%。
Knee3DVLM 是一个序列感知的视觉语言模型,利用全容积 DESS 与液体敏感 TSE MRI 预测 57 个源自 MOAKS 的解剖定位二分类诊断目标。
MetaLearnNCA 提出一种去中心化少样本元学习框架,通过耦合神经细胞自动机(NCA)的动力学交互完成任务适配,推理时无需计算解析梯度。该框架由 Active-NCA 和 Meta-NCA 组成,后者作为去中心化细胞优化器在局部邻域扩散空间误差残差以动态更新空间程序。
跨分词器在线策略蒸馏(OPD)中,严格 1:1 对齐已覆盖大部分学生生成 token,将 reverse KL 限制在共享词表 top-16 子集即可达到与全共享词表 OPD 相当的准确率,优于所评估的跨分词器基线。
NVIDIA 提出 NeMo-DCR(Delta-Compressed Refit),只传输权重变化量却保持比特精确,接收端得到与全量重配完全相同的参数和 buffer 位。
研究团队构建了一个轮次标注的多轮基准(423 段对话、1,661 个标注轮次状态)和带模拟用户的评估框架,用 6 个数据集与 6 个开源权重 LLM 测试不可回答性探针的迁移能力。
研究提出失败驱动提示词优化方法 FDPR,通过分析 LLM 在漏洞分析中的反复失败模式来指导提示词改进。团队基于 DVJA 识别出误报、漏报、无依据推理和 CWE 误分类等失败模式,并在 Juliet Test Suite 上评估优化后的提示词,同时进行跨模型验证。结果显示该方法提升了 LLM 漏洞分析的可靠性,并提炼出可复用的提示词设计原则。
研究者提出免训练框架 GeoPID,从几何视角将 VLM 中的多模态信息分解为冗余、模态独有和协同三类成分。在 22 个 VLM 和 14 个 benchmark 上的分析显示,需要视觉 grounding 的问题中正确预测具有更强的视觉独有成分。基于此,GeoPID 在推理时沿视觉独有子空间选择性放大视觉表征,无需更新模型参数即平均提升 7.63% 相对准确率。
Atom-JEPA 是一个自监督预训练框架,通过原子级和子结构级的互补目标,从无标注 3D 结构中学习潜在表示。该模型在大规模分子与晶体数据集上预训练,经微调后在分子 ADMET 与量子化学性质预测任务上达到 SOTA,在晶体材料物理性质预测上也极具竞争力。代码与预训练模型 checkpoint 已公开。
针对 LLM 引导的图推理中逐跳贪心剪枝过于短视、易过早丢弃关键证据分支的问题,研究者提出远见感知证据检索框架 Foresight-over-Graph(FoG),通过远到近反馈引导路径探索并维护紧凑记忆子图。在常用 KBQA 基准上 FoG 达到 SOTA,CWQ 的 Hit 指标提升 16.58%,同时减少 LLM 调用与 token 消耗。代码已开源,论文被 NeurIPS 2026 接收。
Corbion 与 Intrepid 将 PURASORB 生物可吸收聚合物库与 Intrepid Labs 的 AI 算法 ANDROMEDA 1 结合,用于治疗性多肽的原位成型缓释制剂开发。
研究者提出 Quantizer-Aligned Recalibration(QuAR),一种面向量化 ViT 的单次前向 TTA 方法,不反向传播也不更新任何模型参数,而是在冻结量化器输入端重校准激活值。
研究者提出用传感器坐标构建 k 近邻图,并以该图 Laplacian 的 graph-Matérn 函数作为流匹配模型的源协方差,使生成从空间相干模式而非通道独立噪声出发,且不增加可学习参数。
针对视觉世界模型决策时动作搜索规划预算过大、迭代规划器重复编码不变上下文的问题,研究者提出部署框架 SufficientPlan,无需修改预训练世界模型或规划器更新。
研究者提出面向自动驾驶视频的时空一致性对抗攻击(STCA),分模态扩展、空间攻击与 STCA 攻击三阶段,其中模态扩展用 caption 引导选帧、STCA 阶段用运动引导掩码破坏跨帧时序一致性。
MARCO 是首个专为蛋白质生成模型(PGM)设计的放射性水印框架,通过辅助编码器-解码器在扩散逆向去噪过程中迭代嵌入水印,原始 PGM 参数保持冻结。它采用针对 C_α 原子对距离和扭转角(ψ, φ)的专用损失函数,并结合对抗训练与随机攻击模拟,以保持生物物理保真度和鲁棒性。水印会自动转移到任何基于水印数据训练的盗版模型输出中,从而有效对抗模型提取攻击。
针对自动驾驶远程操控的预测性 QoS(pQoS),研究者基于实测数据提出预测框架,预测上行数据速率与往返时延两项网络 KPI。该框架将历史数据纳入预测流程,以缓解概念漂移导致的机器学习模型在未见数据上的性能退化,并引入关键场景检测指标专门评估远程操控场景下的预测表现。
DySCo 是一个边缘-云协同 LLM 推理运行时,通过保持 KV 缓存本地化并引入 dyForward 层范围执行器,让边缘设备无需重载权重即可运行可配置的连续层范围。其深度同步批处理(DSB)将异构请求推进到最深切分点并批处理公共后缀,在平均并发为 8 时吞吐量较 FIFO 提升 275%、较精确匹配批处理提升 48%、较轮询交错提升 79%,同时降低平均每会话延迟。
VOMMI 是一个可携带的移动操作演示采集与学习框架,通过离线轨迹重建和在线视觉-运动条件化,将便携 RGB 演示接入 VLA 后训练。其 R2-VO 用稀疏几何锚点精修轨迹,使身体与手部流的绝对轨迹误差平均降低 24.6%。仅用便携演示后训练的策略基座速度误差比机器人采集演示低 18.2%,在三项真机任务上平均成功率较 OpenPI 0.5 提升 8.3 个百分点。
STRUCTURALCOST 是一个自定速阅读数据集,包含 475 名参与者和 40,800 条观测,用于分离长距离主谓依存解析的处理成本。研究发现,主句动词处的人类阅读时间随依存长度增加,由句法嵌套而非线性距离驱动;n-gram、SSM 和 Transformer 等语言模型仅部分反映这一难度曲线,且低估了人类的工作记忆整合成本,该差距在不同架构和模型规模下持续存在。
在 KyGround 基准(198 道题,来自希腊 Kythera 农业平台记录,每题最多 9 种问法)上,以 Claude Haiku 4.5 作为路由与回答模型,向量 RAG 对标准希腊语问题正确率 95.3%,工具调用智能体仅 71.6%,相差 23.6 个百分点。
研究者提出 CoRP(Compressed Representation Policy),一个仅 48.9M 参数、不含视觉语言模型和视频生成先验的紧凑策略,在 LIBERO 上达到 97.0%,在 RoboTwin 2.0 Clean/Randomized 上达到 75.78%/73.36%,匹配比它大 40.9-163.6 倍的系统。
研究团队发布 MedConv 多语言数据集,包含英语、丹麦语和德语共 300 例临床问诊,并结合 ACI-BENCH 基准,将临床 AI 平台 Corti 与两款基于通用 AI 的 ambient scribe 软件进行对比。
研究者提出 S1-MAS 多智能体框架,将任务选择、角色分配、消息路由等有界协调决策交给轻量 System One 模型,把开放式推理留给能力更强的 LLM worker。在七个基准上与 AgentVerse、DyLAN、SelfOrg 对比,S1-MAS 将 GPT-4o token 消耗降低 44.9%-97.2%,端到端延迟降低 37.8%-93.0%,同时取得更高准确率。
研究提出"惩罚框架无有效选项 MCQA"设定,在 MMLU-Pro 数学子集上移除正确选项,允许模型选择剩余选项或输出 ABSTAIN,并对无效强制选择进行惩罚。实验显示,即便有明确的无有效选项提示和惩罚评分,模型在原本答对的题目上仍会给出无效强制选择,说明高 MCQA 准确率并不能完全保证弃答可靠性。该工作已被 AACL-IJCNLP 2026 主会议短论文接收。