UniPro:用传播机制统一从 2D 图像到 3D 体数据的多模式医学图像分割
UniPro 是一个统一的多模式医学图像分割模型,通过传播机制把 2D 分割扩展到 3D 体数据,在单一基于切片的框架内同时支持语义分割、上下文分割、交互式分割和基于传播的分割。
UniPro 是一个统一的多模式医学图像分割模型,通过传播机制把 2D 分割扩展到 3D 体数据,在单一基于切片的框架内同时支持语义分割、上下文分割、交互式分割和基于传播的分割。
针对视觉语言模型测试时自适应中全局表示的背景偏置与基于熵的缓存准入不可靠问题,研究者提出 RADC,通过语义前景缓存从 CLIP 表示中聚合类别一致的空间证据,生成前景原型以补充全局缓存。RADC 采用高斯风险准入将多视图表示建模为对角高斯分布,结合类间分离度与特征不确定性筛选可靠的缓存候选。在跨域与分布外基准上,RADC 取得了一致的 SOTA 表现。
研究用医学图像对齐评估测试前沿多模态大模型的通用视觉推理能力,GPT-6 在几乎所有测试场景中准确率超过 85%,而几个月前发布的模型泛化较差、部分场景仅略高于随机水平。微调后的本地模型可在训练任务上追平甚至超越前沿模型,但迁移到未见场景时效果明显更差。
一项案例研究评估了混合 4/8-bit 量化(平均每参数 6 bit 和 7 bit)的 Qwen2-Audio-7B-Instruct,在 508 条英译德 FLEURS 语音和 512 条 RAVDESS 情感片段上,两种分配的 BLEU 和 chrF 与 FP16 的差异区间均包含零。
研究用真实人类语音录音测试语音语言模型(SLM)的声音象征能力,发现 SLM 的听觉判断与人类感知对齐较差,且未能捕捉驱动人类直觉的频谱倾斜等声学线索,开放权重模型也无法可靠地将听到的声音与对应形状关联。视觉-only 对照实验排除了形状感知因素,表明这一弱点源于语音表征方式,感知对齐取决于能否捕捉人类所听的线索,而非更强的视觉能力。
研究提出跨语言迁移矩阵(CLTM),用于系统量化给定任务内语言对之间的跨语言交互。基于多语言 HuBERT 编码器,作者在性别识别和说话人验证两项副语言语音任务上分析了微调时供体语言数据对目标语言性能的影响,结果揭示出任务与语言间存在系统性、语言依赖的迁移模式。
研究者推出 AVMeme Exam,一个由人工整理的千余条互联网标志性声音与视频基准,覆盖语音、歌曲、音乐和音效,每条配独特 Q&A 考察从表层内容到语境、情感、用法与世界知识的理解。对当前 SOTA 多模态大语言模型的系统评测显示,模型在无文本音乐和音效上表现较差,且在语境与文化推理上弱于表层内容理解。该基准已被 COLM 2026 接收。
研究团队扩展 F5-TTS,提出一种无需 Lombard 专用训练数据的可控 TTS 系统,可零样本合成 Lombard 风格语音。该方法通过可学习的风格嵌入并用 PCA 分析其隐空间,找到与 Lombard 属性相关的方向,从而对发声力度和清晰度实现可解释控制。实验显示该方法在保持说话人身份与自然度的同时提升了噪声环境下的可懂度,并可泛化到未见过的说话人。
针对现有 LLM 推荐方法忽视或难以建模用户-物品高阶交互的问题,研究者提出 ELMRec,通过增强 whole-word embeddings 让 LLM 无需图预训练即可理解图结构交互,并针对 LLM 更依赖用户早期交互而非近期交互的现象加入重排序方案。ELMRec 在直接推荐和序列推荐上均优于 SOTA 方法,该论文已被 EMNLP 2024 Main 接收。
DivLM 是一个面向 LLM 创意短篇故事生成的后训练框架,通过持续预训练加权重残差恢复指令跟随能力,再用自定义复合奖励的强化学习,在体裁、语气、风格和命名实体四个维度上提升多样性。在两个 LLM 系列上的实验显示,其多样性指标平均提升超过 9%,同时保持指令跟随、整体回复质量和与人类输出的相似度。
研究者构建了 Wikidata Search Traces 数据集,包含 10,235 条单实体与多跳问题的求解轨迹,以及生成这些轨迹的递归语言模型(RLM)harness。
研究将 TypeSafe 宣传的 "System One" 模型 JEV 与 GPT-6 Luna、Qwen3.8-27B 及已发表研究中的人类编码员在七项政治学复现任务上对比,发现 JEV 准确率与两款 LLM 相当或接近。
研究者提出一套用 LLM 从大规模社交媒体语料中归纳式抽取并编目"主张"(claims)的流水线,并应用于 2020 年美国大选和 2022 年 FIFA 世界杯两个 Twitter 数据集。团队通过人工标注样本衡量召回率与精确率、开展消融实验并做定性错误分析,同时给出各数据集得到的主张目录。
研究基于 RADAR-T 的人类审核样本,对三种 LLM 进行受控实验,发现改变表格行顺序会改变错误发现结果,且仅提供已验证的错误位置不足以实现准确问答——在代码执行下,修复表格的准确率比错误标记表格高出 39.0-59.1 个百分点。为此提出 GBDI 工作流,在 RADAR-T 上对五种 LLM 的问答准确率较代码智能体基线提升 3.8-18.5 个百分点,代价是额外推理开销。
针对 LLM 做 BioNER 时数据集标注语义不清、自由生成缺乏结构约束的问题,研究者提出指南增强多智能体框架 GAMA,先从标注训练实例归纳并验证标注规则构建指南记忆,再由规划组件生成带理由的 span-type 假设、编码组件转为 schema 约束的实体对象,并经验证模块做双循环精修。在五个常用 BioNER 数据集、多种 LLM 主干上,GAMA 持续优于强 LLM 基线。
AgSpec 是一个面向编码智能体流水线的检索式投机解码框架,从会话、工作区和全局语料中检索,并按智能体输出格式索引已打开文件,同时用离线测得的长度上限约束草稿长度、再根据验证反馈在线调整。
研究者提出 NFA-LM,一个面向 NFA 约束生成的多项式时间引擎,在温和假设下具备理论保证。该任务可归约为 #NFA 计数问题,而精确 #NFA 是 #P-complete,此前已有工作证明其存在 FPRAS。实验显示 NFA-LM 能高效生成高质量输出,且近似误差有理论界。
研究者微调多语言编码器搭配仿射跨度标注头,在 35 种语言的前沿模型标注数据上训练,在 7 种语言 1,283 条人工金标测试段上取得最佳 redaction F1 88.8,远超 GLiNER2 的 69.1、Microsoft Presidio 的 57.3 和 OpenAI Privacy Filter 微调的 35.8。
针对约鲁巴语轮廓声调在正字法中长期难以标注、部分人名拼写甚至因此反转含义的问题,该论文提出采用 caron 和 circumflex 符号在单元音上编码升调和降调。这一做法可追溯至 Olmsted(1951)的约鲁巴语音学研究,并首次使这些声调可通过标准键盘输入和计算文本处理实现。方案已在 WriteYoruba 键盘和 TTSYoruba 语音合成器中落地实现。
研究评估了测试时扩展与后训练方法在个体立场预测中的表现,基于包含 500 名 Hacker News 用户、2499 个预测任务的 STANCE-BENCH,识别出错误共识、选择失败、响应过拟合和早期平台四种失效模式。结合候选立场直接评分与历史支持度评估的方法,在 781 任务测试集上用 Qwen3-8B 达到 21.83 Macro F1,高于直接评分的 19.27。
针对业界和学界用 LLM 驱动的合成受访者替代真人样本的做法,研究者提出一套验证框架,要求每项效度声明明确与人类数据的对应层级,并覆盖 location、dispersion、response process、structure 四项诊断及实验效应对比。框架还要求报告子群体效度,并将分布、程序与承认三个公平维度操作化为可测量指标,最后以电动汽车充电电价为例演示并给出报告清单。
Dream-RSI 是一个让 AI 智能体递归自我改进探索策略的框架,它把历史发现树当作回放模拟器,在模拟器中"做梦"获得低成本 off-policy 反馈来评估和优化探索策略,无需反复进行昂贵的在线评估。改进后的策略再部署到线上驱动新发现,持续扩充模拟器池形成自我改进循环。在 4 个领域的 9 项任务上,Dream-RSI 取得有竞争力的质量并提升了发现效率。
一项被 SLT 2026 接收的研究构建了统一生成式评测套件,在匹配数据分布与生成设置下对比纯语音、纯文本和语音-文本语言模型。结果显示联合语音-文本建模显著提升语义连贯性,但音素级指标变化有限,说话人相似度与预测质量反而更低,情感分布指标则有所改善。相比更大规模的纯语音模型,该语音-文本模型在基于转写的语义连贯性上缩小了大部分规模差距。
研究者基于英文 WinoQueer 基准构建了荷兰语数据集 WinoQueer-NL,最终包含 42,906 条句子,用于评估荷兰语及多语言模型对 LGBTQ+ 群体的偏见。经 43 名荷兰酷儿参与者调查,171 条刻板印象中 145 条被确认具有文化相关性,并新增 22 条偏见。模型平均偏见分约 50%,但部分模型对跨性别身份有高达 97% 的概率偏向刻板句子,对男同性恋相关句对仅 6%。
研究者提出免训练方法 TwinKV,用非局部 post-RoPE key 频率对 value energy 打折,在精确存储预算下保留原始 key 和 value。
迭代学习模型研究发现,当高频含义被赋予更高出现频率时,它们可以像自然语言一样摆脱低频含义所遵循的语法约束。但若频率结构施加在含义向量的组成部分而非完整含义向量上,语言将无法跨代稳定传递,即便最高频元素能被可靠习得。结果表明,频率只有在学习者能整体习得的形式-含义单元上分布时,才能塑造涌现的语言结构。
研究者发布德语开放问答临床基准 MedQADE,含 3,800 组问答、10 位医生标注和 9 个 LLM 评审。医生对答案正确性一致性中等偏强(Cohen's kappa = 0.612),Gemini 3 Flash 接近留一医生参考(kappa = 0.694 vs 0.709)。
研究者将对话情感识别(ERC)任务引入手语视频分析,并提出基于 STUDIES 语料库脚本构建的 eJSL Dialog 数据集,包含 1,920 个视频样本、480 段对话。在该数据集上的系统基准测试表明,将对话式 ERC 框架扩展到手语对话在当前基准设定下可行,但现有视觉表征在捕捉手语特有的情感线索方面仍存在局限。
研究对 41 个开源权重 LLM 进行六种行为经济学博弈测试,发现博弈中表现出的合作倾向能稳健预测其在 AI for Science 任务中的团队表现。在共享 GPU 或额度约束下,善于协调并投入乘法式团队生产的模型,在科学报告的准确性、质量和完整性三项指标上均更优。该框架可在多智能体部署前快速筛查模型的合作适配度。
研究团队用回译与微调模型,从少量种子语料生成 170 万条法语合成推文及合成推理轨迹,训练出 600M 参数、支持英法双语推理的模型,在人工标注评测数据上达到 77-79% 准确率,追平或超过 SOTA 专有 LLM 与专用编码器。该流程在降低标注成本的同时避免暴露敏感用户数据,可迁移至其他场景和语言。
研究者提出双向基准 GapEval,用于量化统一多模态模型(UMM)理解与生成能力之间的差距,每道题均可用图像和文本两种模态作答,实现双向推理与跨模态一致性的对称评估。实验显示,不同架构的 UMM 在两个方向上普遍存在持续差距,表明当前模型仅实现表层统一,而非深层认知融合。从知识操作角度的实证研究进一步发现,UMM 内部知识往往彼此割裂,跨模态的能力涌现与知识并不同步。
研究者发布 TabiBERT,一个基于 ModernBERT 架构、从零预训练的土耳其语单语编码器,训练数据为 1 万亿 token,来自 86.58B token 的多领域语料(网页文本 72%、科学出版物 19%、源代码 6%、数学内容 0.3%),支持 8,192 token 上下文,是现有土耳其语 BERT 模型的 16 倍。
研究者发布 Infinity-Chat,一个包含 26K 条真实开放式用户查询的大规模数据集,并首次提出覆盖 6 大类别、17 个子类别的开放式提示词分类体系。
VietBinoculars 是一个零样本检测框架,将 PhoGPT-4B 的 observer 与 performer 模型与校准后的全局决策阈值结合,并采用越南语专用 BPE 分词。
Common Corpus 是迄今最大的开放 LLM 预训练数据集,数据均为无版权或开放许可内容,总量约两万亿 token,涵盖从高资源欧洲语言到低资源语言及大量代码数据。研究团队在该数据集上训练了两个小型语言模型,性能与同规模模型相当,表明其适合多语言预训练。该数据集已被 ICLR 2026 接收为 Oral 论文。
Pleias 发布 Pleias-RAG-350m 和 Pleias-RAG-1B 两款小型推理模型,原生支持引用与字面引文溯源,并整合查询路由、查询改写和来源重排等 RAG 工作流功能。
一项系统性研究提出统一框架,将 Product Quantization(PQ)与 Residual Quantization(RQ)及其混合变体纳入同一设计空间,用于分析生成式信息检索中数值型 DocID 的层次与并行结构、DocID 长度和码本大小等超参数的影响。
在 NQ320K 和 MS300K 上,研究者用残差量化、乘积量化和随机标识符分别训练自回归、掩码扩散和块扩散模型,固定标识符长度与训练预算后对比多种解码方式。
研究发现 EmoNet-Face-HQ 细粒度情绪识别基准的失败源于答案读取方式而非模型感知能力:改用 logits 逐类二分类读取后,11 个开源 VLM 全部超过专家一致性锚点(κ_w=0.507-0.586),其中 3 个显著优于微调模型 EIF(Small κ_w=0.551,Large κ_w=0.534)。
研究者提出 DyaFDB,一个在二元设定下评估全双工语音对话模型的框架:两个模型按指定角色直接对话,目标可合作或冲突,双方均由外部裁判离线打分。该框架实例化 4 项任务、140 个场景,记录 7,560 段对话,覆盖 6 种自博弈与交叉配对。实验显示模型行为会持续重塑其对话伙伴,因此每个模型必须同时充当对方的考官与被试,固定 interlocutor 无法胜任。