跳到正文
今天10月7日周三374 条
  1. 掘金62

    AI 应用如何优雅恢复中断:连接解耦与状态持久化

    文章提出 AI 长任务应把用户连接与实际任务的生命周期解耦,任务状态需持久化以便精确恢复,而非重试或从头开始。作者梳理了断线重连后的四类问题,包括副作用重复、流式输出重复错乱、上下文丢失和检查点版本不兼容,并给出幂等键、offset 去重、schemaVersion 迁移等对应写法。

  2. 掘金62

    KV Cache 精讲:AI 越聊越慢的原因与长上下文的显存成本

    文章从自回归生成机制讲起,解释大模型推理中预填充与解码是两种不同负载,前者计算密集决定首字延迟,后者访存密集决定出字速度。作者给出 KV Cache 显存估算公式,以 8B 模型(32 层、KV 头 8 个、每头 128 维、fp16)为例算出约 128 KB/token,128K 上下文下单请求缓存约 16 GB,与模型权重相当。

  3. 掘金22

    从"算子"到"AI Infra":大模型背后看不见的那群人在忙什么

    大模型运行依赖算子与 AI Infra 两层支撑:算子是最基本的计算步骤,如 MatMul、ReLU、Softmax,同一算子优化前后速度可差几十倍,FlashAttention 通过重排计算顺序让注意力计算快了好几倍。AI Infra 则覆盖从芯片到上线服务的整套系统,解决跑得起、跑得快、跑得省的问题,常用指标 MFU 能做到一半左右已算不错。

  4. arXiv cs.CV22

    SymNetPro:基于稀疏无线电观测的 LOS 感知定向多发射机定位

    SymNetPro 在 SymNet 的双任务无线电地图重建与定位骨干上新增两个组件:稀疏 LOS 感知注意力偏置和发射机丢弃增强,用于从稀疏接收功率观测中定位多个定向发射机。在定向射线追踪城市环境实验中,其 OSPA 在极端稀疏采样下显著低于代表性定位基线,并在测量噪声和发射机数量增加时保持稳定增益。代码、数据集和模型检查点已公开。

  5. arXiv cs.CV22

    SteadySplats:低方差高斯重采样实现高保真随机渲染

    SteadySplats 通过基于历史的空间重采样与时间重要性重采样,在随机渲染中大幅加速图像收敛并保证相机运动下的连贯性;训练阶段的颜色正则项则隐式降低 3DGS 模型沿视线方向的方差。其基于 Vulkan 的渲染器在每像素 1 采样下较此前随机方法提升约 13 dB PSNR,并快速收敛至排序 3DGS,平均 L1 误差低于 10^-4。

  6. arXiv cs.CV24

    HARMONY:面向单目图像到场景合成的分层智能体推理框架

    HARMONY 是一个分层链式思维框架,结合智能体推理与视觉几何基础模型,从单张室内场景图像重建完整 3D 场景。它先校准相机建立语义空间框架,再按墙面元素、独立家具、家具上装饰物的分层顺序放置物体,并用深度优先遍历和反思反馈循环避免误差累积。实验表明 HARMONY 在合成与真实图像上优于所评估的重建基线,与 GPT-6 Astra 的定性对比显示其物体布局更忠实、场景细节保留更好。

  7. arXiv cs.CV22

    REPA-G:用表征对齐视觉特征实现测试时条件控制

    研究者提出 REPA-G(Representation-Aligned Guidance),一种在推理阶段利用自监督模型对齐表征进行条件控制的框架,无需额外训练即可引导扩散模型去噪过程。该方法支持从单 patch 匹配到全局图像特征 token 的多粒度控制,并可扩展至多概念组合,在 ImageNet 和 COCO 上生成高质量且多样的结果。

  8. arXiv cs.CV22

    VLA-ACL:面向高效 Vision-Language-Action 模型的动作一致性视觉 token 剪枝

    VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,保持基础 VLA 模型完全冻结,让剪枝后上下文产生的动作与全上下文教师模型保持一致。在 LIBERO 和真实机器人操作任务上,该方法最多剪掉 87.5% 的视觉 token,计算量降低最多 75%,推理提速 1.5 倍,性能仍具竞争力。代码已开源。

  9. arXiv cs.CV27

    BASA:面向快速高分辨率视觉生成的后端无关稀疏注意力

    研究者提出 BASA,一种后端无关的稀疏注意力机制,用移位局部窗口注意力替代视觉自注意力,通过跨 DiT 块的结构化窗口移位实现全局信息交换,消除窗口边界造成的网格状伪影。BASA 无需定制算子即可部署在现有注意力后端,在 FLUX 上实测加速超过理论估计的 90%,在 Wan 上实现 4.52 倍注意力加速,并保持有竞争力的生成质量。

  10. arXiv cs.CV27

    SpaTime:面向时空推理的流式视觉语言模型

    SpaTime 是一种流式视觉语言模型,在每一帧将因果几何 token 融合进语言模型,仅依赖已观测帧进行时空推理。它提出响应时间损失,把逐帧响应概率映射为可微的期望响应时间,并惩罚其与真实帧的距离。在流式基准 StreamVSTI-Bench 上,SpaTime 总体准确率达 49.2%,平均响应时间误差较最强流式基线降低 66%。

  11. arXiv cs.CV19

    MoRE:用奖励专家混合框架改进基于语言的轨迹预测

    MoRE(Mixture of Reward Experts)通过强化学习将五个冻结的数值预测器的坐标级先验迁移到预训练语言轨迹预测器中,专家预测转为奖励并经不确定性加权共识融合。在 ETH-UCY 上,ADE 从 0.22 降至 0.20 m,FDE 从 0.32 降至 0.29 m;相对基础策略,ADE 在 SDD 上下降 17.9%、在 NBA 上下降 12.7%,且未增加推理内存或延迟。

  12. arXiv cs.CV22

    CALR:通过 Render-of-Thought 压缩实现连续锚定潜在推理

    研究者提出连续锚定潜在推理方法 CALR,通过信息均衡压缩生成参考潜在状态,将答案监督经由中间状态传递,并用推导级语义锚定约束解码内容。在五个数学推理基准上,CALR 在同等预算下比同类连续潜在推理方法提升 26.0 个百分点,其潜在状态既能支撑答案预测,也携带问题特定的中间推理。

  13. arXiv cs.CV24

    BoT-Feedback:用生物力学证据为多模态推理提供依据,实现可解释的人体动作反馈

    BoT-Feedback 框架通过将 MLLM 推理建立在结构化生物力学证据上,提升人体动作反馈生成质量。其核心 Biomechanics of Thought(BoT)四阶段推理框架,配合即插即用的 Biomechanical Data Parser(BDP)与专家-学生动作时序对齐策略,并引入含配对师生视频、3D 骨架与专家标注的 BiomAF 基准。

  14. arXiv cs.CV24

    超越线性表征假设:KANSteer 用非线性激活引导文本到图像模型

    针对文本到图像模型中概念激活轨迹偏离直线的问题,研究者提出 KANSteer,用 Kolmogorov-Arnold Networks(KANs)将概念遍历建模为穿过中间状态的曲线,使引导方向随概念变化并保持可解释性。在多个概念和文本到图像扩散 Transformer 上,KANSteer 比线性引导更贴合激活轨迹,对中间属性的遍历也更平滑。

  15. arXiv cs.CL22

    ELMRec:增强 LLM 推荐模型的高阶交互感知

    针对现有 LLM 推荐方法忽视或难以建模用户-物品高阶交互的问题,研究者提出 ELMRec,通过增强 whole-word embeddings 让 LLM 无需图预训练即可理解图结构交互,并针对 LLM 更依赖用户早期交互而非近期交互的现象加入重排序方案。ELMRec 在直接推荐和序列推荐上均优于 SOTA 方法,该论文已被 EMNLP 2024 Main 接收。

  16. arXiv cs.CL22

    LLM 在不完美表格上的问答错误研究:错误发现与处理机制

    研究基于 RADAR-T 的人类审核样本,对三种 LLM 进行受控实验,发现改变表格行顺序会改变错误发现结果,且仅提供已验证的错误位置不足以实现准确问答——在代码执行下,修复表格的准确率比错误标记表格高出 39.0-59.1 个百分点。为此提出 GBDI 工作流,在 RADAR-T 上对五种 LLM 的问答准确率较代码智能体基线提升 3.8-18.5 个百分点,代价是额外推理开销。

  17. arXiv cs.CL22

    测试时扩展与后训练在个体立场预测中为何失效?

    研究评估了测试时扩展与后训练方法在个体立场预测中的表现,基于包含 500 名 Hacker News 用户、2499 个预测任务的 STANCE-BENCH,识别出错误共识、选择失败、响应过拟合和早期平台四种失效模式。结合候选立场直接评分与历史支持度评估的方法,在 781 任务测试集上用 Qwen3-8B 达到 21.83 Macro F1,高于直接评分的 19.27。

  18. arXiv cs.CL27

    Dream-RSI:通过演化世界实现递归自我改进

    Dream-RSI 是一个让 AI 智能体递归自我改进探索策略的框架,它把历史发现树当作回放模拟器,在模拟器中"做梦"获得低成本 off-policy 反馈来评估和优化探索策略,无需反复进行昂贵的在线评估。改进后的策略再部署到线上驱动新发现,持续扩充模拟器池形成自我改进循环。在 4 个领域的 9 项任务上,Dream-RSI 取得有竞争力的质量并提升了发现效率。

  19. arXiv cs.CL27

    SharedKV-BT:面向行为树智能体的节点本地类型化决策

    SharedKV-BT 让行为树每个活跃节点暴露阶段本地字段与候选,由 Shared-KV 并行打分并将选中决策交给独立执行系统。在机器人操作、移动导航和计算机使用三类任务上,其类型化决策比提示词匹配的自回归解码快 2.36-4.15 倍;操作任务中节点本地 Shared-KV 将联合决策准确率从 75% 提升至 94%,闭环成功率从 0% 提升至 60%。

  20. arXiv cs.LG22

    CLAD:面向神经网络验证的约束抽象域

    研究者提出约束拉格朗日抽象域(CLAD),可在由凸约束组合定义的输入区域上对神经网络计算可靠的过近似,并通过投影原始-对偶方法求解拉格朗日乘子下的 max-min 问题。在 4 个卷积网络、1,944 个实例的评测中,CLAD 在标准无约束 Linf 属性上与 GCPCROWN 验证数量相当且运行时间相近,在 L2-ball 约束属性上比 GCPCROWN 多验证 60% 的实例,整体多 22%。

  21. arXiv cs.CL23

    同数字引用替换:压力测试 Jev 作为金融证据评判器

    研究用同数字引用替换法压力测试 Jev 作为金融证据评判器的表现,评估其对 GPT-4.1-mini 计算轨迹的来源支撑验证能力。在固定操作数与运算、仅在同数字单元格间移动引用的条件下,带符号数字指针基线解释了大部分恢复效果,显式列标签能改善部分错误角色判定,但也会降低对等价证据的支持。在 36 个新来源页上的后续评测复现了检测角色错误与保留有效引用之间的同一权衡。