AI 应用如何优雅恢复中断:连接解耦与状态持久化
文章提出 AI 长任务应把用户连接与实际任务的生命周期解耦,任务状态需持久化以便精确恢复,而非重试或从头开始。作者梳理了断线重连后的四类问题,包括副作用重复、流式输出重复错乱、上下文丢失和检查点版本不兼容,并给出幂等键、offset 去重、schemaVersion 迁移等对应写法。
文章提出 AI 长任务应把用户连接与实际任务的生命周期解耦,任务状态需持久化以便精确恢复,而非重试或从头开始。作者梳理了断线重连后的四类问题,包括副作用重复、流式输出重复错乱、上下文丢失和检查点版本不兼容,并给出幂等键、offset 去重、schemaVersion 迁移等对应写法。
开发者吐槽Claude、GPT等模型在Coding场景下输出"15/15全绿""单腿哑火"等黑话,原因是厂商为省Token把思维链压缩成"穴居语",同句话Token消耗比白话文少70%。Opus 5.5语言能力有所回升,Gemini则被网友认为是目前少数还能正常沟通的AI。
文章从自回归生成机制讲起,解释大模型推理中预填充与解码是两种不同负载,前者计算密集决定首字延迟,后者访存密集决定出字速度。作者给出 KV Cache 显存估算公式,以 8B 模型(32 层、KV 头 8 个、每头 128 维、fp16)为例算出约 128 KB/token,128K 上下文下单请求缓存约 16 GB,与模型权重相当。
大模型运行依赖算子与 AI Infra 两层支撑:算子是最基本的计算步骤,如 MatMul、ReLU、Softmax,同一算子优化前后速度可差几十倍,FlashAttention 通过重排计算顺序让注意力计算快了好几倍。AI Infra 则覆盖从芯片到上线服务的整套系统,解决跑得起、跑得快、跑得省的问题,常用指标 MFU 能做到一半左右已算不错。
SymNetPro 在 SymNet 的双任务无线电地图重建与定位骨干上新增两个组件:稀疏 LOS 感知注意力偏置和发射机丢弃增强,用于从稀疏接收功率观测中定位多个定向发射机。在定向射线追踪城市环境实验中,其 OSPA 在极端稀疏采样下显著低于代表性定位基线,并在测量噪声和发射机数量增加时保持稳定增益。代码、数据集和模型检查点已公开。
SteadySplats 通过基于历史的空间重采样与时间重要性重采样,在随机渲染中大幅加速图像收敛并保证相机运动下的连贯性;训练阶段的颜色正则项则隐式降低 3DGS 模型沿视线方向的方差。其基于 Vulkan 的渲染器在每像素 1 采样下较此前随机方法提升约 13 dB PSNR,并快速收敛至排序 3DGS,平均 L1 误差低于 10^-4。
HARMONY 是一个分层链式思维框架,结合智能体推理与视觉几何基础模型,从单张室内场景图像重建完整 3D 场景。它先校准相机建立语义空间框架,再按墙面元素、独立家具、家具上装饰物的分层顺序放置物体,并用深度优先遍历和反思反馈循环避免误差累积。实验表明 HARMONY 在合成与真实图像上优于所评估的重建基线,与 GPT-6 Astra 的定性对比显示其物体布局更忠实、场景细节保留更好。
研究者提出 REPA-G(Representation-Aligned Guidance),一种在推理阶段利用自监督模型对齐表征进行条件控制的框架,无需额外训练即可引导扩散模型去噪过程。该方法支持从单 patch 匹配到全局图像特征 token 的多粒度控制,并可扩展至多概念组合,在 ImageNet 和 COCO 上生成高质量且多样的结果。
研究提出"视觉编排税"概念,用于衡量智能体 VLM 流水线中语义未变的图像在 API 边界被反复重建的冗余。在 SeeingEye 和 MAMMQA 上审计发现 66.8-75.6% 的视觉证据触碰冗余,且每条查询均超过预设阈值。
VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,保持基础 VLA 模型完全冻结,让剪枝后上下文产生的动作与全上下文教师模型保持一致。在 LIBERO 和真实机器人操作任务上,该方法最多剪掉 87.5% 的视觉 token,计算量降低最多 75%,推理提速 1.5 倍,性能仍具竞争力。代码已开源。
CtrlCache 是一个免训练的控制感知缓存框架,通过动作感知调度与刷新策略,将视频块标记为初始、过渡、转向或稳态,并在选定的去噪步骤复用 Transformer 残差,同时用频率混合历史先验引导利用低频结构。
研究者提出 BASA,一种后端无关的稀疏注意力机制,用移位局部窗口注意力替代视觉自注意力,通过跨 DiT 块的结构化窗口移位实现全局信息交换,消除窗口边界造成的网格状伪影。BASA 无需定制算子即可部署在现有注意力后端,在 FLUX 上实测加速超过理论估计的 90%,在 Wan 上实现 4.52 倍注意力加速,并保持有竞争力的生成质量。
SpaTime 是一种流式视觉语言模型,在每一帧将因果几何 token 融合进语言模型,仅依赖已观测帧进行时空推理。它提出响应时间损失,把逐帧响应概率映射为可微的期望响应时间,并惩罚其与真实帧的距离。在流式基准 StreamVSTI-Bench 上,SpaTime 总体准确率达 49.2%,平均响应时间误差较最强流式基线降低 66%。
Sparse2comm 是一个带宽高效且鲁棒的协同 3D 目标检测框架,将不可靠协同视为对退化协同特征的渐进式修复。它通过稀疏特征编码以随机掩码采样的前景特征实现超低带宽通信与丢包恢复,再用延迟感知对齐补偿延迟消息、自校准融合估计残余空间偏移。
研究者提出自适应神经细胞自动机(aNCA)架构,用可变形卷积动态调整感知野,在网格类数据上迭代推理 2D 空间关系。在公开基准上,该方法求解数独、迷宫最短路径等图像谜题取得 SOTA 且可理解的结果,并具备较强泛化能力。
研究提出相位速度蒸馏(PVD),将生成过程分为粗、细两个阶段,各用一个半尺寸专家模型建模平均速度,累计计算量仅相当于一次完整骨干前向。
MoRE(Mixture of Reward Experts)通过强化学习将五个冻结的数值预测器的坐标级先验迁移到预训练语言轨迹预测器中,专家预测转为奖励并经不确定性加权共识融合。在 ETH-UCY 上,ADE 从 0.22 降至 0.20 m,FDE 从 0.32 降至 0.29 m;相对基础策略,ADE 在 SDD 上下降 17.9%、在 NBA 上下降 12.7%,且未增加推理内存或延迟。
ReVar3R 提出一种无需重训练、不修改冻结模型的扰动不确定性方法,先将预测对齐到统一相似变换框架再计算逐点方差,在 VGGT、π3 和 MASt3R 三个骨干、六个数据集上,18 种条件中有 15 种将 AUSE 降至内置置信度以下。
CueRator 是一个通过智能体搜索决策规则来适配冻结对比式多模态编码器的框架,在 OV-AVEBench 上将总平均分从 57.8 提升至 60.2,未见类别性能从 55.8 提升至 59.9,并将已见-未见差距从 7.1 缩小至 1.2。
研究者提出 Foveated Compression,将全分辨率图像编码一次,用原生分辨率与压缩分辨率视觉 token 混合表示,并训练行为自蒸馏的 Foveated Merger 与轻量 Foveated Selector 从九个空间单元中选一个保留原生分辨率。
GeoWM 是一种几何世界模型,可直接预测指定未来时刻的场景几何,无需递归 rollout。它利用几何基础模型将观测 RGB 帧转为几何历史,再通过 flow-matching transformer 预测未来几何,并用轻量相机运动预测器估计未来视角。
研究者提出连续锚定潜在推理方法 CALR,通过信息均衡压缩生成参考潜在状态,将答案监督经由中间状态传递,并用推导级语义锚定约束解码内容。在五个数学推理基准上,CALR 在同等预算下比同类连续潜在推理方法提升 26.0 个百分点,其潜在状态既能支撑答案预测,也携带问题特定的中间推理。
BoT-Feedback 框架通过将 MLLM 推理建立在结构化生物力学证据上,提升人体动作反馈生成质量。其核心 Biomechanics of Thought(BoT)四阶段推理框架,配合即插即用的 Biomechanical Data Parser(BDP)与专家-学生动作时序对齐策略,并引入含配对师生视频、3D 骨架与专家标注的 BiomAF 基准。
针对文本到图像模型中概念激活轨迹偏离直线的问题,研究者提出 KANSteer,用 Kolmogorov-Arnold Networks(KANs)将概念遍历建模为穿过中间状态的曲线,使引导方向随概念变化并保持可解释性。在多个概念和文本到图像扩散 Transformer 上,KANSteer 比线性引导更贴合激活轨迹,对中间属性的遍历也更平滑。
一项案例研究评估了混合 4/8-bit 量化(平均每参数 6 bit 和 7 bit)的 Qwen2-Audio-7B-Instruct,在 508 条英译德 FLEURS 语音和 512 条 RAVDESS 情感片段上,两种分配的 BLEU 和 chrF 与 FP16 的差异区间均包含零。
针对现有 LLM 推荐方法忽视或难以建模用户-物品高阶交互的问题,研究者提出 ELMRec,通过增强 whole-word embeddings 让 LLM 无需图预训练即可理解图结构交互,并针对 LLM 更依赖用户早期交互而非近期交互的现象加入重排序方案。ELMRec 在直接推荐和序列推荐上均优于 SOTA 方法,该论文已被 EMNLP 2024 Main 接收。
研究基于 RADAR-T 的人类审核样本,对三种 LLM 进行受控实验,发现改变表格行顺序会改变错误发现结果,且仅提供已验证的错误位置不足以实现准确问答——在代码执行下,修复表格的准确率比错误标记表格高出 39.0-59.1 个百分点。为此提出 GBDI 工作流,在 RADAR-T 上对五种 LLM 的问答准确率较代码智能体基线提升 3.8-18.5 个百分点,代价是额外推理开销。
AgSpec 是一个面向编码智能体流水线的检索式投机解码框架,从会话、工作区和全局语料中检索,并按智能体输出格式索引已打开文件,同时用离线测得的长度上限约束草稿长度、再根据验证反馈在线调整。
研究者提出 NFA-LM,一个面向 NFA 约束生成的多项式时间引擎,在温和假设下具备理论保证。该任务可归约为 #NFA 计数问题,而精确 #NFA 是 #P-complete,此前已有工作证明其存在 FPRAS。实验显示 NFA-LM 能高效生成高质量输出,且近似误差有理论界。
研究评估了测试时扩展与后训练方法在个体立场预测中的表现,基于包含 500 名 Hacker News 用户、2499 个预测任务的 STANCE-BENCH,识别出错误共识、选择失败、响应过拟合和早期平台四种失效模式。结合候选立场直接评分与历史支持度评估的方法,在 781 任务测试集上用 Qwen3-8B 达到 21.83 Macro F1,高于直接评分的 19.27。
Dream-RSI 是一个让 AI 智能体递归自我改进探索策略的框架,它把历史发现树当作回放模拟器,在模拟器中"做梦"获得低成本 off-policy 反馈来评估和优化探索策略,无需反复进行昂贵的在线评估。改进后的策略再部署到线上驱动新发现,持续扩充模拟器池形成自我改进循环。在 4 个领域的 9 项任务上,Dream-RSI 取得有竞争力的质量并提升了发现效率。
研究者提出免训练方法 TwinKV,用非局部 post-RoPE key 频率对 value energy 打折,在精确存储预算下保留原始 key 和 value。
SharedKV-BT 让行为树每个活跃节点暴露阶段本地字段与候选,由 Shared-KV 并行打分并将选中决策交给独立执行系统。在机器人操作、移动导航和计算机使用三类任务上,其类型化决策比提示词匹配的自回归解码快 2.36-4.15 倍;操作任务中节点本地 Shared-KV 将联合决策准确率从 75% 提升至 94%,闭环成功率从 0% 提升至 60%。
研究者提出约束拉格朗日抽象域(CLAD),可在由凸约束组合定义的输入区域上对神经网络计算可靠的过近似,并通过投影原始-对偶方法求解拉格朗日乘子下的 max-min 问题。在 4 个卷积网络、1,944 个实例的评测中,CLAD 在标准无约束 Linf 属性上与 GCPCROWN 验证数量相当且运行时间相近,在 L2-ball 约束属性上比 GCPCROWN 多验证 60% 的实例,整体多 22%。
研究者将 Embedded Language Flows(ELF)扩展至数学推理与代码生成,提出 ELF-REG,用冻结的 AR 教师模型监督中间去噪特征并提供与响应联合去噪的全局表示。
研究用同数字引用替换法压力测试 Jev 作为金融证据评判器的表现,评估其对 GPT-4.1-mini 计算轨迹的来源支撑验证能力。在固定操作数与运算、仅在同数字单元格间移动引用的条件下,带符号数字指针基线解释了大部分恢复效果,显式列标签能改善部分错误角色判定,但也会降低对等价证据的支持。在 36 个新来源页上的后续评测复现了检测角色错误与保留有效引用之间的同一权衡。
研究者提出一种薄板交互模型与交互驱动的量子核,由纠缠 Pauli-string 特征映射构建,可显式编码稀疏高阶块交互,其保真度核具有半正定性并支持精确块因子化。
研究者提出神经语义验证框架,将放射组学测量转化为可寻址证据记录与机器可检验声明,在 611 例 UPenn 病例上定义语义状态,外部证据账本覆盖 331 名患者的 1,655 条模型关联记录。
一篇综述系统梳理了在部署阶段为 LLM 增强"参数内记忆"的方法:将承载记忆的参数对象在推理时接入前向传播,以补充 ICL 消耗上下文容量、重复离散编码成本随上下文增长的问题。
ForcingDAS 是一个基于 Diffusion Forcing 的统一数据同化框架,为每帧分配独立噪声水平,学习联合轨迹先验而非逐帧转移,从而捕捉长程时序依赖并减少误差累积。