用生成式 AI 增强「经典」文档自动化:ICAIL 2025 司法可及性研讨会论文
一项研究探讨了基于专家系统等符号方法的文档自动化服务如何与当前生成式 AI 方法相互增强,并报告了使用大语言模型识别和修正非专业人士所写文本问题的初步实验。论文分析了这种结合的潜在收益与挑战,共 10 页,收录于 ICAIL 2025 的 AI for Access to Justice Workshop。
一项研究探讨了基于专家系统等符号方法的文档自动化服务如何与当前生成式 AI 方法相互增强,并报告了使用大语言模型识别和修正非专业人士所写文本问题的初步实验。论文分析了这种结合的潜在收益与挑战,共 10 页,收录于 ICAIL 2025 的 AI for Access to Justice Workshop。
PsyCIDRA 是一个将自由形式精神科访谈与诊断推理相连接的双智能体框架,访谈智能体借助工具维护工作笔记、加载专家技能并检索 ICD-11 参考,诊断推理智能体则基于完整访谈记录给出假设及支持、冲突与缺失证据。
COMPASS 是一种推理时激活引导方法,利用模型自身直接作答的正确性信号构造潜在方向,并通过 logit 空间归因分数定位可有效干预的注意力头。在三个模型家族和多个数学基准上,它平均将 GSM8K 准确率提升 16 个百分点,并以少 20-70% 的生成 token 接近 CoT 准确率,干预无需重新拟合即可迁移到未见基准。
arXiv 论文提出让 AI 智能体的声明变得可审计的方法:声明必须先明确其策略、范围、可据以判定的记录及记录撰写方,并在裁决前固定决策规则。该研究将 Auditable Agents 框架的 Policy Checkability 维度从单一动作扩展到声明,并针对智能体补充独立记录覆盖、动作参数授权绑定、超越完整性的完备性三项条件。
一项角色感知的 Decider-Supervisor(DS)框架研究评估了集中式机器学习、FedAvg 联邦元模型与 Base/QLoRA 大语言模型变体四种组合配置。
研究用时间卷积分类器对20名参与者进行留一受试者(LOSO)交叉验证,基于角度阈值标注的GOOD/BAD步态周期,平均AUROC达0.948,BAD周期灵敏度0.941,GOOD周期特异度仅0.366。
研究人员推出 2D-FET-Bench V2,一个基于显微薄片轮廓构建的 128 项 FET 版图任务基准,用于测试语言模型智能体能否完成薄片专属的器件构造。
研究提出一个 2×2 纵深防御框架,将内部激活引导与外部记忆处理分离,在 MemSyco-Bench 上评估四种开放权重模型。
MemCo 是一个记忆中心协作框架,通过维护互补的局部与全局记忆空间,让 LLM 智能体泛化到未见交互环境。它按智能体当前状态和决策阶段路由局部与全局记忆,避免盲目迁移环境特定细节。在交互决策基准上,MemCo 相比孤立记忆和共享记忆基线提升了任务成功率并减少冗余探索。
研究用 1,119 条已标注智能体动作测试运行时门控堆叠,发现任意两个 LLM 裁判组合仅相当于约 1.2 至 1.4 层乘法等效层,而规则层加一个裁判可达 1.86 至 2.09 层。
研究测试语义熵作为 LLM 路由升级信号,在 GSM8K 上以约 12 倍规模差的小/大模型组合实现 AUROC 0.871,同等成本下路由准确率较随机升级最高提升 9 个百分点。作者指出合成基准上的亮眼结果实为假象:仅基于问题难度的无模型规则几乎完全匹配语义熵,并据此提出一套检查清单,涵盖难度对照、升级成功定义分歧、基准天花板及实时采样真实成本等陷阱。
研究提出 Trajectory-Local Adaptive Retrieval(TLAR),从当前推理轨迹中检索近似匹配的续写,并结合近期验证结果自适应调整检索激活与候选宽度。TLAR 将检索续写与模型生成草稿合并到共享候选树,通过精确验证保持目标模型输出分布。在代码调试、数学和开放式写作任务中,TLAR 结合强检索基线在相同验证预算下提升 token 接受率,并较草稿模型基线提高端到端吞吐。
研究者提出 Rationale-Guided Policy Optimization(RGPO),按模型当前能力自适应利用标准答案中的理由信息,将其作为临时脚手架,仅把更高奖励的模型自生成解回传到原始无引导设置。在纯语言与视觉语言推理任务上,RGPO 均持续优于 RLVR 基线,消融实验显示自适应理由引导是性能提升的关键。该工作已被 NeurIPS 2026 接收。
一篇综述系统梳理了神经符号 AI 中用作符号组件的三类规则语言——Datalog、答案集程序与概率逻辑程序,并沿语义、表达能力、神经集成和求值机制四个维度展开对比。作者分析了 50 余个近期系统与应用,覆盖数据库与编程语言、机器学习、视觉和机器人四个研究领域,并给出将应用场景映射到所需特性的决策矩阵,最后列出开放问题。该文将收录于 RuleML+RR 2026 会议论文集。
LLM 智能体的记忆在过往经验可迁移时有用,但当只有部分证据可迁移时会误导推理,研究将这一失败模式称为 memory over-reliance,在部分查询-记忆重叠时最严重。
研究者提出检索可采性验证框架,为每个记忆-查询对分配可采、不可采或未决三种状态,并在 RHELM 和 MemOps 两个公开长期记忆基准的 3,767 条查询上做 Top-20 事后重分析,锚点召回率从 0.432 升至 0.533,80% 召回可行性从 0.237 升至 0.311,精确相似度评估减少 98.3%。
研究者提出面向 Agent 评测的 Trust Layer,在记录分数旁标注该分数是否可信,核查结果是否有评测评分逻辑支撑、通过答案是否来自可追溯计算、完成声明是否与实际相符、以及重复执行下是否稳定。
针对 LLM 内部特征常被当作模型机制的问题,研究者提出一套实证契约,在自然输入观测值上检验特征:通过 installation(将表现某行为的输入特征值复制到不表现的匹配输入)和 removal(反向操作)以及 downstream rescue(上游编辑后恢复特征)来区分特征是否被模型真正使用。
研究者提出将并行编码智能体的协作问题重构为调度问题,通过预先划分工作范围并按生产者→消费者图排序合并,并构建了 NP-Bench 三臂基准(无协作、反应式检测、主动规划)进行验证。该规划器将干净集成率从 1/9 提升至 9/9,合并冲突从 13 降至 0,在实时破坏性契约变更中干净集成率从 0 升至前沿模型的 1.0、小模型的 0.6。跨会话记忆将重复错误率从 1.00 降至 0.00。
MemMux 是一个本地运行时,为并行编码智能体集群提供可检查的资源治理信号,包括按智能体归属、完整回收、逃逸进程可见性等。在 Linux 内存预算约束下,MemMux 将集群控制在 7.5 GiB 且零 swap,而未治理工具会超出预算 2 倍并溢出约 2 GiB 到 swap;它还能 100% 回收终止智能体的进程子树,并检测出全部 10 个逃逸子进程。
研究提出 Diffusion On-Policy Context Distillation(D-OPCD),将智能体改进后的提示词作为特权上下文,把智能体框架的能力蒸馏进扩散模型权重,使其仅凭原始查询也能保留部分框架收益。
一项 arXiv 研究用向量表示动作与策略,测试几何测量能否让 AI 智能体在行动前识别约束规则,四项研究均未建立可靠的行动前判断。最终合成研究中,词法路由器找回了全部管辖与阻断策略、将策略检查中位数减少 97.7%,但组合流水线仍升级了全部 2,304 个测试动作,包括本应放行的动作。作者据此修正假设:AI 智能体的判断需要构建后果图,该假设尚待验证。
研究提出 Looped Self-Distillation 自演化框架,模型在固定信息预算下反复从自身原始输出学习,无需外部评估或测试筛选。
Cascadia 在十一台 Intel Core Ultra X7 358H AI PC 上常驻运行 975B 总参数、41B 激活参数的 MoE 模型 Inkling,每台配 64 GB 内存、Arc B390 核显与千兆以太网。
该研究提出一种能量自适应噪声调度与白化策略,将全局频谱白化与能量条件化噪声分配结合,根据各变换系数的能量及图像相关的能量路径联合调制注入噪声,同时保持高斯转移与闭式边缘分布,兼容标准 DDPM 和 DDIM 流程。在 CIFAR-10 上,该方法将紧凑型 DCTdiff U-Net 变体的 FID 从 142.48 降至 100.45。
研究将连续环境下的视觉语言导航(VLN)方法从仿真迁移到真实世界,无需导航图或全景视图。系统采用 Cross-Modal Attention(CMA)架构,在仿真数据集上训练后,用自建阿克曼转向机器人(配备摄像头和 LiDAR)采集的真实数据微调,结合线性光度调整,在少量 episode 上即完成适配,并可在专用硬件上离线运行。SPL 和 nDTW 指标验证了方法的鲁棒性与适应性。
研究者将一款现代 AI 编程助手置于未知数字岛屿上的虚拟身体中,仅给出不含具体任务、奖励或活动的极简指令,机器便开始驱动身体行动。在三十小时的运行中,该具身智能体爬山、把方块堆成塔、画曼陀罗、重新诠释运动项目,并对自己世界的物理规律做实验,还习得后来扩展其能力的技巧。
AMBER 是一个让智能体在推理、行动的同时写入自由形式记忆的框架,追加式规则从结构上保证信息不被覆盖删除,可端到端用结果奖励做强化学习,无需大量人工整理的 SFT 数据。
一项被 NeurIPS 2026 Social Agent Workshop 接收的研究提出按断言语义类别设定置信度门槛的智能体记忆保留策略。在 100 个合成角色的冷启动记忆流水线上,4,715 条候选断言中价值与信念类仅 77.9% 有来源支持,其他类别为 96.2%,单一全局阈值无法区分。
一项针对 170 名大一经济学学生的双队列双重差分研究显示,使用经研究生助教核验的 AI 生成播客、FAQ 和测验学习指南,与 50 分制考核中 2.34 分的成绩优势相关。
研究评估轻量级开源语言模型在资源受限的边缘环境下,将输入数据实体匹配到最合适的智能数据模型(SDM)的表现,系统基准测试了通用、推理专用和代码专用三类架构在多个领域数据集上的效果。实验还将所调研的大语言模型与 TF-IDF 和轻量级句子编码器两种近零成本相似度基线在同一任务上对比,为判断 LLM 分类在边缘平台的实际价值提供参考。
一篇 arXiv 论文提出面向生成式 AI 的生产级内容抽取系统,将内容抽取作为独立生命周期阶段,包含选择性 OCR 路由、基于参考的抽取评分器、确定性结构感知父子分块器和只读检索评估器。
CuratorMAS 是一个多智能体协作框架,将数据集策展拆解为五个可编程执行阶段并组成可并行工作流,通过数据集探索、在线领域知识检索、评估标准推导与指标计算、过滤及技能进化模块完成自动策展。实验显示,该框架将噪声率最多降低 36.03 个百分点,下游模型 F1 分数最多提升 8.88 个百分点。
针对 AlphaFold 3 类共折叠模型输出中链间原子重叠、配体键长键角失真、环不共面及手性反转等物理违规问题,研究者提出两种闭式投影算子,直接作用于扩散模型去噪后的干净坐标估计 x̂₀:链间范德华投影推开冲突最严重的原子对,配体距离几何投影恢复键长、键角、内部接触、共面性与手性。
JIVEAdapter 是一种多任务加性低秩适配器,借鉴统计方法 JIVE,将每次权重更新分解为所有任务共享的 Joint 结构与各任务独有的 Individual 结构,并惩罚 Individual 与 Joint 近似正交以保持可解释性。
离线 AI 模块工作流发布语音优先的完全离线部署方案,包含模块化架构、低成本硬件 BOM 和面向 2-5B 参数指令微调模型的可复现量化与基准测试流程。
研究者提出 SSRFT(Supervised Safe-Role Fine-Tuning),首个将安全对齐重构为"内化预设安全角色"的框架,通过心理测量问题、少量越狱提示词和安全角色描述构建 SRQA 数据集,让模型内化安全价值观而非显式拒绝模式。
针对视觉语言模型自验证依赖单一标准或固定提示词、可靠性评估不完整的问题,研究者提出 MOTIVE 多视角自验证框架,通过正确性对齐的多视角验证学习为每个候选答案打分。推理时该分数决定直接采纳还是触发历史引导的重思考,在多种多模态基准和 VLM 主干上持续优于强自验证与自纠正基线,并减少不必要的推理轮次。
TopoPlanner 将工具依赖图提升为 cellular workflow complexes,作为拓扑感知上下文供 LLM 进行工具规划,通过 cosheaf 一致检索获取请求相关的闭合子复形,并对检索到的拓扑做多维结构推理后生成工具序列。在四个工具规划基准上,针对 loop、merge 及 loop-merge 工作流,该方法在不同本地 LLM 骨干上均优于基于提示词和图增强的基线。
基于北京和成都路网速度数据构建的离线代理任务显示,联合校准上界可将路径覆盖率从83.19%提升至92.26%(北京M1)、75.14%至88.33%(成都M1)、74.01%至90.64%(成都M2),但C2策略分别使迟到率增加0.1633、0.7848、0.9200个百分点,平均出行时间增加0.588、3.082、4.418秒。