arXiv cs.AI· Zhi-Kai Chen, Song-Yan Li, De-Chuan Zhan, Han-Jia Ye·· 9 小时前AI 评分27
SchemaFill:通过槽位并行推测解码实现高效 LLM 工具调用
SchemaFill: Efficient LLM Tool Calling via Slot-Parallel Speculative Decoding
AI 导读
SchemaFill 通过槽位并行推测解码加速 LLM 工具调用,在 Glaive 和 BFCL 上端到端吞吐量最高提升 4.05 倍。该框架将多个字段和调用的候选值并发生成后拼接,由目标模型在实际输出前缀下验证,仅提交通过验证的 token,候选不一致时由目标模型提供修正。代码已开源。
来源:arXiv cs.AI · arxiv.org