Co-Designing AI Models Using Speculative Decoding for Faster LLM Inference 大语言模型推理的自回归解码过程,通常需要逐个预测后续词元。来源文章介绍了一种名为推测解码(Speculative Decoding)的技术:先由较小的草稿模型预测多个可能的后续词元,再交由更大的目标模... AI前沿# AI# AI模型协同设计# LLM推理 5小时前9560