在自回归解码过程中,庞大的输出嵌入矩阵正逐渐成为制约大语言模型推理速度的严重瓶颈。特别是对于那些拥有多语言庞大词表的小型、紧凑型模型,内存带宽的限制导致传统的稠密词表投影计算效率极低。为解决这一难题,一篇发表于 ICML 2026 AdaptFM Workshop 的最新研究提出了一种全新思路:将输出投影和 Top-k 词元选择过程重构为基于词元嵌入的最大内积搜索(#MIPS)。
该方法的核心在于使用基于 HNSW(分级可导航小世界)的向量索引来取代传统的稠密词表投影。在这种新型的输出头架构中,系统仅需检索出少量可能获得高分的候选词元,并通过将检索到的 Logits 分散映射回稀疏的全局词表张量中,即可无缝融入现有的解码流水线。这种近乎零改造成本的集成方式,为资源受限环境下的推理加速提供了可行路径。
研究人员在 CPU 环境下对 Gemma 3、Llama 3.2 以及 Qwen 3 等前沿模型进行了基准测试。实验结果表明,在 Batch Size 为 1 的低延迟解码场景下,该方法显著缩短了输出投影的计算耗时,其中 Gemma 3 270M 模型的端到端解码吞吐量提升了高达 82%。更重要的是,在主流的 AlpacaEval 评估中,该方案在不损失生成文本质量的前提下,完美保持了原有模型的性能。
随着 AI Agent 逐渐从云端走向端侧(如手机、PC及嵌入式设备),端侧实时响应能力成为了决定 Agent 生态体验的关键。传统优化手段如模型量化和剪枝,往往会以牺牲模型的复杂推理能力为代价。而本研究所提出的“向量索引替代稠密投影”方案,从根本上绕过了输出层巨大的内存带宽瓶颈,与现有的推测解码和 KV 缓存优化形成了互补。这种技术将极大地解放单机端侧 Agent 的多轮对话和自主规划速度,使更小参数的模型在极低的硬件门槛上也能流畅运行复杂的 Agent 循环。未来的 Agent 架构可能会天然集成这种非对称的检索式输出机制,加速实现“人人皆有专属端侧 Agent”的愿景。