字节跳动Seed团队在最新论文中揭示,大语言模型处理超长文本时性能波动,主要源于分块KV缓存压缩技术的“相位敏感性”。为降低长上下文推理内存消耗,该技术通过固定步幅将连续标记窗口压缩为更少条目,却引入Token相对于压缩窗口的新位置坐标,造成检索偏差,进而引发性能波动。