以存代算,近期最风靡的词汇之一。它的核心,就是KV Cache(键值缓存)。如果把大模型每次推理比作答题,KV Cache就像它的“即时记忆草稿本”。遇到多轮对话,模型直接翻看存好的草稿即可继续推演,既省下了算力,又缩短了答题时间。