我理解KDA与DeepSeek-V4的CSA/HCA都以降低长上下文推理的显存和计算成本为目标,但两者采用了不同的记忆机制: KDA 将历史递归更新到固定大小的状态矩阵中; CSA/HCA保留按序排列的压缩KV条目,之后仍通过稀疏或稠密Attention进行内容寻址,并增加滑动窗口分支。 在相同显存预算下,两种方案在精确位置检索和长距离信息召回方面是否已有对比实验?
我理解KDA与DeepSeek-V4的CSA/HCA都以降低长上下文推理的显存和计算成本为目标,但两者采用了不同的记忆机制:
KDA 将历史递归更新到固定大小的状态矩阵中;
CSA/HCA保留按序排列的压缩KV条目,之后仍通过稀疏或稠密Attention进行内容寻址,并增加滑动窗口分支。
在相同显存预算下,两种方案在精确位置检索和长距离信息召回方面是否已有对比实验?