Skip to content

探讨一下最核心的地方 #28

Description

@ylv01

我理解KDA与DeepSeek-V4的CSA/HCA都以降低长上下文推理的显存和计算成本为目标,但两者采用了不同的记忆机制:
KDA 将历史递归更新到固定大小的状态矩阵中;
CSA/HCA保留按序排列的压缩KV条目,之后仍通过稀疏或稠密Attention进行内容寻址,并增加滑动窗口分支。
在相同显存预算下,两种方案在精确位置检索和长距离信息召回方面是否已有对比实验?

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions