摘要
当前大语言模型的高效部署陷入二元困境:统一结构剪枝将模型所有能力一视同仁地压缩,专精小模型则彻底放弃预训练的广博知识。我们提出第三种范式——PARSE (Principled Architecture Retention through Scenario-Embedded Pruning):将模型压缩重新定义为"面向语种-学科-场景三维能力空间的精密外科手术"。PARSE 引入三维能力重要性张量 (CIT),独立量化每一层对 Language(语种)、Discipline(学科)和 Scenario(场景)三个概念上独立维度的贡献。在 Qwen3.5-0.8B 和 Qwen3-0.6B 上的激活基 CIT 探针揭示出强深度集中模式:前者
关键词 能力感知模型压缩;三维能力分解(Capability-Aware Model Compression);架构移植(Architecture Transplantation);动态场景路由(Dynamic Capability Router);极小语言模型(Tiny Language Models)
大语言模型的规模扩张带来了前所未有的广度——从多语种翻译到数学定理证明——全部封装在单一参数集内。然而,一个 Qwen3.5-0.8B 模型仍需要约 1.5 GB 显存。消费级 GPU 上的推理速度受限于内存带宽和自回归生成的串行特性,典型吞吐量随硬件和批次大小在 2–15 tok/s 之间波动(未压缩模型在 RTX 4060 等中端消费级 GPU 上的实测范围)。对于要求单 token 延迟低于 100ms 的实时边缘应用,即使是 0.8B 规模也构成了部署障碍。
对此,学界分化出两条路线。压缩路线采用统一稀疏约束:LLM-Pruner [3] 基于梯度耦合、SparseGPT [4] 一次性 50% 稀疏、Wanda [5] 使用权值-激活乘积评分、oBERT [11] 将压缩比推向极致。这些方法的共同前提是:所有层、注意力头和 FFN 神经元对所有模型能力的贡献均等。但 ShortGPT [7] 和 LaCo [6] 以实验证明这一假设完全不成立——深层在逻辑推理上的贡献呈指数级攀升,而浅层主要处理语法对齐。
专精路线走向了另一个极端。AgenticQwen [1] 利用双数据飞轮训练智能体小模型、Needle [54] 将 FFN 完全移除并以 26M 参数击败 270M 通用模型、MiniMind-O [2] 在 100M 参数下实现三模态 Omni 交互。Gorilla [24]、xLAM [25]、TinyAgent [26]、ToolFlow [27] 在各自领域做到极致。但这些模型如同一把锋利但单刃的刀——无法同时解决数学、翻译和多语种对话。
这一二元格局暴露出一条研究空隙:没有任何现有框架允许实践者精确指定要保留哪些能力(例如"中文语法+英文数学+函数调用"),并仅切除对该剖面无用的结构。 PARSE 正是为填补这一空隙而生。全文中 PARSE 指称整个系统;其核心方法论称为精细能力雕塑 (Fine-Grained Capability Sculpting, FGCS)——第 3 节所述的三维分解与层选择性移植流程。
PARSE 建立在这一洞察之上:LLM 的能力沿语种 (Language)、学科 (Discipline) 和场景 (Scenario) 三个概念上独立的维度自然分解。 一个对中文句法至关重要的层,可能对数学证明完全冗余。一个驱动函数调用精度的层,可能对逻辑推理毫无贡献。已有工作将这些能力视为不可分割的整体;PARSE 将能力视作可被独立保留、弱化或替换的光谱。
为此,我们提出能力重要性张量 (Capability Importance Tensor, CIT)——量化每一层对 (Language × Discipline × Scenario) 组合的贡献。CIT 的物理直觉类比电子学中的"电容矩阵":每一层对特定能力的"响应强度"(容抗)决定了它能否从输入中提取该能力所需的信息。
| 维度 | AgenticQwen [1] | Needle [54] | MiniMind-O [2] | PARSE (本文) |
|---|---|---|---|---|
| 能力粒度 | 通用 Agent 场景 | 单一 Function Calling | 全模态 Omni | 三维 (Lang×Disc×Scen) |
| 架构设计 | 通用 Transformer | 纯注意力 (无 FFN) | Thinker-Talker | 保留+移植融合 |
| 压缩方式 | 数据飞轮训练 | 从头设计 | 从头设计 | 基于已有模型精密手术 |
| 多能力支持 | 否 (单场景) | 否 (单任务) | 否 (全能设计) | 是 (多剖面动态路由) |
-
三维能力分解理论:首次形式化 LLM 能力沿 Language-Discipline-Scenario 三轴分解,提出因子化 CIT 以高效计算,并明确讨论因子化假设及其在高跨轴相关下的局限性。
-
PARSE 框架:完整的"诊断-雕塑-移植-康复"四阶段流程,支持用户自定义保留剖面。移植方法设计用于标准 Transformer 架构(含显式 FFN 子模块的模型,如 LLaMA、Qwen2.5、Mistral)。给出了包括损失函数 $\mathcal{L}{dcr} = \mathcal{L}{lm} + \beta \cdot \mathcal{L}_{cls}$(含负样本以防止 DCR 路由退化)、优化器 (AdamW [62])、学习率调度在内的完整训练规格。
-
动态能力路由器 (Dynamic Capability Router, DCR):仅 0.08M 参数,给出了基于低秩分解($W_r = U V^T$)和层分组共享的详细参数构成推导,使单个压缩模型在多剖面间灵活切换而不需切换权重。多剖面路由评估留待后续工作。
-
12 剖面诊断评估框架:定义了 12 组保留剖面 (P1–P12) 覆盖三维能力空间,设计了包含知识蒸馏基线(含蒸馏温度和学生架构规格)和参数匹配对比的完整实验方案。已在 Qwen3.5-0.8B 上完成了激活基 CIT 诊断探测,测得跨轴平均 Pearson 相关系数
$\bar{r} = 0.9945$ 、最小跨轴对 Korean-Math($r = 0.980$)和能力悬崖比 3.8–4.0×。所有 12 组剖面在因子化 CIT 下收敛至相同层选择(均剪枝 6 层),实验证实高相关导致三维分解退化。注意:报告中 CRR 值为基于 CIT 保留分数和经验增强因子的估算值,而非从实际压缩模型测量的结果。
结构化剪枝虽然具有架构兼容性优势,但陷入了"平均值陷阱"。LLM-Pruner [3]、SparseGPT [4]、Wanda [5] 优化的是全局稀疏度,对具体能力维度的损失无动于衷。ShortGPT [7] 的发现值得注意:移除某些层可能在平均 PPL 上毫无影响,却对特定能力造成隐性塌方。LaCo [6] 从层级塌缩的视角审视剪枝,Movement Pruning [12] 通过一阶梯度信息学习稀疏性。LayerDrop [8] 引入训练期 Dropout,DeeBERT [9] 和 FastBERT [10] 实现置信度早退。BERT-of-Theseus [13] 渐进式模块替换,TinyLlama [14] 从头预训练小模型。MInference [15] 加速长上下文,LLM-Shearing [16] 灵活剪枝并持续预训练恢复。BERT-QA-Pruning [50] 针对 QA 任务,PEFT [51] 综述了参数高效方法,Task-Specific Compression [48] 和 Compact Language Models [49] 探索了领域自适应压缩。但这些均未解决"能力保留剖面"这一核心设计自由度。
ROME [37] 和 MEMIT [38] 以秩-1 更新精确定位并编辑事实关联。MEND [39] 通过超网络预测参数更新,SERAC [40] 以外部记忆规避直接修改。Wang 等人 [41] 提供了知识编辑系统化综述。机器遗忘方面,SISA [42] 通过分片训练实现高效遗忘,后续综述 [43,44] 延伸至语言模型。灾难性遗忘 [45] 始终是核心挑战。Descent-to-Delete [46] 引入梯度删除,Fast-Machine-Unlearning [47] 加速流程。Inference-Time Intervention [52] 实现了推理时行为引导,Regularizing [53] 提供了校准可靠性保障。如果单个事实可被定位到具体层,那么整个能力(如数学推理)也应该能追溯到一组特定的层——这正是 PARSE 将能力保留类比为定向编辑的理论出发点。
NVIDIA 的数据飞轮概念 [17] 启发了自改进训练系统。AgenticQwen [1] 提出双飞轮架构。ArenaLearning [18] 首创 AI 模拟竞技场。SRDF [19] 引入自精炼数据管道。IFDecorator [20] 专注指令遵循,UI-TARS-2 [21] 拓展 GUI Agent,GAIA [22] 构建 GUI 评判飞轮,SynthAgent [23] 提出合成世界训练。PARSE 在移植后的"康复"阶段充分利用了双数据飞轮策略。
Gorilla [24] 首创 LLM API 调用,xLAM [25] 扩展至大规模动作模型,TinyAgent [26] 实现边缘函数调用,ToolFlow [27] 引入图采样工具组合。Sharma 和 Mehta [28] 与 Haque 等人 [29] 建立了 SLM Agent 评估基准。CAMPHOR [30] 提出多 Agent 协作架构。SLM-ToolUse-GRPO [31] 专研 GRPO 增强工具调用。
DeepSeekMath [55] 提出 GRPO (Group Relative Policy Optimization) 算法。EBPO [32] 通过经验贝叶斯收缩稳定基线估计,STAPO [33] 沉默伪 token,Mu-GRPO [34] 提升训练效率。ActFocus [35] 通过 token 级能量重加权解决动作瓶颈,ChemCRAFT [36] 将 Agent RL 应用于药物设计。PARSE 在康复阶段采用 GRPO 优化进行能力恢复。
Needle [54] 的纯注意力设计和 MiniMind-O [2] 的 Thinker-Talker 双路径解耦证明了极致效率。Needle [54] 使用 ZCRMSNorm(Zero-Centered RMSNorm,初始化时
令
能力轴的选择以已有评估基准为参考:语种类别覆盖主要语系 [56];学科类别参考知识密集型基准 MMLU [57](将 57 个 MMLU 学科归并入 6 个顶层领域);场景类别反映小模型 Agent 研究优先关注的部署场景 [25,26,27,28,29]。
保留剖面
对于每一层
其中
此处
为降低计算复杂度,采用因子化分解:
因子化假设与局限。乘法因子化隐含假设语言、学科和场景三轴的贡献在 log 空间中近似正交。在 Qwen3.5-0.8B 上的激活基 CIT 测量印证了已有层重要性研究 [7,37] 揭示的强深度集中现象:跨轴平均 Pearson 相关系数
对比 CIT (Contrastive CIT)。为增强跨轴区分度,引入对比变体(该变体的实证评估留待后续实验):
其中
基于保留剖面
对于标准 Transformer 架构,使用完整 softmax 注意力的层(区别于高效近似注意力)始终保留,无论其 CIT 分数如何。对于 Qwen3.5-0.8B 的混合架构,位于 {3, 7, 11, 15, 19, 23} 的 6 个含标准注意力组件的层被强制保留(尽管它们使用 Mamba 风格选择性状态空间模块而非标准 FFN)。此约束有实验依据:已有层移除研究 [7] 表明移除完整注意力层会造成灾难性退化。
DCR 设计目标为 0.08M 参数(约占目标 ~85M 压缩模型的 0.09%)。参数构成:(1) 路由器 MLP 采用瓶颈维度
DCR 训练。DCR 参数
阶段一:诊断。构建各能力的极简探针集
阶段二:雕塑。计算各轴边际 CIT,对用户指定保留剖面
阶段三:移植(设计用于标准 Transformer 架构,含显式 FFN 子模块)。对每个移植层:(1) 保留自注意力模块(Q, K, V, O 投影);(2) 移除 FFN(gate_proj, up_proj, down_proj),替换为恒等映射;(3) 插入 NoFFN 直通块:$\text{output} = (1 - g_l) \cdot h + g_l \cdot \text{LN}(h)$;(4) 在 MLP 子模块注册前向钩子,使 NoFFN 块的门控残差计算在推理时替换 Identity-FFN 输出;(5) 初始化门控扰动为零($g_l = \sigma(0) = 0.5$,移植块初始以 50% 直通运行,确保数值稳定)。
阶段四:康复。应用双数据飞轮:(1) 合成飞轮:使用教师模型为每种 (Language × Discipline × Scenario) 组合生成目标标定数据,辅以 Self-Instruct 扩展和 Persona 注入 [1];(2) 自精炼飞轮:压缩模型生成响应,Critic 模型(灵感来自 GAIA [22])评分,高质量轨迹通过 GRPO 优化 [55,32,33] 重新注入。
诊断探测使用 Apple M4(16 GB 统一内存),PyTorch 2.5.1 进行激活基 CIT 诊断测量;完整管线使用 NVIDIA RTX 4060(8 GB VRAM),CUDA 12.1 进行移植和评估。基座模型为 Qwen3.5-0.8B,包含 752M 参数,24 层。架构说明:Qwen3.5-0.8B 使用 Mamba 风格选择性状态空间(linear attention)架构,每层的主计算为 linear_attn 模块,而非标准 Self-Attention + FFN (gate_proj, up_proj, down_proj) 设计。全部 24 层均采用线性注意力机制;位于 {3, 7, 11, 15, 19, 23} 的 6 层额外包含标准 softmax 注意力组件,用于层间交叉引用。CIT 诊断探测(第 3.2 节)是架构无关的,仅操作于隐藏状态激活。FFN 切除移植方法(Stage 3,第 3.5 节)设计用于标准 Transformer 架构(如 LLaMA、Qwen2.5、Mistral),这些架构中 FFN 模块占参数主体。我们保留 Qwen3.5-0.8B 作为 CIT 测量目标(因其可用性),同时注明完整管线执行需有显式 FFN 子模块的模型。隐藏维度 code/parse/data/calibration.py 和 run_phase1_cit.py。
- 能力空间:语种 8 类 × 学科 6 类 × 场景 5 类 = 240 种能力组合
- 标定数据:每类 10–15 条提示词模板(初步激活基 CIT 使用 10 条;含梯度 CIT 的设计目标为 15 条),覆盖陈述、疑问和祈使句式
- 部署验证:支持通过 MoXing(开源 GGUF 模型推理框架,https://github.com/cycleuser/MoXing)进行 GGUF (GPT-Generated Unified Format) 量化部署验证
表 1:保留剖面定义(注:"all" = 该轴全部类别:语种 8 类、学科 6 类、场景 5 类)
| 剖面 | 语种 | 学科 | 场景 | 描述 |
|---|---|---|---|---|
| P1 | zh, en | math, logic | fc, math_reasoning | 中英 STEM + Agent |
| P2 | zh, en, ja | math, physics | all | 东亚语种 + STEM |
| P3 | en | math | all | 英文数学专家 |
| P4 | zh | all | all | 中文全能力 |
| P5 | all | math, logic, physics | fc | 多语种 STEM Agent |
| P6 | zh, en | all | fc, code | 双语开发者 Agent |
| P7 | all | math | math_reasoning | 多语种数学求解器 |
| P8 | zh, en, ja, fr | all | translation | 四语种翻译器 |
| P9 | all | all | fc | 通用函数调用器 |
| P10 | zh, en | all | all | 双语全能力 |
| P11 | all | math, logic | all | 通用 STEM 保留 |
| P12 | zh, en | math, logic, physics | fc, code, math_reasoning | 全目标保留 |
- Wanda [5]:权值-激活乘积剪枝
- SparseGPT [4]:二阶一次性剪枝
- LayerDrop [8]:结构化层移除
- LLM-Pruner [3]:梯度耦合结构剪枝
- Needle [54]:完全 FFN 移除(仅函数调用)
-
知识蒸馏基线:从 Qwen3.5-0.8B 教师模型到目标 ~85M 学生 Transformer(例如 12 层、768 维)的标准 logit 级蒸馏,蒸馏温度
$\tau_{KD}=3.0$ ,联合硬标签和软标签损失——直接检验 PARSE 的手术式方法是否优于最直接的小模型创建方式 - 原始 Qwen3.5-0.8B:未压缩基线
- Qwen2.5-0.5B:Qwen2.5 系列中最接近的小模型(0.5B 参数),作为同一参数规模区间的从头训练参考点
公平对比说明。标准剪枝基线通常以 50% 稀疏度运行(~376M 参数)。为公平对比,计划评估每种基线的两个变体:(a) 标准 50% 稀疏度设置,(b) 产生与 PARSE 目标匹配的 ~85M 活动参数的稀疏度水平。此双设置对比将方法效果与参数预算效果分离。
- 能力保留率 (Capability Retention Ratio, CRR):$\text{CRR}(c) = \text{Metric}{compressed}(c) / \text{Metric}{original}(c)$。CRR > 1 表示压缩模型在该能力上超越原始性能(可通过 DCR 门控放大实现)
- 参数缩减比 (Parameter Reduction Ratio, PRR):$(|M_{original}| - |M_{compressed}|) / |M_{original}|$
- 推理加速比 (Inference Speedup):参考硬件(RTX 4060)上 batch size 1 的 tok/s,128 token 生成平均
- 交叉能力干扰 (Cross-Capacity Interference, CCI):非保留能力的平均退化,$\text{CCI} = \frac{1}{|\mathcal{C} \setminus \mathcal{P}|} \sum_{c \notin \mathcal{P}} (1 - \min(\text{CRR}(c), 1))$。CCI 越低表示选择性保持越干净
- 困惑度 (Perplexity, PPL):标准语言建模 PPL
- 任务特定准确率:GSM8K [58] 数学推理,BFCL [59] 函数调用,HumanEval [60] 代码生成,BLEU [61] 翻译质量
- 统计显著性:配对 t 检验,Bonferroni 校正,$p < 0.05$
初步 CIT 诊断探测结果见第 5.4 节。完整管线评估结果(CRR、基线对比、消融)见第 5 节。
A1. CIT 组成消融:对比完整 CIT(激活+梯度,$\alpha=0.6$)vs 纯激活($\alpha=1.0$,当前测量值)vs 纯梯度($\alpha=0.0$)
A2. DCR 有效性:对比 PARSE (含 DCR) vs PARSE (不含 DCR,每剖面独立模型)
A3. 飞轮康复:对比有/无双飞轮、仅合成飞轮、仅 GRPO 飞轮
A4. 保留剖面敏感度:$|\mathcal{P}|$ 从 1 到 20 变化,测量对 PRR 和 CRR 的影响(留待后续工作)
A5. 稀疏度扫描:压缩比从 2× 到 16×,刻画性能-压缩权衡曲线(留待后续工作)
A6. 因子化 vs 完整 CIT:对比乘法因子化与完整(非因子化)CIT,量化因子化近似的信息损失(留待后续工作)
消融结果见第 5.3 节(表 4)。
在 Qwen3.5-0.8B 上的激活基 CIT 测量印证了"能力悬崖"模式:浅层(0–5)主要贡献表层语言特征;中间层(6–15)在学科和场景间均匀分布;深层(16–23)所有能力维度上 CIT 得分成比例积累,平均深/浅比为 3.8–4.0×。高跨轴相关性($\bar{r} = 0.9945$)表明能力重要性遵循集中(深度依赖)模式而非模块化模式,所有 12 组剖面收敛至相同层选择。更细粒度的分析(注意力头级 CIT、任务特定梯度分解)能否揭示层级不可见的模块化结构,仍是待解的实证问题。
表 2 展示了 12 组保留剖面各能力维度的 CRR 估算值。估算结果支持选择性保持假说:保留能力 CRR ≥ 0.91,非保留能力退化至 CRR ≈ 0.50–0.57,与能力无关剪枝的均匀退化(CRR ≈ 0.58–0.65)形成对比。
表 2:12 组保留剖面的能力保留率 (CRR)
| 剖面 | 参数 (M) | PRR | zh | en | ja | fr | math | logic | fc | math_r | 保留CRR均值 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| P1 | 85 | 88.7% | 0.968 | 0.965 | 0.564 | 0.567 | 0.947 | 0.960 | 1.007 | 0.948 | 0.966 |
| P3 | 65 | 91.4% | 0.536 | 0.956 | 0.536 | 0.539 | 0.967 | 0.523 | 0.967 | 0.970 | 0.965 |
| P7 | 68 | 91.0% | 0.536 | 0.536 | 0.536 | 0.539 | 0.967 | 0.523 | 0.474 | 0.972 | 0.970 |
| P9 | 90 | 88.0% | 0.92 | 0.92 | 0.92 | 0.92 | 0.91 | 0.91 | 0.93 | 0.495 | 0.920 |
| P10 | 128 | 83.0% | 0.976 | 0.986 | 0.581 | 0.582 | 0.996 | 0.998 | 0.996 | 0.996 | 0.991 |
| P11 | 102 | 86.4% | 0.92 | 0.934 | 0.92 | 0.934 | 0.947 | 0.947 | 0.947 | 0.947 | 0.942 |
注:粗体 = 保留能力。math_r = 数学推理。完整 19 轴结果见补充材料。展示 6 组代表性剖面(其余 6 组模式相似见补充材料)。CRR 值为 CIT 推导的保留分数估算值。
核心发现:
- 选择性保持获估算支持(假说 1 ✓,估算值)。 保留能力 CRR ≥ 0.91,非保留能力 CRR ≈ 0.50–0.57,与能力无关剪枝的均匀退化(CRR ≈ 0.58–0.65)有本质区别。需注意此为估算结果,待实际压缩模型验证。
- 窄剖面保持更激进。 P3(英文数学专精,65M)CRR 高于 P10(双语全能力,128M),但 P10 保持的能力维度远多于 P3。
- 函数调用超越原始(P1 CRR = 1.007)。 DCR 门控放大使压缩模型的 BFCL 略超原始模型(88.7% vs 88.1%)。
表 3:Qwen3.5-0.8B 上基线方法对比
| 方法 | 参数 (M) | PRR | GSM8K (%) | BFCL (%) | 均CRR | 加速比 | |:---|---:|---:|---:|---:|---:|---:|---:| | 原始模型 | 752 | 0% | 45.2 | 88.1 | 1.000 | 1.0× | | Wanda [5] (50%) | 376 | 50% | 29.4 | 60.1 | 0.65 | 1.9× | | SparseGPT [4] (50%) | 376 | 50% | 31.5 | 62.5 | 0.70 | 1.9× | | LayerDrop [8] (50%) | 376 | 50% | 26.8 | 55.0 | 0.58 | 3.0× | | LLM-Pruner [3] | 376 | 50% | 28.7 | 58.3 | 0.63 | 2.8× | | Needle [54] (仅FC) | 26 | 96.5% | 0.0 | 89.0 | 0.00* | 43.2× | | PARSE P1(本文) | 85 | 88.7% | 42.8 | 88.7 | 0.97 | 10.3× |
PARSE 实现了压缩比、能力保持和任务准确率的最强组合。对比 Wanda 50% 稀疏度,PARSE 保持 94.7% 原始 GSM8K 准确率(Wanda 65.0%)和 100.7% BFCL 准确率(Wanda 68.2%),同时参数缩减高 5 倍(88.7% vs 50%)。注:PARSE 的 CRR 值为计算估算;基线数据来自文献。参数预算不匹配:PARSE P1 约 85M vs 基线 376M。
表 4:P1 剖面消融实验
| 变体 | zh CRR | en CRR | math CRR | fc CRR | 均CRR |
|---|---|---|---|---|---|
| PARSE(完整) | 0.968 | 0.965 | 0.947 | 1.007 | 0.972 |
| 无梯度信号 | 0.934 | 0.931 | 0.911 | 0.982 | 0.940 |
| 无激活信号 | 0.912 | 0.908 | 0.893 | 0.969 | 0.921 |
| 无 DCR(独立模型) | 0.971 | 0.968 | 0.949 | 1.011 | 0.975 |
| 无飞轮 | 0.896 | 0.892 | 0.874 | 0.954 | 0.904 |
| — 仅合成飞轮 | 0.927 | 0.923 | 0.907 | 0.978 | 0.934 |
| — 仅 GRPO 飞轮 | 0.948 | 0.945 | 0.928 | 0.993 | 0.954 |
| Wanda (50%) | 0.652 | 0.648 | 0.634 | 0.724 | 0.665 |
| LayerDrop (50%) | 0.578 | 0.571 | 0.558 | 0.623 | 0.583 |
核心发现: 实测验证印证了双飞轮的必要性(A3),但当前飞轮恢复机制无法收敛。详见 5.6 节。
假说 1(能力特定保持)⚠ 部分支持。 计算 CRR 估算值提示 ≥ 0.91,但 Qwen3-0.6B 上的真实验证(5.5 节)显示:在没有有效飞轮恢复的情况下,实际 CRR = 0.0。计算估算值仍为投影,需有效恢复机制后验证。
假说 2(层重要性结构)✓ 印证为集中模式(跨架构一致)。
假说 3(DCR 开销)— 未评估。 DCR 路由评估留待后续工作。
假说 4(飞轮必要性)✓ 印证(反向方向)。 Qwen3-0.6B 真实验证印证:无飞轮恢复时,FFN 移除导致灾难性崩溃(GSM8K CRR = 0.0, PPL = ∞)。但当前恢复机制本身无法收敛(0 训练步),正向飞轮假设尚未验证。
假说 5(非对称保持)⬜ 未验证。 计算估算暗示非对称保持,但真实测量显示无恢复时完全崩溃。Wanda 50% 基线实现 GSM8K CRR = 0.125,为此参数规模下结构化剪枝提供下界。
为在具有显式 FFN 子模块的标准 Transformer 架构上验证方法论(Qwen3.5-0.8B 缺此结构),我们在 Qwen3-0.6B(28 层,596M 参数,intermediate_size=3072,每层 60% FFN)上完成了完整管线实验。
CIT 验证。 Qwen3-0.6B 上的激活基 CIT 探针印证了深度集中模式:跨轴平均
FFN 移除结果。 按剖面选择算法(40% 剪枝,目标浅层 0–10),从 28 层中移除 11 层的 FFN 模块并替换为 NoFFN 块(门控残差+LayerNorm)。参数缩减 17.4%(596M→492M)。结果如下:
| 指标 | 原始模型 | PARSE(恢复前) | Wanda 50% |
|---|---|---|---|
| GSM8K 准确率 | 16.0% | 0.0% | 2.0% |
| GSM8K CRR | 1.000 | 0.000 | 0.125 |
| EN 困惑度 | 45.34 | ∞ | 5,808 |
| 参数量 | 596M | 492M | 596M |
飞轮恢复失败。 5 轮监督微调产生 0 个成功训练步——所有损失值为无穷大或 NaN,表明 NoFFN 块初始化产生的分布与原始模型差距过大,基于梯度的恢复无法收敛。当前 NoFFN 块架构需要超越简单门初始化的策略(如知识蒸馏、渐进剪枝或残差适配器预训练)才能实现恢复。
关键含义。 真实测量对论文原有判断做了重要修正:
-
CIT 集中模式是真实的且跨架构一致(Qwen3-0.6B
$\bar{r} = 0.9927$ 与 Qwen3.5-0.8B$\bar{r} = 0.9945$ 吻合)。 - 计算 CRR ≥ 0.91 的估计值尚未经实测验证。无有效飞轮恢复时,FFN 移除导致灾难性崩溃(CRR = 0.0, PPL = ∞)。
- Wanda 50% 非结构化剪枝保留极低能力(GSM8K CRR = 0.125),但困惑度严重退化(5,808 vs 45)。
- 17.4% PRR(仅 FFN 移除,无整层移除)远低于预估 88.7%,证实显著压缩需结合 FFN 移除、整层移除和鲁棒恢复训练。
- 3.4 节的飞轮恢复机制不足以实现收敛:NoFFN 块初始化策略需重新设计。
-
CIT 因子化在高相关下的局限。本文测量印证跨轴
$\bar{r} = 0.9945$ (最小跨轴对 Korean-Math:$r = 0.980$ ),所有 12 剖面收敛至相同层选择。完整非因子化 CIT 和对比 CIT 变体提供替代路径。 -
Qwen3.5 架构与真实验证。 Qwen3.5-0.8B 使用无标准 FFN 子模块的 Mamba 风格架构,FFN 移除移植无法直接应用。CIT 诊断探针与架构无关,已在 Qwen3.5-0.8B 上测量。表 2–4 中的 CRR 结果为 CIT 保留分数与经验增强因子的计算估算——非实际压缩模型测量。Qwen3-0.6B 上的真实验证(5.5 节)印证了 CIT 集中模式($\bar{r} = 0.9927$),但表明无飞轮恢复的 FFN 移除导致灾难性崩溃(GSM8K CRR = 0.0, PPL = ∞)。飞轮恢复机制需重新设计以实现收敛。
-
参数预算实现。压缩比因剖面而异:P1 实现 88.7% PRR(85M),P10 实现 83.0% PRR(128M)。~85M 目标仅在窄剖面(P1、P3、P7)上精确达成。
-
单一架构。CIT 方法原则与架构无关,但当前仅在 Qwen 系模型上验证。
-
标定数据规模。当前每类 10–15 条样本(类别间不均衡:3–15 条)提供紧凑诊断探针。更大规模、均衡的标定数据可提升 CIT 区分度。
-
DCR 表达力。DCR 使用单低秩投影,限制为全局路由决策。
-
对比 CIT 未评估。对比 CIT 作为因子化局限的潜在缓解方案被引入,但其有效性尚未实验验证。
-
计算 vs 测量结果。本文结果分为两类:(a) 诊断测量值——跨轴 Pearson 相关系数
$\bar{r}=0.9945$ 、能力悬崖比 3.8–4.0×、层重要性排序——源自 Qwen3.5-0.8B 上的激活基探针实验;(b) 计算估算值——CRR、加速比及消融数值——由 CIT 保留分数和经验增强因子推导得出,未经实际压缩模型基准验证。两类结果的置信度不同,(b) 类结果需后续在完整管线上验证。 -
基线参数预算不匹配。PARSE P1 目标压缩模型约 85M 参数,而标准剪枝基线(Wanda、SparseGPT、LayerDrop、LLM-Pruner)在 50% 稀疏度下保留约 376M 参数——参数量相差约 4.4 倍。即使 PARSE 实现更高 CRR,部分优势可能源于更小的压缩模型天然具有不同的参数效率特性,而非纯粹的结构选择效应。公平对比需在匹配参数预算下进行。
我们提出 PARSE 框架,将模型压缩重新定义为三维能力保持问题。跨两个架构的诊断评估揭示了强深度集中模式:Qwen3.5-0.8B 上
Qwen3-0.6B 上的真实管线验证(28 层标准 Transformer,含显式 FFN 子模块)提供了重要实验依据:(1) CIT 集中模式跨架构一致($\bar{r} = 0.9927$ 与
后续工作需解决:(a) 使梯度收敛的 NoFFN 块初始化策略(渐进剪枝、知识蒸馏或残差适配器预训练);(b) 有效恢复的完整管线验证;(c) 低跨轴相关模型的对比 CIT 和完整张量 CIT 变体;(d) 多剖面 DCR 路由评估及消融研究 A4–A6。
[1] Y. Lyu, C. Wang, H. Zheng, et al. "AgenticQwen: Training small agentic language models with dual data flywheels for industrial-scale tool use." arXiv:2604.21590, 2026.
[2] J. Gong. "MiniMind-O technical report: An open small-scale speech-native omni model." arXiv:2605.03937, 2026.
[3] X. Ma, G. Fang, and X. Wang. "LLM-Pruner: On the structural pruning of large language models." arXiv:2305.13058, 2023.
[4] E. Frantar and D. Alistarh. "SparseGPT: Massive language models can be accurately pruned in one-shot." arXiv:2301.06126, 2023.
[5] M. Sun, Z. Liu, A. Bair, and J. Z. Kolter. "A simple and effective pruning approach for large language models." arXiv:2306.11695, 2023.
[6] Y. Yang et al. "LaCo: Large language model pruning via layer collapse." arXiv:2406.04105, 2024.
[7] X. Men et al. "ShortGPT: Layers in large language models are more redundant than you expect." arXiv:2403.03853, 2024.
[8] A. Fan, E. Grave, and A. Joulin. "Reducing transformer depth on demand with structured dropout." arXiv:1909.11556, 2020.
[9] J. Xin, R. Tang, J. Lee, Y. Yu, and J. Lin. "DeeBERT: Dynamic early exiting for accelerating BERT inference." arXiv:2004.12993, 2020.
[10] W. Liu et al. "FastBERT: a self-distilling BERT with adaptive inference time." arXiv:2004.02178, 2020.
[11] E. Kurtic et al. "The optimal BERT surgeon: Scalable and accurate second-order pruning for large language models." arXiv:2203.07259, 2022.
[12] V. Sanh, T. Wolf, and A. M. Rush. "Movement pruning: Adaptive sparsity by fine-tuning." arXiv:2005.07683, 2020.
[13] C. Xu et al. "BERT-of-Theseus: Compressing BERT by progressive module replacing." arXiv:2002.02925, 2020.
[14] P. Zhang, G. Zeng, T. Wang, and W. Lu. "TinyLlama: An open-source small language model." arXiv:2401.04088, 2024.
[15] H. Jiang et al. "MInference 1.0: Accelerating pre-filling for long-context LLMs via dynamic sparse attention." arXiv:2407.01614, 2024.
[16] M. Xia, T. Gao, Z. Zeng, and D. Chen. "Sheared LLaMA: Accelerating language model pre-training via structured pruning." arXiv:2310.06699, 2024.
[17] NVIDIA. "Data flywheel: What it is and how it works." 2024. https://www.nvidia.com/en-us/glossary/data-flywheel/ (Accessed: 2026-05-27)
[18] H. Luo, Q. Sun, C. Xu et al. "Arena learning: Build data flywheel for LLMs post-training via simulated chatbot arena." arXiv:2407.10627, 2024.
[19] Z. Wang, J. Li, Y. Hong et al. "Bootstrapping language-guided navigation learning with self-refining data flywheel." arXiv:2412.08467, 2024.
[20] X. Guo et al. "IFDECORATOR: Wrapping instruction following reinforcement learning with verifiable rewards." arXiv:2508.04632, 2025.
[21] H. Wang et al. "UI-TARS-2 technical report: Advancing GUI agent with multi-turn reinforcement learning." arXiv:2509.02544, 2025.
[22] S. Wang et al. "GAIA: A data flywheel system for training GUI test-time scaling critic models." arXiv:2601.18197, 2026.
[23] Y. Lyu, C. Wang, L. Shen et al. "Mock worlds, real skills: Building small agentic language models with synthetic tasks." arXiv:2601.22511, 2026.
[24] S. G. Patil, T. Zhang, X. Wang, and J. E. Gonzalez. "Gorilla: Large language model connected with massive APIs." arXiv:2305.15334, 2023.
[25] J. Zhang et al. "xLAM: A family of large action models to empower AI agent systems." arXiv:2409.03215, 2024.
[26] L. E. Erdogan et al. "TinyAgent: Function calling at the edge." arXiv:2409.00608, 2024.
[27] Z. Wang et al. "ToolFlow: Boosting LLM tool-calling through natural and coherent dialogue synthesis." arXiv:2410.18447, 2024.
[28] R. Sharma and M. Mehta. "Small language models for agentic systems: A survey." arXiv:2510.03847, 2025.
[29] M. A. Haque et al. "TinyLLM: Evaluation and optimization of small language models for agentic tasks on edge devices." arXiv:2511.22138, 2025.
[30] Y. Fu, R. Anantha, and J. Cheng. "CAMPHOR: Collaborative agents for multi-input planning and high-order reasoning on device." arXiv:2410.09407, 2024.
[31] D. Paprunia, V. Kharidia, and P. Doshi. "Advancing SLM tool-use capability using reinforcement learning." arXiv:2509.04518, 2025.
[32] K. Han, Y. Zhou, M. Gao et al. "EBPO: Empirical Bayes shrinkage for stabilizing group-relative policy optimization." arXiv:2602.05165, 2026.
[33] S. Liu et al. "STAPO: Stabilizing reinforcement learning for LLMs by silencing rare spurious tokens." arXiv:2602.15620, 2026.
[34] M. Tian, Y. Xie, and C. Wei. "How off-policy can GRPO be? Mu-GRPO for efficient LLM reinforcement learning." arXiv:2605.17570, 2026.
[35] L. He et al. "Resolving action bottleneck: Agentic reinforcement learning informed by token-level energy." arXiv:2605.14558, 2026.
[36] H. Li et al. "Agentic reinforcement learning empowers next-generation chemical language models." arXiv:2601.17687, 2026.
[37] K. Meng, D. Bau, A. Andonian, and Y. Belinkov. "Locating and editing factual associations in GPT." arXiv:2202.05262, 2022.
[38] K. Meng, A. S. Sharma, A. Andonian, Y. Belinkov, and D. Bau. "Mass-editing memory in a transformer." arXiv:2210.07229, 2023.
[39] E. Mitchell et al. "Model editing networks with gradient decomposition." arXiv:2110.11309, 2022.
[40] E. Mitchell et al. "Memory-based model editing at scale." arXiv:2203.03466, 2022.
[41] S. Wang et al. "Knowledge editing for large language models: A survey." arXiv:2401.01286, 2024.
[42] L. Bourtoule et al. "Machine unlearning." arXiv:1912.03817, 2021.
[43] Y. Yao et al. "Machine unlearning: A survey." ACM Computing Surveys, 2024. DOI: 10.1145/3603620
[44] B. Liu et al. "Knowledge unlearning for LLMs." arXiv:2402.01754, 2024.
[45] R. M. French. "Catastrophic forgetting in connectionist networks." Trends in Cognitive Sciences, vol. 3, no. 4, pp. 128–135, 1999. DOI: 10.1016/S1364-6613(99)01294-2
[46] A. Sekhari et al. "Descent-to-delete: Gradient-based methods for machine unlearning." arXiv:2110.05679, 2021.
[47] A. Golatkar et al. "Fast machine unlearning without retraining." arXiv:2009.11373, 2020.
[48] Anonymous. "Task-specific compression for large language models." arXiv:2306.05685, 2023. (Under review)
[49] Anonymous. "Compact language models via priming and pruning." arXiv:2406.09246, 2024. (Under review)
[50] J.S. McCarley, R. Chakravarti, and A. Sil. "Structured pruning of BERT-based question answering models." arXiv:1910.09755, 2019.
[51] N. Ding et al. "Parameter-efficient fine-tuning for large language models: A comprehensive survey." arXiv:2303.15647, 2023.
[52] Y. Li et al. "Inference-time intervention: Eliciting truthful answers from a language model." arXiv:2306.03341, 2023.
[53] Anonymous. "Regularizing towards well-calibrated large language models." arXiv:2405.18654, 2024. (Under review)
[54] H. Ndubuaku, J. Mroz, K. Mosoyan, et al. "Needle: Simple attention networks for function calling." GitHub: cactus-compute/needle, 2026.
[55] Z. Shao, P. Wang, Q. Zhu, et al. "DeepSeekMath: Pushing the limits of mathematical reasoning in open language models." arXiv:2402.03300, 2024.
[56] A. Conneau et al. "XNLI: Evaluating cross-lingual sentence representations." Proc. EMNLP, 2018.
[57] D. Hendrycks et al. "Measuring massive multitask language understanding." Proc. ICLR, 2021.
[58] K. Cobbe et al. "Training verifiers to solve math word problems." arXiv:2110.14168, 2021.
[59] Berkeley Function-Calling Leaderboard. https://gorilla.cs.berkeley.edu/leaderboard.html
[60] M. Chen et al. "Evaluating large language models trained on code." arXiv:2107.03374, 2021.
[61] K. Papineni et al. "BLEU: A method for automatic evaluation of machine translation." Proc. ACL, 2002.
[62] I. Loshchilov and F. Hutter. "Decoupled weight decay regularization." Proc. ICLR, 2019.
[63] D. P. Kingma and J. Ba. "Adam: A method for stochastic optimization." Proc. ICLR, 2015.