update cudnn-frontend to v1.27.0 - #1728
Conversation
There was a problem hiding this comment.
Copilot reviewed 1 out of 1 changed files in this pull request and generated no comments.
💡 Add a code-review agent skill or configure MCP servers for context-aware, tailored reviews. Learn more in the docs.
There was a problem hiding this comment.
| 序号 | 位置 | 优先级 | 状态 |
|---|---|---|---|
| 1 | packages/paddlefleet_ops/setup.py:41 | 🔴 |
结论:当前提交需要修复依赖兼容性后再合入。packages/paddlefleet_ops/setup.py:41 将 CUTLASS DSL 固定为 4.5.0,但当前 FlashMask 子模块的 setup.py 仍将同一依赖限制为 >=4.4.1,<=4.4.2;实际 ops wheel 构建会进入 FlashMask 的 setup 预安装逻辑,两个约束经解析器验证不可满足。请同步升级 FlashMask 的兼容约束/子模块,或选择同时满足 cuDNN frontend 与 FlashMask 的版本,并同步锁文件元数据。
上一轮已复核:cudnn-frontend v1.27.0 子模块变更本身未发现独立代码问题;本轮新增的 CUTLASS DSL 版本变更引入上述 P1 构建阻断。当前环境未执行 Blackwell 数值回归,但该 finding 由依赖元数据和构建调用链直接复现。
PaddleFleet Log Analysis
日志分析报告失败维度: 全矩阵失败(单卡/多卡/集成 × H20/A100,Python 3.12),失败点统一在 Install PaddleFleet 阶段,无任何测试 case 实际执行。
失败的测试 case: 根本原因分析: 所有 5 个测试 job 的 唯一直接原因 是同一条
修复建议:
🔄 每次 Re-run 后自动更新 |
| "triton", # for deep_gemm, flashmask | ||
| "einops", # for flash-linear-attention | ||
| "nvidia-cutlass-dsl[cu13]==4.4.1", # for sonic_moe and flash_attention | ||
| "nvidia-cutlass-dsl[cu13]==4.5.0", # for sonic_moe and flash_attention |
There was a problem hiding this comment.
该版本固定会让 FlashMask 的依赖解析失败。当前
third_party/flash-attention/flashmask/setup.py:161 仍声明 nvidia-cutlass-dsl[cu13]>=4.4.1,<=4.4.2,而此处改为 ==4.5.0;构建流程实际执行 FlashMask 的 setup.py,其预安装逻辑会同时处理这两个约束。我用解析器验证两者组合得到 requirements are unsatisfiable,因此 CUDA/NVIDIA 的 ops wheel 构建无法稳定完成。请同步升级 FlashMask 的兼容约束/子模块,或选择同时满足 cuDNN frontend 与 FlashMask 的 CUTLASS DSL 版本,并同步锁文件元数据。
PR Category
Environment Adaptation
PR Types
Others
Description
升级cudnn-frontend到1.27.0,官方nvidia-cudnn-frontend需要nvidia-cutlass-dsl 4.5.0,paddlefleet之前的submodule sonic-moe、flsh_attention、cudnn-frontend 1.26都是依赖的4.4.1,导致不兼容,故此PR顺带升级nvidia-cutlass-dsl 到4.5.0
是否引起精度变化