您好!感谢你们开源这个有趣的剪枝项目。我对这个工作很感兴趣,但在查看仓库后有一些疑问:
关于剪枝方法
-
剪枝策略:目前仓库只提供了剪枝后的模型,但没有详细说明使用了哪种剪枝方法。请问是采用了:
- 结构化剪枝(如通道剪枝、层剪枝)
- 非结构化剪枝(权重剪枝)
- 还是其他混合策略?
-
剪枝标准:能否分享一下剪枝的标准和流程?比如:
- 是基于权重重要性、梯度信息还是其他启发式方法?
- 剪枝比例是如何确定的?
- 是否有进行迭代式剪枝和微调?
-
技术细节:希望了解剪枝过程中的一些技术细节:
- 剪枝是在预训练阶段还是微调阶段进行的?
- 剪枝后的模型是否有进行知识蒸馏或其他恢复训练?
- 剪枝对模型性能的具体影响如何?
关于wan系列适配
-
架构兼容性:除了Qwen Image模型,请问这种剪枝方法:
- 是否可以适配到wan系列模型?
- 是否有特定的架构要求或限制?
-
迁移性:如果我想将这种方法应用到其他视觉-语言模型上,需要哪些修改?
- 是否需要重新设计剪枝策略?
- 代码框架是否具有足够的通用性?
其他建议
- 技术文档:希望能够补充更详细的技术文档或论文,解释具体的实现方法。
期待你们的回复!这个工作看起来很有潜力,希望能了解更多技术细节。
谢谢!
您好!感谢你们开源这个有趣的剪枝项目。我对这个工作很感兴趣,但在查看仓库后有一些疑问:
关于剪枝方法
剪枝策略:目前仓库只提供了剪枝后的模型,但没有详细说明使用了哪种剪枝方法。请问是采用了:
剪枝标准:能否分享一下剪枝的标准和流程?比如:
技术细节:希望了解剪枝过程中的一些技术细节:
关于wan系列适配
架构兼容性:除了Qwen Image模型,请问这种剪枝方法:
迁移性:如果我想将这种方法应用到其他视觉-语言模型上,需要哪些修改?
其他建议
期待你们的回复!这个工作看起来很有潜力,希望能了解更多技术细节。
谢谢!