按 @luotao1 建议,将进展跟踪从 PaddlePaddle/Paddle#77429 迁移至此 issue。后续更新均在此汇报。
进展汇总(截至 2026-04-08)
覆盖率单测 — 5 PR 审核中(FastDeploy H10)
GPU 验证:全部均已在 AI Studio V100 实测通过 ✅
🔧 构建工具 — 5 PR 待审核(H10)
🚀 模型实现 — 2 PR 待审核(FastDeploy H10)
🧪 PaddleMaterials 模型复现 — 3 组 PR(RFC + 代码)
每个模型需提交 RFC(community)+ 代码实现(PaddleMaterials),按模型整体评分
📋 FastDeploy 设计文档 — 3 PR 待审核
⚡ 内核优化 — ✅ No.49 已全部合入
No.49 spec-decode CUDA 内核优化任务完成(⭐⭐⭐):
后续架构贡献:基于 No.47 MiniMax-M1 实现中发现的缓存管理局限,提交 Feature Request FD#7199 — 线性注意力 (Lightning/Linear Attention) 循环状态接入 ForwardMeta.caches 缓存管理体系。该 issue 覆盖 MiniMax-M1、RWKV、Mamba/Jamba、RetNet、GLA 等循环状态架构的统一缓存需求。
🔬 PaddleMaterials 新增报名 — 8 任务(待启动)
已在 Paddle#77429 报名,按 RFC 工作流程推进。与 Danqing Li(前 Intel AI 工程师,PaddlePaddle 生态 100+ merged PRs)协作完成。
| 任务 |
模型 |
预估⭐ |
竞争状态 |
| No.007 |
wD-MPNN |
⭐⭐ |
仅报名,无 RFC/代码 PR |
| No.008 |
Crystalformer |
⭐⭐ |
仅报名,无 RFC/代码 PR |
| No.009 |
NewtonNet |
⭐⭐ |
仅报名,无 RFC/代码 PR |
| No.011 |
TrinityLLM |
⭐⭐ |
仅报名,无 RFC/代码 PR |
| No.015 |
DM2 |
⭐⭐⭐ |
仅报名,无 RFC/代码 PR |
| No.016 |
DiffSyn |
⭐⭐⭐ |
仅报名,无 RFC/代码 PR |
| No.017 |
MOFDiff |
⭐⭐⭐ |
仅报名,无 RFC/代码 PR |
| No.019 |
SphereNet |
⭐⭐⭐ |
仅报名,无 RFC/代码 PR |
🎯 PaddleOCR 全球衍生模型挑战赛(2026-04-01 起)
赛事主页:PaddleOCR#17858 · 入门指南:Discussions#17859 · FAQ:Discussions#17860 · 讨论区:Derivative Model Challenge🏆
CloudForge 团队(Robert Grzelka + Danqing Li,前 Intel AI 工程师)两项参赛:
| 方向 |
参赛者 |
简介 |
| 波兰语 OCR |
Robert Grzelka (cloudforge1) |
PaddleOCR-VL 微调,覆盖波兰语印刷/手写/历史文档 |
| 波兰语行政文档 OCR |
Danqing Li |
政府表格、税务/社保文档,混合字体+印章场景 |
PaddleOCR+ERNIE 应用创新赛道 — Paddle#78325
| 方向 |
参赛者 |
简介 |
| PaddleOCR + ERNIE × RAGFlow 波兰语文档 QA |
Robert Grzelka (cloudforge1) |
OCR 提取 → RAGFlow 索引 → ERNIE 问答 |
📈 总览
| 类别 |
任务数 |
PR 数 |
已确认⭐ |
待审⭐ |
| ✅ 已合入 |
8 |
8 |
3.7⭐ |
— |
| 📊 覆盖率单测 |
5 |
5 |
— |
0.8⭐ |
| 🔧 构建工具 |
2 |
5 |
— |
3.0⭐ |
| 🚀 模型实现 |
2 |
2 |
— |
4.0⭐ |
| 🧪 模型复现 |
3 |
6 |
— |
6.0⭐ |
| 📋 设计文档 |
3 |
3 |
— |
— |
| 🔬 新增报名 |
8 |
— |
— |
20.0⭐ |
| 🎯 OCR/ERNIE 赛道 |
3 |
— |
— |
— |
| 合计(H10) |
34 |
29 |
3.7⭐ |
33.8⭐ |
以上仅统计 H10 活跃赛道。H9 任务已转为 Draft(见下方),不计入待审统计。
✅ 已合入(确认 3.7⭐)
⚡ No.49 更新:FD#6960 和 community#1294 已关闭(被 FD#7136 / community#1295 取代)。
� 技术备注
以下 PR 包含原创技术实现,详细技术说明见各 PR ## Motivation 部分。
�📦 H9 自愿贡献(Draft — H9 已结束,不计入赛道奖金)
H9 黑客松已结束(issue #74773 已关闭),以下 PR 转为 Draft 状态,作为社区自愿贡献保留。
自定义算子单测 — 7 PR(全部 Draft)
| 任务 |
算子 |
PR |
CI |
开启日 |
| No.59 |
speculate_set_value_by_flags_and_idx |
FD#6688 |
23/24 |
03-05 |
| No.29 |
cutlass_fp8_fp8_half_block_gemm_fused |
FD#6693 |
23/24 |
03-06 |
| No.38 |
winx_unzip |
FD#6691 |
23/24 |
03-06 |
| No.53 |
multi_head_latent_attention |
FD#6695 |
22/24 |
03-06 |
| No.33 |
moe_wna16_marlin_gemm |
FD#6690 |
— |
03-06 |
| No.31 |
gptq_marlin_repack |
FD#6694 |
21/24 |
03-06 |
| No.39 |
moe_expert_ffn_wint2 |
FD#6687 |
19/24 |
03-05 |
日志重构 + 工程优化 — 3 PR(Draft)
| PR |
说明 |
CI |
状态 |
| FD#6682 |
H9 No.88 — FastDeploy 日志打印范式重构 |
20/24 |
Draft |
| FD#7170 |
Gate expensive ngram tests behind env vars(CI 维护) |
33/38 |
Open |
| FD#7203 |
CPU kernel benchmark for ngram_match(⚠️ DO NOT MERGE — 仅基准测试参考) |
35/38 |
benchmark only |
🔗 参考链接
按 @luotao1 建议,将进展跟踪从 PaddlePaddle/Paddle#77429 迁移至此 issue。后续更新均在此汇报。
进展汇总(截至 2026-04-08)
覆盖率单测 — 5 PR 审核中(FastDeploy H10)
GPU 验证:全部均已在 AI Studio V100 实测通过 ✅
config.pyengine.pyworker_process.pyfused_moe_marlin_backend.pyfused_moe_deepgemm_backend.py🔧 构建工具 — 5 PR 待审核(H10)
🚀 模型实现 — 2 PR 待审核(FastDeploy H10)
🧪 PaddleMaterials 模型复现 — 3 组 PR(RFC + 代码)
每个模型需提交 RFC(community)+ 代码实现(PaddleMaterials),按模型整体评分
📋 FastDeploy 设计文档 — 3 PR 待审核
⚡ 内核优化 — ✅ No.49 已全部合入
No.49 spec-decode CUDA 内核优化任务完成(⭐⭐⭐):
后续架构贡献:基于 No.47 MiniMax-M1 实现中发现的缓存管理局限,提交 Feature Request FD#7199 — 线性注意力 (Lightning/Linear Attention) 循环状态接入
ForwardMeta.caches缓存管理体系。该 issue 覆盖 MiniMax-M1、RWKV、Mamba/Jamba、RetNet、GLA 等循环状态架构的统一缓存需求。🔬 PaddleMaterials 新增报名 — 8 任务(待启动)
已在 Paddle#77429 报名,按 RFC 工作流程推进。与 Danqing Li(前 Intel AI 工程师,PaddlePaddle 生态 100+ merged PRs)协作完成。
🎯 PaddleOCR 全球衍生模型挑战赛(2026-04-01 起)
赛事主页:PaddleOCR#17858 · 入门指南:Discussions#17859 · FAQ:Discussions#17860 · 讨论区:Derivative Model Challenge🏆
CloudForge 团队(Robert Grzelka + Danqing Li,前 Intel AI 工程师)两项参赛:
PaddleOCR+ERNIE 应用创新赛道 — Paddle#78325
📈 总览
✅ 已合入(确认 3.7⭐)
ngram_match·hybrid_mtp_ngramCUDA 内核async_expert_loader.pyload_weight_utils.pyernie4_5_mtp.pyresource_manager.py� 技术备注
以下 PR 包含原创技术实现,详细技术说明见各 PR
## Motivation部分。�📦 H9 自愿贡献(Draft — H9 已结束,不计入赛道奖金)
H9 黑客松已结束(issue #74773 已关闭),以下 PR 转为 Draft 状态,作为社区自愿贡献保留。
自定义算子单测 — 7 PR(全部 Draft)
speculate_set_value_by_flags_and_idxcutlass_fp8_fp8_half_block_gemm_fusedwinx_unzipmulti_head_latent_attentionmoe_wna16_marlin_gemmgptq_marlin_repackmoe_expert_ffn_wint2日志重构 + 工程优化 — 3 PR(Draft)
ngram_match(🔗 参考链接