-
Notifications
You must be signed in to change notification settings - Fork 0
Model Training
sebastEXlabe edited this page Jun 10, 2026
·
1 revision
Audio (B,T,74) → AudioEncoder → (B,T,256)
Video (B,T,35) → VideoEncoder → (B,T,256) → MissingHandler → CrossModalFusion → MultiTaskHead
Text (B,T,300)→ TextEncoder → (B,T,256)
| 编码器 | 输入维度 | 结构 | 参数量 |
|---|---|---|---|
| AudioEncoder | 74 | EMT-DLFR (Conv+LSTM+Attention) | ~38K |
| VideoEncoder | 35 | EMT-DLFR (Conv+LSTM+Attention) | ~26K |
| TextEncoder | 300 | PositionalEncoding + Transformer×3 + LN | ~2.4M |
| 策略 | 原理 | 适用场景 |
|---|---|---|
| FedAvg | 样本数加权平均 | IID 数据 |
| FedProx | 近端项约束 | 轻度 Non-IID |
| SCAFFOLD | 控制变量修正 | 重度 Non-IID |
| Adaptive | 验证性能自适应 | 客户端质量不均 |
| 参数 | 默认值 | 说明 |
|---|---|---|
| hidden_dim | 256 | Transformer 隐藏维度 |
| num_heads | 8 | 注意力头数 |
| num_layers | 4 | 编码器层数 |
| local_epochs | 3 | 客户端本地训练轮次 |
| batch_size | 32 | 批大小 |
| learning_rate | 1e-4 | AdamW 学习率 |
| weight_decay | 1e-4 | 权重衰减 |
所有实验结果来自 4×NVIDIA A100 80GB GPU 服务器实机训练。
| 实验 | 配置 | 最优 MAE | 最优 Corr |
|---|---|---|---|
| FedAvg 100r | IID, random 0.3 | 0.5598 | 0.3984 |
| FedAvg 300r | IID, random 0.3 | 0.5522 | 0.4242 |
| FedProx μ=0.01 | IID, random 0.3 | 0.5601 | 0.3953 |
| SCAFFOLD | IID, random 0.3 | 0.5623 | 0.3920 |
| Non-IID α=0.1 | FedAvg 100r | 0.5741 | 0.3708 |