Skip to content

Model Training

sebastEXlabe edited this page Jun 10, 2026 · 1 revision

模型训练

模型架构

Audio (B,T,74) → AudioEncoder → (B,T,256)
Video (B,T,35) → VideoEncoder → (B,T,256)  → MissingHandler → CrossModalFusion → MultiTaskHead
Text  (B,T,300)→ TextEncoder  → (B,T,256)

编码器规格

编码器 输入维度 结构 参数量
AudioEncoder 74 EMT-DLFR (Conv+LSTM+Attention) ~38K
VideoEncoder 35 EMT-DLFR (Conv+LSTM+Attention) ~26K
TextEncoder 300 PositionalEncoding + Transformer×3 + LN ~2.4M

聚合策略

策略 原理 适用场景
FedAvg 样本数加权平均 IID 数据
FedProx 近端项约束 轻度 Non-IID
SCAFFOLD 控制变量修正 重度 Non-IID
Adaptive 验证性能自适应 客户端质量不均

训练参数

参数 默认值 说明
hidden_dim 256 Transformer 隐藏维度
num_heads 8 注意力头数
num_layers 4 编码器层数
local_epochs 3 客户端本地训练轮次
batch_size 32 批大小
learning_rate 1e-4 AdamW 学习率
weight_decay 1e-4 权重衰减

实验数据

所有实验结果来自 4×NVIDIA A100 80GB GPU 服务器实机训练。

实验 配置 最优 MAE 最优 Corr
FedAvg 100r IID, random 0.3 0.5598 0.3984
FedAvg 300r IID, random 0.3 0.5522 0.4242
FedProx μ=0.01 IID, random 0.3 0.5601 0.3953
SCAFFOLD IID, random 0.3 0.5623 0.3920
Non-IID α=0.1 FedAvg 100r 0.5741 0.3708

Clone this wiki locally