基于 CMU-MOSEI 数据集,使用 Transformer + 联邦学习,支持文本/音频/视频三模态情感预测。
- 三模态推理: 文本 + 音频(.wav) + 视频(.mp4) 独立或组合输入,自动模态缺失补全
- 联邦学习训练: FedAvg / FedProx / SCAFFOLD / Adaptive 四种聚合策略
- 缺失模态处理: Embedding / Reconstruct / Generative 三种策略
- Non-IID 模拟: Dirichlet 分布连续可调的数据分区
- 实时监控: SSE 训练曲线 + GPU 遥测仪表盘
- 实验管理: 拖拽排序、结果对比、JSON 导入导出
从 Releases 下载 Windows 安装包或便携版。
pip install -r requirements.txt
python -m uvicorn src.api.server:app --host 0.0.0.0 --port 8765cd fed-msa-ui
pnpm install
npx electron-vite dev| 层级 | 技术 |
|---|---|
| 深度学习 | PyTorch 2.x |
| 联邦学习 | FedAvg / FedProx / SCAFFOLD / Adaptive |
| 后端 | FastAPI + SSE (8765 端口) |
| 前端 | Electron + React 19 + HeroUI + Tailwind CSS 4 |
| 数据 | CMU-MOSEI (CSD/HDF5) |
├── src/ # Python 后端
│ ├── api/server.py # FastAPI 主服务 (训练+推理)
│ ├── models/ # 多模态模型 (编码器/融合/分类)
│ ├── federated/ # 联邦学习 (客户端/服务器/聚合器)
│ └── data/ # 数据集加载和预处理
├── fed-msa-ui/ # Electron + React 前端
├── data/
│ └── glove_embeddings.pkl # GloVe 词向量 (21,172词)
├── train.py # CLI 训练入口
└── requirements.txt
Audio (B,T,74) → AudioEncoder → (B,T,256)
Video (B,T,35) → VideoEncoder → (B,T,256) → MissingHandler → CrossModalFusion → MultiTaskHead
Text (B,T,300)→ TextEncoder → (B,T,256)
CMU-MOSEI 数据集:
@inproceedings{zadeh2018multimodal,
title={Multimodal Language Analysis in the Wild: CMU-MOSEI Dataset and Interpretable Dynamic Fusion Graph},
author={Zadeh, Amir and Chen, Minghai and Poria, Soujanya and Cambria, Erik and Morency, Louis-Philippe},
booktitle={Proceedings of ACL},
pages={2236--2246},
year={2018}
}仅供学术研究使用。