Skip to content

Repository files navigation

Fed-MSA:面向模态缺失的联邦学习多模态情感分析系统

Release

基于 CMU-MOSEI 数据集,使用 Transformer + 联邦学习,支持文本/音频/视频三模态情感预测。

功能

  • 三模态推理: 文本 + 音频(.wav) + 视频(.mp4) 独立或组合输入,自动模态缺失补全
  • 联邦学习训练: FedAvg / FedProx / SCAFFOLD / Adaptive 四种聚合策略
  • 缺失模态处理: Embedding / Reconstruct / Generative 三种策略
  • Non-IID 模拟: Dirichlet 分布连续可调的数据分区
  • 实时监控: SSE 训练曲线 + GPU 遥测仪表盘
  • 实验管理: 拖拽排序、结果对比、JSON 导入导出

快速开始

下载

Releases 下载 Windows 安装包或便携版。

启动后端

pip install -r requirements.txt
python -m uvicorn src.api.server:app --host 0.0.0.0 --port 8765

启动桌面端

cd fed-msa-ui
pnpm install
npx electron-vite dev

技术栈

层级 技术
深度学习 PyTorch 2.x
联邦学习 FedAvg / FedProx / SCAFFOLD / Adaptive
后端 FastAPI + SSE (8765 端口)
前端 Electron + React 19 + HeroUI + Tailwind CSS 4
数据 CMU-MOSEI (CSD/HDF5)

项目结构

├── src/                    # Python 后端
│   ├── api/server.py       # FastAPI 主服务 (训练+推理)
│   ├── models/             # 多模态模型 (编码器/融合/分类)
│   ├── federated/          # 联邦学习 (客户端/服务器/聚合器)
│   └── data/               # 数据集加载和预处理
├── fed-msa-ui/             # Electron + React 前端
├── data/
│   └── glove_embeddings.pkl # GloVe 词向量 (21,172词)
├── train.py                # CLI 训练入口
└── requirements.txt

模型架构

Audio (B,T,74) → AudioEncoder → (B,T,256)
Video (B,T,35) → VideoEncoder → (B,T,256)  → MissingHandler → CrossModalFusion → MultiTaskHead
Text  (B,T,300)→ TextEncoder  → (B,T,256)

引用

CMU-MOSEI 数据集:

@inproceedings{zadeh2018multimodal,
  title={Multimodal Language Analysis in the Wild: CMU-MOSEI Dataset and Interpretable Dynamic Fusion Graph},
  author={Zadeh, Amir and Chen, Minghai and Poria, Soujanya and Cambria, Erik and Morency, Louis-Philippe},
  booktitle={Proceedings of ACL},
  pages={2236--2246},
  year={2018}
}

许可证

仅供学术研究使用。

About

面向模态缺失的联邦学习多模态情感分析系统 — 基于 CMU-MOSEI + Transformer + 联邦学习,支持文本/音频/视频三模态情感预测

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages