[2026.07.22]完善了训练数据准备全流程。[2026.07.17]发布适配开源数据的训练流程。[2026.07.17]新增多视角重建和相机位姿估计的基准测试与评测支持。[2026.07.08]发布 SenseNova-Vision-Corpus-50M 数据集。[2026.07.08]首次发布 SenseNova-Vision-7B-MoT 模型权重。[2026.07.08]首次发布 SenseNova-Vision 推理代码。[2026.07.08]发布 SenseNova-Vision 技术报告。
🚀 SenseNova-Vision 将计算机视觉任务统一建模为多模态生成问题, 把各种不同视觉任务表达在统一多模态模型(UMM)原生的文本与图像生成空间中。 自然语言指令与可选视觉提示用于指定任务、目标区域或视角、输出结构和解码规则, 模型则通过原生文本、图像,或图文混合生成进行输出。
文本生成用于表达类别、边界框、点、OCR 字符串、关键点、相机参数等符号化视觉内容; 图像生成用于表达分割mask、深度图、表面法线、多视角点图等稠密空间信息。 图文混合响应进一步支持同时包含符号输出与稠密输出的组合式任务。 这一统一形式使单个模型能够在保持输出可被标准评测协议解码的基础上,完全覆盖结构化视觉理解、密集几何预测、分割以及多视角视觉几何建模等经典视觉任务。
为了支撑大规模训练,我们将各类计算机视觉任务标注转换为指令-回答样本, 构建了覆盖可解码文本、图像以及图文混合目标的 SenseNova-Vision Corpus。 SenseNova-Vision 从现成的预训练 UMM 出发,主要基于该语料进行训练, 同时引入辅助多模态数据以保持通用理解与生成能力;整个模型不需要视觉任务专属预测头、 解码器或额外架构分支。
- 🔗 提出统一多模态生成范式,将各类计算机视觉任务映射到 UMM 原生输入输出空间。
- 🧩 构建 SenseNova-Vision Corpus,这是一个大规模计算机视觉指令-回答语料,覆盖可解码文本、图像和图文混合目标。
- ✨ 训练得到 SenseNova-Vision,并在结构化视觉理解、密集几何预测、分割和多视角视觉几何等任务上表现优异,同时支持超出固定评测 schema 的语言定义任务变体。
本仓库为示例运行、单图推理、交互式推理和基准评测提供统一入口。
完整运行说明请参考 docs/INFERENCE.md。
基准评测复现请参考 docs/EVAL.md。
在仓库根目录创建环境:
git clone https://github.com/OpenSenseNova/SenseNova-Vision.git
cd SenseNova-Vision
bash setup.sh sensenova-vision
conda activate sensenova-vision运行预置示例:
bash scripts/run_sensenova_vision.sh example运行一次推理请求:
bash scripts/run_sensenova_vision.sh inference \
binary_seg \
"person" \
examples/images/2.jpg启动 Web Demo。启动脚本会在 Gradio 启动前输出本地访问地址。 **已验证配置:**默认 BF16 Web Demo 可在 1 张 NVIDIA A800 80GB GPU 上运行, 不启用 CPU 或磁盘卸载;记录请求的进程显存峰值为 38,226 MiB。建议使用 80GB GPU; 更小显存的 GPU 尚未完成全任务验证。
MODEL_PATH=/path/to/SenseNova-Vision-7B-MoT \
bash scripts/run_sensenova_vision.sh demo根据 docs/data_prepare.md 准备好 datas/ 和
jsonl_generate/ 后,可运行完整基准评测。完整评测建议至少使用一台配备
8 张 80GB GPU 的机器:
bash scripts/run_sensenova_vision.sh benchmark all \
--num_gpus 8 \
--tasks_per_gpu 2训练 SenseNova-Vision 时,请先按照
docs/train_data_prepare.md 准备训练数据,再按照
docs/TRAIN.md 启动训练。训练至少需要 2 台机器,每台配备
8 张 80GB GPU;推荐使用 32 台及以上同规格机器。
bash scripts/train_cv_unify.sh data/configs/cv_unify/cv_unify_baseline_v9.yamlSenseNova-Vision 在结构化视觉理解、密集几何预测、分割以及多视角视觉几何上进行评测。 所有任务均以自然语言指令表述:文本输出会被解析为边界框、点、识别文本、关键点和相机参数等评测所需结构; 图像输出会被解码为掩码、深度图、法线图或 3D 点图。
结构化视觉理解评测输出可表示为结构化文本生成的任务,例如边界框、点、识别文本和关键点坐标预测等。
| 方法 | 目标检测 | OCR | GUI | 关键点 | ||||||
|---|---|---|---|---|---|---|---|---|---|---|
| COCO-Com. | HR/RefCOCOg V/T | LVIS | Dense200 | VisDrone | HierText | ICDAR15 | ScreenSpot-V2 | COCO-Kpt. | ||
| bbox | bbox | bbox | bbox | bbox | point | bbox | bbox | bbox | point | |
| Grounding DINO-Swin-T | 56.6 | 25.2 / 45.9 / 46.8 | 38.8 | 33.1 | 38.5 | -- | -- | -- | -- | -- |
| Bagel | 50.2 | 74.6 / 76.4 / 77.8 | 46.8 | 42.4 | 23.0 | 36.9 | 7.1 | 15.8 | 81.1 | -- |
| Qwen3-VL-8B-Instruct | 46.6 | 70.4 / 72.3 / 72.6 | 43.2 | 13.5 | 28.7 | 35.7 | 22.4 | 25.4 | 90.5 | -- |
| Qwen3.5-9B | 49.3 | 71.7 / 72.1 / 72.6 | 43.2 | 27.5 | 26.8 | 41.7 | 19.6 | 11.4 | 92.2 | -- |
| LocateAnything | 54.7 | 78.7 / 76.7 / 77.6 | 50.7 | 58.7 | 39.9 | 60.4 | 29.1 | 26.4 | 85.5 | -- |
| Rex-Omni | 52.9 | 79.9 / 73.6 / 74.3 | 46.9 | 58.3 | 35.8 | 58.9 | 28.0 | 28.1 | 88.4 | 32.6 |
| SenseNova-Vision | 56.6 | 80.2 / 79.6 / 80.5 | 54.8 | 66.8 | 43.3 | 62.9 | 31.2 | 49.5 | 85.9 | 34.6 |
密集几何预测评测像素对齐的几何输出,包括单目深度估计和表面法线估计。
| 方法 | 深度 | 法线 | ||||||
|---|---|---|---|---|---|---|---|---|
| NYUv2 | KITTI | ETH3D | ScanNet | DIODE | ScanNet | iBims-1 | NYUv2 | |
| AbsRel↓ / δ1↑ | Mean↓ / 11.25°↑ | |||||||
| DSINE | -- | -- | -- | -- | -- | 16.2 / 61.0 | 17.1 / 67.4 | 16.4 / 59.6 |
| DepthAnything | 4.3 / 98.1 | 7.6 / 94.7 | 12.7 / 88.2 | 4.3 / 98.1 | 26.0 / 75.9 | -- | -- | -- |
| DepthAnything V2 | 4.5 / 97.9 | 7.4 / 94.6 | 13.1 / 86.5 | 4.2 / 97.8 | 26.5 / 73.4 | -- | -- | -- |
| *MoGe-2 | 3.5 / 98.0 | 5.5 / 97.7 | 3.4 / 98.8 | 3.4 / 98.3 | 23.0 / 82.3 | 12.8 / 68.4 | 14.7 / 70.4 | 14.7 / 62.3 |
| Marigold | 5.5 / 96.4 | 9.9 / 91.6 | 6.5 / 95.9 | 6.4 / 95.2 | 30.8 / 77.3 | 21.3 / 45.6 | 18.5 / 64.7 | 20.9 / 50.5 |
| DICEPTION | 6.1 / 96.0 | 6.9 / 94.9 | 5.0 / 97.5 | 7.2 / 94.4 | 28.9 / 72.2 | 18.8 / 53.6 | -- | 18.3 / 52.9 |
| FE2E | 4.1 / 97.7 | 6.6 / 96.0 | 3.8 / 98.7 | 4.4 / 97.5 | 22.8 / 81.2 | 13.8 / 67.2 | 15.1 / 70.6 | 16.2 / 59.6 |
| Lotus-2 | 4.1 / 97.6 | 6.7 / 94.5 | 4.6 / 98.1 | 4.2 / 97.6 | 22.1 / 75.2 | 14.2 / 66.8 | 15.4 / 70.4 | 16.9 / 59.0 |
| SenseNova-Vision | 4.0 / 98.1 | 5.9 / 95.9 | 4.3 / 97.4 | 3.9 / 98.0 | 20.6 / 76.4 | 12.8 / 68.9 | 15.4 / 69.1 | 14.4 / 62.7 |
分割主要关注在语义、指代、推理、具象对话以及交互式提示下的mask预测能力。
| 方法 | 通用分割 | 指代分割 | 推理分割 | GCG 分割 | 交互分割 |
|---|---|---|---|---|---|
| Pan. / Sem. | RefCOCO / + / g | Val / Test | Val / Test | Point / Box | |
| LISA-7B | -- | 74.9 / 65.1 / 67.9 | 52.9 / 47.3 | 62.0 / 61.7 | -- |
| PSALM | 55.9 / 66.6 | 83.6 / 72.9 / 73.8 | -- | -- | 64.3 / 67.3 |
| Text4Seg | -- | 79.2 / 72.8 / 74.0 | 59.1 / 57.1 | -- | -- |
| LENS | -- | 84.2 / 79.4 / 81.2 | 62.1 / 57.2 | -- | -- |
| ConverSeg | -- | 79.4 / 74.3 / 74.9 | 61.9 / 57.0 | -- | -- |
| X-SAM | 54.7 / 66.5 | 85.1 / 78.0 / 83.8 | 56.6 / 57.8 | 69.4 / 69.0 | 65.4 / 70.0 |
| SenseNova-Vision | 48.8 / 64.0 | 81.3 / 76.0 / 80.3 | 63.2 / 60.7 | 65.7 / 66.2 | 60.9 / 73.9 |
多视角视觉几何评测基于多张输入图像的几何建模能力,包括多视角 3D 重建和相机位姿估计。
| 方法 | 多视角重建 | 相机位姿 | ||
|---|---|---|---|---|
| Acc.↓ / Comp.↓ / F1↑ | RRA@30↑ / RTA@30↑ / AUC@30↑ | |||
| 7Scenes | ETH3D | Re10K | CO3Dv2 | |
| DUSt3R | 0.026 / 0.034 / 87.1 | 0.359 / 0.531 / 66.6 | 99.8 / 84.9 / 67.6 | 97.7 / 93.4 / 78.3 |
| DepthAnything3 | 0.020 / 0.026 / 90.5 | 0.228 / 0.212 / 76.6 | 100.0 / 96.4 / 89.6 | 99.3 / 98.0 / 91.8 |
| VGGT | 0.023 / 0.032 / 88.4 | 0.177 / 0.155 / 80.9 | 100.0 / 93.5 / 79.3 | 98.3 / 96.6 / 89.2 |
| MoRe | 0.038 / 0.039 / 77.1 | 0.348 / 0.318 / 62.7 | 100.0 / 94.0 / 79.1 | 98.4 / 96.3 / 83.0 |
| MapAnything | 0.027 / 0.029 / 87.8 | 0.400 / 0.524 / 67.0 | 100.0 / 93.5 / 80.7 | 95.5 / 91.6 / 70.9 |
| G2VLM | 0.084 / 0.056 / 59.2 | 0.784 / 0.553 / 36.7 | 99.8 / 77.5 / 51.8 | 96.3 / 92.0 / 55.2 |
| SenseNova-Vision | 0.028 / 0.026 / 87.9 | 0.301 / 0.175 / 72.2 | 99.8 / 94.2 / 77.3 | 97.4 / 95.4 / 80.1 |
我们进一步将 SenseNova-Vision 与近期覆盖多种视觉能力的通用视觉模型进行对比。
| 方法 | 检测 | 语义分割 | 指代分割 | 深度 |
|---|---|---|---|---|
| mAP | mIoU | cIoU | δ1 | |
| COCO | Cityscapes | RefCOCO / + / g | NYUv2 | |
| Youtu-VL | 47.1 | 70.4 | 80.7 / 76.2 / 76.5 | 90.4 |
| SenseNova-Vision | 53.7 | 71.2 | 81.3 / 76.0 / 80.3 | 98.1 |
| 方法 | 语义分割 | 指代分割 | 推理分割 | 深度 | 法线 | |||||
|---|---|---|---|---|---|---|---|---|---|---|
| mIoU | cIoU | gIoU | δ1 | Mean Error↓ | ||||||
| Cityscapes | RefCOCOg | ReasonSeg | KITTI | NYUv2 | DIODE | ETH3D | NYUv2 | ScanNet | DIODE | |
| Vision Banana | 69.9 | 73.8 | 79.3 | 91.5 | 94.8 | 91.7 | 93.5 | 17.8 | 15.1 | 13.8 |
| SenseNova-Vision | 71.2 | 80.3 | 63.2 | 95.9 | 98.1 | 76.4 | 97.4 | 14.4 | 12.8 | 15.3 |
SenseNova-Vision 将各类计算机视觉标注转换为统一的指令-回答 schema。 每个样本包含一个或多个视觉输入、一条定义任务与输出约定的自然语言指令, 以及以文本、图像或图文混合响应表示的可解码目标。
如果这个项目对您的研究有帮助,请考虑点个项目Star ⭐ 和论文引用 📝:
@misc{sensenova2026sensenovavision,
title={Vision as Unified Multimodal Generation},
author={Xiaoyang Han and Jianhua Li and Kewang Deng and Zukai Chen and Xuanke Shi and Sihan Wang and Boxuan Li and Linyan Wang and Siyi Xie and Xin You and Jinsheng Quan and Zhongang Cai and Haiwen Diao and Ziwei Liu and Lei Yang and Dahua Lin and Quan Wang},
year={2026},
eprint={2607.06560},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2607.06560},
}本项目基于 Apache 2.0 License 开源发布。


















































