Skip to content

Latest commit

 

History

History
775 lines (675 loc) · 36.7 KB

File metadata and controls

775 lines (675 loc) · 36.7 KB

SenseNova-Vision: Vision as Unified Multimodal Generation

📣 最新动态

🌟 概览

🚀 SenseNova-Vision 将计算机视觉任务统一建模为多模态生成问题, 把各种不同视觉任务表达在统一多模态模型(UMM)原生的文本与图像生成空间中。 自然语言指令与可选视觉提示用于指定任务、目标区域或视角、输出结构和解码规则, 模型则通过原生文本、图像,或图文混合生成进行输出。

文本生成用于表达类别、边界框、点、OCR 字符串、关键点、相机参数等符号化视觉内容; 图像生成用于表达分割mask、深度图、表面法线、多视角点图等稠密空间信息。 图文混合响应进一步支持同时包含符号输出与稠密输出的组合式任务。 这一统一形式使单个模型能够在保持输出可被标准评测协议解码的基础上,完全覆盖结构化视觉理解、密集几何预测、分割以及多视角视觉几何建模等经典视觉任务。

为了支撑大规模训练,我们将各类计算机视觉任务标注转换为指令-回答样本, 构建了覆盖可解码文本、图像以及图文混合目标的 SenseNova-Vision Corpus。 SenseNova-Vision 从现成的预训练 UMM 出发,主要基于该语料进行训练, 同时引入辅助多模态数据以保持通用理解与生成能力;整个模型不需要视觉任务专属预测头、 解码器或额外架构分支。

🏗️ 主要贡献

  • 🔗 提出统一多模态生成范式,将各类计算机视觉任务映射到 UMM 原生输入输出空间。
  • 🧩 构建 SenseNova-Vision Corpus,这是一个大规模计算机视觉指令-回答语料,覆盖可解码文本、图像和图文混合目标。
  • ✨ 训练得到 SenseNova-Vision,并在结构化视觉理解、密集几何预测、分割和多视角视觉几何等任务上表现优异,同时支持超出固定评测 schema 的语言定义任务变体。

🛠️ 快速开始

本仓库为示例运行、单图推理、交互式推理和基准评测提供统一入口。 完整运行说明请参考 docs/INFERENCE.md。 基准评测复现请参考 docs/EVAL.md

在仓库根目录创建环境:

git clone https://github.com/OpenSenseNova/SenseNova-Vision.git
cd SenseNova-Vision
bash setup.sh sensenova-vision
conda activate sensenova-vision

运行预置示例:

bash scripts/run_sensenova_vision.sh example

运行一次推理请求:

bash scripts/run_sensenova_vision.sh inference \
  binary_seg \
  "person" \
  examples/images/2.jpg

启动 Web Demo。启动脚本会在 Gradio 启动前输出本地访问地址。 **已验证配置:**默认 BF16 Web Demo 可在 1 张 NVIDIA A800 80GB GPU 上运行, 不启用 CPU 或磁盘卸载;记录请求的进程显存峰值为 38,226 MiB。建议使用 80GB GPU; 更小显存的 GPU 尚未完成全任务验证。

MODEL_PATH=/path/to/SenseNova-Vision-7B-MoT \
  bash scripts/run_sensenova_vision.sh demo

根据 docs/data_prepare.md 准备好 datas/jsonl_generate/ 后,可运行完整基准评测。完整评测建议至少使用一台配备 8 张 80GB GPU 的机器:

bash scripts/run_sensenova_vision.sh benchmark all \
  --num_gpus 8 \
  --tasks_per_gpu 2

训练 SenseNova-Vision 时,请先按照 docs/train_data_prepare.md 准备训练数据,再按照 docs/TRAIN.md 启动训练。训练至少需要 2 台机器,每台配备 8 张 80GB GPU;推荐使用 32 台及以上同规格机器。

bash scripts/train_cv_unify.sh data/configs/cv_unify/cv_unify_baseline_v9.yaml

🏆 评测结果

SenseNova-Vision 在结构化视觉理解、密集几何预测、分割以及多视角视觉几何上进行评测。 所有任务均以自然语言指令表述:文本输出会被解析为边界框、点、识别文本、关键点和相机参数等评测所需结构; 图像输出会被解码为掩码、深度图、法线图或 3D 点图。

结构化视觉理解

结构化视觉理解评测输出可表示为结构化文本生成的任务,例如边界框、点、识别文本和关键点坐标预测等。

方法 目标检测 OCR GUI 关键点
COCO-Com. HR/RefCOCOg V/T LVIS Dense200 VisDrone HierText ICDAR15 ScreenSpot-V2 COCO-Kpt.
bbox bbox bbox bbox bbox point bbox bbox bbox point
Grounding DINO-Swin-T 56.6 25.2 / 45.9 / 46.8 38.8 33.1 38.5 -- -- -- -- --
Bagel 50.2 74.6 / 76.4 / 77.8 46.8 42.4 23.0 36.9 7.1 15.8 81.1 --
Qwen3-VL-8B-Instruct 46.6 70.4 / 72.3 / 72.6 43.2 13.5 28.7 35.7 22.4 25.4 90.5 --
Qwen3.5-9B 49.3 71.7 / 72.1 / 72.6 43.2 27.5 26.8 41.7 19.6 11.4 92.2 --
LocateAnything 54.7 78.7 / 76.7 / 77.6 50.7 58.7 39.9 60.4 29.1 26.4 85.5 --
Rex-Omni 52.9 79.9 / 73.6 / 74.3 46.9 58.3 35.8 58.9 28.0 28.1 88.4 32.6
SenseNova-Vision 56.6 80.2 / 79.6 / 80.5 54.8 66.8 43.3 62.9 31.2 49.5 85.9 34.6

密集几何预测

密集几何预测评测像素对齐的几何输出,包括单目深度估计和表面法线估计。

方法 深度 法线
NYUv2 KITTI ETH3D ScanNet DIODE ScanNet iBims-1 NYUv2
AbsRel↓ / δ1↑ Mean↓ / 11.25°↑
DSINE ---------- 16.2 / 61.017.1 / 67.416.4 / 59.6
DepthAnything 4.3 / 98.17.6 / 94.712.7 / 88.24.3 / 98.126.0 / 75.9 ------
DepthAnything V2 4.5 / 97.97.4 / 94.613.1 / 86.54.2 / 97.826.5 / 73.4 ------
*MoGe-2 3.5 / 98.05.5 / 97.73.4 / 98.83.4 / 98.323.0 / 82.3 12.8 / 68.414.7 / 70.414.7 / 62.3
Marigold 5.5 / 96.49.9 / 91.66.5 / 95.96.4 / 95.230.8 / 77.3 21.3 / 45.618.5 / 64.720.9 / 50.5
DICEPTION 6.1 / 96.06.9 / 94.95.0 / 97.57.2 / 94.428.9 / 72.2 18.8 / 53.6--18.3 / 52.9
FE2E 4.1 / 97.76.6 / 96.03.8 / 98.74.4 / 97.522.8 / 81.2 13.8 / 67.215.1 / 70.616.2 / 59.6
Lotus-2 4.1 / 97.66.7 / 94.54.6 / 98.14.2 / 97.622.1 / 75.2 14.2 / 66.815.4 / 70.416.9 / 59.0
SenseNova-Vision 4.0 / 98.15.9 / 95.94.3 / 97.43.9 / 98.020.6 / 76.4 12.8 / 68.915.4 / 69.114.4 / 62.7

分割

分割主要关注在语义、指代、推理、具象对话以及交互式提示下的mask预测能力。

方法 通用分割 指代分割 推理分割 GCG 分割 交互分割
Pan. / Sem. RefCOCO / + / g Val / Test Val / Test Point / Box
LISA-7B--74.9 / 65.1 / 67.952.9 / 47.362.0 / 61.7--
PSALM55.9 / 66.683.6 / 72.9 / 73.8----64.3 / 67.3
Text4Seg--79.2 / 72.8 / 74.059.1 / 57.1----
LENS--84.2 / 79.4 / 81.262.1 / 57.2----
ConverSeg--79.4 / 74.3 / 74.961.9 / 57.0----
X-SAM54.7 / 66.585.1 / 78.0 / 83.856.6 / 57.869.4 / 69.065.4 / 70.0
SenseNova-Vision48.8 / 64.081.3 / 76.0 / 80.363.2 / 60.765.7 / 66.260.9 / 73.9

多视角视觉几何

多视角视觉几何评测基于多张输入图像的几何建模能力,包括多视角 3D 重建和相机位姿估计。

方法 多视角重建 相机位姿
Acc.↓ / Comp.↓ / F1↑ RRA@30↑ / RTA@30↑ / AUC@30↑
7Scenes ETH3D Re10K CO3Dv2
DUSt3R0.026 / 0.034 / 87.10.359 / 0.531 / 66.699.8 / 84.9 / 67.697.7 / 93.4 / 78.3
DepthAnything30.020 / 0.026 / 90.50.228 / 0.212 / 76.6100.0 / 96.4 / 89.699.3 / 98.0 / 91.8
VGGT0.023 / 0.032 / 88.40.177 / 0.155 / 80.9100.0 / 93.5 / 79.398.3 / 96.6 / 89.2
MoRe0.038 / 0.039 / 77.10.348 / 0.318 / 62.7100.0 / 94.0 / 79.198.4 / 96.3 / 83.0
MapAnything0.027 / 0.029 / 87.80.400 / 0.524 / 67.0100.0 / 93.5 / 80.795.5 / 91.6 / 70.9
G2VLM0.084 / 0.056 / 59.20.784 / 0.553 / 36.799.8 / 77.5 / 51.896.3 / 92.0 / 55.2
SenseNova-Vision0.028 / 0.026 / 87.90.301 / 0.175 / 72.299.8 / 94.2 / 77.397.4 / 95.4 / 80.1

与通用视觉模型对比

我们进一步将 SenseNova-Vision 与近期覆盖多种视觉能力的通用视觉模型进行对比。

方法检测语义分割指代分割深度
mAPmIoUcIoUδ1
COCOCityscapesRefCOCO / + / gNYUv2
Youtu-VL47.170.480.7 / 76.2 / 76.590.4
SenseNova-Vision53.771.281.3 / 76.0 / 80.398.1
方法语义分割指代分割推理分割深度法线
mIoUcIoUgIoUδ1Mean Error↓
CityscapesRefCOCOgReasonSegKITTINYUv2DIODEETH3DNYUv2ScanNetDIODE
Vision Banana69.973.879.391.594.891.793.517.815.113.8
SenseNova-Vision71.280.363.295.998.176.497.414.412.815.3

🎨 效果展示

SenseNova-Vision qualitative results across vision tasks

目标检测
COCO-Com. LVIS Dense200 VisDrone
common object detection COCO case long-tail object detection LVIS case dense object detection Dense200 case object detection VisDrone case
指代检测
referring detection case 1 referring detection case 2
OCR
文本行级别
OCR textline case 1 OCR textline case 2
单词级别
OCR word case 1 OCR word case 2
基于视觉提示检测
visual prompt bbox case 1 visual prompt bbox case 2
visual prompt bbox case 3 visual prompt bbox case 4
版面定位
layout grounding case 1 layout grounding case 2
关键点检测
人体
human keypoint case 1 human keypoint case 2
动物
animal keypoint case 1 animal keypoint case 2
GUI 定位
GUI grounding case 1 GUI grounding case 2
密集几何预测
dense geometric prediction depth and normal cases
全景分割
panoptic segmentation case 1 panoptic segmentation case 2
panoptic segmentation case 3 panoptic segmentation case 4
语义分割
semantic segmentation case 1 semantic segmentation case 2
semantic segmentation case 3 semantic segmentation case 4
指代分割
referring segmentation case 1 referring segmentation case 2
referring segmentation case 3 referring segmentation case 4
推理分割
reasoning segmentation case 1 reasoning segmentation case 2
reasoning segmentation case 3 reasoning segmentation case 4
Grounded Conversation Generation 分割
grounded conversation generation segmentation case 1 grounded conversation generation segmentation case 2
grounded conversation generation segmentation case 3 grounded conversation generation segmentation case 4
交互式分割
点提示
interactive segmentation point prompt case 1 interactive segmentation point prompt case 2
框提示 涂鸦提示
interactive segmentation box prompt case 1 interactive segmentation scribble prompt case 1
多视角 3D 重建
indoor 1 input indoor 1 output
indoor 2 input indoor 2 output
object 1 input object 1 output
object 2 input object 2 output
outdoor 1 input outdoor 1 output
outdoor 2 input outdoor 2 output

数据协议

SenseNova-Vision 将各类计算机视觉标注转换为统一的指令-回答 schema。 每个样本包含一个或多个视觉输入、一条定义任务与输出约定的自然语言指令, 以及以文本、图像或图文混合响应表示的可解码目标。

Representative SenseNova-Vision data protocol examples

✒️ 引用

如果这个项目对您的研究有帮助,请考虑点个项目Star ⭐ 和论文引用 📝:

@misc{sensenova2026sensenovavision,
      title={Vision as Unified Multimodal Generation}, 
      author={Xiaoyang Han and Jianhua Li and Kewang Deng and Zukai Chen and Xuanke Shi and Sihan Wang and Boxuan Li and Linyan Wang and Siyi Xie and Xin You and Jinsheng Quan and Zhongang Cai and Haiwen Diao and Ziwei Liu and Lei Yang and Dahua Lin and Quan Wang},
      year={2026},
      eprint={2607.06560},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2607.06560}, 
}

许可证

本项目基于 Apache 2.0 License 开源发布。