你好,就是利用vl的推理/翻译能力,然后对一个图像的文字进行翻译,并且利用现在的qwen-image等这些进行渲染出来,类似于图片编辑式的图像翻译
你好,就是利用vl的推理/翻译能力,然后对一个图像的文字进行翻译,并且利用现在的qwen-image等这些进行渲染出来,类似于图片编辑式的图像翻译