- 描述:当前即使接入了具备视觉能力的模型,read 工具仍无法把图片内容有效传递给模型,导致图片只能被当作普通文件而不是视觉输入处理。 - 影响:图片理解、截图分析、界面检查等依赖视觉输入的能力不可用,工具实际能力与模型能力不一致。 - 期望:read 在图片输入场景下可以正确触发视觉理解链路,并返回可用于后续推理的内容。 - 验收标准:常见图片格式可稳定读取;模型能基于图片内容返回结果;失败时有明确报错而不是静默失效。