凌晨上线的豆包 1.6-vision,直接把 OpenAI 还没发布的 GPT-5 拉出来“公开处刑”——我们用 48 小时暴力测试:让模型看 10 张模糊监控截图,它在 3 秒内写出完整时间线并锁定嫌疑人;丢一张外卖小票,它能把商家隐形折扣规则、食材卡路里、甚至发票漏税风险一次性算清。内测了快三周的豆包-Seed-1.6-vision,用了上百张图片,我觉得是时候分享一下了,大家平时会好奇现在主流模型里有哪几个是带图像理解的吗?我好奇。用多了OpenAI感觉这都是常规功能了,盘了一圈下来,GPT5、Gemini 2.5 Pro、Qwen-3-Max-Preview、ChatGLM、Kimi K1.5里就剩DeepSeek V3.1只能识别图片里的文字的了。那把范围缩小一点呢?在图片理解的基础上带图片工具的,这个很好理解,缩放、裁剪、旋转、划线都是图片工具的一种。当下真的幻视我七八年前用OpenCV打比赛,不知道还有没有人记得这张包浆照片,当年但凡是做图像处理的都应该用过来改色、或者丢给CNN(卷积神经网络)来识别。所以我也是拿出了OpenAI o3的成名作,通过放大图片的细节来找地点。I took this pic earlier today. Can you find the name of the biggest ship you can see, and where it
...
继续阅读
(51)