试了几个能看图的AI,发现它现在还是看不懂图
去年多模态大模型特别火。说什么AI不仅能读文字,还能看图、看视频。我兴冲冲试了好几个产品,说点真实感受。
先说看图。你给它一张图,问它这是什么。简单的图——一只猫、一杯咖啡、一栋楼——它能答对。但你给它复杂一点的图,它就开始胡说八道了。
有次我给它看一张产品截图,问它"这个按钮是干什么的"。它说这是"搜索按钮"。我一看,那明明是个"提交订单"按钮。它连图里的文字都认错了,更别说理解界面逻辑。
看视频就更离谱了。
你给它一段视频,问它"这个视频讲了什么"。它给你编一段看起来挺像那么回事的描述,但细节全错。视频里人物穿的什么衣服、说了什么话、做了什么动作,它都说不准。
有次我给它看一段30秒的产品演示视频,问它"这个产品有什么功能"。它给我列了五个功能,其中三个是它自己想象出来的。视频里根本没有。
这就是多模态AI现在的问题:它能"看到"像素,但它不"理解"内容。它知道图里有什么颜色、什么形状,但它不知道这些东西之间的关系是什么。
那多模态AI到底能干什么?
简单的场景它能用。比如你给它一张表格截图,它帮你把表格里的文字读出来。这个确实有用——以前你得手动打字,现在它帮你识别。
还有你给它看一张海报,它帮你把海报上的文字提取出来。这个也不错。
但你让它"理解"一张图里的逻辑关系——比如这个流程图哪个环节出了问题、这个界面用户会怎么操作——它现在还做不好。
我估计再过一两年,多模态AI会成熟很多。但现在嘛,当玩具玩玩可以,真拿它做需要理解力的工作还早。
别被发布会吹的牛骗了。演示视频里它什么都能做,你自己用的时候才发现不是那么回事。
说个更具体的例子。有次我用多模态AI帮我整理发票。我拍了一张发票照片,让它帮我提取金额、日期、发票号。这个它做得不错——基本能读对。
但我让它帮我判断这张发票合不合规——抬头对不对、税号有没有、章盖没盖——它就开始瞎说了。它说"这张发票信息完整",但我一看,发票上根本没盖财务章。它看不到这个,因为它不理解"合规"是什么意思。
这就是多模态AI和人的区别。人看一张图,不仅看到了像素,还理解这张图背后的规则和逻辑。AI现在只能看到像素,看不到逻辑。
所以现在多模态AI最靠谱的应用就是"识别"——把图里的文字读出来、把表格里的数据提取出来。这些它做得好。但让它"判断"和"理解",还差得远。
等它真的能看懂图里的逻辑了,那才是真的革命。现在嘛,就是个高级OCR工具。

