让AI看图片,它认得出猫但认不出我家猫
多模态AI出来的时候,我特别兴奋。以前AI只能看文字,现在它能看图了。我试了几个产品,说点真实感受。
认东西确实准。
你给它一张照片,问它这是什么。它告诉你这是猫、那是狗、那是汽车。准确率挺高的。比以前那种简单的图像识别强多了。
它不光能说是什么,还能描述——这只猫是橘色的、在窗台上、下午的阳光。它理解了图片内容,不是简单分类。
这个进步是实打实的。
但你真用了就发现:它认得出东西,认不出细节。
我给它看我家猫的照片,问它这是什么猫。它说橘猫。对,是橘猫。但你再问它:我家猫什么性格?它不知道。它只看得到长相,看不到性格。
我给它看一张聊天截图,问它这段对话什么意思。它能把文字读出来,但它理解不了语气——这句话是在吐槽还是在夸奖?AI看不出来。因为它没有情绪感知。
还有个问题。
它看图片会"编"。你给它一张图,让它描述,它会添油加醋。图片里就一只猫,它说猫在看窗外想事情。猫想什么事情?它编的。
人看图片也会脑补,但AI脑补得特别自信。你不仔细看,就被它带偏了。
那多模态AI到底能干什么?
它适合做信息提取。你给它一张发票照片,它帮你读出金额、日期、商家。你给它一张表格图片,它帮你转成文字表格。这些活它干得不错。
但你让它"理解"图片背后的故事、情感、场景,它还差得远。它能看,但它不懂。
多模态是个好方向。但现在它还在"能看见"的阶段,离"看懂"还有距离。
说个更真实的例子。有次我给AI看一张产品截图,问它这个界面好不好用。它说:界面设计简洁,功能布局合理,用户体验良好。
我一看这截图——其实界面挺乱的,按钮又小又挤,字都看不清楚。但AI说"简洁合理"。为什么?因为它看界面,只能看到上面有什么元素,它不知道用户用起来方不方便。
它能描述界面,但它不能评价界面。评价需要经验——你知道用户点不到按钮会 frustration,你知道字太小看着累。这些AI没有。
还有次我给它看一张设计稿,问它这个设计有什么问题。它说:配色协调,排版美观。我看那个设计——颜色跟品牌色完全不符。它连品牌色都不知道,怎么评价?
这就是多模态AI的局限:它能"看到",但它没有审美、没有经验、没有判断力。你让它描述可以,让它评价还早。
别指望AI看图帮你做设计决策。它就是个高级看图说话的。
别急着吹它多智能。
它还在学。
慢慢来。

