让AI看图片,它认得出猫但认不出我家猫

2026-09-28 / 时事资讯 / 6 阅读

多模态AI出来的时候,我特别兴奋。以前AI只能看文字,现在它能看图了。我试了几个产品,说点真实感受。

认东西确实准。

你给它一张照片,问它这是什么。它告诉你这是猫、那是狗、那是汽车。准确率挺高的。比以前那种简单的图像识别强多了。

它不光能说是什么,还能描述——这只猫是橘色的、在窗台上、下午的阳光。它理解了图片内容,不是简单分类。

这个进步是实打实的。

但你真用了就发现:它认得出东西,认不出细节。

我给它看我家猫的照片,问它这是什么猫。它说橘猫。对,是橘猫。但你再问它:我家猫什么性格?它不知道。它只看得到长相,看不到性格。

我给它看一张聊天截图,问它这段对话什么意思。它能把文字读出来,但它理解不了语气——这句话是在吐槽还是在夸奖?AI看不出来。因为它没有情绪感知。

还有个问题。

它看图片会"编"。你给它一张图,让它描述,它会添油加醋。图片里就一只猫,它说猫在看窗外想事情。猫想什么事情?它编的。

人看图片也会脑补,但AI脑补得特别自信。你不仔细看,就被它带偏了。

那多模态AI到底能干什么?

它适合做信息提取。你给它一张发票照片,它帮你读出金额、日期、商家。你给它一张表格图片,它帮你转成文字表格。这些活它干得不错。

但你让它"理解"图片背后的故事、情感、场景,它还差得远。它能看,但它不懂。

多模态是个好方向。但现在它还在"能看见"的阶段,离"看懂"还有距离。

说个更真实的例子。有次我给AI看一张产品截图,问它这个界面好不好用。它说:界面设计简洁,功能布局合理,用户体验良好。

我一看这截图——其实界面挺乱的,按钮又小又挤,字都看不清楚。但AI说"简洁合理"。为什么?因为它看界面,只能看到上面有什么元素,它不知道用户用起来方不方便。

它能描述界面,但它不能评价界面。评价需要经验——你知道用户点不到按钮会 frustration,你知道字太小看着累。这些AI没有。

还有次我给它看一张设计稿,问它这个设计有什么问题。它说:配色协调,排版美观。我看那个设计——颜色跟品牌色完全不符。它连品牌色都不知道,怎么评价?

这就是多模态AI的局限:它能"看到",但它没有审美、没有经验、没有判断力。你让它描述可以,让它评价还早。

别指望AI看图帮你做设计决策。它就是个高级看图说话的。

别急着吹它多智能。

它还在学。

慢慢来。

#免责声明#

本站提供的一切资源、教程和内容信息仅限用于学习和研究目的;不得将上述内容用于商业或者非法用途,否则,一切后果请用户自负。本站信息来自网络收集整理,版权争议与本站无关。