让AI看视频总结内容,它总结得跟我看的不是一个片
多模态大模型火了。说AI不光能看文字,还能看图、看视频。我试了几个,说点真实结果。
看图还行,看视频就拉了。
你给它一张图,问它图里有什么。它能告诉你:几个人、在干什么、背景是什么。大部分时候是准的。
但你让它看一段视频,说"帮我总结一下这段视频讲了什么"。它给你的总结,跟你看的经常对不上。
为什么?因为它不是真的在"看"视频。它是把视频按几秒钟抽一帧,然后逐帧看图片。它看不到帧和帧之间发生了什么。
比如视频里一个人从左边走到右边。抽帧的时候可能只拍到了左边和右边。它不知道这人中间动了。它会说:左边有个人,右边有个人。
那视频分析现在到底能干什么?
粗看可以。你让它大概说说视频里有什么场景、什么物体,它能给个八九不离十。
但你让它理解动作、理解因果、理解剧情,它就不行了。因为它没有连续画面的概念。
有次我让它总结一个两分钟的教程视频。它给我列了三条:打开软件、点击设置、保存。看着挺对。但中间具体怎么操作的、哪一步有什么坑,它全没说。
因为那些细节在帧之间,它没看到。
那这个技术什么时候能行?
得等它真能理解连续画面,而不是抽帧看图。现在还早。
用的时候你心里有数就行:让它粗看可以,别让它精看。它总结的东西你得自己核对。
技术是一步步来的,别吹得太早。
说个更离谱的。有次我截了一段10秒的搞笑视频给它,问它这视频笑点在哪。它给我分析了半天:画面中有两个人,表情夸张,背景是室内。它把笑点说成了"表情夸张"。
但真正的笑点是其中一个人说的那句台词。它没"听"到台词,因为它看的是图,不是音频。
这就是多模态现在的尴尬:它叫多模态,但实际上它还是主要看文字和图。视频的音频、动作、节奏,它理解得很浅。
当然这技术在进步。半年前它连图都看不利索,现在已经能看懂大部分图片内容了。视频分析可能再过一两年也会好很多。
但现在用的时候,你得知道它的边界在哪。别把它当万能的,它现在就是个刚学会看图的学生。
用AI这个事,最大的坑不是它不会,是你以为它会。你把它能力想高了,用在关键地方,它给你搞砸了。
技术在进步,但现在还早。
用的时候心里有数就行。真的。
别把它当万能的。
真的。
知道它的边界在哪。
真的。
别吹太早。
真的。
技术是一步步来的。
真的。
别着急。
再等等。
真的。
听我的。
别把它想太神。
真的。
它现在就是个学生。
真的。
刚学会看图。
真的。
就这样吧。
嗯。
就这样。
。
。

