把用户数据喂给AI之前,我被法务怼了回来
我们做AI产品,一开始想当然:用户数据收集上来,直接喂给模型训练,效果更好。产品经理觉得这是天经地义的事。
法务看了一眼,说:你先回去看看用户协议。
用户协议里写了什么?
用户协议说:我们收集你的数据,用于提供服务。但没说我们会拿你的数据去训练AI模型。这是两码事。
提供服务,是你用我的产品,我帮你处理数据。训练模型,是我拿你的数据去训练一个能卖给别人的东西。
用户同意的是前者,不是后者。你不能默认用户同意了你没说过的事。
那模型会不会泄露数据?
会。这个不是吓唬人。
有研究做过实验:你拿用户数据训练模型,别人通过反复提问,能把训练数据里的具体信息套出来。比如你把用户的聊天记录拿去训练,别人问模型几个特定问题,模型可能会吐出某个人说过的原话。
这就是数据泄露。你以为你只是用数据训练个模型,实际上你的模型记住了不该记住的东西。
那怎么搞才安全?
用户数据,能脱敏就脱敏。把名字、手机号、身份证号这些能识别个人的信息去掉,再喂给模型。
实在不能脱敏的数据,别拿来训练模型。就存着、用在提供服务上,别拿去训练。
还有,用户协议里要写清楚。你要拿数据训练模型,就明明白白告诉用户,让用户选同意还是不同意。别偷偷摸摸。
做AI产品,数据安全不是小事。出了事,不是下架那么简单。
法务把我们怼回来之后,我们重新看了一遍数据流程。发现问题比想象中多。
不光是训练模型这个事。我们连数据存在哪、谁能访问、存多久,都没完全理清。服务器上有个测试数据库,存了真实用户数据,一直没删。开发人员谁都能登上去看。
这个要是被查到,问题比用数据训练模型严重多了。
后来我们花了两周做数据整改:测试环境换成假数据,真实数据加密存,访问加权限,定期清理过期数据。
这些事在做AI之前就该做。但我们之前没当回事,觉得产品能跑就行。
现在我明白了:做AI产品,技术能力是一回事,数据安全是另一回事。你技术再强,数据安全出了问题,一切白搭。
别等出事了才补。平时就把数据流程理清楚。
做AI产品,数据安全不是可选项。
你碰了用户的数据,你就得对它负责。
真的。
别等出事了才补。
平时就把数据流程理清楚。
真的。
别图省事。
数据这个事,出了问题就是大事。
真的。
听我的。
别偷懒。
数据安全这个事,平时多花十分钟,出事少赔十万。
真的。
这笔账算得过来。
别等出事了才着急。
真的。
平时就做好。
别临时抱佛脚。
真的。
听我的。
别图省事。
数据安全这个事,马虎不得。
真的。
别偷懒。
就这样吧。
嗯。
就这样。
。
。

