数据治理为何成为合规底座

我越来越觉得,企业谈人工智能合规时,最容易被忽略的不是模型,而是数据。模型输出出了问题,大家往往先追问算法是否可靠;但真正往前倒查,常常会落到几个朴素问题:数据从哪里来?有没有使用权利?经过了怎样的清洗和评估?里面是否包含个人信息、受版权保护的内容,或者不适合当前用途的样本?

这就是为什么我把数据治理看成合规底座。法律里的“公平、透明、安全、隐私”,如果只停留在原则层面,团队很难执行。只有把它们落实到数据目录、访问记录、版本管理、风险评估和问题追踪中,企业才有可能拿出一条完整的证据链。

比如,“公平”不能只写在制度里,还要检查数据是否具有代表性,观察不同群体之间是否存在明显差异;“透明”也不只是告诉用户用了人工智能,还要说明系统的适用边界和限制条件。数据来源不清、版本混乱、责任人缺失,到了审计或事故调查时,往往连问题从哪里开始都说不清。

我尤其警惕一种想法:只要模型是供应商提供的,责任就可以一并外包。现实并不是这样。企业采购模型、插件或数据接口后,仍然要判断它是否适合具体业务,是否设置了权限管理、人工复核和退出机制。模型供应商可以交付能力,但不能替部署方完成全部治理。

数据治理要管完整生命周期

对大模型企业来说,需要关注训练数据、微调数据、检索库和用户反馈数据;对普通企业来说,风险可能藏在供应商提供的数据接口里。看起来场景不同,核心要求却很接近:数据要可追溯,使用要有边界,变更要能记录,出现偏差、侵权或错误输出时要能定位和纠正。

这也是行业标准有价值的地方。ISO/IEC 42001和NIST人工智能风险管理框架,都在帮助企业把治理、风险识别、测量和持续管理组织起来。它们不能替代法律,也不能靠一次认证永久解决问题,但能让法务、技术、业务和供应商开始使用同一套语言。

在我看来,合规最怕的不是要求多,而是没有证据。数据治理做得扎实,企业才知道自己在用什么数据、承担什么风险,也才有能力解释和修正问题。模型会更新,业务会变化,规则也可能继续调整,但这套底层能力不会过时。атәи

文章版权归作者所有,未经允许请勿转载。

本文链接:https://www.chatcpt.com.cn/thread/data-governance-foundation/

参与讨论

0 条评论