GPT-NL:荷兰€1350万的数据正义实验,能改写欧洲AI游戏规则吗?

· 科技资讯

当大多数国家还在讨论要不要监管AI时,荷兰已经动手造了一个「从法律里长出来」的大模型。

2023年11月,荷兰应用科学研究组织(TNO)联手国家超级计算合作机构SURF和荷兰法医研究所(NFI),正式启动GPT-NL项目。荷兰经济部拨款€1350万——这个数字放在硅谷不过是头部AI公司几小时的算力账单,但荷兰人要做的不是参数竞赛,而是一场关于AI治理范式的制度实验。

欧洲主权大模型地图

四根支柱:不只是口号

GPT-NL围绕四个核心原则构建:主权——全部研发在欧洲境内完成,数据与模型不流经非欧洲服务器;透明——开源模型权重,配套详细记录训练数据来源与质量的数据表(datasheet)和模型卡(model card);可信——从头训练,确保数据供应链清洁可追溯,拒绝盗版或灰色来源语料;互惠——数据提供者参与收益分配,与内容创作者共担风险、共享成果。

2026年2月,GPT-NL进入beta测试,五个试点组织开始实地验证,涵盖市政虚拟助手(已被约30个荷兰城市使用、2024年处理约7万次对话)、政府公文简化工具和法医调查AI等场景。在文本摘要基准测试上,GPT-NL已超越GPT-3——考虑到仅约25人的团队和€1350万的预算,这是一个颇具象征意义的里程碑。

「清洁数据供应链」:重新定义数据关系

GPT-NL最激进的创新在于数据策略:只使用三类数据——明确授权的opt-in数据、法律明确允许用于LLM训练的公开数据、不侵犯知识产权的合成数据。这意味着OpenAI式的「先抓取网页再打官司」路径被彻底拒绝。

更具开创性的是GPT-NL与荷兰新闻出版商协会达成的集体授权协议——全球首个AI项目与单一市场内所有主流新闻出版机构达成的付费授权协议,覆盖全国性报纸、NU.nl、RTL News等。协议条款全部公开,出版商可撤回内容,退出后仍可持续获得补偿。GPT-NL还设置了技术防护措施,防止通过提示词工程提取版权内容。

欧洲「一国一模型」的悖论

GPT-NL不是孤例。法国有BigScience/BLOOM,德国有LEAM和SOOFI项目,意大利有Italia系列模型。这种分散策略的根源是数字主权焦虑:当政府公文依赖不透明的商业模型来起草,主权已在代码层面悄然流失。蒂尔堡大学全球ICT法教授、GPT-NL项目法律顾问Lokke Moerel一针见血:「如果你只给别人造的科技制定规则,你将永远在追赶。」

但分散模式的弊端同样明显:€1350万和25人,如何与万亿参数、数万人团队的大厂竞争?资源碎片化意味着欧洲可能永远无法诞生世界顶级的基础模型,最终沦为「一堆中等模型」的拼盘。

第三条道路

GPT-NL最有价值的贡献是提供了一条「第三条道路」:既不是硅谷的「先发布后道歉」,也不是布鲁塞尔的「先禁止再豁免」。一个资金有限、团队精干、以公共利益为导向的项目,也能做出被法律界认可、被政府部门采纳、被出版商信任的AI模型——GPT-NL因此获得荷兰隐私奖。它证明了一件事:AI不必先践踏权利再谈补救。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

滚动至顶部
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅