大模型许可证如何审查?把权重、代码、数据与使用条款分开看

企业取得一个可下载的大模型后,应分别审查模型权重、代码、数据和其他条款。仓库中的一张许可证标签,通常不足以说明每项资产都采用相同授权,更不能直接证明任意商业用途都被允许。
“开放权重”与“开源AI”有什么区别
OSI的Open Source AI Definition 1.0已经正式发布。它围绕使用、研究、修改和分享的自由,要求能够获得进行修改所需的数据说明、代码和参数。数据说明应足够详细,使专业人员能够构建实质等效的系统,并按定义说明相关数据来源与取得方式;这不能简单解释为必须无条件公开全部原始训练数据。OSI定义原文
这一框架有助于判断开放程度,但不是替项目出具法律意见或自动授予商业使用权。实际使用仍需阅读对应版本的权重许可、软件许可和附加政策。OSI常见问题
建立一张分层许可清单
模型层记录发布方、模型名称、版本、权重来源、基座与微调关系。不要因为衍生仓库写了新许可,就忽略上游模型的条件。

代码层记录训练、推理、量化、适配和部署代码,以及进入交付物的依赖。代码采用宽松许可,不代表权重或数据也采用同一许可。
数据层记录数据来源、取得方式、使用范围及清理过程;不能用权重许可推断训练数据、个人信息或第三方材料已全部获得授权。
使用条款层检查用途限制、再分发、署名、通知、商标、可接受使用政策和额外授权要求。条款中的定义与版本同样需要保存。
用实际业务行为验证结论
先描述团队准备做什么:内部推理、对外API服务、微调后提供权重,还是把模型交给客户部署。相同模型在不同使用方式下,需要核查的义务可能不同。评审应给出“允许的范围、需满足的条件、尚缺的资料”,而不是只填“可商用”。
版本升级和更换基座后,要重新检查许可;对需要保留的声明和文件,应在交付流程中实际验证。AI-BOM可作为记录资产与关系的载体,但清单本身不能证明权利完整或应用已合规。

如果企业计划发布自己的模型,也应先确认对上游代码、权重与数据拥有怎样的权利,再决定开放范围和许可安排。
