模型相似度能证明“抄袭”吗?以 DeepSeek 为例看溯源证据边界

模型相似度可以帮助调查来源,但不能单独证明“抄袭”,也不能单独证明不存在复制。技术比较回答的是样本在哪些方面相同或接近;授权是否充分、使用是否符合条件,还需要结合来源、许可和实际行为判断。
首先说明在比较哪个模型
模型家族名称不能代替精确工件。DeepSeek-V3、DeepSeek-R1 与 R1-Distill 系列是不同对象。DeepSeek-R1 官方公开说明,部分蒸馏模型基于 Qwen 和 Llama,并列出模型与许可信息。DeepSeek-R1 官方仓库
因此,“基于其他模型”与“不当复制”不能画等号。公开的上游关系应被准确记录,再审查相应使用条件;同样,也不能用一个家族的说明替另一个模型版本背书。
三类相似线索分别能说明什么

架构和配置相似说明模型可能采用共同设计或存在继承关系,但流行架构可以被多个团队使用。结构不同也无法排除数据、代码或输出层面的关系。
词表和参数命名相似可以缩小调查范围,但共享分词器、兼容格式或转换工具也可能产生相似结果。必须说明比较的具体对象。
权重或文件相同提供更直接的工件线索。相同文件摘要可以用于确认字节内容一致;局部张量相似则需要说明对齐方式、量化、格式转换及比较算法。即便文件一致,是否有权使用仍需另行核对。
怎样形成可复核的溯源记录
建议保存模型发布地址、下载时间、提交号与文件摘要,明确候选上游集合和比较方法,再记录工具、参数及基准库版本。报告要区分观测事实、可能解释和无法确认的事项。

例如,“在所比较的 A、B、C 三个版本中,发现部分张量高度接近”是有范围的技术描述;“已证明复制某厂商模型”则需要更多证据。反过来,“未发现高相似样本”只能代表当前范围和方法的结果。
上游仓库说明、模型卡、训练或转换记录和许可证,应与相似性结果一起查看。原始研究或发布者的技术报告,可以提供模型训练与来源的公开描述,但它们仍不等于对所有潜在权利问题的裁判。DeepSeek-R1 技术报告
常见问题
相似度达到 100% 就能定性吗? 先确认 100% 指完整文件、某类特征还是抽样张量。即便字节一致,也还要核对来源和授权。
没有高相似结果,是否可以省略许可审查? 不可以。相似性检测能力和比较范围有限,许可证与使用限制仍需独立记录。

企业最需要什么输出? 一份能回到具体样本、来源和方法的证据记录,以及清楚标明范围的风险判断。
