中国宏观经济月报:DeepSeek的抄袭争议——蒸馏技术的使用
时间:2025-02-12
作者:杨曦
随着DeepSeekR1和V3的迅速走红,模型蒸馏这一原本较为冷门的技术术语也随之进入公众视野。外界对DeepSeek的主要质疑之一,是其模型可能通过从其他先进模型中提取知识而构建,这也引发了OpenAI对其“抄袭”的指控。 在达沃斯论坛上,DeepMind的首席执行官DemisHassabis表示,DeepSeek的模型确实表现出了一些“令人惊讶”的特性,但他也坦言,“对DeepSeek模型的具体工作原理并不完全了解,尤其是它在多大程度上依赖于其他美国公司模型的成果”。1月29日,彭博社援引知情人士的消息称,微软的安全研究人员在2023年秋季发现DeepSeek的员工通过OpenAI的API获取了大量数据,暗示这些数据可能被用于训练V3或R1模型,然而,OpenAI并未提供确凿的证据。 蒸馏技术并非抄袭 在机器学习领域,蒸馏技术是一种常见的优化方法,其核心思想是将大型复杂模型(教师模型)的知识迁移到小型高效模型(学生模型)中。这一过程旨在保留大模型的核心性能,同时显著减少模型的大小和计算需求,使其更适合在资源有限的环境中部署。 通俗地说,这就像一位经验丰富的教授向一位新生传授专业知识。教授代表教师模型,而新生作为学生模型,通过吸收这些知识来完成学习过程。正如学生在学习过程中吸收了前人的智慧并不等同于直接抄袭前人的作品一样,模型蒸馏也并非简单的复制。 蒸馏技术的概念最早由被誉为“AI教父”的GeoffreyHinton在2015年的一篇论文中提出。他在文中明确指出,蒸馏(Distillation)并非复制大模型的架构或代码,而是提取大模型中所包含的知识(knowledge)。因此,蒸馏的本质是知识迁移,而非整体架构的抄袭。