下午察:又有中国AI模型被指控蒸馏

中国人工智能(AI)初创企业月之暗面7月16日推出的大模型Kimi K3,因性能媲美西方顶尖闭源模型而备受科技圈瞩目。但这款模型推出不到一周,便卷入“蒸馏”风波。

美国白宫科技政策办公室主任克拉齐奥斯星期三(7月22日)在社媒平台X上公开点名月之暗面,指控这家企业在开发K3模型时,对美国Anthropic公司的Fable模型进行蒸馏。

蒸馏是一种由高性能大模型向较小模型进行知识转移的过程,就像“老师”指导“学生”。借助这一技术,研发人员能够提取顶尖前沿系统的海量优质数据,用以训练自身模型,从而减少训练成本。

这项最初由谷歌推出的技术在业界十分普遍,并非违法行为。今年4月,SpaceXAI(前称xAI)创办人马斯克便公开承认曾对其他模型进行蒸馏,并形容这是AI企业的“常规操作”。

克拉齐奥斯称,合法的蒸馏技术用于创建更小和更高效的模型,但月之暗面“开发了一个复杂的内部平台,对美国模型进行大规模蒸馏,并能在多种访问方式间快速切换,以躲避侦察”。

他说,这种旨在“窃取美国专有技术并破坏美国研究的大规模、隐蔽的工业级蒸馏,是不可接受的”。

美国白宫科技政策办公室主任克拉齐奥斯指控中国企业月之暗面在开发Kimi K3模型时,蒸馏了美国Anthropic的闭源前沿模型。图为克拉齐奥斯星期三(7月22日)出席一场听证会。(路透社)

美国财长贝森特随后也在X发文称:“当中国企业进行隐蔽的、工业级规模的蒸馏攻击,并越界构成知识产权窃取时,我们将考虑对其实施制裁,并列入‘实体清单’。”

不过,截至星期四(23日),华盛顿尚未提供月之暗面进行蒸馏的证据。月之暗面企业业务负责人黄震昕反驳称,K3性能跃升的核心来自底层原创架构创新,而非对现有模型的蒸馏复刻。

在此之前,美国AI业界已多次指控中国模型利用蒸馏技术开发模型。

今年2月,Anthropic控诉月之暗面、深度求索(DeepSeek)和MiniMax利用约2万4000个虚假账户,与Claude模型进行逾1600万次互动以提取训练数据;到了6月,指控的对象名单再加入阿里巴巴。

Anthropic、OpenAI和谷歌这三家竞争对手在今年4月罕见合作共享信息,以打击“对抗性蒸馏”(Adversarial Distillation)的行为。同时,特朗普政府也承诺出台措施,追究实行蒸馏的外国实体责任。

蒸馏争议的罗生门

围绕Kimi K3模型是否涉嫌蒸馏,西方科技圈内部目前仍有分歧。

评测网站Arena.ai数据显示,拥有2.8万亿参数的K3在多项能力测试上不仅媲美Anthropic的Fable 5和OpenAI的GPT-5.6 Sol,甚至在前端代码和智能体领域实现超越。

不过,有科技博主在X发文指出,如果K3仅是Fable 5的蒸馏产物,其性能理应只是接近后者。但评测结果显示,K3在部分领域优于Fable 5,这种表现难以单凭蒸馏技术实现。

OpenAI战略未来事务主管鲍尔称,K3是“一款极其优秀的模型”,这样的优异性能大概率无法“简单归因于蒸馏或类似手段”。

此外,Fable 5模型最初于6月9日问世,后来因爆出可绕过安全防护机制的“越狱”安全漏洞,上线仅72小时便被迫全球下架,直到7月1日才重新开放。K3是在7月16日发布。

今年6月9日,美国Anthropic公司发布最前沿模型Fable 5与Mythos 5。然而,两款模型发布伊始,便被曝出存在可绕过安全防护机制的“越狱”漏洞。鉴于该隐患可能导致美国政府系统暴露在攻击风险之下,美国商务部随即紧急介入,迫使这两款模型强制下线。(路透社)

有专家质疑,短短两周时间,K3研发团队是否有足够的余地去提取海量输出数据并整合到模型中?

曾在Meta、谷歌Deepmind等任职的AI专家兰伯特(Nathan Lambert)就指出,Fable 5的使用限制堪称业内最严,他对Kimi K3是否有渠道接入Fable持怀疑态度。

不过,华盛顿智库新美国安全中心专门研究AI蒸馏的研究助理海尤姆指出,中国AI企业在完成模型训练后,发布产品的周期往往远快于美国同行。“如果中国团队在训练收尾阶段几乎无缝衔接地对外发布产品,那么他们绝对有充裕的时间,将Fable 5的蒸馏数据整合进去。”

此外,不少网民在X上传截图显示,当被问及“你是谁”时,K3竟回应称“我是Claude”。这一现象被外界视作K3对Anthropic模型进行技术“蒸馏”的直观证据。

包括DeepSeek R1、Kimi K2.5在内的多款中国模型,此前都曾出现过类似的“身份认同危机”。

有网民在测试Kimi K3时询问“你的名字是什么”,模型竟直接回复:“我是Claude,由Anthropic开发的AI助手。”这被不少网民视作Kimi K3对Anthropic模型进行过蒸馏的证据。(互联网)

但有观点认为,之所以出现这种现象,是因为这些模型在进行微调或数据处理时,吸收了美国前沿模型生成内容的数据,未必能证明中国模型实施了大规模蒸馏。

中美科技战下的蒸馏争议

无论蒸馏争议的结果为何,这波指控一定程度上折射出华盛顿对全球AI主导地位可能动摇的深层焦虑。

彭博社认为,K3模型的问世,颠覆了外界关于“美国AI技术仍遥遥领先中国”的固有认知,显示中国开源生态正以超乎预期的速度追赶西方闭源系统,双方技术代差可能已缩短至三到六个月。

除了中美技术鸿沟不断缩小,美国本土企业也日益青睐更具成本优势的中国开源模型。OpenRouter数据显示,7月首周中国大模型在全美企业AI接口调用总量中占比已达63%。

在这一背景下,美国政府似乎正重新评估针对中国大模型的限制措施,以捍卫美国在AI领域的主导地位。

美国Axios新闻网7月20日引述知情人士透露,美方现阶段的策略并非直接祭出全面禁令,而是尝试通过渲染中国模型的潜在风险与安全漏洞,促使本土企业主动弃用,并鼓励美企开发开源生态系统。

华盛顿此时抛出蒸馏指控,似乎正是为了服务上述目的。借着蒸馏指控出台制裁措施,不仅能挤压中国开源系统的生存空间,同时也能为即将在今年9月举行的中美AI政府间对话提前收集谈判筹码。

除了维系科技霸权的战略考量,华盛顿对中国开源生态的警惕还源自对技术失控的安全焦虑。

随着来自中国的顶尖开源模型在全球加速扩散,其用途和流向逐渐脱离美国的掌控,华盛顿将越来越难以阻挡或防范这些模型对美国技术防御体系的持续试探,因为几乎不可能对这些数码产品实施物理意义上的封锁。

正如兰伯特写道,对华盛顿而言,最理想的“安全均衡”在于:最顶尖的前沿模型须维持受控和闭源状态,并对开源模型保持至少数月的技术代差。

K3模型的问世,或许标志着中国开源前沿模型突破美国赖以建立的“安全均衡”,已成为一个几乎不可逆的趋势。可以预见,中美围绕前沿技术主导权的战略博弈,必将愈演愈烈。

您查看的内容可能不完整,部分内容和推荐被拦截!请对本站关闭广告拦截和阅读模式,或使用自带浏览器后恢复正常。