Redis 作者反驳「中国模型之所以强,是因为通过 API 蒸馏了美国模型」

最近,科技圈掀起了一场不大不小的风波。起因是一些海外开发者抛出这样的论调:“中国的大语言模型之所以进步这么快,很大程度上是因为‘蒸馏’了美国模型的 API——说白了,就是偷偷‘抄作业’。” 这个说法像一颗石子投入湖面,迅速引发讨论。但很快,一位重磅人物站了出来——Redis 的作者、知名开发者 Salvatore Sanfilippo(网名 antirez),他公开表示:这种观点不仅傲慢,而且根本站不住脚。

在这篇文章里,我们不用技术黑话,用大白话聊聊:为什么 antirez 说得对?以及“蒸馏”到底是怎么一回事?


一、先搞清楚:什么是“模型蒸馏”?

用最简单的类比来解释:

这种“抄”的过程,在 AI 领域就叫做 蒸馏。它确实存在,而且是一种合法、高效的技术——谷歌、Meta 自己的论文里,也公开使用过蒸馏方法。所以,蒸馏本身不是问题。

问题在于: 某些人声称“中国模型完全靠蒸馏美国模型”,这就像说“中国学生数学考得好,全靠抄袭美国老师”——完全忽略了背后的自主创新和工程努力。


二、antirez 的反驳:几个核心论点

作为 Redis 的创始人,antirez 不仅是技术大牛,也是一位思维敏锐的观察者。他在自己的博客和社交平台上,给出了几个硬核反驳理由:

1. “蒸馏”没那么容易,不是复制粘贴

蒸馏不是简单的“复制 API 输出”。实际上,要将一个大型教师模型(比如 GPT-4)的知识,迁移到一个更小的学生模型(比如中国的 DeepSeek-V2 或 Qwen2)中,需要大量精细的工程调优,包括:

真实案例: 中国团队开发的 DeepSeek-V2,其上下文长度达到 128K,而且在长文本理解任务上超越了 GPT-4。如果只是简单“蒸馏”,根本做不到这种突破。蒸馏只能模仿,不能创新。

2. 美国模型也有“借力”中国技术

antirez 指出一个常被忽略的事实:AI 领域从来就是全球协作的

数据说话: 根据 2023 年 ACL 顶级会议数据,中国作者(包括大陆、香港)发表的论文数量占全球 28%,仅次于美国。评价一个国家的 AI 能力,不能只看“模型名”,更要看“论文库”。

3. 真正的差距不在“蒸馏”,而在算力和生态

antirez 最后点出一个更残酷的现实:

“如果中国模型真的完全靠蒸馏,那为什么 OpenAI、Anthropic 还要花数十亿美元采购 GPU?因为真正的壁垒不是模型参数,是算力和供应链。”

中国在高端 GPU 上受到限制(比如 Nvidia H100/B200 的出口管制),这让中国团队不得不:

这反而倒逼出了一批“瘦身型”创新——就像用更少的食材,做出同样美味的菜肴。这不是“偷工减料”,而是“困境下的创造力”。


三、普通人该怎么理解这场争论?

我们不搞学术站队,只给三条实用建议:

误区 真相
“中国模型=美国模型缩水版” 两者架构、训练数据、侧重领域不同,比如中国模型在中文理解、医疗、金融场景上更优
“蒸馏=作弊” 蒸馏是学术界公认的合法技术,Google、Meta 自己也在用
“一方强=另一方弱” AI 是长跑,目前美国在基础科研、芯片上领先,中国在应用场景、工程效率上追赶

一句话总结: 这就像说“中国乒乓球队之所以赢,是因为长期看日本队员的比赛录像”——录像当然有用,但真正决定冠军的,是成千上万小时的自主训练和战术创新。


四、行动号召:保持清醒,别被“技术民粹”带偏

作为普通读者,你不需要懂梯度下降或 Transformer。但你可以做到:

  1. 警惕“非黑即白”的叙事:凡是说“全靠蒸馏”或“完全不靠”的,都是情绪化表达。
  2. 关注实际应用效果:打开你的手机,看看日常用的 AI 助手——Kimi、豆包、文心一言,有没有帮你完成过靠谱的任务?体验比口号重要。
  3. 支持开源和开放讨论:如果你是个开发者,可以亲自试试 DeepSeek-V2 或 Qwen72B,用自己的代码跑一遍,比看一万篇争论都有说服力。

最后,别被“技术鄙视链”裹挟。 无论是美国模型还是中国模型,最终的目标都应该是让普通人用得起、用得好。如果有一天,一个非洲乡村的医生通过中国开源模型诊断疾病,一个日本学生用美国模型学习中文——那才是真正的胜利。


免责声明: 本文作者与 Redis 作者、antirez 本人无任何利益关系。文中提到的模型性能数据均来自公开论文和评测基准(如 C-Eval、GSM8K、MMLU)。技术观点仅供参考,不构成投资或技术选型建议。AI 领域变化极快,本文写作于 2025 年,请以最新学术动态为准。