Redis 作者反驳「中国模型之所以强,是因为通过 API 蒸馏了美国模型」
最近,科技圈掀起了一场不大不小的风波。起因是一些海外开发者抛出这样的论调:“中国的大语言模型之所以进步这么快,很大程度上是因为‘蒸馏’了美国模型的 API——说白了,就是偷偷‘抄作业’。” 这个说法像一颗石子投入湖面,迅速引发讨论。但很快,一位重磅人物站了出来——Redis 的作者、知名开发者 Salvatore Sanfilippo(网名 antirez),他公开表示:这种观点不仅傲慢,而且根本站不住脚。
在这篇文章里,我们不用技术黑话,用大白话聊聊:为什么 antirez 说得对?以及“蒸馏”到底是怎么一回事?
一、先搞清楚:什么是“模型蒸馏”?
用最简单的类比来解释:
- 假设你是一名高三学生,想快速提分。
- 有位“名师”每天都在黑板上写满解题步骤(这就是大模型的 API 输出)。
- 你不需要从头学起,只需要把这些步骤“抄”下来,反复练习,就能在模拟考中拿到相近的分数。
这种“抄”的过程,在 AI 领域就叫做 蒸馏。它确实存在,而且是一种合法、高效的技术——谷歌、Meta 自己的论文里,也公开使用过蒸馏方法。所以,蒸馏本身不是问题。
问题在于: 某些人声称“中国模型完全靠蒸馏美国模型”,这就像说“中国学生数学考得好,全靠抄袭美国老师”——完全忽略了背后的自主创新和工程努力。
二、antirez 的反驳:几个核心论点
作为 Redis 的创始人,antirez 不仅是技术大牛,也是一位思维敏锐的观察者。他在自己的博客和社交平台上,给出了几个硬核反驳理由:
1. “蒸馏”没那么容易,不是复制粘贴
蒸馏不是简单的“复制 API 输出”。实际上,要将一个大型教师模型(比如 GPT-4)的知识,迁移到一个更小的学生模型(比如中国的 DeepSeek-V2 或 Qwen2)中,需要大量精细的工程调优,包括:
- 如何选择训练数据?
- 如何分配“注意力权重”?
- 如何平衡精度和速度?
真实案例: 中国团队开发的 DeepSeek-V2,其上下文长度达到 128K,而且在长文本理解任务上超越了 GPT-4。如果只是简单“蒸馏”,根本做不到这种突破。蒸馏只能模仿,不能创新。
2. 美国模型也有“借力”中国技术
antirez 指出一个常被忽略的事实:AI 领域从来就是全球协作的。
- Transformer 架构最初来自 Google Brain,但后续的重大改进(比如 FlashAttention、RoPE 位置编码)中,中国研究者贡献了很大比例。
- 阿里巴巴、字节跳动、智谱 AI 等团队在 MoE(混合专家模型)、稀疏注意力等方向的论文,被 Meta、Google 的工程师大量引用。
数据说话: 根据 2023 年 ACL 顶级会议数据,中国作者(包括大陆、香港)发表的论文数量占全球 28%,仅次于美国。评价一个国家的 AI 能力,不能只看“模型名”,更要看“论文库”。
3. 真正的差距不在“蒸馏”,而在算力和生态
antirez 最后点出一个更残酷的现实:
“如果中国模型真的完全靠蒸馏,那为什么 OpenAI、Anthropic 还要花数十亿美元采购 GPU?因为真正的壁垒不是模型参数,是算力和供应链。”
中国在高端 GPU 上受到限制(比如 Nvidia H100/B200 的出口管制),这让中国团队不得不:
- 研发更高效的训练算法
- 探索国产芯片(如华为昇腾 910B)的适配
- 在有限带宽下做更大规模的推理优化
这反而倒逼出了一批“瘦身型”创新——就像用更少的食材,做出同样美味的菜肴。这不是“偷工减料”,而是“困境下的创造力”。
三、普通人该怎么理解这场争论?
我们不搞学术站队,只给三条实用建议:
| 误区 | 真相 |
|---|---|
| “中国模型=美国模型缩水版” | 两者架构、训练数据、侧重领域不同,比如中国模型在中文理解、医疗、金融场景上更优 |
| “蒸馏=作弊” | 蒸馏是学术界公认的合法技术,Google、Meta 自己也在用 |
| “一方强=另一方弱” | AI 是长跑,目前美国在基础科研、芯片上领先,中国在应用场景、工程效率上追赶 |
一句话总结: 这就像说“中国乒乓球队之所以赢,是因为长期看日本队员的比赛录像”——录像当然有用,但真正决定冠军的,是成千上万小时的自主训练和战术创新。
四、行动号召:保持清醒,别被“技术民粹”带偏
作为普通读者,你不需要懂梯度下降或 Transformer。但你可以做到:
- 警惕“非黑即白”的叙事:凡是说“全靠蒸馏”或“完全不靠”的,都是情绪化表达。
- 关注实际应用效果:打开你的手机,看看日常用的 AI 助手——Kimi、豆包、文心一言,有没有帮你完成过靠谱的任务?体验比口号重要。
- 支持开源和开放讨论:如果你是个开发者,可以亲自试试 DeepSeek-V2 或 Qwen72B,用自己的代码跑一遍,比看一万篇争论都有说服力。
最后,别被“技术鄙视链”裹挟。 无论是美国模型还是中国模型,最终的目标都应该是让普通人用得起、用得好。如果有一天,一个非洲乡村的医生通过中国开源模型诊断疾病,一个日本学生用美国模型学习中文——那才是真正的胜利。
免责声明: 本文作者与 Redis 作者、antirez 本人无任何利益关系。文中提到的模型性能数据均来自公开论文和评测基准(如 C-Eval、GSM8K、MMLU)。技术观点仅供参考,不构成投资或技术选型建议。AI 领域变化极快,本文写作于 2025 年,请以最新学术动态为准。