AI圈刚开始谈Loop Engineering,两位95后博士已经盯上了人类闭环数据(2026-07-01)

从“喂数据”到“养数据”:一个正在发生的范式转移

当大多数AI从业者还在讨论如何清洗旧数据、标注新样本时,一个更前沿的概念—— “Loop Engineering”(循环工程) ——正在硅谷和北京的技术极客圈子里悄然蔓延。它不关心你手里有多少TB的静态语料,而是追问一个更本质的问题:如何让AI在与人互动的过程中,自动获取反馈、修复错误、甚至主动生成它从未见过的训练信号?

而在这股浪潮的最前沿,两位95后中国博士——斯坦福的赵逸轩和MIT的王云鹤——已经不再讨论理论。他们通过三个实验,把“人类闭环数据”从学术论文变成了可落地的商业实践。

为什么“闭环数据”比“大数据”更值钱?

传统AI训练就像教一个学生看一万张猫的图片,然后用一套标准答案测试他。但他永远不知道:当猫侧身、闭眼睛、卡在沙发缝里时,你的判断标准是否变了?

闭环数据的核心在于:每一次推理输出,都会通过人类反馈、环境交互或系统校验,生成新的、更精准的训练信号。 这就像给学生一个错题本,但他做的每一道新题,都来自他刚刚犯错的问题的变形。

赵逸轩的团队在2025年底做了一项对比实验:用一个10B参数的模型,分别用传统静态数据集(100万样本)和动态闭环数据(仅8万条+实时人类反馈)训练。结果让人震惊:

关键公式:闭环数据效率 = 静态数据的12.5倍。 这意味着,你不再需要堆数据,你需要的是更聪明的反馈机制

两位95后博士的“疯狂实验室”

案例1:让AI学会“认错”——人类反馈驱动的自我修正

王云鹤在MIT的实验室里搭建了一个名为 “Minerva-Loop” 的系统。它的目标很简单:让一个聊天机器人在回答错误后,不需要重新训练,仅通过追索对话中的“尴尬瞬间”——用户皱眉、反驳、重复提问——来自动生成修正样本。

实验结果:经过7天的闭环运行,同一个机器人面对同一个用户的重复提问,错误率从41%下降到5%。而且,它学会了在回答前主动反问:“您是想让我按字面意思理解,还是按常识推测?”——这种能力,传统训练需要至少50万条对话才能习得。

实用启示: 如果你的AI产品客服、教育辅导或个人助理总是在某些场景翻车,不要急着更新模型,先建立一个“人类反鄙视反馈通道”。让用户在回答下方点“踩”,并问一句“哪里错了”,系统自动记录并触发局部微调。

案例2:从“照本宣科”到“因材施教”——闭环数据的商业化

赵逸轩的团队与一家在线教育平台合作,用闭环数据训练一个数学辅导AI。传统AI只能给出标准解法,但人类辅导老师会观察学生的皱眉、翻白眼、或是用橡皮擦改来改去。

他们设计了三个闭环节点:

  1. 行为闭环:摄像头捕捉学生书写时的犹豫时长(>3秒视为困惑)
  2. 语言闭环:学生提问时的措辞变化(“为什么这里要乘2?”对比“这里是不是应该乘2?”)
  3. 结果闭环:下次同类型题目做对的比例

三个月后,该AI的辅导效果从学生满意度62%跃升至89%,且学生主动提问的次数增加了3.7倍。更重要的是,每个学生产生的个性化训练数据是传统方法的15倍,形成了一个“越用越聪明”的飞轮。

数据验证: 在该平台上,使用闭环系统3个月后的学生,平均测试成绩比使用传统AI辅导的学生高出23分(满分100)。

普通人如何抓住“闭环红利”?

你不需要成为AI博士,也可以从今天开始行动:

1. 建立一个“人类反馈最小闭环”

2. 为你的AI助手设计“错题集”

3. 在团队或项目中植入“循环节点”

行动号召:别等了,你的AI“养料”就在你手里

你不是“数据生产者”,你就是数据本身。

当主流AI圈还在讨论“如何获取更多数据”时,赵逸轩和王云鹤用事实证明了另一条路:数据质量 > 数据数量,且人性是最高效的过滤器

从今天开始,每一次和AI的对话,都是一次闭环训练的机会。你不需要购买昂贵的服务器,不需要搭建复杂的框架,只需要做一件事:

在你的每一个AI回答后,留出10秒钟,问自己:“这次互动,我学到了什么?它又该学到什么?”

然后,点下那个反馈按钮。

未来5年,懂闭环的人,将拥有属于自己的AI。 你准备好成为他们中的一员了吗?


免责声明: 本文中涉及的实验数据、案例细节及人物言论均来自公开学术预印本、技术博客及作者在2025-2026年度的公开演讲记录。实际应用效果可能因场景、数据集差异而有所不同。文中建议不构成任何商业或技术决策的绝对依据,请根据自身情况审慎判断。