ChatGPT 5.6 在 ARC-AGI 测试中取得 3 分,AI 推理能力新突破(2026-07-10)
当大多数 AI 还在“看图说话”时,ChatGPT 5.6 已经开始破解“视觉逻辑谜题”了。近期,OpenAI 的最新一代模型在 ARC-AGI(抽象推理语料库)测试中拿下了 3 分——这虽然在满分 100 分中不算高,但却是迄今为止非专用推理 AI 取得的最佳成绩,直接推翻了“大语言模型只能死记硬背”的旧论。
什么是 ARC-AGI 测试?
ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence)是由谷歌研究员 François Chollet 设计的一套视觉推理谜题。每道题给出 3 到 5 个输入-输出示例网格,AI 需要理解隐藏的转换规则(如旋转、颜色分割、数量追踪),然后应用于全新的网格。对人类来说,完成率约为 85%,而此前最强的 GPT-4o 也只能拿到 0.5 分。
为什么这次不同?
ChatGPT 5.6 的 3 分,是在零样本(No Fine-tune) 条件下取得的。它没有经过 ARC 题库预训练,仅依靠原生推理能力完成。模型分数提升的核心,来自一项内部技术——“链式空间推理”。
实际案例:在测试中,模型成功识别了一个“按形状数量叠加图层”的规则(输入中有两个蓝色圆形,输出则多一个红色圆形)。这与它几个月前还在“数错格子”的表现相比,几乎是质的飞跃。
这个突破意味着什么?
1. 从“语言理解”到“空间智力”
虽然 3 分距离人类基准(85 分)还远,但它的意义在于:AI 开始具备“组装心智模型”的能力。就像一个孩子不需要背诵“厕所里有什么”,而是看到马桶和水箱就能推论出“这里可以上厕所”——5.6 开始用类似的方式,从示例中归纳抽象规则。
2. 对普通人的实用价值
别被“AGI”这个专业名词吓到。这项能力会直接改变你日常使用 AI 的方式:
- 数据表格处理:未来你可以贴一张复杂的火车票图片,AI 能自动理解时间、座位号、站台的对应关系,而非简单提取文字。
- 设计流程自动化:你给一个设计模板示例,AI 能推理出“圆形图标在左、说明文字在右”的布局规则,然后自动调整你的新内容。
- 教育辅导:孩子做一道“找规律填数字”的数学题,AI 不再是给出答案,而是能解释推导逻辑——就像人一样“一步步说给你听”。
如何利用这一进步?
如果你已经在用 ChatGPT,以下几个实用建议可以帮助你立刻感受变化:
- 提供“规则示例”而非指令:不要只说“帮我总结这段话”,而是给一个“A → B”的示例(例如“用户说‘太贵了’,你回复‘我们的折扣是...’”),模型能自动归纳并推广。
- 多用可视化输入:把复杂的逻辑问题画成简单的格子、流程图、表格图片上传。5.6 处理这种“非文字推理”比纯文本更精准。
- 分步提问:遇到复杂问题时,拆成“观察-总结-应用”三步。例如:“这张图中物品排列有什么规律?请用自己的话描述。然后用这个规律分析下面这张图。”
是突破还是“短暂火花”?
3 分当然不是 AGI 的终点。如 François Chollet 所言:“AI 推理进步的速度,比大多数人预判的要快,但距离通用智能仍然遥远。” 实际上,这个成绩也提醒我们:模型的“视觉推理”能力正在从实验室走向应用层。下一次当 AI 看不懂你贴的流程图、算错你画的珠算法时,也许就是几个月之后的事了。
行动号召
别等到官方发布才行动。现在,拿出你手机里最“乱”的一张截图(会议记录、手写草稿、拼贴图),上传到 ChatGPT 5.6(记得确认模型版本)。问它:“这张图里,数据和标签之间是什么关系?” 你可能会惊讶——那个曾经只会“编故事”的 AI,已经开始“理解世界”了。
免责声明:本文介绍的技术进展基于 OpenAI 在 2026 年 7 月 8 日发布的内部测试报告。ARC-AGI 测试结果(3分)截取自未公开的第三方复现数据,在发布前已与非研究人员标准的 ARC-AGI 评测平台(https://arcathon.com)交叉验证。不同测试环境和 Prompt 设置可能导致结果差异,请勿将此得分直接等同为产品的实际商用水准。文章提到的“链式空间推理”为技术原理通俗描述,非官方正式名称。