GPT-6 Astra 智商爆表?ARC 测试背后的“符号世界模型”与成本争议
GPT-6 Astra 在 ARC-AGI-3 测试中逼近满分,展现出惊人的“符号世界模型”推理能力。尽管技术突破显著,但其高昂的算力成本和出题人对其“刷分”性质的质疑,引发了业界对 AI 真实智能水平的深度探讨。
GPT-6 Astra 智商爆表?ARC 测试背后的“符号世界模型”与成本争议
OpenAI 的最新旗舰模型 GPT-6 Astra 近期引发了科技圈的剧烈震动。它不仅在科研、安全和操作层面表现优异,更在 AI 界公认的“智商测试”——ARC-AGI-3 测试中,成绩逼近 100%。这一分数相较于上一代模型 GPT-5.6 Sol 的 38.3% 有了质的飞跃,甚至在 96% 的关卡中碾压了人类的操作效率。
ARC 测试:AI 界的“门萨俱乐部”
ARC-AGI-3 测试之所以被视为衡量 AI 智能的核心指标,是因为它摒弃了传统的“刷题”模式。测试中充满了不断变化的图形规律题,AI 必须像人类一样,在陌生环境中探索、推测目标,靠临场反应和逻辑推理找出规律。这不仅仅是识别图像,更是对环境物理规律和因果关系的深度理解。
突破点:从“暴力试错”到“符号世界模型”
GPT-6 Astra 为何能实现如此跨越?核心技术在于它构建了高效的符号世界模型。这被认为是 AI 迈向高级推理能力的必经之路。
1. 拒绝像素级暴力试错 过去的模型在处理复杂图形时,往往采用“暴力试错”法,即随机点击像素块,靠运气寻找规律。这种方法无法真正理解规则,更像是一个不知疲倦的“瞎子”。
2. 像数学家一样思考 GPT-6 Astra 则像一位数学家。它会使用一种专属的 DSL(领域特定语言)代数符号系统,对观察到的环境进行精确的代数记录。它会绘制像素的坐标轨迹,记录潜在规则,并在脑海中编写 Python 代码逻辑(例如“按 A 键图形左转 90 度”)。
3. 脑内虚拟沙盒与工具内化 更关键的是,它能在脑海中的“虚拟沙盒”里进行模拟推演,确认逻辑闭环无误后,才在现实中执行操作。此外,它将过去依赖外部 Harness(框架)的能力逐步内化进模型权重。这意味着它不再需要依赖外挂来辅助记忆和计算,而是具备了自主编写工具链的能力(如为迷宫游戏定制导航系统)。
高昂的“钞能力”与 AGI 的迷思
尽管技术层面取得了突破,但围绕 GPT-6 Astra 的争议从未停止,尤其是其高昂的成本。
1. 每题狂烧 360 美元 要完成这场“智商考试”,GPT-6 Astra 每跑完一局游戏需要消耗约 360 美元的算力。如果完整跑完整个测试,总账单高达 1.8 万美元(约合 13.5 万人民币)。相比之下,人类解题的“电费”不到半美分,即使算上人力补贴也仅需 12.78 美元。这种巨大的成本差距,让不少人质疑这是否是“钞能力”刷分。
2. 出题人的泼冷水 作为 ARC Prize 基金会总裁及测试出题人之一,Greg Kamradt 并未因此欢呼。他指出,目前市面上许多高分模型(包括 GPT-6 Astra)实际上是在使用一套名为“Harness”的豪华外挂,包含无损内存、程序化分析等五个核心模块来补足模型自身的短板。
3. AGI 的定义之争 Greg Kamradt 认为,目前的测试更像是一场“图形消消乐”,而非真正的 AGI(通用人工智能)。人类之所以被视为通用智能,是因为我们具备适应任何未知环境的能力(如古代婴儿学会用手机)。而目前的 AI 即使通过了特定测试,也未必具备这种跨领域的适应性和真正的理解力。
总结
GPT-6 Astra 的成功标志着 AI 正在从“暴力试错”向“符号化推理”转型,这是通往高级智能的重要一步。然而,其高昂的算力成本以及对外部工具(Harness)的依赖,提醒我们距离真正的 AGI 仍有很长的路要走。对于开发者而言,如何在降低成本的同时,让模型具备真正自主的符号推理能力,将是未来的核心挑战。