资讯动态

GPT-6高分引发考题重制,未来考核将侧重发明


AI在考试中取得几乎满分,后续测试又将如何展开?GPT-6 Astra刚发布,就在ARC-AGI-3测试中获得了99.9%的高分。OpenAI称其已经达到饱和状态,因此原定的ARC评测计划遭遇重大调整,必须重新设计题目。ARC Prize创始人François Chollet宣布,ARC-AGI-4计划于明年第一季度推出,而被认为具有颠覆性的ARC-AGI-5也进入正式筹备阶段。ARC-AGI-4将集中关注长期学习和课程学习,ARC-AGI-5则将专注于“发明”主题。他提到,当AI的学习效率与人类的差距不再可测时,便到了真正的AGI时代。

在ARC-AGI-3中的惊人表现是2026年AI领域的重要变革。尽管Astra在之前的测试中获得了62.7%的成绩,然而接入OpenAI的Provider Adapter后,同一模型的得分飙升至99.9%,这是一种能够保留模型推理状态的适配器。结果显示,同一组问题下,得分差异达到36个百分点。该系列的排行榜因而面临重新审视,讨论重点从模型的泛化能力转向评测工具的公平性。类似地,Claude Opus在不同适配器下的得分也出现巨大差异。

ARC-AGI-3主要测察探索、建模、目标获取及规划与执行。与前两代的静态规则题不同,ARC-AGI-3设置了动态游戏环境,要求AI自己探寻规则和逻辑。GPT-6 Astra在大多数关卡中以比人类更少的步数完成任务,显示出显著的能力提升,尽管仍强调测试环境的局限性。 球友会

下一轮测评将转向“发明”主题,ARC-AGI-4将继续延续ARC-AGI-3的精神,但会增加关卡的复杂性。Chollet已将“开放式发明”的概念纳入ARC系列的未来规划中。针对发明的考察方法尚未确定,因为这类创造性成果往往没有标准答案或人类基准。

或许可以借助Chollet对智能的定义来量化发明的效率,发明能否提高解决后续问题的速度或许是一个可能的考核方向。Astra在游戏中开发符号表征的尝试,便是这一理念的初步实践。

随着AI技术的迅速发展,ARC系列的考试可能在第六或第七代结束。Chollet认为只要存在“人类能做而AI不能做”的任务,考题将持续更新;一旦两者的学习效率差距消失,即是AGI的来临。AI的进步日新月异,留给人类设计具有挑战性的考题的时间正在紧缩,新的挑战迫在眉睫。 球友会