X @OpenAI · OpenAI7/30 07:57100精选

OpenAI:GPT-5.6 Sol 解决数学难题,却在 ARC-AGI-3 基准测试中表现不佳

OpenAI: GPT-5.6 Sol has been used to solve open problems in mathematics. So why was it struggling with ARC-AGI-3, a benchmark of

阅读原文

推荐理由:值得看:OpenAI 自曝 GPT-5.6 Sol 在 ARC-AGI-3 上翻车,原因竟是测试框架不让它记住已学内容。对 AI 创作者和产品孵化者来说,这是直接抄作业的案例——调两个 API 设置就能让得分翻三倍、token 省六倍,说明评测设计比模型能力更关键。

OpenAI 发布消息称,其模型 GPT-5.6 Sol 已被用于解决数学中的开放问题,但在 ARC-AGI-3 基准测试(一种 2D 拼图游戏基准)中表现挣扎。经调查发现,测试框架(harness)未允许模型记住已学内容。通过启用两个 API 设置,模型得分提升了三倍,同时输出 token 减少了 6 倍。该推文获得 26 次转发、292 次点赞和 28165 次浏览,引发对模型能力与测试方法差异的讨论。

关联讨论 · 10

来源与依据

时间证据
7/30 07:57
收录于 7/30 08:05
交叉线索
1 个独立来源
内容可信度: