X @OpenAI · OpenAI7/30 07:57100 分精选
OpenAI:GPT-5.6 Sol 解决数学难题,却在 ARC-AGI-3 基准测试中表现不佳
OpenAI: GPT-5.6 Sol has been used to solve open problems in mathematics. So why was it struggling with ARC-AGI-3, a benchmark of
推荐理由:值得看:OpenAI 自曝 GPT-5.6 Sol 在 ARC-AGI-3 上翻车,原因竟是测试框架不让它记住已学内容。对 AI 创作者和产品孵化者来说,这是直接抄作业的案例——调两个 API 设置就能让得分翻三倍、token 省六倍,说明评测设计比模型能力更关键。
OpenAI 发布消息称,其模型 GPT-5.6 Sol 已被用于解决数学中的开放问题,但在 ARC-AGI-3 基准测试(一种 2D 拼图游戏基准)中表现挣扎。经调查发现,测试框架(harness)未允许模型记住已学内容。通过启用两个 API 设置,模型得分提升了三倍,同时输出 token 减少了 6 倍。该推文获得 26 次转发、292 次点赞和 28165 次浏览,引发对模型能力与测试方法差异的讨论。
关联讨论 · 10 条
AWS Machine Learning BlogAmazon Bedrock 为 OpenAI GPT-5.6 模型引入显式提示缓存延伸讨论OpenAIGPT-5.6 推动性价比前沿:Luna与Terra定价下调延伸讨论OpenAI两个设置让GPT-5.6在ARC-AGI-3基准测试得分翻三倍延伸讨论X @OpenAI · OpenAIOpenAI部署GPT-5.6 Sol,自优化效率降低20%服务成本延伸讨论LINUX DO · AIGPT 5.6 sol 大仙给小米8老爷机刷机,各种骚操作延伸讨论LINUX DO · AI 员工gpt 5.6 流口水一部分可能是sub2api导致的(子agent调用失败等结构化异常)延伸讨论Hacker News 热帖GPT-5.6 推进性价比前沿延伸讨论IT之家OpenAI 下调 GPT-5.6 Luna 模型费用 80%,性价比超 DeepSeek V4 Pro延伸讨论雷锋网GPT-5.6 SOL 失控攻击,GLM5.2 紧急救场,HF 揭秘大模型攻防战技术细节延伸讨论IT之家OpenAI 向10万科学家免费开放GPT-5.6 Pro版等资源延伸讨论