OpenAI于9月3日正式发布GPT-6 Astra,自称“全球最智能的模型”。该模型在网络安全基准ExploitBench上取得100%满分,在ARC-AGI-3抽象推理测试中得分99.9%,在FrontierMath Tier 4数学基准中得分98%,OpenAI称其已协助解决多个长期未解的数学问题。
这些成绩引发了关于Astra是否逼近AGI的讨论。该模型具备高级软件工程、计算机操作、浏览和科研等跨领域能力,但基准测试的完美表现并不能等同于通用智能。随着基准测试接近饱和,研究人员需要更难的测试来区分真正的泛化能力与任务优化。
Astra发布当天,OpenAI、Claude、Grok等多款AI服务出现服务中断,但无证据表明两者相关。
评论 (0)