GPT-6有多强大?从7.8%到99.9%,全面解读OpenAI最强模型
GPT-6 Astra 是 OpenAI 于 2026 年 9 月 3 日发布的新一代旗舰模型。它的核心价值可以概括为一句话:GPT-6 不再是一个“聊天模型”,而是一个能自主操作电脑、独立完成复杂工作流的“计算机使用系统”。OpenAI 总裁 Greg Brockman 在发布会上直接表示“欢迎来到 AGI 时代”。本文从五个维度拆解 GPT-6 Astra 到底有多强大。
一、抽象推理:从 7.8% 到 99.9% 的代际跃升
GPT-6 Astra 最令人震撼的进步,出现在衡量陌生环境学习和抽象推理能力的 ARC-AGI-3 测试中。
上一代 GPT-5.6 Sol 在这项测试中的得分仅为 7.8%,而 GPT-6 Astra 达到了 99.9%,接近满分。短短一代模型,实现了超过十倍的提升。
在代表高阶数学能力的 FrontierMath Tier 4 上,Astra 得分 97.6%,几乎将这套研究级数学测试“打穿”。OpenAI 还披露,Astra 参与解决了两个长期未取得进展的素数间隔问题,其中一项把已知的有界素数间隔从 240 缩小到 186。
需要留意的细节:ARC-AGI-3 的 99.9% 是在 OpenAI 自有 Provider Adapter 配置下取得的。在 ARC Prize 统一提供的标准测试框架下,Astra 的得分为 62.7%。两者差距的原因在于,专用适配框架允许模型保留不透明的推理状态并压缩长对话,而标准框架不提供这类能力。即便如此,62.7% 在标准框架下依然是一个很高的分数。
二、计算机操作:从“能聊天”到“能干活”
这是 GPT-6 Astra 最核心的定位转变。OpenAI 官方将其描述为“计算机使用系统”,而非聊天模型。
在测试模型能否在真实桌面环境中完成跨应用任务的 OSWorld 2.0 上,Astra 得分 72.6%,高于 GPT-5.6 Sol 的 65.7%。更关键的是效率:Astra 完成一项任务平均只需约 40 分钟,而 GPT-5.6 Sol 需要约 75 分钟,耗时减少了约 47%。
Astra 可以自主完成的操作包括:填写网络表单、更新 CRM 客户记录、整理日历、在邮件或文档编辑器中撰写总结、分析科学数据并生成图表、创建网站并运行前端质量测试,甚至可以自主安装和测试软件,并根据屏幕上出现的问题进行排查。
在实际测试中,开发者用 Astra 在 Unreal Engine 里逐街重建了曼哈顿,另一名开发者用浏览器端 3D 库在 24 分钟内重建了杭州全城。
三、编程与科学研究:代际领先
在编程能力上,Astra 同样实现了大幅提升:
| 基准测试 | GPT-6 Astra | GPT-5.6 Sol | 提升 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | +20.6pp |
| Agents‘ Last Exam | 59.3% | — | 领先 |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | +42.2pp |
在 Terminal-Bench Science 0.1 上,Astra 的得分 64.6% 显著高于两天前 Anthropic 发布的 Claude Fable 5.1 的 52.6%,且完成同等任务的估计 API 成本低约 31%。
四、网络安全:OpenAI 首个“关键”级别模型
GPT-6 Astra 是 OpenAI 首个达到内部“关键”(Critical)网络安全能力门槛的模型。
在测试漏洞利用能力的 ExploitBench 中,Astra 得分达到 100%,而 GPT-5.6 Sol 为 78.5%。在专门使用 2026 年 6 月至 8 月新披露漏洞构建的测试中,Astra 的成功率达到 39%,远高于 Sol 的 5.5%。
这意味着 Astra 能够在没有人工逐步指导的情况下,在防护严密的系统中自主发现此前未知的安全漏洞,并开发相应的漏洞利用方案。正因如此,OpenAI 对其最先进的网络安全能力设置了更严格的访问限制。
五、实际应用:早期客户的使用反馈
早期获得访问权限的客户给出了具体的使用结果:
- 法律科技公司 Legora:使用 Astra 在几分钟内检查了 41 份财务文件,并找出了预先埋入的 4 个错误,工作流成绩比上一代提高近 40%。
- 游戏开发公司 Playco:Astra 将制作游戏原型时所需的人工修复减少了 50%,并能根据同一套基础场景一次生成 3 个可玩的主题版本。
- 免疫学家 Derya Unutmaz:正在用 Astra 构建一套复杂的生物医学分析应用,并因此取消了商业软件订阅。
六、总结
GPT-6 Astra 的强大可以用一张表来概括:
| 维度 | 核心表现 | 相比 GPT-5.6 Sol |
|---|---|---|
| 抽象推理 | ARC-AGI-3 得分 99.9%(标准框架 62.7%) | 从 7.8% 跃升 |
| 高阶数学 | FrontierMath Tier 4 得分 97.6% | 显著提升 |
| 计算机操作 | OSWorld 2.0 得分 72.6%,耗时减少 47% | 从 65.7% 提升 |
| 编程能力 | Terminal-Bench 4.0 得分 57.9% | 从 37.3% 提升 |
| 网络安全 | ExploitBench 得分 100%,首个“关键”级模型 | 从 78.5% 提升 |
| Token 效率 | 编程任务 Token 消耗仅为 Sol 的 1/3 | 效率大幅优化 |
GPT-6 Astra 的“强大”不在于它在某一个测试上刷了高分,而在于它第一次让 AI 从“告诉你怎么做”变成了“直接帮你做完”。它能接住一个复杂目标,然后把中间的几十个步骤一口气完成——操作浏览器、阅读文件、编写和运行代码、使用专业软件、检查结果、遇到问题继续修改。
当然,更强的能力也意味着更高的成本。Astra 的 API 定价为每百万输入 Token 10 美元、输出 Token 50 美元,约为 GPT-5.6 Sol 的 2.5 倍。但得益于 Token 效率的提升——编程任务 Token 消耗仅为 Sol 的三分之一——完成单个任务的实际成本可能并不会线性增加。是否值得为“能干活”的自主性买单,取决于你的具体场景。



