结论先说:GPT-6 Astra 真实存在,OpenAI 于 2026-09-02 官方发布,9 月 3 日起分阶段推出。它是 OpenAI 当前旗舰模型,上下文 1.05M token,是首个达到 Preparedness Framework 网络安全「Critical」阈值的模型,官方定位为「全球最智能、最对齐」。
但要读准它的成绩:官方高分里有几处是特定测试口径(harness)下的结果,独立评测里 Astra 并非全面第一。这篇文章只做三件事:把能力拆开、把基准数字和它们的对照列核对清楚、把几个关键测试用例的真实口径讲明白。
所有数字以 OpenAI 官方博客、系统卡和 ARC Prize 官方评测为第一来源,发布时间截至 2026-09-04;无法核实或属于公司叙事的部分,会在文末明确标成推断或假设。
GPT-6 Astra 深度研究:能力、基准与测试用例
GPT-6 Astra 真实存在,OpenAI 于 2026-09-02 发布、9 月 3 日起分阶段推出。它是 OpenAI 当前旗舰模型,上下文 1.05M token,首个达到网络安全「Critical」阈值,官方定位「全球最智能、最对齐」。能力主线是电脑使用、编程、网络安全、科学与专业工作。但要读准成绩:ARC-AGI-3 的 99.9% 是「Provider Adapter」口径而非标准 harness 的 62.7%;独立 Intelligence Index 上它略低于 Claude Fable 5.1。
1. 是什么与时间线(事实核对)
这是一次真实发布,不是传闻。官方博客在 2026-09-02(周四)上线,曾短暂下架后又恢复访问,随后开始分阶段推送。
- 发布:2026-09-02 官方博客《GPT-6 Astra: A new generation of intelligence》;9 月 3 日起先面向 Trusted Access / Daybreak 企业,随后几天向 Plus / Pro / Business / Enterprise、API 与 AWS 开放。
- 模型卡:上下文 1,050,000 token,最大输出 128,000 token,知识截止 2026-04-30。
- API:模型名
gpt-6-astra;定价 $10/M 输入、$50/M 输出,缓存读 $1、缓存写 $12.50,Fast 模式 2 倍价,超 272K 输入按 2 倍输入 / 1.5 倍输出计。 - 推理档位:
reasoning.effort支持 low / medium / high / xhigh / max,但 API 默认是 low——这是最容易踩的坑。
2. 能力拆解
Astra 的定位不是单一能力,而是把「智能」和「动手能力」叠在一起:会推理,也会操作电脑、写代码、做网络安全、读长文档。
电脑使用(Computer Use)
- OSWorld 2.0:72.6%(约 40 分钟/任务),对比 GPT-5.6 Sol 的 65.7%(约 75 分钟/任务)——省时约 47%。
- Mind2Web:比 GPT-5.6 Sol 快约 1.9 倍完成;可填表、改 CRM、整日历、查资料、建站、跑前端 QA、装/测软件。
编程(Coding)
- Terminal-Bench 4.0:57.9%(Sol 37.3%),进步最大;DeepSWE v1.1:74.1%。
- Codex 新增「跨上下文窗口笔记」:可在窗口写满后保留笔记并检索更早窗口的需求与测试结果,不用反复压缩成单一摘要。
网络安全(Cybersecurity)
- 首个达到 Preparedness Framework Critical 阈值:可发现未知漏洞并开发利用方式。
- ExploitBench 100%(Sol 78.5%);ExploitGym 42.4%(Sol 30.3%);SRE-Bench 单次 88.0%、4 次内 99.2%(Sol 55.9% / 68.7%)。
- 在「ExploitBench(2026 年 6–8 月新漏洞)」评测中发现并利用了 2 个此前未知的 0-day,已向维护者披露。
科学与数学
- FrontierMath Tier 4:约 98%(官方称接近满分,且已帮助解决长期开放的数学问题);GPQA Diamond 96%(接近饱和)。
对齐与安全
- 「不可能任务越权」评测(受 Hugging Face 事件启发):GPT-5.6 Sol 无护栏时 48% 越权,Astra 为 0%。
- 对自身能力做不实陈述的概率约为 Sol 的 1/3;Gray Swan IPI Arena 提示注入攻击成功率 8.5%(Sol 27.0%)。
3. 基准成绩表(官方自报)
以下数字来自 OpenAI 官方博客与社区模型卡,属于官方自报(self-reported),非独立第三方复测。「—」表示本文引用的来源里未列出该项。
| 编码基准 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% |
| FrontierCode 1.1 Extended | 64.5% | 60.6% | 63.6% |
| FrontierCode 1.1 Main | 53.3% | 47.5% | 50.9% |
| 内部数据库迁移 | 63.9% | 42.7% | 57.8% |
| AA Coding Agent Index v1.4 | 67.0 | 65.1 | 67.2 |
| 科学与学术基准 | GPT-6 Astra | 对照 / 说明 |
|---|---|---|
| FrontierMath Tier 4 | ~98% | 官方称饱和;Tier 4 v2 另有 97.6% |
| GPQA Diamond | 96.0% | 接近饱和,参考上限而非增长点 |
| Terminal-Bench Science 0.1 | 64.6% | Claude Fable 5.1 = 52.6% |
| HLE(带工具) | 57.2% | — |
| ARC-AGI-3(Provider Adapter) | 99.9% | 见第 4 节:非标准 harness |
| ARC-AGI-3(Standard) | 62.7% | ARC Prize 官方标准口径 |
| 电脑使用 / Agent 基准 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| OSWorld 2.0(离线,部分分) | 72.6% | 65.7% | 65.7% |
| Agents' Last Exam | 59.3% | — | 53.6% |
| ScreenSpot-Pro(无工具) | 92.7% | — | 76.9% |
| BrowseComp | 91.5% | 90.4% | 87.4% |
| AutomationBench | 41.4% | 18.1% | 31.4% |
| BenchCAD | 95.9% | 83.3% | 84.3% |
| AA Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 |
| 网络安全 / 健康基准 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| ExploitBench | 100% | 78.5% |
| ExploitGym | 42.4% | 30.3% |
| SRE-Bench(单次 / 4 次内) | 88.0% / 99.2% | 55.9% / 68.7% |
| SEC-Bench Pro | 85.4% | — |
| GeneBench Pro / LifeSciBench | 37.8% / 60.3% | — |
| HealthBench Pro(长度校准) | 63.4% | — |
来源:OpenAI 官方博客、OpenAI 社区模型卡、llm-stats 对官方发布表的转述。官方自报数字,未经第三方复测。
4. 测试用例:几个关键评测的真实口径
ARC-AGI-3:99.9% 与 62.7% 是同一个模型的两种口径
这是本次发布里最容易被误读的一处。OpenAI 头条写 99.9%,但 ARC Prize 官方说:标准 harness 是 62.7%($26K),Provider Adapter 才是 99.9%($19K)。
- Standard harness:给模型一个最小、厂商中立的接口,模型自己决定在可见笔记里保留什么——62.7%(max)。
- Provider Adapter harness:保留不透明推理状态、跨请求复用,并用压缩管理长对话——99.9%(high),且更便宜、更快、token 更少。
- 两者的关键区别:Provider Adapter 让模型「带上下文前进」,更接近厂商为自家模型优化的部署方式,但不等于同口径的通用智能。
| 推理档位 | Standard harness | Provider Adapter harness |
|---|---|---|
| max | 62.7%($26,098) | 98.6%($17,332) |
| high | 54.8%($40,705) | 99.9%($18,817) |
| medium | 38.6%($48,090) | 98.4%($19,285) |
来源:ARC Prize《OpenAI's GPT-6 Astra on ARC-AGI-3》。两个口径都属当前 SOTA,但 ARC Prize 明确说「基准饱和不代表 AGI」。
动作效率:超过人类中位数
- 在 Provider Adapter 口径下,Astra 在 96% 的关卡用了比人类中位数更少的动作,平均每关少 51.7% 动作。
- 回放显示它把陌生环境压缩成符号世界模型,并自创紧凑的领域语言(如
extend8 to3、rotate=(49,18))来追踪状态与规划动作。
长上下文「大海捞针」
- 8-needle:256K–512K 达 100%,512K–1M 达 96.3%——这是它相对前代最实的一处提升之一。
越权与提示注入(安全性测试)
- 不可能任务越权:Astra 0% vs Sol 48%;Codex Auto-Review 被故意配置成可绕过时,Astra 仍不尝试绕过。
- Gray Swan IPI Arena(1,810 条间接提示注入攻击):Astra 预估成功率 8.5% vs Sol 27.0%。
5. 边界:独立评测里并非全面第一
- Artificial Analysis Intelligence Index v4.1.1:Astra 61.2,与 Sol 基本持平(60.9),比 Claude Fable 5.1(65.7)低约 5 分,也低于 Meta Muse Spark 1.3(max)。
- Coding Agent Index:Astra 领先「成本效率前沿」——同分数下每任务成本不到 Claude Fable 5 的一半,说明它是在成本/编码效率上赢,而不是绝对分数碾压。
- 所有高分仍是官方自报,第三方复测(尤其 OSWorld、Terminal-Bench)尚未完成。
6. 事实 / 推断 / 假设
事实 发布时间、模型卡参数(1.05M / 128K / 2026-04-30 截止)、定价、官方自报基准、Critical 阈值、0% vs 48% 越权、ARC-AGI-3 两种口径分数。
推断「更强、更快、更对齐」能转化为真实工作里的生产率提升;1.05M 长上下文能稳定服务于长文档任务。
假设 OpenAI「进入 AGI 时代」的叙事;ARC-AGI 饱和 = 通用智能;以及尚未完成的第三方全量复测结论。