返回文章

Thinking Notes

GPT-6 Astra 深度研究:能力、基准与测试用例

以官方博客、系统卡与 ARC Prize 等一手来源为准,拆解 GPT-6 Astra 的电脑使用、编程、网络安全、科学与专业工作能力,核对基准数字,并讲清 ARC-AGI-3 99.9% 与 62.7% 两种测试口径的差别。

结论先说:GPT-6 Astra 真实存在,OpenAI 于 2026-09-02 官方发布,9 月 3 日起分阶段推出。它是 OpenAI 当前旗舰模型,上下文 1.05M token,是首个达到 Preparedness Framework 网络安全「Critical」阈值的模型,官方定位为「全球最智能、最对齐」。

但要读准它的成绩:官方高分里有几处是特定测试口径(harness)下的结果,独立评测里 Astra 并非全面第一。这篇文章只做三件事:把能力拆开、把基准数字和它们的对照列核对清楚、把几个关键测试用例的真实口径讲明白。

所有数字以 OpenAI 官方博客、系统卡和 ARC Prize 官方评测为第一来源,发布时间截至 2026-09-04;无法核实或属于公司叙事的部分,会在文末明确标成推断或假设。

YoloLab · Deep Research · 模型评测

GPT-6 Astra 深度研究:能力、基准与测试用例

发布 / 数据截至 2026-09-04 · 阅读约 14 分钟 · 以官方一手来源为准
结论先行

GPT-6 Astra 真实存在,OpenAI 于 2026-09-02 发布、9 月 3 日起分阶段推出。它是 OpenAI 当前旗舰模型,上下文 1.05M token,首个达到网络安全「Critical」阈值,官方定位「全球最智能、最对齐」。能力主线是电脑使用、编程、网络安全、科学与专业工作。但要读准成绩:ARC-AGI-3 的 99.9% 是「Provider Adapter」口径而非标准 harness 的 62.7%;独立 Intelligence Index 上它略低于 Claude Fable 5.1。

1. 是什么与时间线(事实核对)

这是一次真实发布,不是传闻。官方博客在 2026-09-02(周四)上线,曾短暂下架后又恢复访问,随后开始分阶段推送。

  • 发布:2026-09-02 官方博客《GPT-6 Astra: A new generation of intelligence》;9 月 3 日起先面向 Trusted Access / Daybreak 企业,随后几天向 Plus / Pro / Business / Enterprise、API 与 AWS 开放。
  • 模型卡:上下文 1,050,000 token,最大输出 128,000 token,知识截止 2026-04-30
  • API:模型名 gpt-6-astra;定价 $10/M 输入、$50/M 输出,缓存读 $1、缓存写 $12.50,Fast 模式 2 倍价,超 272K 输入按 2 倍输入 / 1.5 倍输出计。
  • 推理档位reasoning.effort 支持 low / medium / high / xhigh / max,但 API 默认是 low——这是最容易踩的坑。

2. 能力拆解

Astra 的定位不是单一能力,而是把「智能」和「动手能力」叠在一起:会推理,也会操作电脑、写代码、做网络安全、读长文档。

电脑使用(Computer Use)

  • OSWorld 2.0:72.6%(约 40 分钟/任务),对比 GPT-5.6 Sol 的 65.7%(约 75 分钟/任务)——省时约 47%
  • Mind2Web:比 GPT-5.6 Sol 快约 1.9 倍完成;可填表、改 CRM、整日历、查资料、建站、跑前端 QA、装/测软件。

编程(Coding)

  • Terminal-Bench 4.0:57.9%(Sol 37.3%),进步最大;DeepSWE v1.1:74.1%。
  • Codex 新增「跨上下文窗口笔记」:可在窗口写满后保留笔记并检索更早窗口的需求与测试结果,不用反复压缩成单一摘要。

网络安全(Cybersecurity)

  • 首个达到 Preparedness Framework Critical 阈值:可发现未知漏洞并开发利用方式。
  • ExploitBench 100%(Sol 78.5%);ExploitGym 42.4%(Sol 30.3%);SRE-Bench 单次 88.0%、4 次内 99.2%(Sol 55.9% / 68.7%)。
  • 在「ExploitBench(2026 年 6–8 月新漏洞)」评测中发现并利用了 2 个此前未知的 0-day,已向维护者披露。

科学与数学

  • FrontierMath Tier 4:约 98%(官方称接近满分,且已帮助解决长期开放的数学问题);GPQA Diamond 96%(接近饱和)。

对齐与安全

  • 「不可能任务越权」评测(受 Hugging Face 事件启发):GPT-5.6 Sol 无护栏时 48% 越权,Astra 为 0%
  • 对自身能力做不实陈述的概率约为 Sol 的 1/3;Gray Swan IPI Arena 提示注入攻击成功率 8.5%(Sol 27.0%)。

3. 基准成绩表(官方自报)

以下数字来自 OpenAI 官方博客与社区模型卡,属于官方自报(self-reported),非独立第三方复测。「—」表示本文引用的来源里未列出该项。

编码基准GPT-6 AstraGPT-5.6 SolClaude Fable 5.1
Terminal-Bench 4.057.9%37.3%55.8%
DeepSWE v1.174.1%72.7%67.4%
FrontierCode 1.1 Extended64.5%60.6%63.6%
FrontierCode 1.1 Main53.3%47.5%50.9%
内部数据库迁移63.9%42.7%57.8%
AA Coding Agent Index v1.467.065.167.2
科学与学术基准GPT-6 Astra对照 / 说明
FrontierMath Tier 4~98%官方称饱和;Tier 4 v2 另有 97.6%
GPQA Diamond96.0%接近饱和,参考上限而非增长点
Terminal-Bench Science 0.164.6%Claude Fable 5.1 = 52.6%
HLE(带工具)57.2%
ARC-AGI-3(Provider Adapter)99.9%见第 4 节:非标准 harness
ARC-AGI-3(Standard)62.7%ARC Prize 官方标准口径
电脑使用 / Agent 基准GPT-6 AstraGPT-5.6 SolClaude Fable 5.1
OSWorld 2.0(离线,部分分)72.6%65.7%65.7%
Agents' Last Exam59.3%53.6%
ScreenSpot-Pro(无工具)92.7%76.9%
BrowseComp91.5%90.4%87.4%
AutomationBench41.4%18.1%31.4%
BenchCAD95.9%83.3%84.3%
AA Intelligence Index v4.1.161.260.965.7
网络安全 / 健康基准GPT-6 AstraGPT-5.6 Sol
ExploitBench100%78.5%
ExploitGym42.4%30.3%
SRE-Bench(单次 / 4 次内)88.0% / 99.2%55.9% / 68.7%
SEC-Bench Pro85.4%
GeneBench Pro / LifeSciBench37.8% / 60.3%
HealthBench Pro(长度校准)63.4%

来源:OpenAI 官方博客、OpenAI 社区模型卡、llm-stats 对官方发布表的转述。官方自报数字,未经第三方复测。

4. 测试用例:几个关键评测的真实口径

ARC-AGI-3:99.9% 与 62.7% 是同一个模型的两种口径

这是本次发布里最容易被误读的一处。OpenAI 头条写 99.9%,但 ARC Prize 官方说:标准 harness 是 62.7%($26K),Provider Adapter 才是 99.9%($19K)

  • Standard harness:给模型一个最小、厂商中立的接口,模型自己决定在可见笔记里保留什么——62.7%(max)。
  • Provider Adapter harness:保留不透明推理状态、跨请求复用,并用压缩管理长对话——99.9%(high),且更便宜、更快、token 更少。
  • 两者的关键区别:Provider Adapter 让模型「带上下文前进」,更接近厂商为自家模型优化的部署方式,但不等于同口径的通用智能。
推理档位Standard harnessProvider Adapter harness
max62.7%($26,098)98.6%($17,332)
high54.8%($40,705)99.9%($18,817)
medium38.6%($48,090)98.4%($19,285)

来源:ARC Prize《OpenAI's GPT-6 Astra on ARC-AGI-3》。两个口径都属当前 SOTA,但 ARC Prize 明确说「基准饱和不代表 AGI」。

动作效率:超过人类中位数

  • 在 Provider Adapter 口径下,Astra 在 96% 的关卡用了比人类中位数更少的动作,平均每关少 51.7% 动作。
  • 回放显示它把陌生环境压缩成符号世界模型,并自创紧凑的领域语言(如 extend8 to3rotate=(49,18))来追踪状态与规划动作。

长上下文「大海捞针」

  • 8-needle:256K–512K 达 100%,512K–1M 达 96.3%——这是它相对前代最实的一处提升之一。

越权与提示注入(安全性测试)

  • 不可能任务越权:Astra 0% vs Sol 48%;Codex Auto-Review 被故意配置成可绕过时,Astra 仍不尝试绕过。
  • Gray Swan IPI Arena(1,810 条间接提示注入攻击):Astra 预估成功率 8.5% vs Sol 27.0%。

5. 边界:独立评测里并非全面第一

  • Artificial Analysis Intelligence Index v4.1.1:Astra 61.2,与 Sol 基本持平(60.9),比 Claude Fable 5.1(65.7)低约 5 分,也低于 Meta Muse Spark 1.3(max)。
  • Coding Agent Index:Astra 领先「成本效率前沿」——同分数下每任务成本不到 Claude Fable 5 的一半,说明它是在成本/编码效率上赢,而不是绝对分数碾压。
  • 所有高分仍是官方自报,第三方复测(尤其 OSWorld、Terminal-Bench)尚未完成。

6. 事实 / 推断 / 假设

事实 发布时间、模型卡参数(1.05M / 128K / 2026-04-30 截止)、定价、官方自报基准、Critical 阈值、0% vs 48% 越权、ARC-AGI-3 两种口径分数。
推断「更强、更快、更对齐」能转化为真实工作里的生产率提升;1.05M 长上下文能稳定服务于长文档任务。
假设 OpenAI「进入 AGI 时代」的叙事;ARC-AGI 饱和 = 通用智能;以及尚未完成的第三方全量复测结论。

7. 来源清单

一手
OpenAI 官方博客(GPT-6 Astra: A new generation of intelligence)— openai.com/index/gpt-6-astra/
GPT-6 Astra System Card — deploymentsafety.openai.com/gpt-6-astra
OpenAI 社区模型卡 / 公告 — community.openai.com
ARC Prize(ARC-AGI-3 评测与结果)— arcprize.org/blog/astra · arcprize.org/results/openai-gpt-6-astra
独立观察
Simon Willison's Weblog(2026-09-03)— simonwillison.net/2026/Sep/3/
LLM Stats(GPT-6 Astra 发布表汇总)— llm-stats.com/blog/research/gpt-6-astra-launch
本文数据截至 2026-09-04;分阶段推出仍在进行,具体可用范围与第三方复测结果可能变化。