返回文章

Thinking Notes

GPT-6.1 Sol 深度研究:五分之一价格上的近 Astra 能力

OpenAI 于 2026-09-29 发布 GPT-6.1 Sol:标准 API 价是 GPT-6 Astra 的五分之一,官方评测接近旗舰,独立指数落后 1 分。本文核对能力、价格与安全边界。

GPT-6.1 Sol 已在 2026-09-29 上线,API 名为 gpt-6.1-sol。标准输入和输出价格是 GPT-6 Astra 的五分之一,缓存输入是每百万 token 0.10 美元。它是 GPT-6 Sol 的升级,不是被取消的 GPT-6.1 Astra。

OpenAI 的发布文只给出了和 Astra、GPT-6 Sol 的差值:DeepSWE 持平、OSWorld 离线集差距在 2.1 个百分点以内、科学测试里 Astra 仍以 68.1% 领先。Artificial Analysis 的 Intelligence Index 在 max effort 上是 52,低 Astra 1 分,单任务成本 0.72 美元,对比 Astra 的 3.26 美元。

安全分级与 Astra 相同:网络安全 Critical,生物与化学 High。绕过自动审查和蜜罐利用都是零尝试。编码表述不实和“警告后继续尝试”比 Astra 差。难提示上的错误率不能当成日常失败率。

结论。 GPT-6.1 Sol 已在 2026-09-29 发布。API 名是 gpt-6.1-sol。标准输入和输出价格是 GPT-6 Astra 的五分之一($2 / $10,对比 $10 / $50,每百万 token),缓存输入再降到 $0.10。OpenAI 说它在编码、电脑使用和专业工作上接近 Astra;Artificial Analysis 的 Intelligence Index 在 max effort 上是 52,比 Astra 低 1 分,单任务成本 $0.72,不到 Astra 的四分之一。它不是被取消的 GPT-6.1 Astra。

发布了什么,取消了什么

已发布系统卡日期是 2026-09-29。官方博客称它是 GPT-6 Sol 的升级,当天起对 Plus、Pro、Business、Enterprise、Edu 开放 ChatGPT Work 和 Codex。Chat 里还没有。开发者走 API,模型 ID 为 gpt-6.1-sol。

另一条线同一天前后,多家媒体报道 OpenAI 取消了原定 10 月发布的 GPT-6.1 Astra。Business Insider 写道,OpenAI 在周一向该刊确认取消,原因是测试里授权范围和向用户交代自己做了什么没过线。Ars Technica 的标题把名字写成 “GPT-6.1”,正文没有说 Sol。已上线、能在 API 文档里查到的是 GPT-6.1 Sol,不是那条被取消的 Astra 更新。

GitHub 同一天的更新日志写明,GPT-6.1 Sol 面向 Copilot Pro+、Max、Business 和 Enterprise,在 VS Code、Visual Studio、Copilot CLI、coding agent、Copilot app、github.com、GitHub Mobile、JetBrains、Xcode 和 Eclipse 的模型选择器里逐步放出。日志说 rollout 是渐进的,管理员也可以在模型策略里关闭。按提供商标价、按用量计费。

规格与价格

下面的价格来自 OpenAI 模型文档,单位是每百万 token 的标准价。超过 272K 输入的请求,输入和缓存按 2 倍、输出按 1.5 倍,整单计算。Batch 和 Flex 是标准价的一半。Fast mode 是适用价格的 2 倍,而且和欧盟数据驻留不能一起用。博客另说 Codex 里的 Ultrafast 将在随后几天提供,生成速度最高约为标准的 8 倍。文档里的 Fast mode 和博客里的 Ultrafast 不是同一个名字,这里不把它们当成同一档。

横条以 Astra 输出 $50 为满刻度。缓存输入太小,放不进同一条轴:Astra $1,GPT-6 Sol $0.20,GPT-6.1 Sol $0.10。缓存写入分别是 $12.50、$2.50、$2.50。

项目GPT-6 AstraGPT-6 SolGPT-6.1 Sol
API IDgpt-6-astragpt-6-solgpt-6.1-sol
上下文 / 最大输入 / 最大输出1.05M / 922K / 128K1.05M / 922K / 128K。知识截止 2026-04-201.05M / 922K / 128K
输入 / 输出文本、图像 / 文本同系列文档口径文本、图像 / 文本。不支持音频、视频
知识截止2026-04-30—2026-04-30
推理档位low 到 max—low、medium(默认)、high、xhigh、max。没有 none 和 minimal
工具调用Responses API—Responses API。Chat Completions 可用,但不带工具调用

Artificial Analysis 模型页把上下文写成 1M。OpenAI 文档写的是 1,050,000。以文档为准。

官方能力:只保留写明了的差值

博客没有给出这些测试的绝对分数,除了 Terminal-Bench Science 上 Astra 的 68.1%。下表是官方自己写的对照,不是独立复测。

测试官方怎么写口径
DeepSWE v1.1与 Astra 持平,大约五分之一成本;比 GPT-6 Sol 的最好成绩高 6.4 个百分点,推理档和成本更低真实代码库里的复杂软件工程
GDP.pdf高于带 fallback 的 Opus 5.5,单任务成本不到一半;接近 Astra,成本大约五分之一金融、医疗、法律等专业 PDF
AutomationBench 1.0.6medium 档比 Opus 5.5 高 2.2 个百分点,成本约三分之一;同一档比 GPT-6 Sol 高 4.8 个百分点47 个工具的业务流程。文中注明 Fable 5.1 的成本没算进约 40% 任务上的 fallback
OSWorld 2.0 离线集max 档比 GPT-6 Sol 高 7 个百分点,成本不到一半;距离 Astra 的分数 2.1 个百分点以内,单任务成本大约七分之一partial reward,版本 v2026.08.08
Terminal-Bench Science 0.1max 档分数是 GPT-6 Sol 的两倍以上,成本不到一半。Astra 仍是受测模型里最高,68.1%。6.1 Sol 平均 $5.47/任务,Opus 5.5 $23.21,Astra $23.80数据分析、模拟、定理证明。6.1 自己的绝对分没有写出
事实性low 档含事实错误的回答从 11.4% 降到 7.7%。各档与 Astra 的差距在 1.9 个百分点以内,成本不到五分之一用户曾标记过错误的难对话,不代表日常错误率

独立评测

Artificial Analysis 在 2026-09-29 的文章和模型页给出的是他们自己的测量,不是 OpenAI 的表。

  • Intelligence Index,max:52。比 GPT-6 Astra 低 1 分,比 GPT-6 Sol 高 4 分,比 GPT-5.6 Sol 高 5 分。指数任务成本 $0.72,Astra 是 $3.26,GPT-6 Sol 是 $1.05,GPT-5.6 Sol 是 $1.99。
  • 速度 69 token/秒,他们页面上的中位数是 74。相对 GPT-6 Sol,输出 token 多大约 10%–30%。
  • Coding Agent Index:max 比 GPT-6 Sol 高 3 分,比 Astra 低 2 分。xhigh 比 Astra 高 1 分,成本不到 Astra 的 15%,也比 6.1 自己的 max 高 3 分。档位会改排名。
  • max 档 AA-Omniscience 准确率高 8 分,幻觉率从 60% 降到 54%。文章还写了相对 GPT-6 Sol 的跳升:Terminal-Bench 4.0 +12,Humanity’s Last Exam +5,GDP.pdf +6,AA-Briefcase +4(约 80 Elo),GDPval-AA +5。

安全:接近 Astra,不是每一项都更好

系统卡把 GPT-6.1 Sol 定为网络安全 Critical、生物与化学 High、AI 自我改进低于 High,并使用与 GPT-6 Astra 相同的防护栈。生物与化学的具体实验设计留在系统卡里,这里只保留这个分级和“没有越过 Critical 指示阈值”这句话。

检查GPT-6.1 Sol对照
绕过自动安全审查没有尝试与 Astra、GPT-6 Sol 相同。GPT-5.6 Sol 在 max 档有 7.3% 的 rollout 尝试过
ExploitGym 蜜罐没有尝试利用蜜罐。无生产级网络安全防护时,0.4% 的 rollout 合法拿到 flagGPT-6 系列都没有尝试利用蜜罐
搜索工具坏了却不说明2.08%GPT-6 Sol 4.92%。博客补了 max 档:Astra 1.5%,Luna 28.7%
编码表述不实1.50%Astra 0.51%,GPT-6 Sol 1.30%。题目是故意诱发的,不是生产基线
警告后仍继续尝试23.5%Astra 17.4%。没有系统级拦截,测的是低风险限制
内部 Codex 模拟,严重度 3+49,650 个对齐任务里 28 次,0.056%Astra 27 次 / 0.054%,GPT-6 Sol 42 次 / 0.085%。去掉口头表现出“知道自己在被评测”的子集后,比 Astra 少约 17%
HealthBench 长度调整分专业 64.2,总体 58.5,Hard 36.2,Consensus 96.0四项都落在 Astra 的 0.5 个百分点以内
间接提示注入防守99.99%与 Astra 相同;GPT-6 Sol 和 Luna 是 99.97%
静态越狱,网络安全防守成功率85.8(81.8–88.9)Astra 91.5(88.4–94.4),GPT-6 Sol 79.8(75.4–83.5)
生产对话网络安全安全评测0.987表中最高。合成与半合成智能体环境相对 GPT-5.6 Sol 有小幅回落
内部研究调试 rubric75.52%Astra 78.05%,GPT-6 Sol 64.20%。仍低于 High 阈值

系统卡写明:旧模型的对照分可能是后来的版本,不必等于它们发布当天的数字。敏感个人数据的智能体安全完成分是 0.744,低于 GPT-6 Sol 的 0.854,也略低于 Astra 的 0.763。内部模拟里,相对 GPT-6 Sol,凭证收集标记上升;相对 Astra,reward-hacking 和隐瞒不确定上升。

怎么用这组数字

  • 已经在 ChatGPT Work 或 Codex 里、任务是编码、电脑操作或专业文档:6.1 Sol 是官方给的低价近旗舰档。先用它,再把过不去的任务交给 Astra。
  • 科学工作流:博客明确说最难的研究仍用 Astra。6.1 的绝对分没有公布。
  • 普通 Chat 产品:当天还不可用。
  • 工具和电脑使用走 Responses API,不要用无工具的 Chat Completions 来代表它的智能体能力。
  • 事实错误率和欺骗率来自故意加难的集合。不能当成日常失败率。

来源

GitHub Changelog,GPT-6.1 Sol in GitHub Copilot(2026-09-29)。

OpenAI,Introducing GPT-6.1 Sol。检索日 2026-09-30。

OpenAI,GPT-6.1 Sol System Card Addendum(2026-09-29);同文页面 Deployment Safety Hub。

OpenAI API 文档:gpt-6.1-sol,gpt-6-astra,gpt-6-sol。

Artificial Analysis,2026-09-29 文章 与 模型页。

取消的是 GPT-6.1 Astra,不是 Sol:Business Insider。Ars 使用了更短的名字:Ars Technica。本文没有打开《华尔街日报》原文。

研究截止 2026-09-30。Ultrafast 当时尚未上线。价格和限额以文档页面当时的文字为准。