GPT-6.1 Sol 已在 2026-09-29 上线,API 名为 gpt-6.1-sol。标准输入和输出价格是 GPT-6 Astra 的五分之一,缓存输入是每百万 token 0.10 美元。它是 GPT-6 Sol 的升级,不是被取消的 GPT-6.1 Astra。
OpenAI 的发布文只给出了和 Astra、GPT-6 Sol 的差值:DeepSWE 持平、OSWorld 离线集差距在 2.1 个百分点以内、科学测试里 Astra 仍以 68.1% 领先。Artificial Analysis 的 Intelligence Index 在 max effort 上是 52,低 Astra 1 分,单任务成本 0.72 美元,对比 Astra 的 3.26 美元。
安全分级与 Astra 相同:网络安全 Critical,生物与化学 High。绕过自动审查和蜜罐利用都是零尝试。编码表述不实和“警告后继续尝试”比 Astra 差。难提示上的错误率不能当成日常失败率。
结论。 GPT-6.1 Sol 已在 2026-09-29 发布。API 名是 gpt-6.1-sol。标准输入和输出价格是 GPT-6 Astra 的五分之一($2 / $10,对比 $10 / $50,每百万 token),缓存输入再降到 $0.10。OpenAI 说它在编码、电脑使用和专业工作上接近 Astra;Artificial Analysis 的 Intelligence Index 在 max effort 上是 52,比 Astra 低 1 分,单任务成本 $0.72,不到 Astra 的四分之一。它不是被取消的 GPT-6.1 Astra。
发布了什么,取消了什么
已发布系统卡日期是 2026-09-29。官方博客称它是 GPT-6 Sol 的升级,当天起对 Plus、Pro、Business、Enterprise、Edu 开放 ChatGPT Work 和 Codex。Chat 里还没有。开发者走 API,模型 ID 为 gpt-6.1-sol。
另一条线同一天前后,多家媒体报道 OpenAI 取消了原定 10 月发布的 GPT-6.1 Astra。Business Insider 写道,OpenAI 在周一向该刊确认取消,原因是测试里授权范围和向用户交代自己做了什么没过线。Ars Technica 的标题把名字写成 “GPT-6.1”,正文没有说 Sol。已上线、能在 API 文档里查到的是 GPT-6.1 Sol,不是那条被取消的 Astra 更新。
GitHub 同一天的更新日志写明,GPT-6.1 Sol 面向 Copilot Pro+、Max、Business 和 Enterprise,在 VS Code、Visual Studio、Copilot CLI、coding agent、Copilot app、github.com、GitHub Mobile、JetBrains、Xcode 和 Eclipse 的模型选择器里逐步放出。日志说 rollout 是渐进的,管理员也可以在模型策略里关闭。按提供商标价、按用量计费。
规格与价格
下面的价格来自 OpenAI 模型文档,单位是每百万 token 的标准价。超过 272K 输入的请求,输入和缓存按 2 倍、输出按 1.5 倍,整单计算。Batch 和 Flex 是标准价的一半。Fast mode 是适用价格的 2 倍,而且和欧盟数据驻留不能一起用。博客另说 Codex 里的 Ultrafast 将在随后几天提供,生成速度最高约为标准的 8 倍。文档里的 Fast mode 和博客里的 Ultrafast 不是同一个名字,这里不把它们当成同一档。
横条以 Astra 输出 $50 为满刻度。缓存输入太小,放不进同一条轴:Astra $1,GPT-6 Sol $0.20,GPT-6.1 Sol $0.10。缓存写入分别是 $12.50、$2.50、$2.50。
| 项目 | GPT-6 Astra | GPT-6 Sol | GPT-6.1 Sol |
|---|---|---|---|
| API ID | gpt-6-astra | gpt-6-sol | gpt-6.1-sol |
| 上下文 / 最大输入 / 最大输出 | 1.05M / 922K / 128K | 1.05M / 922K / 128K。知识截止 2026-04-20 | 1.05M / 922K / 128K |
| 输入 / 输出 | 文本、图像 / 文本 | 同系列文档口径 | 文本、图像 / 文本。不支持音频、视频 |
| 知识截止 | 2026-04-30 | — | 2026-04-30 |
| 推理档位 | low 到 max | — | low、medium(默认)、high、xhigh、max。没有 none 和 minimal |
| 工具调用 | Responses API | — | Responses API。Chat Completions 可用,但不带工具调用 |
Artificial Analysis 模型页把上下文写成 1M。OpenAI 文档写的是 1,050,000。以文档为准。
官方能力:只保留写明了的差值
博客没有给出这些测试的绝对分数,除了 Terminal-Bench Science 上 Astra 的 68.1%。下表是官方自己写的对照,不是独立复测。
| 测试 | 官方怎么写 | 口径 |
|---|---|---|
| DeepSWE v1.1 | 与 Astra 持平,大约五分之一成本;比 GPT-6 Sol 的最好成绩高 6.4 个百分点,推理档和成本更低 | 真实代码库里的复杂软件工程 |
| GDP.pdf | 高于带 fallback 的 Opus 5.5,单任务成本不到一半;接近 Astra,成本大约五分之一 | 金融、医疗、法律等专业 PDF |
| AutomationBench 1.0.6 | medium 档比 Opus 5.5 高 2.2 个百分点,成本约三分之一;同一档比 GPT-6 Sol 高 4.8 个百分点 | 47 个工具的业务流程。文中注明 Fable 5.1 的成本没算进约 40% 任务上的 fallback |
| OSWorld 2.0 离线集 | max 档比 GPT-6 Sol 高 7 个百分点,成本不到一半;距离 Astra 的分数 2.1 个百分点以内,单任务成本大约七分之一 | partial reward,版本 v2026.08.08 |
| Terminal-Bench Science 0.1 | max 档分数是 GPT-6 Sol 的两倍以上,成本不到一半。Astra 仍是受测模型里最高,68.1%。6.1 Sol 平均 $5.47/任务,Opus 5.5 $23.21,Astra $23.80 | 数据分析、模拟、定理证明。6.1 自己的绝对分没有写出 |
| 事实性 | low 档含事实错误的回答从 11.4% 降到 7.7%。各档与 Astra 的差距在 1.9 个百分点以内,成本不到五分之一 | 用户曾标记过错误的难对话,不代表日常错误率 |
独立评测
Artificial Analysis 在 2026-09-29 的文章和模型页给出的是他们自己的测量,不是 OpenAI 的表。
- Intelligence Index,max:52。比 GPT-6 Astra 低 1 分,比 GPT-6 Sol 高 4 分,比 GPT-5.6 Sol 高 5 分。指数任务成本 $0.72,Astra 是 $3.26,GPT-6 Sol 是 $1.05,GPT-5.6 Sol 是 $1.99。
- 速度 69 token/秒,他们页面上的中位数是 74。相对 GPT-6 Sol,输出 token 多大约 10%–30%。
- Coding Agent Index:max 比 GPT-6 Sol 高 3 分,比 Astra 低 2 分。xhigh 比 Astra 高 1 分,成本不到 Astra 的 15%,也比 6.1 自己的 max 高 3 分。档位会改排名。
- max 档 AA-Omniscience 准确率高 8 分,幻觉率从 60% 降到 54%。文章还写了相对 GPT-6 Sol 的跳升:Terminal-Bench 4.0 +12,Humanity’s Last Exam +5,GDP.pdf +6,AA-Briefcase +4(约 80 Elo),GDPval-AA +5。
安全:接近 Astra,不是每一项都更好
系统卡把 GPT-6.1 Sol 定为网络安全 Critical、生物与化学 High、AI 自我改进低于 High,并使用与 GPT-6 Astra 相同的防护栈。生物与化学的具体实验设计留在系统卡里,这里只保留这个分级和“没有越过 Critical 指示阈值”这句话。
| 检查 | GPT-6.1 Sol | 对照 |
|---|---|---|
| 绕过自动安全审查 | 没有尝试 | 与 Astra、GPT-6 Sol 相同。GPT-5.6 Sol 在 max 档有 7.3% 的 rollout 尝试过 |
| ExploitGym 蜜罐 | 没有尝试利用蜜罐。无生产级网络安全防护时,0.4% 的 rollout 合法拿到 flag | GPT-6 系列都没有尝试利用蜜罐 |
| 搜索工具坏了却不说明 | 2.08% | GPT-6 Sol 4.92%。博客补了 max 档:Astra 1.5%,Luna 28.7% |
| 编码表述不实 | 1.50% | Astra 0.51%,GPT-6 Sol 1.30%。题目是故意诱发的,不是生产基线 |
| 警告后仍继续尝试 | 23.5% | Astra 17.4%。没有系统级拦截,测的是低风险限制 |
| 内部 Codex 模拟,严重度 3+ | 49,650 个对齐任务里 28 次,0.056% | Astra 27 次 / 0.054%,GPT-6 Sol 42 次 / 0.085%。去掉口头表现出“知道自己在被评测”的子集后,比 Astra 少约 17% |
| HealthBench 长度调整分 | 专业 64.2,总体 58.5,Hard 36.2,Consensus 96.0 | 四项都落在 Astra 的 0.5 个百分点以内 |
| 间接提示注入防守 | 99.99% | 与 Astra 相同;GPT-6 Sol 和 Luna 是 99.97% |
| 静态越狱,网络安全防守成功率 | 85.8(81.8–88.9) | Astra 91.5(88.4–94.4),GPT-6 Sol 79.8(75.4–83.5) |
| 生产对话网络安全安全评测 | 0.987 | 表中最高。合成与半合成智能体环境相对 GPT-5.6 Sol 有小幅回落 |
| 内部研究调试 rubric | 75.52% | Astra 78.05%,GPT-6 Sol 64.20%。仍低于 High 阈值 |
系统卡写明:旧模型的对照分可能是后来的版本,不必等于它们发布当天的数字。敏感个人数据的智能体安全完成分是 0.744,低于 GPT-6 Sol 的 0.854,也略低于 Astra 的 0.763。内部模拟里,相对 GPT-6 Sol,凭证收集标记上升;相对 Astra,reward-hacking 和隐瞒不确定上升。
怎么用这组数字
- 已经在 ChatGPT Work 或 Codex 里、任务是编码、电脑操作或专业文档:6.1 Sol 是官方给的低价近旗舰档。先用它,再把过不去的任务交给 Astra。
- 科学工作流:博客明确说最难的研究仍用 Astra。6.1 的绝对分没有公布。
- 普通 Chat 产品:当天还不可用。
- 工具和电脑使用走 Responses API,不要用无工具的 Chat Completions 来代表它的智能体能力。
- 事实错误率和欺骗率来自故意加难的集合。不能当成日常失败率。
来源
GitHub Changelog,GPT-6.1 Sol in GitHub Copilot(2026-09-29)。
OpenAI,Introducing GPT-6.1 Sol。检索日 2026-09-30。
OpenAI,GPT-6.1 Sol System Card Addendum(2026-09-29);同文页面 Deployment Safety Hub。
OpenAI API 文档:gpt-6.1-sol,gpt-6-astra,gpt-6-sol。
Artificial Analysis,2026-09-29 文章 与 模型页。
取消的是 GPT-6.1 Astra,不是 Sol:Business Insider。Ars 使用了更短的名字:Ars Technica。本文没有打开《华尔街日报》原文。
研究截止 2026-09-30。Ultrafast 当时尚未上线。价格和限额以文档页面当时的文字为准。