产品简介
GPT-6 Astra 是 OpenAI 于 **2026/9/3(美西)正式发布**的新一代旗舰模型,官方定义是「新一代智能」(A New Generation of Intelligence),自称「目前全球最智能、且对齐程度最高的模型」。Astra 在拉丁语中意为星辰,发布前的预告语正是 The stars are almost aligned。总裁布罗克曼在吹风会上直言「欢迎来到 AGI 时代」,称未来回望时 Astra 可能被视为 AGI 时代开启的标志性模型——这是 OpenAI 首次主动把自家发布与 AGI 叙事直接挂钩,也是发布会最大的话题点。
**这一代的核心变化是「从回答问题到完成工作」**。Astra 不再止步于对话与生成,而是可以接收一个总目标(比如「整理财务分析并做成演示文稿」「开发一个游戏原型并测试能否运行」),自己拆解任务、调用工具、根据屏幕反馈持续执行直到交付。它可以直接操作电脑:填写网页表单、更新 CRM 记录、整理日历、做网络调研、打开 Python 笔记本分析科学数据、创建网站并跑前端 QA、自主安装软件并排查屏幕上的报错。在 OSWorld 2.0 计算机操作测试中 Astra 拿到 **72.6%**(GPT-5.6 Sol 为 65.7%),延迟模拟下单任务平均耗时从 Sol 的约 75 分钟降到约 **40 分钟,效率提升近 47%**——这是 AI 操作电脑第一次逼近「与其自己动手不如交给它」的生产力门槛。
**推理能力出现近乎「打穿」的跃升**。被视作衡量通用智能核心指标的 ARC-AGI-3(陌生环境抽象推理与学习),Astra 拿到 **99.9%**,而 GPT-5.6 Sol 只有 7.8%,单代提升十余倍。研究级数学基准 FrontierMath Tier 4(v2)Astra 得分 **97.6%**(Sol 83.0%、Claude Fable 5.1 为 87.8%),官方还宣布 Astra 帮助解决了两个素数间隔领域的开放理论问题(将短素数间隔界从 240 改进到 186,并改进了一个尘封 80 余年的长素数间隔项)。编程侧 Terminal-Bench 4.0 得分 57.9%(Sol 37.3%、Fable 5.1 55.8%),科学工作流 Terminal-Bench Science 0.1 高达 64.6%(Sol 仅 22.4%),逆向工程基准 SRE-Bench 四次尝试解决 99.2% 的任务。
**网络安全是这代最特殊的一张牌**。Astra 是 OpenAI 首个在内部预备框架(Preparedness Framework)中达到 **Critical 关键级**网络安全能力门槛的模型——这意味着在合适的工具与权限下,它能自主发现此前未知的安全漏洞并构建利用链。ExploitBench 满分 **100%**(Sol 78.5%);在覆盖 2026 年 6 至 8 月真实漏洞的内部测试中,其任意代码执行率远超 Sol,测试中甚至自主发现并利用了**两个此前未知的零日漏洞**(已向维护方披露)。为此 OpenAI 把 Astra 的发布推迟了数周强化防护,并将最前沿的攻防能力限制在 Daybreak 项目内、按防御用途逐步开放。对齐侧同样给出惊人数据:突破用户授权边界的情况 **0%**(Sol 达 48%),内部计算机使用不当行为率 2.4%(Sol 22.0%),幻觉率 4.2%(Sol 12.2%)。
**落地节奏与定价**:9/3 当天先向参与网络安全项目 Daybreak 的部分企业开放,未来数日内推送给全部 ChatGPT Plus / Pro / Business / Enterprise 订阅用户,同时通过 OpenAI API(模型名 gpt-6-astra)与 Amazon Bedrock 提供;Pro 与企业档另有 Astra Pro。API 标准价 **$10 / 每百万输入 token、$50 / 每百万输出 token**,是 Sol 当前价($4/$20)的 2.5 倍,与 Claude Fable 5.1 定价基本持平;支持缓存折扣、2.5 倍速的快速模式与五级推理强度调节。第三方机构 Artificial Analysis 的独立数据则提醒:Astra 的智能指数(61.2)相比 Sol(60.9)提升有限、单任务成本可能高出约 75%,但在 Codex 长任务环境里完成同类任务的成本反而接近甚至低于 Sol——「贵不贵」取决于怎么用。
核心功能
- 首个 Critical 网络安全评级:OpenAI 历史上首个达到预备框架「关键级」门槛的模型:可自主发现未知漏洞并构建利用链,ExploitBench 100%,能力与防护同时拉满
- ARC-AGI-3 99.9%:陌生环境抽象推理与学习基准从 GPT-5.6 Sol 的 7.8% 跃升至 99.9%,单代十余倍提升,被视作接近通用智能的核心指标
- FrontierMath Tier 4 97.6%:研究级数学几乎「打穿」;官方宣布 Astra 协助解决素数间隔领域两个开放理论问题(186 界 / 尘封 80 余年项)
- 真正的计算机操作 Agent:OSWorld 2.0 72.6%、单任务 40 分钟(较 Sol 快 47%);能操作表单/CRM/日历/科学软件/KiCad/Blender 等完成整条工作流
- 对齐与控制显著升级:越权行为 0%(Sol 48%)、不当行为率 2.4%(Sol 22%)、ExploitGym 蜜罐 0%(Sol 48.2%),OpenAI 称其迄今最「听话」的模型
- Codex 长程记忆:跨上下文窗口保留并检索工作记录,不再反复压缩为摘要;Mind2Web + Codex 任务完成速度为 Sol 体验的 1.9 倍
- 105 万 token 上下文:总上下文 105 万 token、最大输出 12.8 万 token,知识截止 2026/4/30,支持流式/结构化输出/函数调用/网页浏览
- 专业软件工作流:BenchCAD 几何重叠 95.9%(Sol 83.3%),可完成 PCB 布局、Blender 建模转虚幻引擎场景、金融建模、法律文档等
适合谁用
以下类型的用户会特别受益于 GPT-6 Astra:
- 长程智能体任务:给一个目标让它自己拆解执行(计算机操作、软件工程、数据工作流)
- 科学研究:进入专业软件分析数据、设计实验与模型拟合(Terminal-Bench Science 0.1 64.6%)
- 授权网络安全防御:漏洞研究、验证与检测(Daybreak 项目,攻防能力受限开放)
- 专业设计工程:PCB 布局、3D 建模、CAD 与金融建模等过去难以自动化的软件内工作
- 深度数学与代码推理:FrontierMath / Terminal-Bench / SRE-Bench 场景
- ChatGPT 订阅与 API 重度用户的旗舰升级(Astra Pro 面向 Pro/企业档)
优点亮点
- ARC-AGI-3 99.9% 与 FrontierMath 97.6% 的推理跃升是实打实的代差
- 首个 Critical 网络安全模型,攻防能力业界独一档
- 对齐数据史上最好:越权 0%、不当行为率降近 10 倍、幻觉率降约 2/3
- 计算机操作开始具备真实生产效率(40 分钟/任务 vs Sol 的 75 分钟)
- 105 万 token 上下文 + Codex 跨窗口记忆,长任务不再丢细节
- 数学研究有实际产出(素数间隔两个新理论结果),不只停留在基准
价格与方案
**API 标准价**:$10 / 每百万输入 token,$50 / 每百万输出 token,为 GPT-5.6 Sol($4/$20)的 2.5 倍,与 Claude Fable 5.1($10/$50)基本持平。缓存读取 $1 / 百万 token(约 90% 折扣),缓存写入加收约 25% 溢价。**快速模式(Fast)**:处理速度最高为标准模式 2.5 倍,价格为标准模式 2 倍。**推理强度**:支持 low 到 max 五级调节,可按任务难度权衡成本与深度。**订阅**:Astra 用量含在既有订阅额度内,超额可购买 credits;Pro / Business / Enterprise 档另有 GPT-6 Astra Pro。**渠道**:OpenAI API(gpt-6-astra)与 Amazon Bedrock。**独立评估提醒**:Artificial Analysis 测得其智能指数 61.2(Sol 60.9)接近但输出 token 减少约 10%,因单价涨 2.5 倍,简单场景单任务成本可能比 Sol 高约 75%;Codex 环境内长任务成本反而接近甚至低于 Sol 与 Claude Fable 5。
总结与建议
GPT-6 Astra 是 OpenAI 2026 年 9 月发布的第六代旗舰模型,定位从对话与生成转向完整的智能体工作:可直接操作电脑、自主拆解并执行长程任务。它在 ARC-AGI-3 拿到 99.9%、FrontierMath Tier 4 拿到 97.6%,是 OpenAI 首个达到网络安全关键级门槛的模型,ExploitBench 满分,同时在对齐与越权控制上交出史上最好数据。API 定价为每百万输入 10 美元、输出 50 美元,是 GPT-5.6 Sol 的 2.5 倍,与 Claude Fable 5.1 持平。适合需要深度推理、长程智能体执行或高安全边界的开发者与企业;对成本敏感或轻量任务用户,Sol/Terra/Luna 仍是务实之选。
版本演进
- GPT-6 Astra 正式发布 (2026-09-04):OpenAI 发布新一代旗舰模型 GPT-6 Astra,自称「全球最智能且对齐程度最高的模型」。首个达到网络安全 Critical 关键级门槛的模型(ExploitBench 100%、发现两个零日漏洞),ARC-AGI-3 99.9%、FrontierMath Tier 4 97.6%;定位长程智能体与计算机操作(OSWorld 2.0 72.6%、单任务 40 分钟)。9/3 率先向 Daybreak 网络安全项目企业开放,未来数日推送全部 ChatGPT 订阅用户、API 与 Amazon Bedrock。API $10/$50,是 GPT-5.6 Sol 的 2.5 倍。