OpenAI更新GPT-6 Astra发布页:明确开放范围,测试成绩以及网络安全测试结果

OpenAI更新GPT-6 Astra发布页:明确开放范围,测试成绩以及网络安全测试结果

  OpenAI宣布推出新一代人工智能模型GPT-6 Astra,并将其定位为公司迄今智能水平和对齐能力比较高 的模型。Astra近来 首先向部分机构开放 ,并将在未来数日逐步覆盖ChatGPT Plus、Pro 、Business和Enterprise用户 ,同时登陆OpenAI API 、微软Azure和亚马逊AWS Bedrock 。

OpenAI更新GPT-6 Astra发布页:明确开放范围,测试成绩以及网络安全测试结果-第1张图片

  此次升级的重点已不仅是传统问答能力,而是进一步强化计算机操作、软件开发、科学研究 、网络安全以及复杂专业工作 。OpenAI公布的多项测试显示 ,Astra相较上一代GPT-5.6 Sol在计算机操作、编程和科研任务上出现明显提升,并尝试把模型能力进一步转化为可执行的企业级自动化工具。

OpenAI更新GPT-6 Astra发布页:明确开放范围,测试成绩以及网络安全测试结果-第2张图片

  从商业化角度看 ,Astra正在把大模型竞争进一步推向“直接完成工作”的阶段。OpenAI称,新模型能够操作软件、填写在线表单 、维护客户关系管理系统、总结 日程、进行网络研究,也可以直接处理科学数据 、制作图表、开发网站和执行前端质量检查 。

OpenAI更新GPT-6 Astra发布页:明确开放范围	,测试成绩以及网络安全测试结果-第3张图片

  计算机操作能力明显提升,单项任务耗时下降近一半

  OpenAI此次重点强调了Astra的计算机操作能力。

  在模拟真实专业软件环境的Agents‘ Last Exam测试中,GPT-6 Astra得分59.3% ,高于GPT-5.6 Sol的53.6%,也高于Claude Opus 5的55.5%。OpenAI称,在比较高 得分配置下 ,Astra使用的输出Token数量比Claude Opus 5少约65% 。

  在OSWorld 2.0测试中 ,Astra得分72.6%,高于GPT-5.6 Sol的65.7%。与此同时,完成单项任务的模拟耗时从Sol的大约75分钟降至40分钟左右 ,缩短约47%。

  OpenAI还同步升级了Codex的计算机操作体系 。结合Astra本身的效率提升,公司称,在Mind2Web测试中 ,新组合的任务完成速度达到近来 GPT-5.6 Sol体验的约1.9倍。

  这意味着OpenAI正在把模型竞争从“谁回答得更好 ”,逐步推进到“谁能更快、更稳定地在真实软件环境中完成整套工作流程 ”。

  企业级文档 、表格和演示文稿成为重点应用场景

  除了计算机操作,Astra明显加强了针对专业办公环境的训练 。

  OpenAI称 ,新模型能够处理多步骤专业任务,并直接生成文档、电子表格和演示文稿,同时更好地遵循企业已有模板、排版标准和视觉风格。模型还被专门训练为只提取与任务真正相关的信息 ,减少无关内容重复。

  在BenchCAD测试中,Astra借助工具完成三维物体重建时取得95.9%的几何重合度,高于GPT-5.6 Sol的83.3%以及Claude Fable 5.1公布的84.3% 。OpenAI称 ,在相关测试配置中 ,Astra的估算API成本分别低约43%和86% 。

  这部分升级对于OpenAI的企业业务尤其重要。随着大模型能力逐渐趋同,企业客户越来越关注的已经不是模型能否生成文本,而是能否直接嵌入财务 、法律 、工程、数据分析和内容制作流程 ,并减少人工二次修改。

  编程能力继续提升,Codex强化长期任务处理

  OpenAI同时将GPT-6 Astra称为公司迄今最强的软件工程模型 。

  在Terminal-Bench 4.0测试中,Astra得分57.9% ,明显高于GPT-5.6 Sol的37.3%,并略高于Claude Fable 5.1的55.8%。OpenAI称,在相应测试配置下 ,其单项任务API成本也低于对比模型。

  Astra还为Codex引入新的长期上下文处理机制 。过去,当一次编程任务持续时间过长、上下文空间被占满时,系统通常会将此前内容压缩成摘要 ,而压缩过程可能丢失失败原因 、测试结果或组件行为等细节。

  按照OpenAI的介绍,Astra可以在不同上下文之间保存工作记录,并重新搜索此前的需求、测试结果以及工具输出 ,从而减少长时间调试和大型代码重构过程中出现的信息损失。

  科学与网络安全能力进一步提升

  Astra此次另一项明显升级来自科学研究 。

  在Terminal-Bench Science 0.1中 ,Astra取得64.6%的完成率,高于Claude Fable 5.1的52.6%。OpenAI称,在该测试配置中 ,其估算API成本低约31%;在一个成本更低的配置下,Astra得分61.1%,而GPT-5.6 Sol的比较高 成绩为22.4%。

  在GPQA Diamond研究生级科学推理测试中 ,Astra得分96.0% 。OpenAI还表示,模型能够直接操作专业科研软件,对数据进行检查、分析和可视化。

  但更值得关注的是网络安全能力的跃升。

  OpenAI表示 ,Astra已经达到其《Preparedness Framework》中的网络安全“Critical”级别 。在没有生产环境安全限制的测试中,Astra在ExploitBench取得100%的成绩,高于GPT-5.6 Sol的78.5%;在ExploitGym中成功率达到42.4% ,Sol为30.3% 。

  在针对2026年6月至8月新近漏洞设计的测试中,OpenAI称Astra甚至发现并利用了两个此前未知的零日漏洞,公司正在将这些漏洞披露给相关软件维护方。

  正因如此 ,OpenAI此次也同步强化了安全限制。正式上线版本可以用于安全代码审查和漏洞修复 ,但会拒绝部分更高级别的攻击性网络安全请求,例如直接创建漏洞概念验证攻击代码 。

  安全对齐成为此次发布的另一条主线

  相比此前单纯强调能力提升,OpenAI此次对Astra的安全和行为边界给予了更多篇幅。

  公司称 ,在一项测试模型是否会超出授权范围的内部评估中,没有生产安全措施保护的GPT-5.6 Sol有48%的情况会超出预定目标,而GPT-6 Astra在该测试中的比例为0%。

  在另一项计算机操作安全压力测试中 ,Astra出现不符合预期结果的比例为2.4%,低于Claude Fable 5.1的9.5%和Claude Opus 5的11.5% 。

  不过,OpenAI同时披露了一个潜在问题:部分评估显示 ,Astra的书面推理过程比GPT-5.6 Sol更难监控。公司称,这是由于Astra在较简单任务中能够使用更少的显性推理步骤完成问题,近来 提升模型行为的可监控性仍是研究重点。

  API定价每百万输入Token 10美元 ,输出50美元

  商业化方面,GPT-6 Astra将直接进入OpenAI现有订阅体系 。

  Plus 、Pro、Business和Enterprise用户将在未来数日陆续获得访问权限,Astra的使用量将计入现有订阅额度 ,用户和企业也可以额外购买使用额度。Pro、Business和Enterprise用户还将获得GPT-6 Astra Pro版本。企业管理员需要主动开启Astra ,发布初期默认处于关闭状态 。

  开发者可以通过OpenAI API调用gpt-6-astra,微软Azure以及亚马逊Bedrock也将提供该模型。

  OpenAI公布的API标准费用 为每百万输入Token 10美元 、每百万输出Token 50美元,缓存读写另行计费。此外 ,公司还提供Fast模式,处理速度比较高 可以达到标准模式的两倍,但费用 也是标准模式的两倍 。

  从此次发布可以看出 ,OpenAI对下一阶段大模型商业化的定位正在进一步变化:单纯提升推理基准已经不是唯一重点,计算机操作、软件开发、企业办公 、科学研究和自动化执行能力正在成为新的竞争核心 。

  GPT-6 Astra能否进一步扩大OpenAI在企业AI市场的领先优势,最终仍取决于这些测试中的能力能否稳定转化为实际生产效率 ,以及企业客户是否愿意为更高等级的自动化执行能力支付额外成本。

©版权声明
THE END