GPT-6 Astra:是革命还是人工智能发展的又一小步?

GPT-6 Astra 已于 2026 年 9 月 3 日由 OpenAI 正式发布。 该公司将其定位为最先进的模型,并强调了其在计算机使用(computer use)、网络浏览、编程、网络安全、学习以及专业工作方面的全新能力水平。这固然重要,但同样重要的是要区分事实与营销术语。Astra 并非“AGI 的证据”,而是一个具体且公开描述的前沿模型,它将推理与执行多步骤操作相结合。 最大的变化在于,OpenAI 不再仅仅将 Astra 描述为一个回答问题的系统。该模型旨在利用计算机、浏览器、代码、文档和专业工具来执行任务。在实践中,这意味着从“为我写一个答案”模式转向“为我执行一个流程”。 TechSociety 编辑插图:GPT-6 Astra 作为推理、代理、计算机使用和网络安全的结合。 1.

GPT-6 Astra 已成为 OpenAI 的官方模型 此前关于 Astra 的信息涉及开发项目。2026 年 9 月 3 日,OpenAI 正式推出了 GPT-6 Astra。该模型正分阶段部署:最初提供给一小部分组织,随后将面向 ChatGPT Plus、Pro、Business 和 Enterprise 用户以及通过 API 提供。OpenAI 还指出 Microsoft Azure 和 Amazon Bedrock 为其分发渠道。 在开发文档中,该模型以 gpt-6-astra 标识符出现。OpenAI 提供的内容窗口大小为 1,050,000 token ,最大输出为 128,000 token ,知识截止日期为 2026年4月30日 。该模型支持以下推理强度(reasoning effort)级别:low、medium、high、xhigh 和 max。 这一点非常重要,因为 GPT-6 这个名称不再仅仅是对 Astra 名称的媒体解读。OpenAI 在公告和 API 文档中都正式使用了“GPT-6 Astra”这一名称。 2.

超百万 token 的上下文 Astra 最具体的特征之一是 105 万 token 的上下文。如此巨大的容量允许模型在单个任务中处理非常广泛的材料:大型代码库、文档、项目历史、多份文件或庞大的数据集。 仅有庞大的上下文并不保证质量。信息的筛选、提示词(prompt)的构建方式、检索、工具以及计算成本依然至关重要。然而,在智能体(agent)工作中,大窗口尤为重要,因为长任务可能需要保留大量的先前决策、测试结果和约束条件。 OpenAI 报告 Astra 在 MRCR v2 8-needle 测试中取得了优异成绩。对于 256K–512K 的上下文,模型获得了 100%;对于 512K–1M 的上下文,获得了 96.3%。GPT-5.6 Sol 分别获得了 91.5% 和 73.8%。这些是 OpenAI 发布的结果,并对应特定的基准测试方法论。 3.

Computer use:计算机成为模型的工具 此次发布中最具实用性的元素是 computer use。OpenAI 将 Astra 描述为一个能够执行诸如填写在线表单、更新 CRM 中的客户记录、组织日历、进行在线研究、在电子邮件和文档编辑器中准备摘要、分析科学数据、创建图表、构建网页以及执行前端 QA 等任务的模型。 该模型还可以安装和测试软件,并协助诊断屏幕上出现的故障。这不再仅仅是生成文本或代码。模型获得了观察环境并采取后续行动的能力。 在 OSWorld 2.0 基准测试中,OpenAI 给出了 Astra 72.6% 的得分,而 GPT-5.6 Sol 为 65.7% 。在延迟模拟中,Astra 在约 40 分钟内完成一项任务,而 Sol 则需要约 75 分钟。OpenAI 将此描述为在获得更高分数的同时,耗时减少了约 47%。 4.

ScreenSpot-Pro 与界面理解 在不使用工具的情况下,根据 OpenAI 的数据,GPT-6 Astra 在 ScreenSpot-Pro 中获得了 92.7% ,而 GPT-5.6 Sol 获得了 76.9% 。该测试涉及对用户界面元素的理解。 这一结果对智能体(agents)非常重要,因为在应用程序中操作需要正确识别屏幕元素。智能必须知道正确的按钮、字段、菜单或界面元素位于何处。仅具备生成文本的能力不足以完成此类任务。 5.

AutomationBench:更强的执行流程能力 在 AutomationBench 中,GPT-6 Astra 获得了 41.4% 。作为对比,OpenAI 给出的数据为:GPT-5.6 Sol 为 18.1%,Claude Fable 5.1 为 31.4%,Claude Fable 5 为 17.4%,以及 Claude Opus 5 为 26.9%。 此结果不应被解读为“Astra 自动化了 41.4% 的业务流程”。该基准测试衡量的是一组特定的任务。然而,它是一个重要的指标,表明 Astra 已针对执行包含多个步骤的工作进行了优化。 6.

Agents’ Last Exam 在 Agents’ Last Exam 中,Astra 达到了 59.3% ,GPT-5.6 Sol 为 53.6%,Claude Opus 5 为 55.5%,而 OpenAI 提供的对比数据中 Claude Fable 5 为 48.7%。 这类测试非常重要,因为不仅是单个回答的正确性变得越来越重要,智能体执行整个流程的能力也变得至关重要。在实际业务中,正是这一点决定了 AI 仅仅是一个助手,还是真正能够接管部分流程。 7.

编程:Astra 执行任务,而非仅仅编写代码 OpenAI 将 GPT-6 Astra 定义为其迄今为止最强的软件工程模型。该模型专为代理式工作(agentic work)而设计,在这些工作中,编码只是包含仓库分析、终端操作、运行测试以及迭代改进结果的更宏大过程中的一部分。 Codex 的重要变化之一是长会话期间上下文的存储方式。此前,后续的上下文窗口会被压缩成摘要。Astra 可以在不同窗口之间保留笔记,且之前的窗口仍可被检索。因此,即使某些内容未包含在简短摘要中,模型仍能回顾需求、测试结果或之前的操作。 这在大型重构、迁移和长期任务中非常重要。在这种环境下,模型不应仅被评估为“是否生成了正确的代码?”,而应被评估为“是否将整个任务推向了可运行的结果?” 8.