GPT-6 Astra 发布 计算机操控和百万 token 上下文改变了什么

OpenAI 发布 GPT-6 Astra,支持计算机操控(OSWorld 2.0 得分 72.6%)和百万 token 上下文,Codex 新增跨上下文笔记和异步提问。已在 GitHub Copilot 可选。

GPT-6 Astra 发布 计算机操控和百万 token 上下文改变了什么

OpenAI 发布了 GPT-6 Astra,定位为"新一代智能"。和之前的 GPT 模型不同,Astra 的核心卖点不是更强的文本生成,而是两个实际能力的跨越:计算机操控(computer use)和编程。OSWorld 2.0 得分 72.6%(GPT-5.6 Sol 为 65.7%),Terminal-Bench 4.0 得分 57.9%,DeepSWE v1.1 得分 74.1%。目前面向 ChatGPT 付费用户逐步开放,API 可用(模型名 gpt-6-astra),GitHub Copilot 也已上线。

作者CodePass 技术编辑

计算机操控:从生成文本到操作界面

Astra 可以直接和图形界面交互:填表单、更新 CRM 记录、安装和测试软件、截屏排查问题。OpenAI 在 OSWorld 2.0 上报告 72.6% 的得分,比 GPT-5.6 Sol 的 65.7% 高出约 7 个百分点。

这意味着 Astra 做的不只是告诉你怎么操作,它能替你操作。在 Codex 里,这表现为 Astra 可以启动应用、点击按钮、填写输入框、验证结果,整个过程在一个任务里完成,不需要你中间介入。

对于开发者的实际价值:端到端测试场景。之前你需要写 Playwright 或 Cypress 脚本来模拟用户操作,Astra 可以直接用自然语言描述测试步骤,它自己操作界面来验证。这不是完全替代测试框架(自动化测试需要确定性和可重复性),但在探索性测试和原型验证阶段能省大量时间。

编程能力和跑分

在编程基准测试上,Astra 的定位是全面领先:

Terminal-Bench 4.0:57.9%。这个跑分测试的是在终端环境里完成复杂多步骤任务的能力,包括调试、部署、系统管理等。Claude Fable 5.1 在同一基准上得 55.8%,两者接近。

DeepSWE v1.1:74.1%。这个基准测试真实的 GitHub issue 修复任务。Cognition 刚发布的 SWE-2 在同一基准上得 73.0%,几乎持平,但 Astra 的计算成本更高。

GPT-5.2-Codex 相比,Astra 是完全不同的定位。5.2-Codex 专注于 Agent 编程场景,Astra 是通用模型,编程只是它能力的一个方面。如果你只需要编程能力,5.2-Codex 在 Codex 内可能更合适(成本更低);如果你需要计算机操控 + 编程的混合工作流,Astra 是目前唯一的选择。

Codex Harness 更新

配合 Astra,OpenAI 同步更新了 Codex 的底层 harness:

跨上下文笔记(cross-context notes):Astra 可以在上下文窗口满了之后保留笔记,而不是像之前那样只做压缩摘要。之前的压缩会丢失细节(为什么某个修复失败、某个组件的行为模式),笔记机制让这些信息跨窗口持续可用。之前的上下文窗口也保持可搜索。这个功能目前是实验性的,需要在 config.toml 里手动开启。

异步提问(async questions):当 Astra 遇到需要你决定的问题时,它可以继续处理不依赖答案的部分,同时异步等待你的回复。如果你不回复,它会在合理的假设下继续推进,但对重大决策会等你确认。

Mind2Web 基准上,Astra + 新 harness 的任务完成速度比 GPT-5.6 Sol 快 1.9 倍。

可用性和 Cursor 的关系

API:模型名 gpt-6-astra,通过 OpenAI API、Azure、AWS Bedrock 均可访问。支持百万 token 上下文(MRCR 评估在 512K-1M 范围得分 96.3%)。

GitHub Copilot:已面向 Pro+、Max、Business、Enterprise 用户开放,逐步滚动。

Cursor:由于 OpenAI 11 月 12 日切断对 Cursor 的模型供应,Astra 不会出现在 Cursor 的内置模型列表里。你可以通过 BYOK 填入 OpenAI API key 在 Cursor 的 Chat 和 Agent 里使用,但 Cloud Agent、Background Agent 等高级功能不支持 BYOK 模型。详见 Cursor 迁移 OpenAI 模型的实操步骤

参考资料