PD虚拟机     VPS     Win11     微软     苹果     SetApp     Office     精选

GPT-6 Astra 上线!有什么重磅新变化?为什么说 AGI 新时代来了?

 人工智能   2026-09-05
0 下载

OpenAI 新旗舰 GPT-6 Astra 终于发布了!现在官网绑定信用卡开会员就能马上体验!或者各大中转站也都纷纷上线了。在发布会结尾,总裁 Greg Brockman 直接甩下一句 “Welcome to the AGI era”,狂是真的狂,但看完整个发布内容,我只能说这次 OpenAI 确实有点狂的底气。

GPT-6 Astra

支持开通 GPT 会员虚拟卡

高性价比 API 中转站

先快速过一遍 GPT 6:105 万 Token 上下文,最大输出 12.8 万 Token,知识截止到 2026 年 4 月底。API 定价每百万输入 10 美元、输出 50 美元,是上一代 GPT-5.6 Sol 的 2.5 倍,和两天前 Anthropic 刚发的 Claude Fable 5.1 定价一模一样。目前先开放给少量机构,ChatGPT Plus、Pro、Business、Enterprise 和 API 用户还要等几天灰度推送。Plus 用户别急着升 Pro,Astra 本身就在 Plus 的开放范围内,等推送就行。

不过说实话,参数和价格都是配角。GPT-6 Astra 真正的变化总结起来就一句话:它从“回答问题”的角色彻底进化成了“帮你把活干完”的角色

GPT-6 最大杀器:它真的会自己操作电脑了!

GPT-6 Astra 这次最核心的升级是「Computer Use」。OpenAI 直接喊出“世界上最好的电脑操作模型”,真不是营销话术。以前想让 AI 用软件,要么接 API、要么上 MCP,碰上那种二十年前写的内部老系统,文档都找不到,基本歇菜。

Astra 彻底换了个思路:不给我接口是吧?那我直接看屏幕、找按钮、点鼠标、填内容,跟人一样用电脑就完了。屏幕和键鼠,才是这个世界上最通用的 API

GPT-6 Astra Computer Use

官方演示里它干的事挺杂:在 KiCad 里画 PCB 电路板、用 Excel 和 Power BI 做报表、填美国 1040 报税表、给法律文件排版、在 Blender 里建一栋房子再扔进 Unreal Engine 5 变成能走进去逛的场景、搭完网站还自己跑一遍前端 QA。这些软件之间毫无共同点,但 Astra 全都用同一套“看屏幕干活”的方式拿下了。

实测数据也撑得住。OSWorld 2.0 电脑操作测试,Astra 拿 72.6%,Sol 是 65.7%;更关键的是时间——单任务平均耗时从 75 分钟砍到 40 分钟,快了 47%。办公自动化测试 AutomationBench 直接从 18.1% 飙到 41.4%。最直观的对比:找儿科医生这种任务,Astra 2 分 54 秒干完,人类平均要花 5 小时。

GPT-6 Astra 跑分离谱到什么程度?

三个数字足够解释它的能力了:

  • ARC-AGI-3:99.9%。这个测试把 AI 扔进没有任何规则说明的陌生游戏里,让它自己边玩边摸索通关,考的其实是“悟性”,人类平均分才 48%。半年前最强模型只有 0.51%,Sol 是 7.8%,Claude Opus 5 是 30.2%。不过得打个星号:99.9% 用的是 OpenAI 自家的 Responses API 框架,不完全等于裸模型的裸分。
  • FrontierMath Tier 4:97.6%,高难数学基本被刷饱和了。
  • ExploitBench:100%,漏洞利用直接满分。

编程上,Terminal-Bench 4.0 拿到 57.9%,压过 Fable 5.1 的 55.8%,Sol 只有 37.3%。科研也顺手整了个大的:Astra 参与解决了两个素数间隔问题,把有界素数间隔从 240 进一步压到了 186。

Codex 会记笔记了,还学会了“什么时候问你”

「长任务」一直是痛点:超多的上下文很容易就满,就得压缩,一压缩就容易丢细节——之前某次修复为什么失败、某个组件有什么问题,后面搞着搞着就没了忘记了。Astra 给 Codex 加了一套新机制:像人一样「记笔记」!!它可以跨上下文窗口记笔记,早先的对话还能继续搜索,没写进摘要的信息也能回头翻出来。这功能目前是实验开关,接下来几周会变成默认。

GPT-6 Astra

还有个特别戳人的升级叫“判断力”。信息缺了但影响不大,它自己合理脑补;会改变最终结果的,它问一个精准的问题。在 Codex 里它还能一边问你、一边继续干不依赖你回答的活。说真的,这就很像一个靠谱同事——知道什么时候来烦你,也知道什么时候闭嘴干活。

最安全,也最难监控

安全这块有点拧巴。一方面,Astra 是 OpenAI 号称史上第一个达到 Critical 网络安全门槛的模型,测试期间还顺手发现了两个此前未知的零日漏洞。普通版本会拒绝高阶漏洞利用请求,强能力通过 Daybreak 计划慢慢开放给审核过的防守方。

另一方面,对齐进步肉眼可见:面对不可能完成的任务,Sol 在无防护情况下 48.2% 会越界乱搞,Astra 是 0%;能力幻觉率也从 9.4% 降到 2.0%。

但反转来了:行为更安全了,思维链却更难读懂了。英国 AI 安全研究所测出来,Astra 不写长推理、直接“心算”的时间跨度是 Sol 的近 10 倍。OpenAI 自己在 System Card 里也承认,思维链可监控性显著下降。一个更聪明、更自主的模型,人类反而更难靠“看它想了什么”来管住它,这也是 OpenAI 没敢一口气全量放开的原因。

最后说点实在的

GPT-6 Astra 是 OpenAI 史上最大规模训练,得州 Stargate 超算 10 万 + GPU 起步,还是第一款由前代模型深度参与训练监督的旗舰——AI 开始帮 OpenAI 训练 AI 了,细品。

支持开通 GPT 会员虚拟卡

高性价比 API 中转站

价格贵了 2.5 倍,但 OpenAI 的说法是别看 Token 单价,得看“完成一个任务总共花多少钱”。Astra 步骤更少、返工更少,单项任务成本未必更贵,这个逻辑,可以先听着。

普通用户怎么选?只聊天写文案,国产免费三件套(DeepSeek、豆包、通义千问)照样香;真要拿 Agent 跑长任务、操作电脑的,Astra 值得蹲。AGI 到底来没来,各有各的说法,但有一点很确定:AI 能替你干的活,又往前跨了一大步。

/ 关注 “异次元软件世界” 微信公众号,获取最新软件推送 /






    评论内容 (*必填):
    Ctrl + Enter 快速提交   

    赞赏异次元


    请通过支付宝、微信 APP 扫一扫,海外读者可「使用 PayPal 赞赏

    “ 感谢您对异次元网站的支持! ”