作者|碧山
来源|博望财经
北京时间9月5日凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra——拉丁语里"星辰"的意思,发布前官方只留下一句预告:"星星几乎排列好了"。总裁格雷格·布罗克曼在媒体吹风会上的收尾更直白:"欢迎来到AGI时代。"两天后,Pro、Enterprise和Business Premium用户已在ChatGPT Work和Codex里全量用上,API同步上线。
(资料图片仅供参考)
01
迟到了一个多月的发布
这款模型其实早就被剧透过了。8月初,《The Information》就报道奥特曼在华盛顿向政策制定者演示过代号Astra的新模型,内部一度考虑直接命名GPT-6。但此后焦点从"有多强"转向"够不够安全"——OpenAI确认Astra触及了准备框架里"关键级"的网络安全能力门槛,成为公司第一个跨过这条线的模型,为此一度放慢开发、加做安全测试。奥特曼自己承认,发布比预期晚,一个重要原因就是花了更多时间做对齐。
发布的姿态拉得很满。官网视觉一改往日的简洁克制,用上了动态变化的数字6和深色界面;奥特曼称这是第一个让他觉得可以放心让用户直接"试一试"的模型,希望它开启"新一代的创业、科学发现与创造";布罗克曼则把话说到了AGI的高度——他承认AGI至今是个灰色模糊的概念,但"现在认为我们已经进入AGI时代,并不是一种不合理的看法",至于算不算正式宣布实现AGI,他把判断留给了读者。
02
跑分表上的“打穿区”
先看最夸张的几项。在考察陌生环境学习和抽象推理的ARC-AGI-3上,Astra拿到99.9%,上一代GPT-5.6 Sol只有7.8%,Claude Opus 5为30.2%——一个数量级的跳跃;在代表高阶数学能力的FrontierMath Tier 4上得分97.6%,接近把这套研究级测试打穿,OpenAI还顺带公布了它参与解决质数间隔这一长期开放数学问题的新结果。
网络安全维度的跃升更有现实冲击力。测试漏洞利用能力的ExploitBench上,Astra拿到100%,GPT-5.6 Sol为78.5%;在一组专门用2026年6月至8月新披露漏洞构建的测试里,Astra成功率39%,Sol只有5.5%。OpenAI还披露,内部测试中Astra发现并利用了2个此前未知的漏洞,目前正在向相关维护者走披露流程。
比"更聪明"更重要的是"更听话"。OpenAI参考近期的Hugging Face事件设计了一项新评估:面对极其困难甚至无法完成的任务时,模型会不会为了达成目标擅自突破用户授权边界。没有生产级防护的条件下,GPT-5.6 Sol有48%的情况会越界,Astra是0%。代价也不是没有——官方坦言Astra的书面推理过程比前代更难监控,简单任务上它用更少步骤解决问题,传统的思维链监控变得更难,OpenAI表示宁可牺牲一部分能力上限,也要保住监控能力。
03
从会说到会做
这一代模型的重头戏不在聊天本身,而在操作电脑这件事上。OpenAI直接把Astra称作"世界上最好的computer use模型":填网络表单、更新CRM记录、整理日历、做在线研究写摘要、分析科学数据出图表、建网站跑前端测试,甚至自主安装软件、照着屏幕上的报错排查故障。OSWorld 2.0测试里,Astra得分从Sol的65.7%提到72.6%,完成单个任务的平均时间却从约75分钟压到40分钟,缩短47%;配合新版Codex Harness,Mind2Web上的任务完成速度是前代体验的1.9倍。
专业场景的跑分差距拉得更开。自动化任务评测AutomationBench上,Astra拿到41.4%,Sol只有18.1%;BenchCAD里根据多角度渲染图写CAD代码重建3D物体,Astra几何重合度95.9%,官方估算其API成本还比Sol低约43%;金融建模世界杯挑战,它以约四倍于人类冠军选手的速度完成。企业案例开始接近真实生产流程:法律科技公司Legora用它审阅财务报表,一次Agent运行几分钟扫完41份文件,还揪出了人为埋设的4处错误;游戏公司Playco用它做原型开发,人工修复工作减少50%。
长任务编程是另一个被重做的环节。过去上下文窗口装满后,模型只能把前文压缩成摘要,方案为什么失败、测试出过什么异常,压缩几次就丢了;Astra版的Codex引入了跨上下文的笔记机制,此前的需求、测试结果、工具输出都能被检索回来。对动辄跑数小时的软件工程Agent来说,这比单纯扩大上下文窗口更解渴。Terminal-Bench 4.0里Astra得分57.7%,Sol为37.3%;内部数据库迁移任务,63.9%对42.7%。
04
内测玩家已经玩疯了
使用资格还在分批放开,但抢先上手的那批内测玩家已经替所有人把它狠狠折腾了一遍,他们显然没打算拿它做普通问答。开发者Pietro Schirano让它做一款Mac应用——先在Blender里建个3D iPod,再还原经典界面用来查看Codex线程,15分钟就成了;网友丢过去一条Zillow房源链接,它照着照片重建整套房屋的3D模型,顺手剪出一支房产宣传片;Higgsfield让它负责一段博物馆戏的空间调度,从摸清场馆布局到安排演员走位、列镜头清单,再交给Seedance逐镜渲染,测完给出的评价是"空间推理能力世界级"。
游戏场景里的数字更直白。GPT-5.5挑战《宝可梦火红》连续奋战218小时没打完,GPT-5.6 Sol花了96小时35分钟通关,Astra把时间压到18小时12分钟,而且只靠游戏截图,没有内存信息、攻略和人工提示。造游戏也行:一个提示词配合游戏引擎做出10对10的《光环》风格多人FPS,地图、武器、联机逻辑一套配齐;免疫学家Derya Unutmaz只输入"做一个5分钟的T细胞教学视频",它自己写解说、做动画、出图,还主动建议配旁白,一次出片——这位研究了35年T细胞的科学家看完说,自己肯定讲不了这么好。
最会玩的案例来自开发者Matt Shumer:他让一个Astra当"经理"把任务拆成阶段清单,再开一个Astra当执行者,最猛的时候96个子智能体同时开工,一周时间在虚幻引擎里一条街一条街搭出了曼哈顿。他还发现一个措辞玄学:要求每个阶段做到"极好",项目就稳步推进;改成"完美",模型立刻钻进细枝末节出不来。一个词的差别,决定项目是推进还是停滞。
05
工程师的第一条建议:删掉你的提示词
发布之后最有意思的建议来自OpenAI自己。工程师Victor Nunez给用户的第一条建议出人意料:趁Astra上线,回去清理你的AGENTS.md和Skills文件。这几年开发者对付模型的办法是做加法——它听不懂就多解释一步,老犯错就多加一条限制,提示词像给健忘的新员工贴便签,日积月累贴满整张桌子。而Astra对指令的敏感度变了:以前当摆设的旧规矩,它现在逐条执行,一条含糊的规则会让它停下来反复确认,两条冲突的规则直接卡住。官方迁移指南里反复强调的词是"审计":把过时的、冗余的、冲突的指令统统删掉。
顺着这个"做减法"的逻辑往下看,官方指南甚至附了段现成的提示词,专门禁止模型使用"delve""值得注意的是"这类套话,连"先否定再翻转"的句式都被点名禁掉。写套话的是模型,教人防套话的是模型厂家,这种"自己挖坑自己教填"的诚实,多少有点黑色幽默。但背后的信号是认真的:模型越强,你写的规矩反而该越少——它已经能从上下文推断意图,指令有歧义时主动提问,还能记住多步任务里的全局目标。
06
价格、野心和一句上市表态
价格方面有个看似矛盾的组合:Astra的标准定价为每百万输入Token 10美元、输出50美元,是目前促销中的GPT-5.6 Sol的2.5倍,另有速度快至2.5倍、价格翻倍的Fast模式。OpenAI的解释是单Token更贵但活儿干得省——最高分设置下,Astra的输出Token用量比Claude Opus 5少约65%,一些场景里完成同一任务的总成本反而更低。奥特曼把长期目标描述为"极其廉价且丰沛的智能",承诺继续大幅降价。
他还罕见地对上市松了口:如果有一天真的上市,会花大量时间提醒想买股票的人——OpenAI使命优先、极度面向长期,会在数十年的时间跨度上做决策。一边是"欢迎来到AGI时代"的宣言,一边是"使命优先"的预防针,GPT-6 Astra这场发布,OpenAI想同时讲给两种听众:等模型的用户,和等它的资本。
已入驻平台
今日头条|百度百家|微博|新浪看点
36氪|钛媒体|腾讯|网易|搜狐|知乎
界面新闻|知识星球|天极网|维科网
商业新知|猎云网|顶端新闻|资鲸网
东方财富|蓝鲸财经|华盛金融|雪球
华盛金融|天风证券|同花顺|格隆汇
富途证券|老虎证券|环球老虎财经
融中财经|猎云网|TMT观察网
顶端新闻|陀螺科技|支付宝社区
抖音|西瓜视频|腾讯视频|哔哩哔哩
小红书|快手|大鱼号|创业邦
敬告读者:本文均基于公开资料、主流数据信息平台、机构媒体报道内容、受访者提供相关内容信息撰写。博望财经及作者发布内容仅供行业探讨与观察,不代表任何观点、不构成任何投资建议、不推荐任何产品。资本市场充满风险,投资需谨慎!未经博望财经授权平台不得转载、抄袭、洗稿,违者必究!







