这两天大模型圈子最重磅的炸弹,无疑是 OpenAI 正式推出的 GPT-6 Astra。

官方的发布通稿和科技媒体的赞歌铺天盖地,甚至直接喊出了“AGI 已经降临”的口号。但作为一个天天泡在终端和 Agent 里的折腾党,看一个新模型绝对不能只听官方画饼,最踏实的方式是按照一条线性的逻辑把它扒开:先看官方喊了什么口号与跑分指标,再看民间内测长什么样,接着算清楚实际价格与效率账,最后给出优缺点和使用结论


一、官方口号与外部评测:到底在测什么指标?

每次 OpenAI 发大版本,造势的调门都会拔到极高。

这次 OpenAI 用“群星已经排列就绪”开篇,总裁布罗克曼直接宣称世界正式步入 AGI 时代,并在其官方技术博客与发布页面公布了一整套极其耀眼的基准测试成绩。

GPT-6 Astra 官方核心基准跑分对比

单纯看一堆百分比没有意义,我们把官方主推的这几个核心指标翻译成人话:

  1. OSWorld 2.0(得分 72.6%):测的是全真实操作系统的 GUI 操作能力。它不再是单纯看图说话,而是让模型像真人一样去点击软件、填写 CRM、整理日历、跑浏览器。上一代 GPT-5.6 Sol 是 65.7%,更关键的是官方特别强调:完成单项任务的平均耗时从 Sol 的 75 分钟缩短到了 40 分钟左右,耗时降了近一半。
  2. Terminal-Bench 4.0(得分 57.9%):测的是命令行终端下的软件工程修复。在真实的 Linux 环境里排查报错、修改代码、执行脚本。上一代 Sol 只有 37.3%,Astra 直接拉开了 20 个百分点的差距。
  3. ARC-AGI-3(得分 99.9%):测的是未知规则的抽象归纳能力。这是业界公认很难靠海量记忆“刷题作弊”的基准,要求模型在陌生环境里自己探索规律并解决问题。上一代 Sol 仅有 7.8%,Astra 几乎拿了满分。
  4. Agents’ Last Exam(得分 59.3%):测的是长程复杂多工具调用的专家级任务,旨在衡量模型能不能独立扛起持续数小时的企业级工作流。
  5. FrontierMath (97.6%) 与 ExploitBench (100%):分别测前沿高阶数学推理和网络安全漏洞利用,官方甚至宣称它在内测中独立挖掘并利用了两个此前未公开的 0-day 漏洞。

官方的这一整套指标,核心目的只有一个:告诉大家 Astra 不再只是个陪你聊天的模型,而是一个能直接在电脑上替你干活的数字员工


二、民间内测看板:真实世界里长什么样?

官方跑分往往有最严苛的 harness 环境与特定微调,那么在开源社区与民间的盲测看板里,Astra 表现如何?

在民间的开源评测站点 CodexRadar 模型评测看板 里,有两组真实数据非常说明问题:

1. 庞贝壁画修复 / 视觉推理实测

这个测试要求模型对残缺、复杂的视觉空间进行推断与修补:

庞贝壁画修复视觉推理看板 1:GPT 系列与 GLM 庞贝壁画修复视觉推理看板 2:主流对比模型

庞贝壁画修复 / 视觉推理实测:耗时 vs 视觉智商

在视觉维度上,Astra 给出的数据非常显眼:

  • 综合视觉 IQ 冲到了 136,在 max 与 ultra 档位直接飙到了 142 IQ,单次耗时压缩在 7 到 16 分钟之间。
  • 上一代 Sol 只有 97 到 108 IQ,而同期其他模型大多卡在 75 到 90 IQ 之间。
  • 对比之下,K3(Kimi Code)在视觉任务里单次耗时居然高达 120 到 133 分钟(两个多小时),花费高昂却深陷算力死循环。

但我自己的实际体感是,这并不代表它的纯逻辑智商真的发生了什么突变,而是视觉感知的精细度上去了。以前的模型看图像近视眼,只能看个大概轮廓就去生硬脑补;Astra 是真能看清局部的细微像素、残缺边缘和空间相对关系。正是这种视觉分辨率的质变,直接拉高了它在空间修复上的得分。

2. DeepSWE 软件工程代码实测

在测试长程代码修复能力的 DeepSWE 中:

DeepSWE 代码工程看板:OpenAI 家族 DeepSWE 软件工程实测:耗时 vs 解题智商

Astra 在 high 档位拿下了 109 IQ,综合 105 IQ 稳稳位居榜首,耗时保持在 9 到 25 分钟之间。这印证了一点:Astra 底层的智力上限确实没有水分,比 5.6 Sol 强出了一个大台阶


三、价格与真实消耗:横向对比下的体感真相

聊完能力,我们必须把价格拉到台面上算一笔明白账。

首先建立一个现实的基准坐标:一个普通的 20 美元 Pro 订阅,往常在实际的额度池体系里,折算下来大约相当于每个月承载了 12,000 美元的理论 Token 消耗。在这个基准上,我们把两代模型的纸面单价与真实工程花费拉一张横向对比表:

维度 GPT-5.6 Sol (上一代) GPT-6 Astra (新一代) 真实体感差异
官方输入单价 约 $3.00 / M tokens $10.00 / M tokens 纸面单价显著上涨,看似“用不起”
官方输出单价 约 $15.00 / M tokens $50.00 / M tokens 旗舰级高溢价
单日重度开发账面 $42.38 $54.83 Astra 账面高出约 20%
DeepSWE 任务耗时 34 ~ 53 分钟 (拖沓) 9 ~ 25 分钟 (干脆) 耗时减半以上,效率翻倍
DeepSWE 单任务花费 $7.95 ~ $24.46 $3.07 ~ $5.24 实际单任务成本反而暴降 60%+
思维推演风格 冗长虚胖、套路化废话 Token 多 链路精简、直奔交付、一次做对 废话 Token 骤减摊平了单价溢价

模型成本排行(单日重度使用)

这张表格直观揭示了很多人直觉上的盲区:单价更贵,并不代表最终跑完一个任务的总消耗一定会更高

上一代 GPT-5.6 Sol 最大的问题是“思维虚胖”。为了完成一个任务,Sol 经常在后台进行漫长的套路化推演,动辄吐出几万个无意义的思考 Token,还极易因为理解偏差导致反复返工,结果在 DeepSWE 里单次任务经常要跑上四五十分钟,生生堆出了 $7.95 甚至 $24.46 的巨额账单。

而 Astra 的智力底子极硬,省去了所有表演性质的伪推演,能用极短的路径一次性把事情做对。

虽然单价上浮了,但由于废话 Token 减少、返工率锐减、任务耗时直接腰斩,最终反映在实测里,Astra 完成单项高难度任务的花费反而只要 $3 到 $5。它不仅没有把总成本推高,反而用翻倍的交付效率,把实际的时间成本彻底打了下来。


四、优点与缺点:键盘前的肉身实测

理清了性能与价格,抛开官方的宏大叙事,我对 Astra 的肉身体感总结如下:

核心优点

  1. 彻底告别刻舟求剑式的“过度思考”: 上一代最让我难受的地方,就是把限制条件机械化地过度放大。比如跟它说“今天我们做个插件(不做 Python)”,旧模型就会在后台魔怔般地推演,甚至在生成的说明和代码注释里到处写上“(本项目不做 Python)”,整篇内容都在刻意表演它如何避开 Python,主次完全颠倒。Astra 终于改掉了这个毛病,它能把否定指令当成底层约束默默遵守,不再挂在脸上到处宣扬。
  2. 意图理解与服从性大幅增强: Astra 对真实上下文的领会能力明显好很多。交代一个稍微模糊的需求,它能精准抓到意图,而且执行时的服从性极高。不再自作聪明地教我做事,也不再为了表现自己思考深沉而强行节外生枝,基本做到了“指令指到哪,代码落到哪”。
  3. 极具生产力的“留白补全”: 日常交代任务很难把所有细枝末节一次说全。Astra 懂得根据项目上下文自动补齐普通的逻辑空白,直奔交付,只有在缺失信息真正会改变核心决策时才停下来向我确认,大幅减少了无意义的来回拉扯。
  4. 视觉精细度带来的能力跃升: 庞贝测试能跑出 142 IQ,在我看来核心在于它的视觉感知精细度有了质的提升。它不再像旧模型那样粗线条地把图片压缩成模糊特征,而是真能看清像素级细节、边缘和空间相对位置。正是这种“看得更细更准”的感知力,直接拉高了它在多模态和空间推断上的表现。

致命缺点

  1. 病态的“测试狂魔”(官方文档实锤): 这是 Astra 目前最劝退人的强迫症。在 OpenAI 官方的开发者使用与迁移指南(latest-model)里,官方甚至专门开了一节叫 Testing and verification,坦白承认:对于小任务,Astra 往往会跑出远超出任务需求的海量测试。哪怕只是改两行配置或写个几十行的小函数,它都极度缺乏安全感,非要在本地搭一套完整的测试框架,写断言、跑回归。这种习惯在大工程重构里能防患未然,但在日常快速迭代里,这种“改个螺丝钉都要测个底朝天”的做派,把交付节奏拖得极沉,让人频繁在屏幕前陷入漫长的干等。官方甚至不得不专门给开发者提供 Prompt 模板,去强行告诫它“不要为低影响的代码改动写测试”。
  2. 对规则极度敏感,容易被 AGENTS.md 绊倒卡死: 在官方指南的 Instruction following 章节里,OpenAI 也明确指出了这个问题:Astra 对上下文中的规则和指导文件(比如 Agent 的 Skill 或工作区的 AGENTS.md)表现出了近乎偏执的敏感。如果你挂载的指导文件里有哪怕一丁点规则冲突或边界模糊,Astra 不会像以前的模型那样顺畅滑过去,而是会直接中途停下来挂起任务,拒绝继续推进。为了让它正常干活,我不得不专门在提示词里做针对性调优,显式声明“用户指令绝对优先于 Skill 规则”,否则它动不动就会被自己读到的某行规范给绕进死胡同。
  3. 关键时刻的“权限阻断”: 虽然它懂得留白补全,但官方也承认它存在“不必要的主动打断(Unnecessary approval pauses)”。有时候任务明明推进到一半,只差临门一脚的落地,它却会突然谨慎过头,停下来向我索要多余的确认,破坏本来极其流畅的自动化心流。
  4. 依然存在配额天花板: 即便单任务效率高,它依然是高价值重器,无法随心所欲拿来做高频、琐碎的日常打杂。

五、总结:找准它的定位

回到开篇的命题:GPT-6 Astra 到底是个什么角色?

别信那些“AGI 已经降临”的公关辞令,实测下来,它本质上是一个更聪明、效率成倍翻倍、能帮你省下宝贵时间,但得了严重测试强迫症的“高级 Sol”

它依然在大模型既有的逻辑范式内,只是把前代的痛点修好了,并把智商上限拉到了新高度。

对待它最好的姿态是务实分工:

  • 交给它:复杂的架构搭建、深水区疑难排查、重度视觉推断与空间建模、以及经得起它反复跑测试的高要求工程;
  • 放过它:日常一句话写个临时小脚本、清理日志、高频调用与常规聊天。把任务与模型匹配好,才能真正榨出它的价值。

参考与数据来源