这两天模型圈又把“新纪元”这套词给喊热了,OpenAI 端出了号称迈向 AGI 的 GPT-6 Astra,Google 则像开了流水线一样,六周连跳三代把 Gemini 3.8 Flash 拍在桌上。

各路科技媒体都在狂发跑分通稿,算每百万 Token 便宜了几个百分点,或者对着发布会 PPT 展望未来。但在我看来,如果你真把模型天天挂在终端和 Agent 里跑,成本这玩意儿其实早就对我们脱敏了

Google Pro 订阅反代配额与预测用量

就拿上面这张我跑反代的后台监控来说,一个月 20 美元的 Google Pro 订阅,挂上反代反重力,一个号一周能吞吐 1.6B(16 亿)Token,跑了几天才消耗了 9% 的额度。在动辄几十亿的配额面前,谁还去按次计算那几分钱的账单?

真正卡住日常折腾脖子的,从头到尾只有两个硬指标:一是速度,你把任务交代下去后它到底要我干等多久;二是 IQ,它能不能把话听明白,把事情一次性做对

正好最近民间开源社区流出了一套很有意思的实测看板(包括 DeepSWE 代码工程能力与庞贝壁画修复视觉推理),样本量虽然不算天量,但把“速度(耗时)与 IQ”这两个维度的反差扒得非常透彻。结合我自己的实操,聊聊这两款模型的真实体感。


视觉实测与 Astra:智力确实断层,但它是个“测试狂魔”

先泼一盆冷水,官方发布会吹的那套“AGI 已经降临”,我完全没感受到。

实测下来,我更愿意把它定义成一个更聪明、但更贵、而且得了重度强迫症的 GPT-5.6 Sol。它没有发生什么物种级别的蜕变,只是把上一代身上最招人烦的臭毛病改掉了一部分,顺便把智力上限又拔高了一大截。

最直观的惊喜是它终于不搞虚套了。上一代 5.6 Sol 最让人高血压的地方,就是极度套路化的“过度思考”,明明一句两句话就能理顺的逻辑,非要自己在后台哼哧哼哧推演半天假装很深沉,最后给出一堆爹味说教。Astra 这次收敛了非常多,它能够迅速吃透指令背后的意图,即便你的需求留了些模糊地带,它也能凭借极强的理解力准确补全,而不是要么反复追问废话,要么直接猜歪。

在民间的这组“庞贝壁画修复 / 视觉推理”测试看板里,这种智商层面的代际压制展现得淋漓尽致:

庞贝壁画修复视觉推理看板 1:GPT 系列与 GLM 庞贝壁画修复视觉推理看板 2:DeepSeek、Grok、K3 与 Gemini

如果把看板里各家模型在视觉任务上的“耗时与 IQ”单独抽出来做成散点图,态势就更直观了:

庞贝壁画修复 / 视觉推理实测:耗时 vs 视觉智商

看这几个关键数据:

  • Astra 独走无人区:综合视觉 IQ 直接飚到了 136,在 max 与 ultra 档位甚至打出了 142 IQ,而上一代 Sol 只有 97 到 108,主流模型大多堆在 75 到 90 之间;更关键的是它把单次耗时压缩到了 7 到 16 分钟。
  • 算力黑洞的惨烈对照:边上的 K3(Kimi Code)在视觉任务里简直是灾难现场,单次任务耗时高达 120 到 133 分钟(两个多小时),最后拿出来的 IQ 只有 74 到 86,完全陷在死循环里空转。

但 Astra 身上有一个让我极度头疼的特质:它实在太喜欢做测试了

不知道是不是在对齐阶段被代码质量规范训过了头,Astra 表现出了一种近乎病态的防御性编程洁癖。哪怕你只是让它改一行简单的配置,或者写个不到二十行的小功能,它都极度缺乏安全感,非要在本地给你搭一套完整的测试框架,写断言、跑回归、反复验证输出。这种偏执在复杂的架构重构里或许能救命,但在日常快速迭代里,这种“任何一个功能都要测个底朝天”的习惯,硬生生把交付节奏拖得很慢,让你坐在屏幕前只能眼巴巴等着它做完自我心理建设。

智力比 5.6 Sol 强了不止一个档次,但这个测试狂魔的性格,注定让它只能呆在重度任务的攻坚位上。


DeepSWE 与 Gemini 3.8 Flash:从“张口就来”到真香工兵的开窍之路

相比 Astra 的高冷与迟缓,Gemini 3.8 Flash 给我的惊喜反而要大得多。

理解 3.8 的好,得先回顾一下 Google 前几代 Flash 让人又爱又恨的历史。在 3.5 和 3.6 的时期,Gemini 的自然语言表达能力确实很强,甚至经常显得文采斐然,但它的工具调用能力基本可以用灾难来形容。丢给它一个任务,它几乎不主动碰外部工具,给出的很多方案完全是自信满满地“张口就来”,一跑全是幻觉。

真正的转折点发生在 3.7 Flash。从 3.7 开始,我突然发现它开窍了,会主动根据上下文停下来调用外部工具,开始学着用真实环境的反馈来校准自己。

而到了刚发布的 3.8 Flash,Google 终于补齐了它长期以来“不愿深度思考、做事浮躁”的心病。

我们来看看开源社区跑出来的 DeepSWE 软件工程基准看板:

DeepSWE 代码工程看板 1:OpenAI 家族 DeepSWE 代码工程看板 2:国产主力 DeepSeek 与 GLM DeepSWE 代码工程看板 3:Gemini 反重力、Grok 与 K3

把各家模型在 DeepSWE 上的交付速度与解题智商汇成散点图:

DeepSWE 软件工程实测:耗时 vs 解题智商

从散点图的分布上一目了然:

  • Astra 依然盘踞在 107 到 109 IQ 的天花板,耗时 9 到 25 分钟;
  • 挂着 Antigravity(反重力)标签的 Gemini 3.7/3.8 Flash,稳稳把时间卡在 14 到 15 分钟,交出了 91 到 93 IQ 的成绩;
  • 对比之下,上一代 Sol 和 DeepSeek V4 Pro 动辄要跑 50 多分钟,K3 更是要跑 62 分钟。

对于一个定位偏轻量级的 Flash 模型来说,14 分钟交出 93 IQ,意味着它不仅能在短时间内把代码写完,还能一次性通过绝大部分边界用例。

在我的实际日常开发中,Gemini 3.8 Flash 带来了几项极其舒适的体感:

  1. 彻底告别八股文:这一点对我太重要了。用习惯了 GPT 之后,你真的会受够那种教导主任式的长篇大论、安全免责声明和套话前菜。Gemini 的沟通非常干净干脆,说结论就说结论,日常交代任务省心太多,我再也不想忍受跟 GPT 讲话时的心累感。
  2. 速度上的降维打击:在把模型接入到 OMP(全栈开发环境)里执行任务时,两者的体感差距简直像绿皮车和高铁。GPT 系列在长上下文交互时的常态吞吐大多只有 20 到 25 token/s,经常出现光标卡住几秒才吐一个词的迟钝感;而 Gemini 经常直接狂飙到 120 到 140 token/s,命令行里的代码和解释像瀑布一样倾泻而下,完全跟得上思考的速度。
  3. 无限续杯的底座红利:配合反代反重力,一周吃下十几亿 Token,你可以把它随意丢去跑批处理、扫描仓库上下文、清理日志或抓取分析网页,完全不需要心疼。

当然,必须承认它的局限性。

它的思考能力提升是相对过去的自己而言,上限依然有限,千万别指望它去搞高难度的架构设计或者深度开荒,它最稳妥的角色就是“高频执行、日常清理与对话的 Agent 工兵”。

另外,Google 的生态做法也确实让人想吐槽。虽然官方说不封号,但把门锁死、逼着大家通过反代反重力去榨取额度,这种保守的做法在当下的开源与 Agent 浪潮里挺 low 的,用起来心里始终多一份顾虑。


各自找准自己的位置

聊完这两款模型,其实没必要神化哪一家,也没必要搞非黑即白的选型纠结。

合理的态度是正视每个模型的实际进步。Gemini 并不是没有进步,从 3.5 时代的张口就来,到 3.7 主动调用工具,再到 3.8 补齐深度思考,配合它几乎不用等待的吐字速度和天量额度,它在轻量执行上的进化是非常扎实的;而 Astra 也绝对不是什么全知全能的 AGI 救世主,智力确实上去了,但伴随而来的迟缓、昂贵和测试强迫症,一样会在很多场景里把人劝退。

归根结底,什么样的任务就去匹配什么样的模型,什么样的 Agent 就该去选什么样的底座。

日常的脏活累活、高频调用的自动化脚本、需要即时反馈的日常对话,老老实实扔给 Gemini 3.8 Flash,速度和心流都能拉满;真遇到逻辑特别复杂、在死胡同里需要高阶推断,或者重度依赖视觉空间解析的代码攻坚,再换上 Astra 去试一试。根据手头的活儿随时切换工具,而不是迷信某个单一模型能包打天下,这才是折腾大模型时最务实的做法。