在大模型圈子里,各家的打法越来越分化。

前两天 OpenAI 推出 GPT-6 Astra,继续兜售“AGI 降临”的宏大叙事;而 Google DeepMind 却换了一条路:短短六周里连推三个 Flash 版本,一路快跑到 Gemini 3.8 Flash

官方不再死磕昂贵笨重的超大旗舰,而是主打极速响应和低价走量。但作为一个天天在终端和 Agent 里折腾的人,看模型不能光看宣传统稿。我们还是按老规矩拆开看:官方指标的真实水位、民间看板实测、额度与价格账,以及键盘前的真实落地姿势


一、官方指标:有进步,但真没宣传的那么神

这次 3.8 Flash 发布,官方拿出了一张挺好看的成绩单,宣称在 14 组指标里拿下 8 组第一。

比如基础命令行的 Terminal-bench 2.1 拿到 89.4%,软件工程 DeepSWE v1.1 从 3.7 Flash 的 65.3% 涨到 71.0%,直逼 Opus 5 的 74.0%。

但平心而论,它确实有进步,但真的没有吹得那么神

到了真正复杂的深水区,短板立刻暴露:更考验系统级交互的 Terminal-bench 4.0 只有 19.1%(Opus 5 有 51.8%),图形界面的 OSWorld 2.0 也只有 59.0%。说白了,它在中短链路的日常修复和终端调用上更利索了,但面对复杂系统级长程任务,底层大局观依然离顶级旗舰有明显差距。


二、民间 CodexRadar 看板:真实世界里的战力对照

在民间的模型能力与消耗看板(CodexRadar)里,抛开定制环境,它的表现更接近日常体感:

1. DeepSWE 软件工程实测

DeepSWE 软件工程实测看板 1:主流旗舰与开源模型 DeepSWE 软件工程实测看板 2:DeepSeek 与 GLM 家族 DeepSWE 软件工程实测看板 3:Gemini、Grok 与 Kimi K3

看板里的对比很直观:

  • Gemini Flash 系列:3.7 Flash 在 Antigravity 环境下跑出 85 IQ,单次耗时只要 14~15 分钟,花费 $2 左右。3.8 Flash 官方涨到 71%,民间也微弱险胜 DeepSeek V4 Pro。
  • DeepSeek 系列:V4 Pro 综合 89 IQ,单价便宜($0.59~$0.87),但耗时要 43~56 分钟;V4 Flash 综合 76~77 IQ,耗时也要约 30 分钟。
  • K3 与 Grok 4.6:K3 在 max 档虽然冲到 104 IQ,但单任务跑了整整 62 分钟;Grok 4.6 综合 94 IQ,耗时约 30 分钟。
  • 顶级旗舰 Astra:综合 106 IQ 领跑,耗时 926 分钟,单次花费 $3$10。

Gemini Flash 核心优势就是快且干脆。15 分钟内把活干完,智商咬在主流第一梯队,不用坐牢干等大半个小时。

2. 庞贝壁画修复 / 视觉推理实测

庞贝壁画修复视觉推理看板 1:GPT 系列与 GLM 庞贝壁画修复视觉推理看板 2:DeepSeek、Grok、K3 与 Gemini

视觉测试里:

  • Gemini Flash 综合 81 IQ(high 档位 92 IQ),单次耗时 15~24 分钟,花费约 $1.2。
  • 虽说比不上 Astra(137 IQ)这种像素级怪兽,但对比 DeepSeek V4 Flash Vision Exp(84 IQ / 30分钟左右)、GLM-5.3 Flash(74 IQ / 44分钟),以及动辄跑出两小时死循环的 K3,它的交付效率非常稳定。

三、价格与真实消耗:反重力下的 16 亿额度

抛开纸面单价,在真实工程里算账更有意思。

Gemini 3.8 Flash 的官方 API 维持了优惠价:输入 $0.75 / M,输出 $3.75 / M,大概只有 Opus 5 的 15%。

但真正凶残的是配套订阅体系:

反重力每周额度消耗监控看板

一个月 20 美元的订阅,在反重力(Antigravity)Agent 调度里:

  • 每周直接给到了 1.6B(16 亿 Token)的预算额度
  • 我在这个周期里密集跑了 1,300 次复杂调用、吞了近 1.5 亿 Token,额度池才用了 9%,还剩 91%
  • 这 16 亿 Token 要是放商业旗舰按量计费,账单至少大几百美元;但在订阅里,边际成本几乎为零。

加上它 340+ tokens/s 的极速吞吐,没有旗舰那种冗长套路推演,任务耗时短,算下来真实成本比 DeepSeek 还香,完全能让人放开手脚随便造。


四、肉身体感:快与爽,以及上下文漂移的硬伤

回到键盘前的日常写代码,感受很分明:

核心优点

  1. 响应极快,心流不断:敲下回车瞬间输出,没有旗舰常见的等待便秘感,写脚本打杂非常顺手。
  2. 思考强度够用:标准业务重构、排查报错和终端交互足够靠谱,不是那种只能改错别字的弱智模型。
  3. 额度管饱,没有心理负担:20 美元买到天量额度,跑大规模自动化或者多 Agent 协作完全不用心疼。

致命缺点:上下文一旦堆积就漂移

如果说速度和价格是优点,那上下文漂移就是它的硬伤

官方标称 100 万 Token 上下文,但实测中只要多轮会话把上下文堆起来,它的注意力就会严重涣散:

  • 开始遗忘最初 System Prompt 里的规则与边界约束;
  • 会把前面跑偏甚至报错的代码当成既定事实,一路顺着错下去;
  • 出现前后矛盾或答非所问,即便在最新消息里纠偏,也很容易被前面的长历史带偏。

标称 1M 只是“吞得进”,长程记忆和抗干扰能力依然明显欠缺。


五、在 Agent 体系里的真实落地姿势

结合它极快的响应、充沛的额度池以及容易漂移的特性,在真实的 Agent 工作流里,它的生态位非常清晰:

1. 非常适合作为 Hermes 这类助手 Harness 的长期陪伴对象

在日常的助手型 Harness(比如 Hermes、日常个人终端助手)里,模型面对的通常是高频、碎片化、跨度长的日常对话与单点打杂。

这里的关键诉求是响应极快、首字无延迟,而且额度经得起整天泡在后台不断调用。Gemini 3.8 Flash 在反重力下每周 16 亿的额度池,加上 340+ tokens/s 的回话速度,拿来当日常常驻助理非常舒服。只要配合常规的会话截断,它就能兼顾低廉成本与敏捷反馈。

2. 适合在工程 Harness 里作为执行 Subagent

在复杂的工程项目开发中,如果使用多 Agent 分工模式,Gemini 3.8 Flash 是绝佳的纯执行型 Subagent

比如主架构师规划好了一组清晰明确的修改方案,需要派发子任务去改写特定的配置文件、写一套特定断言的单元测试、或者执行一连串固定的命令行检查。这种任务输入上下文干净、交付目标单一、不需要多轮历史累积。把它丢给 3.8 Flash,它能用极短的时间快速交付代码并退出会话,把极速和便宜的优势发挥到极致。

3. 坚决不建议直接当做规划 Agent(Planner)

但千万不要试图让它去当整个工程的顶层规划 Agent(Planner / Orchestrator)。

规划型 Agent 需要通读整个项目架构,维护长期的决策记忆,在数十步的系统级探索中始终保持不走偏。而 3.8 Flash 只要上下文一旦堆叠,注意力就会开始漂移,很容易在第十步就把第一步制定的全局原则忘得一干二净,甚至在错误推演里越走越远。

把规划大脑的大任交给 GPT-6 Astra 或 Claude Opus 5 这种大局观极强、长程抗干扰扎实的旗舰;把具体的脏活累活和单点执行拆解后丢给 Gemini 3.8 Flash。大脑负责算无遗策,小钢炮负责极速出击,这才是目前最实用、最划算的人机工程搭配。