Gemini 3.8 Flash 上線:官方數字曬出來,多數任務打平甚至贏 Opus 5,但這兩項差距藏不住
Google 9 月 2 日上線 Gemini 3.8 Flash,距離上一版 3.7 Flash 只有三週,價格只要 Claude Opus 5 的六分之一到七分之一。我把官方自己貼出來的評測表整理成看得懂的版本,多數任務打平甚至贏過 Opus 5,但 Terminal-bench 4.0、電腦操作測試的差距沒有行銷稿講的那麼小。

Google 這次玩很快。3.6 Flash、3.7 Flash、3.8 Flash,三個月內喊了第三次「新一代 Flash」,最新這款 9 月 2 日上線,距離上一版 3.7 Flash 才三週。Hacker News 討論串當天衝到 775 分,比較少見的是這次吵的重點不是「有沒有比前一代強」,而是「跟貴一個檔次的旗艦模型比,到底輸在哪」。我把 Google 官方自己貼出來的評測表整理成看得懂的版本,答案比行銷稿誠實。
官方自己曬的分數:多數項目打平甚至贏 Opus 5
先講價格。3.8 Flash 每百萬輸入 token 0.75 美元、輸出 3.75 美元,這是到 2026 年 12 月 31 日的介紹價,明年 1 月 1 日起漲回 1.50/7.50 美元。對照組 Claude Opus 5 是 5/25 美元,GPT-5.6 Sol 是 4/20 美元,換算下來 3.8 Flash 現在的價格大約只要 Opus 5 的六分之一到七分之一。
照這個價差,多數人會猜它的實力該差 Opus 5 一大截,但官方公布的比較表打臉了這個猜測。財務分析類的 Vals Finance Agent v2,3.8 Flash 拿 61.4%,比 Opus 5 的 58.6% 還高。法律流程的 Harvey's Legal Agent Benchmark,3.8 Flash 10.0% 對 Opus 5 6.7%。長程軟體工程的 DeepSWE v1.1,3.8 Flash 73.7% 只小輸 Opus 5 的 74.0%,差距僅 0.3 個百分點,幾乎打平。終端機任務 Terminal-bench 2.1,3.8 Flash 89.4% 甚至些微領先 Opus 5 的 89.1%。多模態的 CharXiv Reasoning、長影片理解 LVBench、生物研究 LABBench2 這三項,3.8 Flash 更是整張表裡分數最高的模型,贏過所有對照組,包含 Opus 5。
但有兩個地方,差距大到藏不住
把整張表看完會發現一個規律:贏的都是「單一任務、範圍明確」的測試,一旦換成「需要長時間自己規劃、操作整個環境」的任務,3.8 Flash 就現出原形。最明顯的是 Terminal-bench 4.0,測的是更貼近真實情境的通用 agent 能力,3.8 Flash 只拿 19.1%,Opus 5 是 51.8%,輸了 32.7 個百分點,是整張表裡差距最大的一項。電腦操作測試 OSWorld-2.0 也一樣,3.8 Flash 59.0% 對 Opus 5 75.4%,輸 16.4 個百分點。知識工作類的 GDPVal-AA v2(用 Elo 分數計算),3.8 Flash 1545 分,Opus 5 是 1824 分,差距同樣不小。
這個落差跟 Google 官方文件寫的定位其實是一致的。3.8 Flash 主打的是「有明確目標、步驟相對固定」的 agent 工作,例如照著規格寫程式、跑財務或法律的固定流程。換成「自己判斷下一步該做什麼、需要長時間通盤規劃」的開放式任務,還是旗艦模型 Opus 5 穩。所以「打敗前沿模型」這種說法沒有說謊,只是只挑了對自己有利的那幾項出來講。
主打「省成本」,但第三方測出來的用量沒那麼便宜
Google 這次的賣點是「Flash 的速度跟成本、旗艦的智慧」,DeepMind 官方頁面上甚至直接寫「Best for token efficiency」。

DeepMind 官方網站把 Gemini Flash 定位成「coding、knowledge work、multimodal tasks 的 token 效率最佳選擇」。(圖片來源:Google DeepMind 官方網站)
但獨立跑分機構 Artificial Analysis 量到的實際狀況有點反差。開到 High 推理強度時,3.8 Flash 的首字延遲(time to first token)要 13.3 秒,同級模型的中位數是 2.99 秒,等於慢了四倍以上,換成 Low 強度延遲會降到 0.7 秒,但代價是放棄大半推理能力。輸出速度倒是真的快,High 模式下每秒吐 304.6 個 token,遠高於同價位模型 70.8 token 的中位數,可是吐得快不代表吐得少,同一組跑分任務,3.8 Flash 總共花了 1.2 億個輸出 token,中位數只要 7,100 萬,等於多燒了近 70% 的量。換算下來,帳單上單價便宜不等於整輪任務跑下來總花費也便宜,這是兩筆帳,得分開算。
還有一項官方自己承認的退步。DeepMind 的模型卡寫明,3.8 Flash 在「多語言安全性」的自動化測試上比 3.7 Flash 退步了 5.4 個百分點,人工紅隊測試雖然仍通過上線門檻,但這代表非英文情境下的防護不是進步、而是略為鬆動,做多語系客服或面向海外用戶的人要留意。
一般訂閱戶不用額外開通,Pro/Ultra 直接吃得到
跟前陣子 Claude Fable 5.1 上線 那篇提到「訂 Pro 也用不到、得另外開額外用量」的做法不一樣,Google 官方部落格寫得很直白,3.8 Flash 已經上線給 Google AI Pro 和 Ultra 訂閱戶使用,不用另外解鎖、不用多付費,訂閱的當下就切得到這顆新模型。Google AI Pro 月費 19.99 美元、Ultra 分兩檔,99.99 美元是 5 倍用量、199.99 美元是 20 倍用量,三檔都在原本的訂閱額度裡直接含 3.8 Flash,這點對一般只是在 Gemini App 裡聊天、不碰 API 的人來說,是最直接的差異。
不過要注意,Google 自家的方案介紹頁目前主打的招牌模型還是 Gemini 3.1 Pro,3.8 Flash 這顆是在應用程式選單裡切模型才會看到的選項,官方行銷頁沒有特別把它拉出來講,算是藏在訂閱裡的加映,不是這次改版的主打賣點。
開發者怎麼用、多少錢
除了 Gemini App,3.8 Flash 也同步開放給 Google AI Studio、Android Studio、Google Antigravity 這些開發工具,企業客戶則是走 Gemini Enterprise。API 計價前面提過,0.75/3.75 美元的介紹價撐到今年底。換算一輪對話的成本,假設輸入 1 萬 token、輸出 1,500 token,大概是 0.0075 美元加 0.0056 美元,兩者相加約 0.013 美元,換算台幣不到一塊錢,比 Claude 那篇算過的 Fable 額外用量(同樣輸入輸出比例下大約 0.18 美元)便宜了十幾倍。規格上,3.8 Flash 支援文字、圖片、語音、影片輸入,脈絡長度 100 萬 token,單次輸出上限 6.4 萬 token,跟前一代 3.7 Flash 相同。這次是延伸訓練、不是全新的底層模型,這點官方模型卡寫得很清楚,沒有藏著掖著。
所以到底要不要在意
如果你只是 Google AI Pro/Ultra 訂閱戶,平常就在 Gemini App 裡問問題查資料,這次更新幾乎不用做任何事,選單切過去就是新模型,多數場景會比 3.7 Flash 更準,代價頂多是偶爾回應變慢一點。如果你是拿 API 在跑 agent、寫程式或串接固定流程的工作,3.8 Flash 目前這個價位帶確實划算,官方數字也支持「跑得動、跟旗艦打平手」的說法,但前提是任務範圍要明確。一旦換成需要長時間自主規劃、操作整個電腦環境的開放式任務,Terminal-bench 4.0 跟 OSWorld-2.0 那兩項差距擺在那,該用 Opus 5 還是得用 Opus 5,別被「打敗前沿模型」這種標題騙了只看對自己有利的那幾項分數。

