[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"\u002Fcategories":3,"\u002Farticles\u002Fgemini-3-8-flash-benchmark-vs-opus-5-2026":41},[4,11,17,23,29,35],{"id":5,"slug":6,"name":7,"description":8,"sortOrder":9,"articleCount":10},"a7a26ffe-60e7-4548-b3d0-f271db563d51","travel","旅遊","訂房、機票、行程規劃相關的工具與心得",1,2,{"id":12,"slug":13,"name":14,"description":15,"sortOrder":10,"articleCount":16},"6002f679-2bf8-4917-ba71-c59d4e5c3c0a","productivity","生產力","筆記、待辦、時間管理 App 實測",0,{"id":18,"slug":19,"name":20,"description":21,"sortOrder":22,"articleCount":10},"5020f399-c954-48d2-bb8d-d330714ac6d6","finance","理財","記帳、投資、支付工具的使用經驗",3,{"id":24,"slug":25,"name":26,"description":27,"sortOrder":28,"articleCount":10},"418fe4fb-fbce-4f37-88e0-a917b7f2c87b","lifestyle","生活","日常會用到的各種服務與小工具",4,{"id":30,"slug":31,"name":32,"description":33,"sortOrder":34,"articleCount":22},"df5d8a68-5464-4db3-b0ff-ce3843b48885","tech","科技","人類前進的動力",5,{"id":36,"slug":37,"name":38,"description":39,"sortOrder":40,"articleCount":10},"84734e6c-fdfe-4544-b08a-0522c4df802f","game","遊戲","身為玩家的最愛",6,{"id":42,"slug":43,"type":44,"title":45,"excerpt":46,"coverImageUrl":47,"categoryId":30,"categorySlug":31,"categoryName":32,"authorName":48,"status":49,"publishedAt":50,"seoTitle":51,"seoDescription":52,"ogImageUrl":47,"aiGenerated":53,"aiSourceNotes":54,"viewCount":9,"featured":55,"productsPosition":56,"unpublishedReason":48,"unpublishedAt":57,"createdAt":58,"updatedAt":59,"contentHtml":60,"plainSummary":52,"tags":61,"products":70,"related":71},"39aebe51-103d-4029-b041-05aa0a7ab759","gemini-3-8-flash-benchmark-vs-opus-5-2026","post","Gemini 3.8 Flash 上線：官方數字曬出來，多數任務打平甚至贏 Opus 5，但這兩項差距藏不住","Google 9 月 2 日上線 Gemini 3.8 Flash，距離上一版 3.7 Flash 只有三週，價格只要 Claude Opus 5 的六分之一到七分之一。我把官方自己貼出來的評測表整理成看得懂的版本，多數任務打平甚至贏過 Opus 5，但 Terminal-bench 4.0、電腦操作測試的差距沒有行銷稿講的那麼小。","\u002Fuploads\u002F1588b32d-8129-4f0f-a328-95e7613b44a9.jpg","","published","2026-09-03T03:17:37.320Z","Gemini 3.8 Flash 評測整理：官方數據對比 Opus 5、GPT-5.6 Sol","整理 Gemini 3.8 Flash 官方公布的評測數字，逐項對比 Claude Opus 5、GPT-5.6 Sol，價格只要六分之一但 Terminal-bench 4.0、OSWorld 電腦操作差距仍大，含 Google AI Pro／Ultra 訂閱戶使用方式與 API 定價試算。",true,"彙整自 Google 官方部落格 blog.google（3.8 Flash 與 3.8 Flash Cyber 發表文）、DeepMind 官方 model card 與評測方法論頁面（deepmind.google\u002Fmodels\u002Fmodel-cards\u002Fgemini-3-8-flash，含官方 benchmark 對照表圖片）、9to5google 發布時間軸報導、Artificial Analysis 獨立跑分（time to first token、output token 用量）、officechai／eesel.ai 的整理報導交叉核對後以官方數字為準。",false,"bottom",null,"2026-09-03T11:15:10.065Z","2026-09-03T11:17:37.321Z","\u003Cp>Google 這次玩很快。3.6 Flash、3.7 Flash、3.8 Flash，三個月內喊了第三次「新一代 Flash」，最新這款 9 月 2 日上線，距離上一版 3.7 Flash 才三週。Hacker News 討論串當天衝到 775 分，比較少見的是這次吵的重點不是「有沒有比前一代強」，而是「跟貴一個檔次的旗艦模型比，到底輸在哪」。我把 Google 官方自己貼出來的評測表整理成看得懂的版本，答案比行銷稿誠實。\u003C\u002Fp>\n\u003Ch2>官方自己曬的分數：多數項目打平甚至贏 Opus 5\u003C\u002Fh2>\n\u003Cp>先講價格。3.8 Flash 每百萬輸入 token 0.75 美元、輸出 3.75 美元，這是到 2026 年 12 月 31 日的介紹價，明年 1 月 1 日起漲回 1.50／7.50 美元。對照組 Claude Opus 5 是 5／25 美元，GPT-5.6 Sol 是 4／20 美元，換算下來 3.8 Flash 現在的價格大約只要 Opus 5 的六分之一到七分之一。\u003C\u002Fp>\n\u003Cp>照這個價差，多數人會猜它的實力該差 Opus 5 一大截，但官方公布的比較表打臉了這個猜測。財務分析類的 Vals Finance Agent v2，3.8 Flash 拿 61.4%，比 Opus 5 的 58.6% 還高。法律流程的 Harvey's Legal Agent Benchmark，3.8 Flash 10.0% 對 Opus 5 6.7%。長程軟體工程的 DeepSWE v1.1，3.8 Flash 73.7% 只小輸 Opus 5 的 74.0%，差距僅 0.3 個百分點，幾乎打平。終端機任務 Terminal-bench 2.1，3.8 Flash 89.4% 甚至些微領先 Opus 5 的 89.1%。多模態的 CharXiv Reasoning、長影片理解 LVBench、生物研究 LABBench2 這三項，3.8 Flash 更是整張表裡分數最高的模型，贏過所有對照組，包含 Opus 5。\u003C\u002Fp>\n\u003Ch2>但有兩個地方，差距大到藏不住\u003C\u002Fh2>\n\u003Cp>把整張表看完會發現一個規律：贏的都是「單一任務、範圍明確」的測試，一旦換成「需要長時間自己規劃、操作整個環境」的任務，3.8 Flash 就現出原形。最明顯的是 Terminal-bench 4.0，測的是更貼近真實情境的通用 agent 能力，3.8 Flash 只拿 19.1%，Opus 5 是 51.8%，輸了 32.7 個百分點，是整張表裡差距最大的一項。電腦操作測試 OSWorld-2.0 也一樣，3.8 Flash 59.0% 對 Opus 5 75.4%，輸 16.4 個百分點。知識工作類的 GDPVal-AA v2（用 Elo 分數計算），3.8 Flash 1545 分，Opus 5 是 1824 分，差距同樣不小。\u003C\u002Fp>\n\u003Cp>這個落差跟 Google 官方文件寫的定位其實是一致的。3.8 Flash 主打的是「有明確目標、步驟相對固定」的 agent 工作，例如照著規格寫程式、跑財務或法律的固定流程。換成「自己判斷下一步該做什麼、需要長時間通盤規劃」的開放式任務，還是旗艦模型 Opus 5 穩。所以「打敗前沿模型」這種說法沒有說謊，只是只挑了對自己有利的那幾項出來講。\u003C\u002Fp>\n\u003Ch2>主打「省成本」，但第三方測出來的用量沒那麼便宜\u003C\u002Fh2>\n\u003Cp>Google 這次的賣點是「Flash 的速度跟成本、旗艦的智慧」，DeepMind 官方頁面上甚至直接寫「Best for token efficiency」。\u003C\u002Fp>\n\u003Cp>\u003Cimg src=\"\u002Fuploads\u002F6d3e0351-6fa2-47e5-9c98-389021ab24b5.jpg\" alt=\"DeepMind 官方頁面把 Gemini Flash 定位成 token 效率最佳選擇\">\u003C\u002Fp>\n\u003Cp>\u003Cem>DeepMind 官方網站把 Gemini Flash 定位成「coding、knowledge work、multimodal tasks 的 token 效率最佳選擇」。（圖片來源：Google DeepMind 官方網站）\u003C\u002Fem>\u003C\u002Fp>\n\u003Cp>但獨立跑分機構 Artificial Analysis 量到的實際狀況有點反差。開到 High 推理強度時，3.8 Flash 的首字延遲（time to first token）要 13.3 秒，同級模型的中位數是 2.99 秒，等於慢了四倍以上，換成 Low 強度延遲會降到 0.7 秒，但代價是放棄大半推理能力。輸出速度倒是真的快，High 模式下每秒吐 304.6 個 token，遠高於同價位模型 70.8 token 的中位數，可是吐得快不代表吐得少，同一組跑分任務，3.8 Flash 總共花了 1.2 億個輸出 token，中位數只要 7,100 萬，等於多燒了近 70% 的量。換算下來，帳單上單價便宜不等於整輪任務跑下來總花費也便宜，這是兩筆帳，得分開算。\u003C\u002Fp>\n\u003Cp>還有一項官方自己承認的退步。DeepMind 的模型卡寫明，3.8 Flash 在「多語言安全性」的自動化測試上比 3.7 Flash 退步了 5.4 個百分點，人工紅隊測試雖然仍通過上線門檻，但這代表非英文情境下的防護不是進步、而是略為鬆動，做多語系客服或面向海外用戶的人要留意。\u003C\u002Fp>\n\u003Ch2>一般訂閱戶不用額外開通，Pro／Ultra 直接吃得到\u003C\u002Fh2>\n\u003Cp>跟前陣子 \u003Ca href=\"\u002Farticles\u002Fclaude-fable-5-1-ai-subscription-comparison-2026\">Claude Fable 5.1 上線\u003C\u002Fa> 那篇提到「訂 Pro 也用不到、得另外開額外用量」的做法不一樣，Google 官方部落格寫得很直白，3.8 Flash 已經上線給 Google AI Pro 和 Ultra 訂閱戶使用，不用另外解鎖、不用多付費，訂閱的當下就切得到這顆新模型。Google AI Pro 月費 19.99 美元、Ultra 分兩檔，99.99 美元是 5 倍用量、199.99 美元是 20 倍用量，三檔都在原本的訂閱額度裡直接含 3.8 Flash，這點對一般只是在 Gemini App 裡聊天、不碰 API 的人來說，是最直接的差異。\u003C\u002Fp>\n\u003Cp>不過要注意，Google 自家的方案介紹頁目前主打的招牌模型還是 Gemini 3.1 Pro，3.8 Flash 這顆是在應用程式選單裡切模型才會看到的選項，官方行銷頁沒有特別把它拉出來講，算是藏在訂閱裡的加映，不是這次改版的主打賣點。\u003C\u002Fp>\n\u003Ch2>開發者怎麼用、多少錢\u003C\u002Fh2>\n\u003Cp>除了 Gemini App，3.8 Flash 也同步開放給 Google AI Studio、Android Studio、Google Antigravity 這些開發工具，企業客戶則是走 Gemini Enterprise。API 計價前面提過，0.75／3.75 美元的介紹價撐到今年底。換算一輪對話的成本，假設輸入 1 萬 token、輸出 1,500 token，大概是 0.0075 美元加 0.0056 美元，兩者相加約 0.013 美元，換算台幣不到一塊錢，比 Claude 那篇算過的 Fable 額外用量（同樣輸入輸出比例下大約 0.18 美元）便宜了十幾倍。規格上，3.8 Flash 支援文字、圖片、語音、影片輸入，脈絡長度 100 萬 token，單次輸出上限 6.4 萬 token，跟前一代 3.7 Flash 相同。這次是延伸訓練、不是全新的底層模型，這點官方模型卡寫得很清楚，沒有藏著掖著。\u003C\u002Fp>\n\u003Ch2>所以到底要不要在意\u003C\u002Fh2>\n\u003Cp>如果你只是 Google AI Pro／Ultra 訂閱戶，平常就在 Gemini App 裡問問題查資料，這次更新幾乎不用做任何事，選單切過去就是新模型，多數場景會比 3.7 Flash 更準，代價頂多是偶爾回應變慢一點。如果你是拿 API 在跑 agent、寫程式或串接固定流程的工作，3.8 Flash 目前這個價位帶確實划算，官方數字也支持「跑得動、跟旗艦打平手」的說法，但前提是任務範圍要明確。一旦換成需要長時間自主規劃、操作整個電腦環境的開放式任務，Terminal-bench 4.0 跟 OSWorld-2.0 那兩項差距擺在那，該用 Opus 5 還是得用 Opus 5，別被「打敗前沿模型」這種標題騙了只看對自己有利的那幾項分數。\u003C\u002Fp>\n",[62,66],{"id":63,"slug":64,"name":65},"a9b0fba6-ed4b-4842-b7d2-83a8ea66b1c1","ai-訂閱","AI 訂閱",{"id":67,"slug":68,"name":69},"7acbca59-6c54-4991-a5cb-7edcb88c9cee","gemini","Gemini",[],[72,86],{"id":73,"slug":74,"type":75,"title":76,"excerpt":77,"coverImageUrl":78,"contentMd":48,"categoryId":30,"categorySlug":31,"categoryName":32,"authorName":48,"status":49,"publishedAt":79,"seoTitle":80,"seoDescription":81,"ogImageUrl":78,"aiGenerated":55,"aiSourceNotes":57,"viewCount":82,"featured":55,"productsPosition":83,"unpublishedReason":48,"unpublishedAt":57,"createdAt":84,"updatedAt":85},"bb8d641f-bb40-4718-839f-49c58c2c3213","claude-fable-5-1-ai-subscription-comparison-2026","review","Claude Fable 5.1 上線：月付 20 美元的 Claude Pro 其實用不到它，三家 AI 訂閱現在該怎麼挑","Claude Fable 5.1 在 9 月 1 日上線，衝上 Hacker News 頭條，但官方文件寫明它不含在 Pro 的訂閱額度裡。這篇整理 Claude、ChatGPT、Gemini 三家在 20 美元、100 美元、200 美元各檔位的實際差異與台幣價格，給正在猶豫該續訂哪一家的人參考。","\u002Fuploads\u002F3b8b5540-eb24-4497-b25c-632493aac674.jpg","2026-09-02T05:56:45.000Z","AI 訂閱比較 2026：Claude Fable 5.1 上線後，Claude Pro、ChatGPT Plus、Gemini 該選哪個","整理 Claude Fable 5.1 的效能與價格變化，並比較 Claude Pro、ChatGPT Plus、Google AI Pro 在 20 美元檔位的旗艦模型可用性、使用限制、影像生成與台幣實際費用，附高階方案與入門方案的選擇建議。",23,"top","2026-09-02T13:30:46.089Z","2026-09-02T13:56:45.729Z",{"id":87,"slug":88,"type":75,"title":89,"excerpt":90,"coverImageUrl":91,"contentMd":48,"categoryId":30,"categorySlug":31,"categoryName":32,"authorName":48,"status":49,"publishedAt":92,"seoTitle":93,"seoDescription":94,"ogImageUrl":91,"aiGenerated":53,"aiSourceNotes":95,"viewCount":96,"featured":55,"productsPosition":56,"unpublishedReason":48,"unpublishedAt":57,"createdAt":97,"updatedAt":98},"eb635696-9591-4811-a043-4e98a5df280d","silicon-wafer-shortage-laptop-buying-guide","矽晶圓3年來首見全面漲價：記憶體大缺貨潮下，筆電手機現在該不該先買起來放","記憶體與矽晶圓罕見全面漲價，PC品牌已預告下半年調漲15%到20%。整理這波漲價的成因，還有現在CP值合理的5款筆電選擇，從文書機、電競筆電到二手Mac都有。","\u002Fuploads\u002F56f2d48a-1911-408c-823f-0b2f7ccd94a7.jpg","2026-09-01T14:46:17.015Z","矽晶圓記憶體漲價2026｜筆電手機該不該現在買？5款推薦整理","2026年DRAM合約價格單季暴漲逾50%，PC品牌預告下半年調漲15-20%。整理這波AI帶動的記憶體缺貨成因，以及Acer、MSI、MacBook Pro共5款現階段CP值合理的筆電選擇。","資料來源：TrendForce\u002FIDC相關報導（鉅亨網、富果、Mason AI Lab整理文）2026年DRAM合約價漲幅與供應成長率預測；Acer\u002FMSI\u002FApple官方商店與PChome\u002Fmyfone零售頁面查得的規格與定價（抓取時間2026-09-01）。5個蝦皮聯盟連結因IP被判定為機器人\u002F資料中心來源，商品內頁與圖片全數連不上，改用「\u002Fproduct\u002F」網址格式的\u003Ctitle>標籤取得商品名稱，再用WebSearch\u002F官方商店比對出完整規格與定價，並用官方通路的商品圖代替logoUrl。MacBook Pro那組是二手listing，賣場頁面沒標示確切晶片版本(M4\u002FM4 Pro\u002FM4 Max)，已在內文與cons誠實註明。5款商品的優缺點均為查證後撰寫，未捏造缺點。",18,"2026-09-01T22:43:15.281Z","2026-09-03T00:08:40.237Z"]