Google 在 9 月 2 日推出 Gemini 3.8 Flash,距離 3.7 Flash 只有三週,也是六週內第三款 Flash 模型。應用程式介面(API)導入價維持每百萬輸入運算權杖(token)0.75 美元、輸出 token 3.75 美元,對已用 3.7 Flash 的團隊來說,換模型不必先接受單價上漲。
這次升級集中在長流程程式開發、自動化代理與多步推理。Google 公布的軟體工程測試 DeepSWE v1.1 顯示,3.8 Flash 的完成率已逼近更大型模型;人類最後考試驗證集(HLE-Verified)成績為 54.9%。這些數字來自官方評測,適合用來看進步方向,不能直接當成每個真實專案都會同比提升。
費用判斷不能只看每百萬 token 單價。Google 說明 3.8 Flash 面對複雜工作時會執行更多推理步驟,也可能反覆呼叫工具,因此同一個任務即使單價不變,總 token 與工具執行成本仍可能高於 3.7 Flash。大量批次分類、摘要或格式轉換若不需要最高推理強度,降低 effort,或繼續使用 3.7 Flash,反而比較容易控制預算。
對內容團隊與開發者,最實際的測法是拿既有工作流做同題 A/B:比較一次完成率、人工修正時間、總 token、工具呼叫次數與延遲。只看單題 benchmark,容易忽略模型多想幾步後省下的人工,也可能低估長代理流程累積的用量。
Google 同時推出 Gemini 3.8 Flash Cyber,專門處理弱點偵測與自動修補,但目前只透過 Fairwind 防禦者計畫提供給受信任的防禦團隊。一般開發者能直接使用的是 3.8 Flash,可從 Google AI Studio、Gemini API、Android Studio 與企業版服務開始測試。
如果現有 3.7 Flash 已穩定運作,不必只因版本號立刻全面切換。先挑最常失敗、最吃人工的長流程任務測 3.8,再用每個成功產出的總成本決定是否遷移,會比單看模型榜單更接近真實投資報酬。

