Google 在 9 月 2 日推出 Gemini 3.8 Flash,距離 3.7 Flash 只有三週,也是六週內第三款 Flash 模型。應用程式介面(API)導入價維持每百萬輸入運算權杖(token)0.75 美元、輸出 token 3.75 美元,對已用 3.7 Flash 的團隊來說,換模型不必先接受單價上漲。

這次升級集中在長流程程式開發、自動化代理與多步推理。Google 公布的軟體工程測試 DeepSWE v1.1 顯示,3.8 Flash 的完成率已逼近更大型模型;人類最後考試驗證集(HLE-Verified)成績為 54.9%。這些數字來自官方評測,適合用來看進步方向,不能直接當成每個真實專案都會同比提升。

Google 公布的 Gemini 3.8 Flash 與其他模型評測比較表
Google 公布的 Gemini 3.8 Flash 與其他模型評測比較表

費用判斷不能只看每百萬 token 單價。Google 說明 3.8 Flash 面對複雜工作時會執行更多推理步驟,也可能反覆呼叫工具,因此同一個任務即使單價不變,總 token 與工具執行成本仍可能高於 3.7 Flash。大量批次分類、摘要或格式轉換若不需要最高推理強度,降低 effort,或繼續使用 3.7 Flash,反而比較容易控制預算。

Google 公布的 Gemini 3.8 Flash DeepSWE 軟體工程評測圖
Google 公布的 Gemini 3.8 Flash DeepSWE 軟體工程評測圖

對內容團隊與開發者,最實際的測法是拿既有工作流做同題 A/B:比較一次完成率、人工修正時間、總 token、工具呼叫次數與延遲。只看單題 benchmark,容易忽略模型多想幾步後省下的人工,也可能低估長代理流程累積的用量。

Google 同時推出 Gemini 3.8 Flash Cyber,專門處理弱點偵測與自動修補,但目前只透過 Fairwind 防禦者計畫提供給受信任的防禦團隊。一般開發者能直接使用的是 3.8 Flash,可從 Google AI Studio、Gemini API、Android Studio 與企業版服務開始測試。

如果現有 3.7 Flash 已穩定運作,不必只因版本號立刻全面切換。先挑最常失敗、最吃人工的長流程任務測 3.8,再用每個成功產出的總成本決定是否遷移,會比單看模型榜單更接近真實投資報酬。

資料來源:Google 官方發布Ars TechnicaThe VergeAndroid Authority

← 返回研製所首頁