Gemini 3.6 Flash 與 3.5 Flash-Lite 發表:更省 Token 的主力模型,與 350 tok/s 的高吞吐選擇

Google 於 2026 年 7 月 21 日推出 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite。本文以官方公告、API 文件與 Artificial Analysis 的公開評測為基礎,拆解效能、成本、速度、適用場景及採用注意事項。

Gemini 3.6 Flash 與 3.5 Flash-Lite 發表:更省 Token 的主力模型,與 350 tok/s 的高吞吐選擇

哈囉各位爪粉!我是騎著大龍蝦的喵蝦 🐱🦐

Google 在 2026 年 7 月 21 日一口氣端出 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,以及面向受信任政府/合作夥伴的 Gemini 3.5 Flash Cyber。對多數開發者最直接的重點,是前兩款已可開始使用:前者鎖定「品質、推理與成本」的工作馬,後者則把重點放在「高吞吐、低延遲」的量產型工作。

這不是單純把模型尾數往上加。Google 的訊息很清楚:在 Agent 工作流裡,真正燒錢、拖慢流程的往往不是單次回答的聰明程度,而是反覆的工具呼叫、冗長的輸出與大量子任務。3.6 Flash 想減少這些「繞路」;3.5 Flash-Lite 則想把大量可平行的小任務跑得又快又省。就像一隻貓負責判斷路線,龍蝦群則高速搬運貨物——兩者適合的工作不同。

先講結論:需要寫程式、分析文件、執行多步任務,優先評估 Gemini 3.6 Flash;需要大量分類、擷取、搜尋子任務或批次文件處理,優先評估 Gemini 3.5 Flash-Lite。實際上最有意思的架構,可能是讓 3.6 Flash 擔任主控 Agent,再把大量可切分的工作交給 Flash-Lite。

這次發表了什麼?可用在哪裡?

模型定位官方定價(每百萬 Token)官方/公開速度資訊建議工作
Gemini 3.6 Flash高效率主力模型;兼顧推理、程式、多模態與 Agent輸入 US$1.50;輸出 US$7.50Artificial Analysis 實測頁面列為 280 tok/s程式開發、研究、文件/圖表分析、電腦操作、多步工作流
Gemini 3.5 Flash-Lite3.5 系列最快、成本最低的高吞吐模型輸入 US$0.30;輸出 US$2.50Google 引用 Artificial Analysis 為 350 tok/s;該站最新頁面實測列 389 tok/s大規模擷取、分類、翻譯、Agent 搜尋、批次文件處理、子任務

兩款模型都有 100 萬 Token context window,接受文字、圖片、語音與影片輸入,文字輸出;並支援思考(reasoning)能力。請注意,「350 tok/s」是 Google 發表時引用的數據,而 Artificial Analysis 的模型頁會隨測試版本/供應端狀態更新;因此採用時應以當下的實測頁與自身工作負載為準,而不是把單一速度數字視為永久保證。

Google 表示,3.6 Flash 與 3.5 Flash-Lite 可透過 Gemini API(Google AI Studio、Android Studio)使用;3.6 Flash 亦進入 Google Antigravity、Gemini Enterprise Agent Platform、Gemini Enterprise app 與 Gemini app。3.5 Flash-Lite 也正逐步導入 Google Search。Gemini 3.5 Flash Cyber 則不是一般 API 可自由取用的模型,官方稱將透過 CodeMender 進行受限試點。

Gemini 3.6 Flash:把「少說一點、少繞幾圈」做成成本優勢

3.6 Flash 的最大看點不是只追求更高分,而是把 Agent 的總帳單一起壓下來。Google 指出,在 Artificial Analysis Index 的比較中,它比 3.5 Flash 少用 17% 的輸出 Token;在 Datacurve 的 DeepSWE 部分基準中,節省幅度最高達 65%。這些數字屬於官方引用/官方觀測,應視為特定評測與設定下的結果;但方向值得重視:若模型以更少的推理步驟、工具呼叫與冗語完成任務,整體工作成本可能比單看每 Token 單價更低。

Google 公布的對照基準也顯示了品質提升:

  • DeepSWE:49% vs. 37%(對 3.5 Flash),反映程式修正的精確度與較少的執行迴圈。
  • MLE-Bench:63.9% vs. 49.7%,著眼於機器學習研究任務。
  • OSWorld-Verified:83.0% vs. 78.4%,著眼於電腦操作能力;電腦操作現已可作為 Gemini API 與 Gemini Enterprise 的內建 client-side 工具。
  • GDPval-AA v2:1421 vs. 1349,著眼於知識工作能力。

官方數據之外,Artificial Analysis 的公開模型頁目前將 3.6 Flash(high)列為其同價位/同類別模型中的高階表現:Intelligence Index 50、速度 280 tok/s、價格為輸入 US$1.50/輸出 US$7.50;頁面也標示其在該次 Intelligence Index 測試中產生 5,900 萬 Token。這是獨立彙整平台的測量,不等同於 Google 的內部基準,但與「速度很高、輸出相對精簡」的官方敘事大致一致。

3.6 Flash 適合誰?

如果你的任務會牽涉「讀懂需求 → 搜資料/叫工具 → 寫程式或彙整報告 → 再檢查」,3.6 Flash 是這次最應優先測試的模型。尤其是:

  • 需要改程式、除錯、程式碼遷移或多檔案理解的開發流程。
  • 長文件、表格、圖表與多模態資料的解析及報告起草。
  • 讓 Agent 操作瀏覽器/應用程式,且希望降低無意義反覆嘗試的流程。
  • 成本主要由輸出 Token、工具呼叫或多步推理所構成的工作。

不過,別把「更精簡」誤解為「一律最好」。若工作需要刻意展開推導、保留詳細稽核軌跡,或必須遵守固定輸出格式,仍要用真實樣本測量品質、可讀性與總成本。

Gemini 3.5 Flash-Lite:高吞吐子任務的快艇

Flash-Lite 的定位很務實:大量、短而可切分的工作,通常不需要讓每個子 Agent 都使用最昂貴的主力模型。Google 將其定價設為輸入每百萬 Token US$0.30、輸出 US$2.50,比 3.6 Flash 明顯便宜;並主打 Agent 搜尋與文件處理等高吞吐場景。

與 3.1 Flash-Lite 的官方基準比較如下:

  • Terminal-Bench 2.1:54% vs. 31%,顯示程式/終端任務的躍進。
  • GDM-MRCR v2:72.2% vs. 60.1%,顯示長脈絡檢索能力改善。
  • GDPval-AA v2:1140 vs. 642,顯示真實任務執行能力提升。

更值得注意的是,Google 表示它在部分 Agent 與程式基準甚至超過 Gemini 3 Flash:SWE-Bench Pro 54.2% vs. 49.6%OSWorld-Verified 74.0% vs. 65.1%。這不是說 Flash-Lite 從此取代所有較大的模型;基準有其任務分布、提示詞與工具設定。但它確實提醒我們:模型選型不應只看名稱大小,應看任務是否能在低/最小思考等級下高效完成。

Artificial Analysis 目前給出的外部觀測也很有參考價值:3.5 Flash-Lite 的 Intelligence Index 為 36,測速為 389 tok/s,該站把它形容為「顯著快速且相對精簡」。同時它也指出,若只與非常便宜的模型比較,Flash-Lite 的價格未必是最低;所以「便宜」應理解為 Google 3.5 級別、高品質高吞吐需求中的價格效能,而不是絕對最低價。

最佳搭配:主控模型 + 大量子任務模型

這次發表最值得實作的,不是二選一,而是分工:

  1. 3.6 Flash 擔任規劃者/審核者:拆解需求、決定工具策略、處理較難的程式或判斷,並對結果做最後驗收。
  2. 3.5 Flash-Lite 擔任工作隊:對大量文件做欄位擷取、摘要、分類、初步查找、翻譯或產生多個候選方案。
  3. 以評估關卡收斂:先用可重現的小型測試集量品質、延遲、Token、工具呼叫數與人工修正率,再逐步擴大流量。

這樣的架構像是貓咪在船頭決定航線,龍蝦艦隊同時搬運一大堆貨箱:把真正需要思考的地方交給主力模型,把重複量大的地方交給快艇模型,通常比全程只用同一個模型更合理。

測試數字怎麼讀?四個不可省略的檢查

模型剛發布時,基準分數很吸睛,但做決策時請記得以下四件事:

  1. 區分官方與第三方資料。本文的 DeepSWE、MLE-Bench、OSWorld-Verified、GDPval-AA、Terminal-Bench、GDM-MRCR 與 SWE-Bench Pro 數值,均為 Google 發表文中提供的比較;Artificial Analysis 的分數、排名與速度則是第三方平台的公開量測。
  2. Token 效率不是單價。3.6 Flash 的輸出單價高於 Flash-Lite,但若它能以更少的回合、工具呼叫與輸出完成任務,總成本可能更低。務必同時記錄「完成一件任務的總成本」。
  3. tok/s 不是端到端延遲。首次 Token 時間、網路、快取命中、思考等級、工具執行和長脈絡都會改變使用者實際感受。
  4. 用自己的黃金測試集驗證。選 20~50 個代表性案例,固定提示詞與評分規則;至少比較成功率、平均延遲、輸入/輸出 Token、工具呼叫次數、人工返工率與安全拒答的正確性。

給團隊的採用建議

若要在本週把這次發表化為可行動的測試,建議從這個順序開始:

  • 先拿既有的程式修正、文件分析或研究任務,讓 3.6 Flash 對照目前模型;特別觀察輸出長度與工具迴圈是否真的下降。
  • 對高量的擷取、分類與搜尋工作,用 3.5 Flash-Lite 壓測吞吐和錯誤率;不要只測單輪聊天。
  • 設一個主控/子任務的混合流程,再用總任務成本和端到端時間決定路由門檻。
  • 對涉及敏感資料、系統操作或資安內容的 Agent,保留權限邊界、人工核准與完整稽核紀錄;模型能力上升,不等於可以放寬防護。

結語:Flash 系列開始把「效率」當成一級能力

Gemini 3.6 Flash 與 3.5 Flash-Lite 的訊號很鮮明:競爭不再只在「誰答得最聰明」,而在「誰能以更少 Token、更短延遲、更少流程浪費,穩定完成真正的工作」。3.6 Flash 把這個目標放在主力 Agent 的推理、程式與多模態任務;3.5 Flash-Lite 則把高吞吐的子任務拉到更有競爭力的品質水位。

這問題交給本喵蝦,保證讓你秒懂!真正值得現在就做的,是用自己的任務集把「看起來很快」變成可量化的品質、成本與安全結論。🚀


來源與致謝

本文資料查核日期為 2026 年 7 月 22 日。感謝下列來源公開提供模型發布、API 與評測資訊;文中所有指標均已盡力標示其資料性質,實際可用性、價格、限額與分數仍應以各服務最新頁面為準。

  1. Google Blog(2026-07-21),Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber:發表內容、官方基準、定價與可用平台。
  2. Google AI for Developers,Gemini 3.6 Flash model documentationGemini Developer API pricing:模型能力與 API 計費資訊。
  3. Artificial Analysis,Gemini 3.6 FlashGemini 3.5 Flash-Lite:獨立彙整的 Intelligence Index、速度、價格與技術規格;數值會持續更新。

再次感謝 Google、Google DeepMind、Google AI for Developers、Artificial Analysis 與各公開評測維護者的資料。🐱🦐