2026 年 10 月 1 日,Google 發表新一代前沿模型 Gemini 4 Argon。官方的定位很明確:這是一個為了「在複雜、長時間的工作流程中維持深度推理」而設計的模型(Google 台灣官方部落格)。這篇文章把公告裡的重點拆成五件事:它是什麼、強在哪、多少錢、誰現在能用、安全上做了什麼,讀完你可以判斷它跟自己有沒有關係。
快速重點
- 發布日期:2026 年 10 月 1 日,作者為 Google DeepMind 的 Koray Kavukcuoglu
- 最大賣點:輸出詞元上限從 6.4 萬個擴增到 100 萬個
- 程式能力:DeepSWE v1.1 得分 77.9%,官方稱為業界最先進的新紀錄
- API 價格(優惠期):每百萬輸入詞元 2 美元、輸出 10 美元;優惠期結束後為 4 美元與 20 美元
- 誰能先用:付費 API 客戶與 Google AI Ultra 訂閱者
- 網路安全相關能力:採分階段開放,先給受信任的網路防禦專家
Gemini 4 Argon 是什麼?
Gemini 4 Argon 是 Google 目前公開的最新一代 Gemini 前沿模型,重點放在「長期、多步驟」的工作,而不是單輪問答。官方說它已經改變了 Google 內部的做事方式,數千名 Google 員工在發表前就測試過,主要用在軟體工程、企業知識工作與網路安全防禦三個方向。
如果你習慣把模型想成「問一句答一句」,Argon 想解決的是另一種情境:一個任務要跑很久、中間要自己拆步驟、查資料、改錯,最後交出完整結果。這也是為什麼官方公告裡幾乎所有評測,都是「代理型」或「長任務」類的基準。
核心能力:官方公布了哪些成績?
先說明一件事:以下分數都是 Google 在公告中自行公布的結果,尚未看到獨立第三方的完整複測,參考時請抱著這個前提。

輸出上限從 6.4 萬提高到 100 萬詞元
官方寫的是把輸出詞元上限,「從先前的 6.4 萬個詞元大幅擴增至業界領先的 100 萬個詞元」。輸出上限指的是模型單次回覆最多能寫多長。對一般聊天用途影響不大,但對需要一次產出大量程式碼、長篇報告或完整文件的任務來說,不會再因為「寫到一半被截斷」而得分段處理。
要注意的是,公告裡沒有提到輸入長度(context window),所以別把「輸出 100 萬」誤讀成「能一次讀 100 萬」。
程式與軟體工程
在評估真實世界長期軟體工程任務的 DeepSWE v1.1 基準測試中,Argon 拿到 77.9%,官方形容為業界最先進的新紀錄。Google 另外列了幾個內部案例:
- 量子演算法最佳化:在特定案例中,表現比現有公開文獻的結果好 40%
- 記憶體效率:釋放超過 300 TiB 的記憶體,預估可節省 500 TiB 到 1 PiB
- C/C++ 遷移到 Rust:處理的程式碼規模從數萬行到 80 多萬行不等
- libgav1 影片解碼器:輸出品質相同,速度快 2.7 倍
這些是 Google 內部自己的專案,數字很亮眼,但外部團隊的程式碼庫能不能複製同樣的效果,要等實際使用回饋。
企業知識工作
官方表示 Argon 在 Vals 指數排名第一,涵蓋金融、法律與稅務等領域,相關評測包含:
- Vals Finance Agent v2(多步驟金融研究):榜首
- Harvey’s Legal Agent Benchmark(法律研究與草擬):榜首
- AutomationBench:51.3%,名列第一
Vals 指數與前兩項官方只說「榜首」,沒有給出具體分數。
多模態與影片理解
在評測長影片理解的 LVBench 上,Argon 拿到 91.7%。官方提到它能做圖表分析、辨識影片中的關鍵細節、分析文件內容。
網路安全
在 CWE-bench v1 測試中,Argon 拿到 68%,與最高分並列第一。官方特別拿它跟前一代的 3.8 Flash Cyber 比較,指出在涵蓋 20 種程式語言的漏洞識別上有顯著提升;在 Wiz 的黑箱滲透測試中,攻擊面探測、漏洞識別與概念驗證(PoC)生成也表現良好。
實際成果方面,官方提到透過 Wiz 的「Scan for Good」計畫,Argon 協助發現了關鍵醫療軟體的漏洞。
價格:優惠期與標準價差一倍
Gemini 4 Argon 的 API 計費分成兩個階段(單位為每百萬詞元):

| 優惠期 | 優惠期結束後(標準價) | |
|---|---|---|
| 輸入詞元 | 2 美元 | 4 美元 |
| 輸出詞元 | 10 美元 | 20 美元 |
| 快取輸入詞元 | 比一般輸入便宜 95% | 官方未另列 |
官方沒有公布優惠期的結束日期,所以如果你打算把它放進產品或長期專案,成本請直接用標準價 4 美元/20 美元估算,優惠期當作額外的好處就好。
舉個簡單的例子:假設一個任務輸入 50 萬詞元、輸出 10 萬詞元,以標準價計算約是 50 萬 ÷ 100 萬 × 4 美元 + 10 萬 ÷ 100 萬 × 20 美元 = 4 美元;優惠期則是 2 美元。這是依官方單價做的試算,實際花費會受快取命中率與任務重試次數影響。
想先搞懂詞元是怎麼算的,可以參考站內的 什麼是 Token?搞懂 ChatGPT 記憶限制與對話額度 一文。
誰現在能用?
官方原文是:Gemini 4 Argon「將率先開放給付費 API 客戶與 Google AI Ultra 訂閱者使用」。換句話說,免費版使用者短期內大概輪不到。
另外有兩點要分開看:
- 一般功能:付費 API 客戶與 Google AI Ultra 訂閱者優先。公告沒有提到 Gemini App 或 Vertex AI 的具體開放時程,這部分我們不猜,等 Google 更新再補。
- 網路安全相關能力:採分階段推出,先開放給透過「Fairwind」計畫認定的受信任網路防禦專家,正式廣泛推出前會繼續收集早期測試者回饋,並調整安全防護機制。
安全機制:官方列了四道防線
因為 Argon 的資安能力很強,Google 在安全面著墨不少,分成四個層面:
- 防濫用:依循 Google 的《前沿安全架構》,拒絕有害請求,但保留合法的軍民兩用研究空間
- 防提示注入:特別強化對「間接提示注入」的防禦,官方稱在 Gray Swan IPI 基準測試中領先業界
- 未對齊監控:監看模型的思維鏈與行動,必要時中止執行
- 系統強化:改進沙盒環境的隔離,並強化代理程式的安全性
此外,Google 表示正與美國政府合作,進行自願性的安全評估,在廣泛推出前先強化防護。官方也呼籲整個業界保持對模型推理過程的可見性,才有機會及早發現並修正未對齊的行為。
一般使用者該怎麼看這次發表?
整理成三種人的判斷方式:
- 一般聊天、寫文案、查資料的人:短期內不用急。Argon 優先開放給付費 API 與 Ultra 訂閱者,而且主打的長任務能力,日常問答感受不明顯。
- 開發者、做自動化流程的人:值得先試。輸出上限提高、DeepSWE 成績亮眼,對長任務、大型重構最有感,價格也相對明確,記得用標準價估成本。
- 做資安或企業知識工作的團隊:留意 Fairwind 計畫與後續開放資訊,這兩塊是官方重點著墨的方向。
也想看看同期其他旗艦模型怎麼選,可以接著讀 GPT-6 Astra 全面解析。
常見問題 FAQ
Gemini 4 Argon 是什麼時候發布的?
Google 在 2026 年 10 月 1 日於官方部落格發表 Gemini 4 Argon,目前採分階段開放。
Gemini 4 Argon 和前一代差在哪?
最明確的差異是輸出詞元上限從 6.4 萬個提高到 100 萬個。官方也拿它跟前代 3.8 Flash Cyber 比較,指出網路安全能力顯著提升;公告沒有提供其他前代模型的逐項對照。
Gemini 4 Argon 要多少錢?
API 優惠期為每百萬輸入詞元 2 美元、輸出 10 美元;優惠期結束後為輸入 4 美元、輸出 20 美元。快取輸入詞元比一般輸入便宜 95%。官方未公布優惠期結束日。
免費使用者可以用 Gemini 4 Argon 嗎?
官方說明會率先開放給付費 API 客戶與 Google AI Ultra 訂閱者,沒有提到免費版的開放時程。
Gemini 4 Argon 的 DeepSWE 分數是多少?
DeepSWE v1.1 基準測試為 77.9%,官方稱這是業界最先進的新紀錄。
這些評測分數可信嗎?
分數來自 Google 官方公告,屬於廠商自行公布;建議等獨立第三方評測或實際使用回饋出來後,再綜合判斷。
Gemini 4 Argon 的 context window 有多大?
官方公告沒有提到輸入長度。公告中的 100 萬是「輸出詞元上限」,不是輸入長度。
延伸閱讀



