作者ZMTL (Zaious.)
看板Stock
標題[新聞] Google 發佈 Gemini 4 Argon 多項跑分超
時間Thu Oct 1 05:31:23 2026
原文標題: Google 發佈 Gemini 4 Argon 多項跑分超 Astra 及 Fable 5.1
原文連結: https://go.chroniclecore.com/s/4857e
發布時間: 2026年10月1日週四 上午4:49
記者署名: Doris
原文內容:
Google 發佈新一代前沿模型 Gemini 4 Argon,標榜這是「前沿智能的新時代」,專為「
跨複雜、長流程工作負載的深度推理」而設。新模型採用全新命名方式,接續早前取消
Gemini 3.5 Pro、集中發展 3.8 Flash 的路線,目標是在編程、知識工作、網絡安全防
禦及創意寫作方面提供「前沿級能力」。
輸出上限升至 100 萬 Token
Gemini 4 Argon 的輸出 Token 上限由 64K 大幅提升至 100 萬,以支援更長、更複雜的
使用情境,並同時擴大編程、推理及多模態能力。Google 指出,當模型有足夠空間深入
思考,並在單一軌跡中生成數十萬個 Token,即可一次過處理艱難問題,令推理深度達到
新層次。
DeepSWE 測試領先同級模型
在基準測試方面,Google 稱 Gemini 4 Argon 於 DeepSWE v1.1 取得 77.9%,高於
Claude Opus 5.5 的 74.2%,以及 GPT-6 Astra 的 74.1%。在評估模型修復安全漏洞能
力的 CWE-bench v1 上,Argon 以 68% 的最高分並列第一。
Google 表示,Gemini 4 Argon 在網絡安全防禦方面「能力極高」,表現較 3.8 Flash
Cyber 有明顯躍進。模型將在「不設網絡安全護欄」的情況下,提供予受信任的防禦人員
及 Google 內部團隊,讓他們「發揮完整的前沿級網絡安全防禦能力」。除編程以外,
Argon 在其他特定領域評估中同樣有領先表現,例如 Vals Finance Agent v2(多步驟財
務研究)及 Harvey 的 Legal Agent Benchmark(法律研究與起草)。
在 Zapier 用於衡量核心業務功能端到端執行表現的 AutomationBench 上,Argon 以
51.3% 排名第一;在衡量長影片理解的 LVBench 上,Argon 以 91.7% 取得當前最佳成績
。
率先開放予 Ultra 訂戶
Gemini 4 Argon 將「即將推出」,最先開放予 Google AI Ultra 訂戶及付費 API 客戶
。Google 公佈的入門價格為每 100 萬個輸入 Token 收費 2 美元、每 100 萬個輸出
Token 收費 10 美元,快取輸入 Token 較輸入 Token 價格便宜 95%;入門期結束後,價
格會調整為每 100 萬輸入 Token 4 美元、每 100 萬輸出 Token 20 美元。
推出前強化安全與監控
目前 Gemini 4 Argon 已提供予受信任測試者及網絡防禦人員(透過 Fairwind Program
)。在更廣泛推出之前,Google 正集中處理數方面的工作。針對網絡或化學、生物、放
射及核(CBRN)攻擊的濫用,Google 已改進「監測模型內部激活以識別濫用的技術」。
針對提示注入攻擊,Google 稱 Argon 是「歷來對間接提示注入最具韌性的模型」,並
在 Gray Swan 的 Indirect Prompt Injection(IPI)基準中「在提示注入穩健性方面領
先」。
在強化系統方面,Google 表示會「在高風險訓練或評估開始前,隔離並封閉沙盒環境」
。在監測偏離方面,Google 正「部署偏離緩解措施,監測 Argon 的思維鏈與行動,並在
必要時停止執行」,同時以類似系統監測訓練過程,並向專責事故應變團隊發出警報,又
小心防範把發現回饋至訓練,以免影響 Argon 的推理,使其學會迴避監測。
內部已用於程式碼遷移
在 Google 內部,Gemini 4 Argon 已用於支援內部工作流程,有「數千名 Google 員工
」指出模型在專門編程任務、深入研究及寫作品質方面的優勢。Google 亦分享部分例子
。
記憶體效率方面,一組 Argon 代理分析全機群的效能剖析遙測數據,自主識別並在
Google 數據中心套用記憶體優化,全面推行後釋放逾 300 TiB 記憶體,預計總節省量
達 500 TiB 至 1 PiB。
大規模程式碼庫遷移與優化方面,Argon 代理正協助把 C/C++ 程式碼庫遷移至 Rust,規
模由 re2、libgav1 等核心程式庫的數萬行,到 Fuchsia OS Zircon 核心的 80 萬行以
上。由於不少系統至關重要,這類大規模重寫在推行至生產環境前,須經過嚴格的自動化
與人手審核、模擬測試及覆核。
以 libgav1 為例,這個 Google 用作解碼影片的開源軟件,Argon 代理在現有 Rust 版
本上,透過多輪以效能剖析引導的實驗,研究編譯器的輸出並產生安全 Rust 程式碼,讓
編譯器自動向量化,最終取代 3.2 萬行 SIMD 程式碼。結果是記憶體安全的影片解碼器
,運行速度較 Rust 版本快 2.7 倍,影片輸出完全相同,並更接近經優化的 C++ 版本。
心得/評論:
※必須填寫滿30正體中文字,心得過短或濫竽充數將以板規 1-2-3 處分
總之跑分是跑贏了,大部分都贏過 GPT6 Astra跟Claude Opus 5.5
https://go.chroniclecore.com/i/uhqq4.png
這年頭跑分跑不贏大概都不敢公開,
但跑分不代表實際執行能力,相對於目前的王者 Opus 5.5 也還沒拉出絕對的優勢,
同等的價錢下,大概就是靠著生態系與大量免費資源(eg. 教育方案一年免費)來競爭
比起來我更在乎能撐多久不降智也是個問題。
價格的部分
| 模型 | Input | Output | Cached Input |
| Gemini 4 Agron | $2.00 | $10.00 | ? | 推廣期
| Gemini 4 Agron* | $4.00 | $20.00 | ? | 原價
對比
| 模型 | Input | Output | Cached Input |
| Claude Sonnet 5.5 | $2.00 | $10.00 | $0.10 |
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 |
| Claude Fable 5.1 | $10.00 | $50.00 | $0.20 |
| GPT-6 Astra | $10.00 | $50.00 | $1.00 |
| GPT-6.1 Sol | $2.00 | $10.00 | $0.10 |
| GPT-6 Luna | $0.10 | $0.50 | $0.01 |
--
AI_Art 生成式AI板 歡迎各方前來討論生成式AI相關議題!
──────────
◆ 從 Human-in-the-Loop → Human-AI Symbiosis (人機共生) ◆
LinkedIn:
https://www.linkedin.com/in/zaious/
GitHub :
https://github.com/Zaious
白皮書 :
https://github.com/Zaious/ChronicleCore-Architecture
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 125.228.55.14 (臺灣)
※ 文章網址: https://www.ptt.cc/bbs/Stock/M.1790803887.A.768.html
※ 編輯: ZMTL (125.228.55.14 臺灣), 10/01/2026 05:31:45
※ 編輯: ZMTL (125.228.55.14 臺灣), 10/01/2026 05:33:25
推 uoho : gg估狗 10/01 05:35
推 losage : 垃圾又要來騙訂閱了 10/01 05:49
推 darkangel119: 去年付費的一樣被當韭菜割 10/01 06:00
推 Scion : Gemini是目前用過最懶惰的AI,能躲就躲,一堆事情都 10/01 06:01
→ Scion : 假裝自己不會,要一直逼才會做 10/01 06:01
→ Scion : 不過換個角度想大概也是最安全的吧... 10/01 06:01
推 jyhfang : 看看這次撐多久之後開始降低智商 10/01 06:02
→ vltw5v : 各家模型一直競爭改進 不錯啊 造福的都是使用者 10/01 06:16
推 jason168 : 快樂龍進化了XDD 10/01 06:21
推 POWERSERIES : 阿港 10/01 06:28
推 ginhwa : 作文能力更強了 10/01 06:49
推 cutekenny : 用沒幾個月就大降智 10/01 06:55
推 Laviathan : 是驢是馬出來溜一下就知道 10/01 06:59
推 ksjr : 記憶體要崩了嗎 10/01 06:59
推 mightymouse : 阿你趕快上架啊,給人實際用就知道了,在那邊測試 10/01 07:03
→ mightymouse : 三小 10/01 07:03
推 flowheart : 幻覺不解決,跑分再高也沒意義。 10/01 07:11
→ appledick : 大家是不是互相蒸餾啊 怎麼每次一個中大突破之後 沒 10/01 07:12
→ appledick : 多久就大家都突破了 10/01 07:12
推 guky : 不要在騙人了,寫了一大堆,然後用起來很可笑 10/01 07:21
→ bnn : 大家都很熟了 跑分一定跑贏了才發布 然後降智 10/01 07:25
→ bnn : 當然幻覺什麼的請你花更多token請agent檢查囉 加錢 10/01 07:26
→ zong780405 : 跑分很好看 實際就是一坨屎 10/01 07:37
→ JH10 : 阿貢?好台的名字 10/01 07:51
推 noar : 這文章可能是gemini自己吹的 10/01 08:04
推 saito2190 : Gemini比Claude還會唬爛,還是GPT好用 == 10/01 08:05
→ aloness : 看敘述只是增加了記憶體的使用容量 10/01 08:13
→ baka1412 : 放出來再說 10/01 08:22
推 neil139 : G家智商要打折阿 10/01 08:24
推 andy79323 : 狗家三天打回智x 10/01 08:31
推 stnighter : 這文章跟測試數據肯定也是生成的 我的幻覺嘻嘻 10/01 08:31
→ BBKOX : 可以幫我肝新楓之谷了嗎? 10/01 08:31
推 DPP48 : Google賣很便宜還送網路空間,好想試試看 10/01 08:35
推 pttfrasier : 就跟手機吹跑分一樣 到一定程度就無意義了 10/01 08:41
→ tcancer : 現在賽豬公跑分新模型發佈出來也不是給窮逼用的 10/01 08:42
推 g1254501 : 傻逼龍改個名字就不是傻逼? 10/01 08:43
推 abc0922001 : 我專案留兩個issue等Gemini4出來要測試 10/01 08:44
→ windblood : 問一答一 ,往下問他就知道要回答啥 就不自己主動 10/01 08:45
推 timmer : 不用管推廣期 推廣期後模型又換了N代 10/01 08:48
推 HelloPTT : 從跑分來看claude還是最強,但gpt以下的AI慘了,現 10/01 08:53
→ HelloPTT : 在訂閱claude和gemini就夠了 10/01 08:53
推 deathoflove : gemini 無法關掉數據上傳拿去訓練 10/01 08:55
→ neilisme : 啥時再推半價啊 這次一訂訂閱 10/01 08:56
推 jack529 : 實測出來才知道,跑分模型超會唬爛好嗎 10/01 09:05
推 OhmaZiO : GOOGLE 打從要衝市占率開始 Gemini 就變笨蛋了 10/01 09:07
推 chatbra : AI工廠成批開出來,才有可能不降智 10/01 09:08
→ sezna : 瞬間降智 10/01 09:19
推 d8917936 : 知道了 10/01 09:20