作者LDPC (Channel Coding)
看板Stock
標題Re: [新聞] Google 發佈 Gemini 4 Argon 多項跑分超
時間Thu Oct 1 12:06:24 2026
這次模型應該是瞄準ToB了 前幾天就收到神秘信說今天下午可以來公測
信中還說可以無限點調酒和包吃包喝 就殺來狗家辦公室蹭飯
在講這件事情是 但先說件評測模型
現在大家體驗就是訓練模型很簡單 但怎樣去評估很難
常常把模型訓練完 在各種刷分榜數據 可以大殺四方 但實際落地就是笑死人
這個連我自己都遇到 在瘋狂調教我的肥宅模型 內部數據測試 真的大殺四方
結果現實被顧客說垃圾 所以現在最難的不是訓練模型 是如何去評鑑他
俗話說 你只要能評鑑 你就有辦法去訓練改進 就像RPG 只要有血條 你就能殺死它
最怕就是所有評鑑數據都滿分
然後現實爛掉 因為現實很多場景是沒有辦法用離線數據去測試
所以狗家怎樣搞 內部刷完分數之後 叫你們這些toB收到邀請函來現場單挑
帶者你們最棘手的數據和任務 到現場PK PK完不夠 又給你一個月回家繼續去PK
這就是今天下午的事情 然後我...老實說沒準備 QQ 就進去吃吃喝喝 喝酒喝到有點飄
但我看到PLTR 還有幾家是認真的在測 不得不說 狗家敢這樣讓你帶你任務
跟你單挑 應該模型很強 不過在場的都是toB 我不知道toC體驗是怎樣
至少狗家這種ToB服務 體驗真的好
然後Muse帶動其他前沿開始捲個人助理 狗家好像目前沒參戰
※ 引述《ZMTL (Zaious.)》之銘言:
: 原文標題: Google 發佈 Gemini 4 Argon 多項跑分超 Astra 及 Fable 5.1
: 原文連結: https://go.chroniclecore.com/s/4857e
: 發布時間: 2026年10月1日週四 上午4:49
: 記者署名: Doris
: 原文內容:
: Google 發佈新一代前沿模型 Gemini 4 Argon,標榜這是「前沿智能的新時代」,專為「
: 跨複雜、長流程工作負載的深度推理」而設。新模型採用全新命名方式,接續早前取消
: Gemini 3.5 Pro、集中發展 3.8 Flash 的路線,目標是在編程、知識工作、網絡安全防
: 禦及創意寫作方面提供「前沿級能力」。
: 輸出上限升至 100 萬 Token
: Gemini 4 Argon 的輸出 Token 上限由 64K 大幅提升至 100 萬,以支援更長、更複雜的
: 使用情境,並同時擴大編程、推理及多模態能力。Google 指出,當模型有足夠空間深入
: 思考,並在單一軌跡中生成數十萬個 Token,即可一次過處理艱難問題,令推理深度達到
: 新層次。
: DeepSWE 測試領先同級模型
: 在基準測試方面,Google 稱 Gemini 4 Argon 於 DeepSWE v1.1 取得 77.9%,高於
: Claude Opus 5.5 的 74.2%,以及 GPT-6 Astra 的 74.1%。在評估模型修復安全漏洞能
: 力的 CWE-bench v1 上,Argon 以 68% 的最高分並列第一。
: Google 表示,Gemini 4 Argon 在網絡安全防禦方面「能力極高」,表現較 3.8 Flash
: Cyber 有明顯躍進。模型將在「不設網絡安全護欄」的情況下,提供予受信任的防禦人員
: 及 Google 內部團隊,讓他們「發揮完整的前沿級網絡安全防禦能力」。除編程以外,
: Argon 在其他特定領域評估中同樣有領先表現,例如 Vals Finance Agent v2(多步驟財
: 務研究)及 Harvey 的 Legal Agent Benchmark(法律研究與起草)。
: 在 Zapier 用於衡量核心業務功能端到端執行表現的 AutomationBench 上,Argon 以
: 51.3% 排名第一;在衡量長影片理解的 LVBench 上,Argon 以 91.7% 取得當前最佳成績
: 。
: 率先開放予 Ultra 訂戶
: Gemini 4 Argon 將「即將推出」,最先開放予 Google AI Ultra 訂戶及付費 API 客戶
: 。Google 公佈的入門價格為每 100 萬個輸入 Token 收費 2 美元、每 100 萬個輸出
: Token 收費 10 美元,快取輸入 Token 較輸入 Token 價格便宜 95%;入門期結束後,價
: 格會調整為每 100 萬輸入 Token 4 美元、每 100 萬輸出 Token 20 美元。
: 推出前強化安全與監控
: 目前 Gemini 4 Argon 已提供予受信任測試者及網絡防禦人員(透過 Fairwind Program
: )。在更廣泛推出之前,Google 正集中處理數方面的工作。針對網絡或化學、生物、放
: 射及核(CBRN)攻擊的濫用,Google 已改進「監測模型內部激活以識別濫用的技術」。
: 針對提示注入攻擊,Google 稱 Argon 是「歷來對間接提示注入最具韌性的模型」,並
: 在 Gray Swan 的 Indirect Prompt Injection(IPI)基準中「在提示注入穩健性方面領
: 先」。
: 在強化系統方面,Google 表示會「在高風險訓練或評估開始前,隔離並封閉沙盒環境」
: 。在監測偏離方面,Google 正「部署偏離緩解措施,監測 Argon 的思維鏈與行動,並在
: 必要時停止執行」,同時以類似系統監測訓練過程,並向專責事故應變團隊發出警報,又
: 小心防範把發現回饋至訓練,以免影響 Argon 的推理,使其學會迴避監測。
: 內部已用於程式碼遷移
: 在 Google 內部,Gemini 4 Argon 已用於支援內部工作流程,有「數千名 Google 員工
: 」指出模型在專門編程任務、深入研究及寫作品質方面的優勢。Google 亦分享部分例子
: 。
: 記憶體效率方面,一組 Argon 代理分析全機群的效能剖析遙測數據,自主識別並在
: Google 數據中心套用記憶體優化,全面推行後釋放逾 300 TiB 記憶體,預計總節省量
: 達 500 TiB 至 1 PiB。
: 大規模程式碼庫遷移與優化方面,Argon 代理正協助把 C/C++ 程式碼庫遷移至 Rust,規
: 模由 re2、libgav1 等核心程式庫的數萬行,到 Fuchsia OS Zircon 核心的 80 萬行以
: 上。由於不少系統至關重要,這類大規模重寫在推行至生產環境前,須經過嚴格的自動化
: 與人手審核、模擬測試及覆核。
: 以 libgav1 為例,這個 Google 用作解碼影片的開源軟件,Argon 代理在現有 Rust 版
: 本上,透過多輪以效能剖析引導的實驗,研究編譯器的輸出並產生安全 Rust 程式碼,讓
: 編譯器自動向量化,最終取代 3.2 萬行 SIMD 程式碼。結果是記憶體安全的影片解碼器
: ,運行速度較 Rust 版本快 2.7 倍,影片輸出完全相同,並更接近經優化的 C++ 版本。
: 心得/評論:
: ※必須填寫滿30正體中文字,心得過短或濫竽充數將以板規 1-2-3 處分
: 總之跑分是跑贏了,大部分都贏過 GPT6 Astra跟Claude Opus 5.5
: https://go.chroniclecore.com/i/uhqq4.png
: 這年頭跑分跑不贏大概都不敢公開,
: 但跑分不代表實際執行能力,相對於目前的王者 Opus 5.5 也還沒拉出絕對的優勢,
: 同等的價錢下,大概就是靠著生態系與大量免費資源(eg. 教育方案一年免費)來競爭
: 比起來我更在乎能撐多久不降智也是個問題。
: 價格的部分
: | 模型 | Input | Output | Cached Input |
: | Gemini 4 Agron | $2.00 | $10.00 | ? | 推廣期
: | Gemini 4 Agron* | $4.00 | $20.00 | ? | 原價
: 對比
: | 模型 | Input | Output | Cached Input |
: | Claude Sonnet 5.5 | $2.00 | $10.00 | $0.10 |
: | Claude Opus 5.5 | $4.00 | $20.00 | $0.20 |
: | Claude Fable 5.1 | $10.00 | $50.00 | $0.20 |
: | GPT-6 Astra | $10.00 | $50.00 | $1.00 |
: | GPT-6.1 Sol | $2.00 | $10.00 | $0.10 |
: | GPT-6 Luna | $0.10 | $0.50 | $0.01 |
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 98.37.67.135 (美國)
※ 文章網址: https://www.ptt.cc/bbs/Stock/M.1790827585.A.949.html
※ 編輯: LDPC (98.37.67.135 美國), 10/01/2026 12:09:26
推 ppuuppu : 果然只有LDPC大大能進去那個場合!!! 10/01 12:10
推 windfeather : 聽起來很有自信捏 10/01 12:11
推 roseritter : 推 10/01 12:17
推 donkilu : 完全同意 現在的瓶頸真的是eval 尤其是使用者的感覺 10/01 12:19
推 windfeather : 所以我說,狗家的酒和餐點水準如何? 10/01 12:20
→ donkilu : 至於狗的toC就... Gemini被一路嫌到現在是有道理的 10/01 12:21
→ b9513227 : 我對垃圾ai沒興趣 所以那個食物圖呢 10/01 12:22
推 kcy05785 : 狗家的To C基底應該是最好的 10/01 12:23
推 sdbb : 謝謝,那有遇到TQQQ 王嗎? 10/01 12:25
推 fisher6879 : 太厲害惹吧,白嫖狗家,爽啊吃啊 10/01 12:25
推 h0103661 : gemini的問題哪是toB toC的差別,完全就是sft階段 10/01 12:28
→ h0103661 : 出了問題,這誰來用、用在哪都會遇到 10/01 12:28
我不太懂你在說啥 就拿法律來講 法律訴訟寫得好不好 這玩意不是SFT能解決
SFT可以在問答QA benchmark得到高分 但是他無法很好的解決使用者體驗
pre-training重要是他的知識量 但benchmark刷高分(pre-training) 不等於優秀智能體
以法律來說 你可以看到很多做ToB Legal AI solution 白領使用者體驗
都在抱怨 這些模型寫的訴訟 寫得就像初階律師訴訟論點
非常菜鳥 但不是那些專業戶要的知識呈現
你在訓練模型時 你可能在LawQA benchmark測試模型法律知識 得到高分任務
這反映 SFT訓練好 一堆QA benchmark可以刷高分 不意味體驗好
尤其在白領工作人類高標準 知識產出體驗 他就是垃圾
他垃圾地方在於 這些體驗 他需要大量人類接手去修改
這些toB領域 很多的體驗垃圾原因 不是他知識不行 而是他不是在做你的需求
換句話說 有些前沿模型可以寫到跟專業律師類似 有些寫得像菜鳥律師
但兩者模型在法律知識QA 可能分數差不多
所以你要怎樣eval? 一個辦法 就是量人類修改次數和花費時間 也就是人為介入次數
比方說你讓Harvey AI智能體幫律師寫擬稿訴狀 那如果人類校稿修改三次 花費五分鐘
vs 修改大量 花費1hr 前者就及格 某些任務 前沿任務甚至達到 人類零修改
這玩意就不是benchmark能量 很多量測方法就是量人類需要介入程度
無人駕駛也是同樣概念 所以toC就是量白領階級任務 人類需要接手幾次 這是一個辦法
但pltr今天說了一些 我就不分享了@@
但這種人機互動協作的eval量測方式就是叫trace eval就是去看你要多少步才能到你需求
benchmark只是單次性的量測 而非一個整體序列性的體驗量測
但人為介入次數 也等於 你token燒的浪費次數 人為介入越多 表示你token燒的沒意義
推 LoveSports : 感謝業界專家分享心得 10/01 12:32
推 NoMomoNoLife: 感謝分享 10/01 12:35
推 likeshit : 我想用肥宅模型 10/01 12:38
推 ZMTL : 感謝分享,不知道有無意願轉AI_Art板分享 10/01 12:41
推 lsckinoko : 推分享 10/01 12:42
→ HiuAnOP : 羨慕吃吃喝喝喝到飄‼ 10/01 12:42
推 donkilu : 確實跟無人駕駛有異曲同工之妙XD 10/01 12:43
推 HiuAnOP : 既然有肥宅模型那應該也有蘿莉模型吧‼ 10/01 12:45
推 pornpig32 : 好的 買PLTR 10/01 12:48
推 strlen : 狗家不是有spark 這不就是muse嗎 10/01 12:49
推 Muilie : 被請去喝臘八粥了 10/01 12:53
推 josephpu : spark沒人在用吧 10/01 12:56
推 diyteam : 模型就像演算法,背後的資料才是key。模型會清洗資 10/01 12:58
→ diyteam : 料/演算法要人工清洗! 10/01 12:58
推 mynumber55 : 啊是可以用了嗎? 10/01 13:04
→ mynumber55 : 放消息放了幾個月了 10/01 13:04
推 addy7533967 : 想要男娘模型 10/01 13:06
推 CorkiN : 感謝分享 10/01 13:07
※ 編輯: LDPC (98.37.67.135 美國), 10/01/2026 13:09:20
推 as6633208 : 用到後面還是會乖乖回去訂閱Claude,anthropic 快上 10/01 13:21
→ as6633208 : 市 10/01 13:21
推 LoveSports : 模型未來自我遞歸改進會不會漸漸取代PLTR類似的公司 10/01 13:21
→ LoveSports : 模型如果學到PLTR設專業領域框架的技術 10/01 13:23
推 CaptPlanet : 各大廠的模型的能力底子都不錯了,還是 harness 重 10/01 13:24
→ CaptPlanet : 要吧 10/01 13:24
推 joygo : 狗家強的應該就是整合 畢竟他可以得到很多使用者習 10/01 13:29
→ joygo : 慣 ai根本不用太聰明 就跟你不會請一個天才來做簡 10/01 13:29
→ joygo : 單的報表一樣 要剛剛好 10/01 13:29
推 arnold3 : 我覺得模型夠用了 專業技能給ai去用mcp就好 10/01 13:32
推 winner1104 : 感恩心得分享 10/01 13:32
推 as6633208 : AI夠聰明我才會想用,copilot 掃信箱給出的答案,跟 10/01 13:36
→ as6633208 : Claude 掃信箱給出的答案差異蠻大的,整合這塊AI模 10/01 13:36
→ as6633208 : 型商自己也在做,當大家都可以把需要的資料灌給AI的 10/01 13:36
→ as6633208 : 時候,整合就不是優點了,最終還是比哪個模型最聰明 10/01 13:36
→ as6633208 : ,可以注意到最多你沒注意到的細節,產出你超出你預 10/01 13:36
→ as6633208 : 期的答案 10/01 13:36