測(cè):100 萬 token 輸出的「做題家」,到底能不能干活)
Gemini 4 Argon 實(shí)測(cè)100 萬 token 輸出的「做題家」到底能不能干活上一波熱點(diǎn)我追完 Astra、Computer Use、RSI、MCP 之后還寫過一篇中國大模型調(diào)用量第一。當(dāng)時(shí)我留了個(gè)尾巴——前沿能力之爭(zhēng)海外那幾家始終是繞不開的參照系。結(jié)果話音沒落谷歌就把新旗艦甩出來了Gemini 4 Argon。這篇我想做兩件事一是把 Argon 這組分?jǐn)?shù)拆開看清楚二是回答一個(gè)更實(shí)在的問題——它號(hào)稱能單次輸出 100 萬 token、軟件工程測(cè)試屠榜那它到底是真能干活還是又一個(gè)榜單做題家以及你能不能現(xiàn)在就上手。一、先看它是什么憋了大半年谷歌換了個(gè)新名字Gemini 4 Argon 是谷歌時(shí)隔數(shù)月推出的新一代前沿模型也是谷歌第一次在命名上不走 Pro 路線、改用 Argon 這個(gè)新代號(hào)。定位很明確面向復(fù)雜、長(zhǎng)周期的任務(wù)主攻三個(gè)方向——長(zhǎng)程軟件工程、企業(yè)知識(shí)工作金融/法律/稅務(wù)、網(wǎng)絡(luò)安全防御。最能體現(xiàn)長(zhǎng)周期這三個(gè)字的是它把單次輸出上限從上一代的 6.4 萬 token 直接拉到了 100 萬 token。這個(gè)數(shù)字是行業(yè)里目前最激進(jìn)的意味著它能一次性吃下一整個(gè)大型代碼庫、一份超長(zhǎng)文檔或者一條幾十步的完整任務(wù)鏈中間不用人反復(fù)喂。這里我得提醒一句別把輸出 100 萬 token理解成免費(fèi)變強(qiáng)。輸出是按 token 計(jì)費(fèi)的100 萬輸出 token 意味著一次長(zhǎng)任務(wù)可能燒掉幾十美元這在后面定價(jià)部分會(huì)細(xì)說。二、分?jǐn)?shù)確實(shí)好看但要看它是怎么刷的先擺成績(jī)單。官方給的數(shù)據(jù)里Argon 在幾項(xiàng)關(guān)鍵基準(zhǔn)上拿了第一基準(zhǔn)Gemini 4 Argon主要對(duì)手DeepSWE v1.1長(zhǎng)程軟件工程77.9%第一Claude Opus 5.5 74.2%、GPT-6 Astra 74.1%Vals Index金融/編程/法律/稅務(wù)68.9%第一Opus 5.5 67.0%、Astra 63.1%AutomationBench業(yè)務(wù)自動(dòng)化51.3%第一Opus 5.5 42.5%、Astra 41.4%LVBench長(zhǎng)視頻理解91.7%第一—CWE-bench v1漏洞修復(fù)68%并列第一與 GPT-6 Astra 并列單看這張表Argon 幾乎屠榜。但我要潑盆冷水——有幾個(gè)關(guān)鍵項(xiàng)它并不領(lǐng)先在 FrontierSWE v2、Terminal-Bench終端操作這些更貼近真實(shí)干活的測(cè)試?yán)锼浜笥?GPT-6 Astra 和 Claude Opus 5.5。這也是為什么鈦媒體那篇直接給了個(gè)標(biāo)題——“做題家”榜單成績(jī)強(qiáng)實(shí)際干活差點(diǎn)意思。我的看法是這個(gè)批評(píng)戳中了一半。DeepSWE、AutomationBench 這類基準(zhǔn)確實(shí)能反映長(zhǎng)周期任務(wù)的能力Argon 在它們身上領(lǐng)先不是假的但真實(shí)干活比基準(zhǔn)臟得多涉及終端交互、失敗恢復(fù)、邊界判斷這些恰恰是它沒跑贏的地方。所以更準(zhǔn)確的說法是Argon 在長(zhǎng)程代碼這一項(xiàng)上確實(shí)是目前最強(qiáng)的但別把它當(dāng)成全面碾壓。三、100 萬 token 輸出真正的意義在哪我之前寫 GLM-5.3-Flash 時(shí)說過一句話以前長(zhǎng)上下文和便宜是互斥的。Argon 這次解決的是另一對(duì)矛盾——以前長(zhǎng)任務(wù)和要人盯是綁定的。過去讓模型做一個(gè)大重構(gòu)它寫到一半 token 就用完你得把上下文續(xù)上、再喂一遍模型容易在斷點(diǎn)處跑偏。100 萬輸出上限配合它能一次性讀入的大上下文本質(zhì)是讓模型能一口氣把一條長(zhǎng)鏈走到頭不用中途被人打斷。這對(duì)自動(dòng)改代碼—跑測(cè)試—再改—再跑這種循環(huán)尤其值錢。但代價(jià)是實(shí)打?qū)嵉腻X。下面這張定價(jià)表能讓你直觀感受一下首發(fā)價(jià)輸入 $2 / 百萬 token輸出 $10 / 百萬 token優(yōu)惠期結(jié)束后會(huì)漲到 $4 / $20緩存輸入有約 95% 的折扣這點(diǎn)對(duì)重復(fù)喂上下文的長(zhǎng)任務(wù)很友好。換算一下一次吃滿 100 萬輸出 token 的任務(wù)光輸出就 $10優(yōu)惠期到 $20常規(guī)。所以100 萬 token是能力不是福利用之前先算清楚賬單。四、最關(guān)鍵的一條你大概率現(xiàn)在用不上說句大實(shí)話這篇最該讓你知道的是最后這條——Argon 目前不對(duì)普通用戶開放。它首發(fā)走的是Fairwind 計(jì)劃先優(yōu)先提供給可信的網(wǎng)絡(luò)安全專家、政府機(jī)構(gòu)等并參與美國政府的自愿評(píng)估流程之后才逐步向付費(fèi) API 客戶和 Google AI Ultra 用戶開放。官方給出的理由就是安全——一個(gè)能修漏洞、能做長(zhǎng)周期自動(dòng)化、輸出上限又拉到 100 萬的模型紅隊(duì)和濫用風(fēng)險(xiǎn)都得先壓住。所以對(duì)絕大多數(shù)開發(fā)者現(xiàn)在的狀態(tài)是看得到成績(jī)單摸不到 API。你暫時(shí)沒法在本地或控制臺(tái)里真跑一遍它。五、我的判斷值得盯著但不用急著切綜合下來我對(duì) Argon 的判斷是三句強(qiáng)是真的強(qiáng)長(zhǎng)程軟件工程這個(gè)方向上77.9% 的 DeepSWE 是實(shí)打?qū)嵉念I(lǐng)先100 萬輸出上限也確實(shí)是里程碑級(jí)別的變化但沒到閉眼換終端操作、真實(shí)任務(wù)里的穩(wěn)定性還沒跑贏 Astra/Opus加上 Fairwind 限制短期內(nèi)它的實(shí)際可用性被安全這一道閘門卡著對(duì)開發(fā)者的啟示真正該關(guān)注的不是谷歌屠榜了而是**長(zhǎng)周期任務(wù) 超長(zhǎng)輸出正在成為下一階段的競(jìng)爭(zhēng)主軸**。誰先把能一口氣干完長(zhǎng)活這件事做到又穩(wěn)又便宜誰就贏了下一局。對(duì)普通開發(fā)者眼下能做的其實(shí)很樸素先別管 Argon把你手里的任務(wù)用現(xiàn)在能拿到的模型Astra、Opus、GLM-5.3跑通把長(zhǎng)任務(wù)拆解的基本功練扎實(shí)。等 Argon 真正開放的那天你的任務(wù)鏈早就準(zhǔn)備好了直接切上去試一版就行。小結(jié)Gemini 4 Argon 這篇三句話總結(jié)分?jǐn)?shù)DeepSWE 77.9%、Vals 68.9%、AutomationBench 51.3% 多項(xiàng)第一但 FrontierSWE、Terminal-Bench 落后做題家的批評(píng)有幾分道理能力單次輸出 6.4 萬 → 100 萬 token核心是讓模型一口氣干完長(zhǎng)活、不用人盯但輸出按 token 計(jì)費(fèi)長(zhǎng)任務(wù) 幾十美元門檻走 Fairwind 計(jì)劃先給網(wǎng)絡(luò)安全/政府機(jī)構(gòu)普通開發(fā)者現(xiàn)在摸不到 API只能等逐步開放。下一篇預(yù)告谷歌在這邊憋新旗艦國產(chǎn)模型在另一邊悄沒聲地把 Cursor 打下來了。下一篇聊聊GLM-5.3 怎么進(jìn)的 Cursor、CursorBench 開放權(quán)重第一是怎么回事以及中美 AI 差距縮到 3% 這個(gè)數(shù)字背后的產(chǎn)業(yè)邏輯。關(guān)注不迷路。本文觀點(diǎn)為個(gè)人看法事實(shí)部分來自公開報(bào)道鏈接如下歡迎指正。谷歌反擊Gemini 4 Argon 性能比肩 Astra成本僅 60%36氪谷歌推出了個(gè)做題家Gemini 4 Argon 屠榜但干活差點(diǎn)意思鈦媒體谷歌最前沿 AI 模型 Gemini 4 Argon 登場(chǎng)長(zhǎng)周期代碼工程 DeepSWE 超 Claude Opus 5.5IT之家Google launches Gemini 4 Argon as its new frontier modelThe NewsGemini 4 Argon 追平 GPT-6 Astra但還用不上騰訊云開發(fā)者