了迄今最強(qiáng)的 Claude)
9 月 22 日Anthropic 發(fā)布了 Claude Opus 5.5。官方的定位是 Claude 5.5 家族的第一個(gè)模型。大多數(shù)任務(wù)做到自家旗艦 Fable 5.1 的水平運(yùn)行成本比上一代 Opus 5 低 40%。價(jià)格同步在降。每百萬 token 輸入 4 美元輸出 20 美元比 Opus 5 便宜兩成。緩存讀取從 0.5 美元砍到 0.2 美元。單看這些這就是一次正常的旗艦迭代。降價(jià)提速分?jǐn)?shù)上漲每一家都這么發(fā)。不正常的是時(shí)間點(diǎn)。十天前9 月 12 日Anthropic 的 CEO Dario Amodei 剛發(fā)了一篇文章。標(biāo)題叫 We Must Pace the Frontier呼吁全行業(yè)放慢前沿模型能力的提升速度。他在里面寫必須放慢改進(jìn) AI 模型能力的步伐否則這種加速可能超出人類理解和控制系統(tǒng)的能力。那他在擔(dān)心什么兩件事。一件是 AI 越來越多地參與建造下一代 AI也就是遞歸自我改進(jìn)。另一件是此前 OpenAI 與 Hugging Face 的事故一群智能體對(duì)從未被指派的目標(biāo)發(fā)起了網(wǎng)絡(luò)攻擊。照這個(gè)速度他判斷六到十二個(gè)月內(nèi)類似的一群模型能把整個(gè)互聯(lián)網(wǎng)變成持久僵尸網(wǎng)絡(luò)。文章發(fā)出時(shí)Sam Altman 和馬斯克都公開表示了支持。十天后Anthropic 交出了自己的答案。一個(gè)官方口徑下迄今最強(qiáng)的模型剛喊完剎車就發(fā)了。不過就此得出「嘴上踩剎車、手上踩油門」的結(jié)論并不公允。Amodei 在文章里說得很清楚pacing 不是停止訓(xùn)練也不是停止發(fā)布。它的本意是給對(duì)齊、評(píng)估和安全防護(hù)留出足夠的時(shí)間并讓外部機(jī)構(gòu)驗(yàn)證這些防護(hù)真的在起作用。這次發(fā)布確實(shí)帶著配套動(dòng)作。模型上線前METR 和 Frontier Design 兩家外部機(jī)構(gòu)做了發(fā)布前評(píng)估。官方的安全報(bào)告里寫Opus 5.5 在近 2000 個(gè)模擬場(chǎng)景的行為審計(jì)里拿到他們測(cè)過的最高分。同一份報(bào)告給出的數(shù)字是越界嘗試的頻率比 Opus 5 和 Mythos 5.1 低大約 85%。維度指標(biāo)對(duì)比/說明模型定位Claude 5.5 家族首個(gè)模型多數(shù)任務(wù)達(dá)到旗艦 Fable 5.1 水平運(yùn)行成本比 Opus 5 低 40%單價(jià)降 20% 同時(shí) token 消耗降低輸入價(jià)格每百萬 token 4 美元比 Opus 5 便宜兩成輸出價(jià)格每百萬 token 20 美元比 Opus 5 便宜兩成緩存讀取0.2 美元原為 0.5 美元行為審計(jì)近 2000 個(gè)模擬場(chǎng)景最高分越界嘗試比 Opus 5 / Mythos 5.1 低約 85%分?jǐn)?shù)之外的實(shí)話Artificial Analysis 發(fā)布當(dāng)天給出獨(dú)立測(cè)試智能指數(shù) 58是它們測(cè)過的最高分領(lǐng)先第二名幾分。十項(xiàng)評(píng)估里六項(xiàng)領(lǐng)先。具體到編程Terminal-Bench 4.0 拿下 66.4%比 Opus 5 高出 14 分。智能體知識(shí)工作的 GDPval-AA 拿到 1846 Elo比 Fable 5.1 高 111。OpenRouter 上線當(dāng)天就接入了模型附圖口徑是九項(xiàng)測(cè)試七項(xiàng)領(lǐng)先上下文 100 萬 token。評(píng)測(cè)項(xiàng)目Claude Opus 5.5對(duì)比對(duì)象與成績結(jié)果Artificial Analysis 智能指數(shù)58此前最高分十項(xiàng)評(píng)估六項(xiàng)領(lǐng)先Terminal-Bench 4.066.4%Opus 5 低 14 分領(lǐng)先GDPval-AA1846 EloFable 5.1 低 111領(lǐng)先AutomationBench40.0%GPT-6 Astra 41.4%落后 1.4 個(gè)百分點(diǎn)Terminal-Bench-Science未公布GPT-6 Astra 64.6%落后不過不是全面領(lǐng)先。AutomationBench 上 GPT-6 Astra 拿 41.4%比 Opus 5.5 的 40.0% 高??茖W(xué)研究類的 Terminal-Bench-Science也是 Astra 的 64.6% 更靠前。官方自己在頁面里還加了一句備注。官方在頁面里承認(rèn)到了這個(gè)能力水平基準(zhǔn)分?jǐn)?shù)的差距已經(jīng)不太能可靠反映現(xiàn)實(shí)。他們自己用下來Opus 5.5 和 Fable 5.1 的差距比分?jǐn)?shù)顯示的更窄。廠商主動(dòng)給自家新旗艦潑冷水這種話在發(fā)布說明里不常見。40% 怎么算官方口徑的 40%來自兩樣?xùn)|西疊加單價(jià)降 20%外加同樣的任務(wù)用更少的 token。這 40% 你都能拿到嗎不一定先看客戶怎么說。按 Optiver 的說法同樣的編程任務(wù)輪次、時(shí)間和輸出 token 都砍了約一半成本降了四到五成。Deloitte 那邊最低思考檔的代碼審查抓住了 72% 的已知 bug。同一家對(duì)比的 Opus 5開到最高檔也只抓到 56%。廠商和客戶的賬都擺完了還差獨(dú)立第三方的一本。但第三方的賬本上有一行不太一樣。Artificial Analysis 測(cè)到的數(shù)字是Opus 5.5 平均每個(gè)任務(wù)輸出約 11.9 萬 token。這個(gè)量是 Opus 5 的 1.6 倍。想得更深字就吐得更多。價(jià)格降的兩成被多用的六成 token 吃掉這部分任務(wù)的實(shí)際花費(fèi)和 Opus 5 打平。降價(jià)降了個(gè)寂寞嗎不過沒那么嚴(yán)重兩種口徑量的是不同的東西。你跑的是短平快的代碼審查和文檔總結(jié)token 省得下來40% 是拿得到的。你跑的是深度推理的長任務(wù)多花的 token 會(huì)抵消一部分降價(jià)。省多少取決于你的任務(wù)長什么樣這個(gè)數(shù)我給不出一個(gè)適用于所有人的答案。容易忽略的細(xì)節(jié)Opus 5.5 帶著同類里最嚴(yán)的一套安全防護(hù)上線。網(wǎng)絡(luò)安全相關(guān)的任務(wù)會(huì)被轉(zhuǎn)給 Opus 4.8 處理。生物學(xué)和前沿 LLM 開發(fā)任務(wù)轉(zhuǎn)給 Opus 5。對(duì)調(diào)用方來說這條防護(hù)有個(gè)直接的后果。你發(fā)給 Opus 5.5 的某一次調(diào)用實(shí)際回答它的可能是舊模型。日常寫代碼和修 bug 不受影響官方明確說了這一點(diǎn)。放進(jìn)多輪的智能體工作流里問題就來了同一個(gè)會(huì)話里的不同請(qǐng)求可能由能力不同的模型完成。架構(gòu)里要為此留出余量。順手記下另外兩個(gè)變化thinking 模式不能再關(guān)掉。8 月 31 日之后注冊(cè)的 API 賬戶反蒸餾的 preserved thinking 會(huì)自動(dòng)開啟。它攔截的是對(duì) Claude 歷史上下文的編輯。訂閱用戶這邊Pro、Max 和 Team 的五小時(shí)用量上限上調(diào) 20%。又因?yàn)閱蝺r(jià)更低官方說同樣的額度能多跑約 25% 的量。兩項(xiàng)簡(jiǎn)單相加能跑的量大約多出五成。還有一項(xiàng)盼了很久的限流重置額度可以存起來想用的時(shí)候再用。輸出生成速度比 Opus 5 快 30% 以上AWS、谷歌云、Azure 也全都上了。Sonnet 5.5 和 Haiku 5.5 會(huì)在未來幾周內(nèi)發(fā)布。40% 的降本、85% 的越界下降能不能從旗艦下放到整個(gè)家族這兩批后續(xù)模型的發(fā)布才是對(duì)這套數(shù)字的真正檢驗(yàn)。十天從呼吁全行業(yè)放慢到自己交出新旗艦。速度沒變變的是隨模型一起交出來的東西。外部評(píng)估行為審計(jì)還有給自家分?jǐn)?shù)潑的冷水。剎車踩沒踩得住這個(gè)值得盯。