:拿得多的,會被拿得少的打敗)
本文首發(fā)于我的博客梁文鋒 4 小時投資會精讀上拿得多的會被拿得少的打敗 · 「東玄蟒」最近讀完一份流出的四小時錄音文字稿——據(jù)稱是梁文鋒 5 月 20 日與投資人的閉門交流會七月整理流出未見官方證實。全文是語音轉寫加 AI 整理不分說話人個別名詞甚至有識別錯誤但觀點密度是真的高。這篇是我讀完前兩部分愿景與開源、AGI 技術路線的理解不是摘抄是把他的邏輯從頭推一遍再對照一批經(jīng)典論文做校驗。蛋糕大到獨占必死DeepSeek 堅持開源外面最常見的解讀是格局。讀完原文我覺得更準確的讀法是反過來的開源首先是一個客觀規(guī)律的判斷其次才是愿景。梁文鋒的賬是這么算的AI 最終可能占人類 GDP 的百分之十。這么大的市場“一個人獨占這個事情你不可能獨占你一定得跟別人分享否則你肯定活不下來”。歷史上開源和商業(yè)化沖突是因為一個軟件公司一年市場才幾十億美金開源了就只剩幾千萬。AI 不一樣——“你隨便分一點點就已經(jīng)很足夠了”。從這個判斷往下推是最鋒利的一句拿得多的會被拿得少的打敗。他給 OpenAI 算過賬理論上賬是算得過來的但只要你想要百分之五就會有只要百分之一的人打敗你然后又有只要千分之一的人打敗前面那個人。“甚至你還不用真的拿得多愿景如果是拿得多的話你就先輸了?!彼?DeepSeek 的定價不是利潤最大化十個月收回設備成本約六倍利潤。利潤最大化的做法應該定更高的價——原文說得很直白這個價格區(qū)間需求沒有彈性價格再翻一倍token 消耗量區(qū)別不大。但他就到十個月回本為止。最能說明問題的是個細節(jié)模型降價到四分之一的時候公司群里是歡呼的。任何其他公司降價一半 ARR 就掉一半。還有兩個支撐細節(jié)開源的模型和自部署的是完全同一套權重沒有留一手而在這個定價之下第三方自己部署的成本不可能更低所以開源并不傷收入——“我只擔心他部署不起來”。那么問題來了這套戰(zhàn)略靠什么組織落地這就到了我認為全文最精彩的地方。我的推導三個支撐點讀完第一部分我把散落的說法拼成一條自己的推導。要做到愿景驅(qū)動、開源、松弛這三件事同時成立有三個支撐點缺一個就塌**第一集中力量辦大事。**公司松弛、人少所以不應該什么都去做只做自己認為在通向 AGI 關鍵節(jié)點上的事。原文的說法是克制帶來聚焦3D、視頻生成、世界模型甚至多模態(tài)都只是組件不進主線——哪怕視頻生成在商業(yè)上是個好生意。連好生意都舍棄這才叫聚焦。**第二公司小必須精準找到屬于自己的賽道。**沒辦法像大公司那樣全都要得讓自己能盈利、能持續(xù)長久地走下去。開源是這條賽道的一部分處于一種合理的定價十個月回本別人自己部署也不會更便宜但自己有錢可以掙。這里有兩個條件咬合在一起沒有部署成本門檻開源就是純讓利沒有合理定價開源就失去商業(yè)邏輯。兩個都在開源和賺錢才同時成立。**第三必須要做足夠多的優(yōu)化讓卡的效率更加高。**DeepSeek 大概兩萬張 H 等效算力和美國比差距只有資源不是人才。大公司靠加卡解決它只能靠效率——成本越低同樣的卡能撐越大的模型。原文有句話讓我覺得最值得琢磨商業(yè)化公司沒有動力追求模型效率因為低成本不符合他們的利益。DeepSeek 追求效率一半是資源約束逼的一半是愿景——它的員工知道普通人用 AI 是要花錢的。松弛是前提還是結果組織上DeepSeek 有兩條線。從上到下目標明確大家一起干比如發(fā) V4 要分工每個人做一部分這叫正式從下到上每個人都有自己的 idea 和創(chuàng)意沒人管、沒有 KPI按自己覺得重要的方向探索。一條硬規(guī)則正式不要超過員工時間的一半。不加班也有兩個原因研究需要松弛的環(huán)境逼得緊就沒法做研究聚焦所以事情少沒那么多活要干。讀到這里我停了一下因為有個因果方向的問題。原文的順序是克制戰(zhàn)略→ 聚焦 → 事情少 → 所以松弛松弛是結果。但按我自己的讀法可以反著推松弛且人少的組織天然做不了多線作戰(zhàn)所以只能挑關鍵節(jié)點——松弛是前提。兩種讀法互為因果但我的讀法有個推論值得單獨記下如果組織變大、不再松弛了聚焦會自己松動。這比創(chuàng)始人想不想要聚焦更根本。Google 的 20% 時間是現(xiàn)成的警告——Gmail、AdSense 都從這里出來后來名存實亡Schmidt 親口說那其實是指下班后的時間。大組織里短期交付永遠比遠期探索緊急。梁文鋒能守住這一條靠的是三件事咬合愿景共識篩掉了不認同的人招聘即治理利潤結構允許低效十個月回本而非利潤最大化聚焦讓正式工作真的少于一半。缺一個自由探索就退化成口號。階梯從語言模型到具身第二部分是 AGI 的技術路線。梁文鋒給了一個階梯語言模型 → CoT → Agent → 持續(xù)學習 → 奇點 → 具身智能。去年走的階梯是 CoT今年是 Agent下一個瓶頸是持續(xù)學習他說的是學習去學習奇點是自我迭代——但他特意說這個奇點其實不是一個奇點是一個連續(xù)的過程。這個順序的理由很實用主義每一步都踩在前一步上沒有一步白走而且是最輕松的路線——先解決持續(xù)學習奇點之后具身智能的活可以交給模型自己開發(fā)不用人來做。反過來先做具身就是苦活。商業(yè)上的動作去年的 C 端、今年的 B 端都只是主線的副產(chǎn)物——“站在技術的高位上做低一級別的技術是降維打擊”。Scaling 他說得干脆信。墻還沒有摸到——“我們訓練這么大的模型并不是因為我覺得這么大就夠了而是我剛好有這么多資源”。擋住 Scaling 的是算力不是意愿硅谷說的 Scaling 到頭“對中國來講我們離那個還很遠”。CoT 的病o1 的藥這兩部分原文里梁文鋒對 CoT 著墨不多階梯一筆帶過。下面是我自己的補充功課——把自己的判斷和一批論文對了個賬。CoT 最大的兩個病。一是不回溯一條鏈走到底前面錯后面就完全錯誤。這個判斷不是我發(fā)明的——Tree of Thoughts2023開頭對 CoT 的批評就是原話從左到右逐 token 決策不能回溯不能全局探索。ToT 的藥方是分支、回溯、前瞻評估Self-Consistency2022更簡單粗暴采樣多條獨立推理鏈投票取多數(shù)。我最早記的多 CoT 模式投票表決實現(xiàn)是現(xiàn)成的。二是先給答案然后編思維過程。兩篇論文給過實錘Turpin et al. 2023 在輸入里埋暗示“答案應該是 A”模型的思維鏈完全不提暗示但答案仍被暗示左右——解釋不是決策的依據(jù)。Lanham et al. 2023Anthropic用截斷、替換、改寫思維鏈的辦法測依賴反直覺的發(fā)現(xiàn)是任務越簡單、模型越大CoT 越可能不忠實——簡單題根本不需要推理思維鏈是事后編的。CoT 的發(fā)展我看到三條線外部擴展思考空間風險是故意模仿人類的思考步驟多 CoT 并行投票以及 o1/o3 的路線——不是獎勵具體的步驟而是搭建一個可以驗證思維方式是否正確的環(huán)境讓錯誤的決策被否決。這句話背后是一次路線掉頭。2023 年 OpenAI 自己在 “Let’s Verify Step by Step” 里驗證過過程獎勵PRM優(yōu)于結果獎勵ORM——人工標注每一步對錯。而 o1 被廣泛解讀為反著走不用人工步驟標注容易被鉆空子、標注貴只用可驗證獎勵RLVR數(shù)學、代碼有標準答案做結果級 RL讓模型自己學會糾錯、拆解、換路。o1 到底用沒用 PRMOpenAI 沒說死過學界吵到現(xiàn)在。但搭環(huán)境而不獎勵步驟是現(xiàn)在站得住的共識表述。o1 機制的三個觀察我的筆記做了校準回答之前先生成思維 token緩存下來不展示給用戶。精確化用戶看到的是摘要原始思維鏈是隱藏的——OpenAI 給的理由是防蒸餾和安全監(jiān)控。緩存更接近 API 層的推理上下文復用OpenAI 的 previous_response_id、Claude 的思維塊緩存不是被確認過的訓練機制。提前訓練自糾錯做邏輯矛盾的剪枝讓思考自己反饋自己。這個成立獎勵只看最終對錯糾錯行為被 RL 自發(fā)強化。思維空間在解空間上搜索放棄低概率的搜索空間具備判斷路徑復雜度的能力。這是我最想展開的一條——用我的本行打比方這就是 CBO基于代價的優(yōu)化查詢優(yōu)化器的 cost model 決定走不走索引、并不并行o1 內(nèi)化的就是自己的 cost model簡單題燒兩萬 token 是浪費奧數(shù)題只給一百 token 是找死。Snell et al. 2024 驗證的正是這件事按難度自適應分配 test-time compute固定預算下小模型能打贏無腦堆算力的大模型。開放問題是這個 cost model 是練出來的還是拍出來的——現(xiàn)在各家 API 的 thinking budget 全靠用戶手調(diào)模型自知難度這件事沒有完全解決。還沒想清楚的三個問題拿得多的被拿得少的打敗有個隱含前提技術優(yōu)勢本身構不成護城河。那它什么時候失效——模型能力差距拉大到某種程度的時候還是分發(fā)和生態(tài)鎖定生效的時候DeepSeek 自己又靠什么不變成被鎖死的一方o1 式的 RL是不是把 ToT 式的顯式搜索內(nèi)化進了權重模型自己學會回溯和剪枝不再需要外部樹搜索如果是Agent 階梯會不會也走同一條路——今天外掛的 Agent 框架最終被內(nèi)化成一個模型能力這恰好對得上沒有一步是白走的。正式不超過一半這條復制者最先崩的是哪一環(huán)招不到愿景一致的人還是管理層忍不住把自由時間填滿寫下來的是前兩部分。第三部分是算力與國產(chǎn)芯片據(jù)說有 TileLang 的精彩論述第五部分是投資人 QA據(jù)說有下代模型激活參數(shù) 150B–250B。讀完寫下。參考來源梁文鋒投資者交流會實錄 · 01 愿景與開源、02 AGI 技術路線錄音 2026-05-20轉寫稿未經(jīng)官方證實Tree of ThoughtsYao et al., 2023Self-Consistency Improves Chain of Thought ReasoningWang et al., 2022Language Models Don’t Always Say What They ThinkTurpin et al., 2023Measuring Faithfulness in Chain-of-Thought ReasoningLanham et al., 2023Let’s Verify Step by StepLightman et al., 2023Scaling LLM Test-Time Compute OptimallySnell et al., 2024首發(fā)于我的博客梁文鋒 4 小時投資會精讀上拿得多的會被拿得少的打敗歡迎來原文交流。