
Strata 是一個高性能推理引擎目標是在單張消費級顯卡≥12GB VRAM ≥32GB 系統(tǒng)內(nèi)存 SSD 的家用 PC 上運行 1250 億參數(shù)的 MoE 模型Qwen3.8-Flash-Next達到 60–95 tokens/s 的生成速度一句話總結(jié)GPU 做每個 token 都要做的密集部分 熱門專家CPU 與 GPU 并行算冷門專家專家全駐留 RAMSSD 只放 n-gram 表再用 MTP prompt lookup 投機解碼一次產(chǎn)出多個 token——通過把整個 PC 變成推理流水線把 125B 模型塞進了 12GB 顯卡。核心思想三級分層卸載模型是 MoE 架構(gòu)48 層、共 24,576 個專家但每個 token 只激活約 10 個專家——所以不需要把所有專家都放進顯存Strata 把工作分攤到三個硬件層級GPUVRAM存放每個 token 都需要的部分——attention 與 DeltaNet mixer、門控殘差權(quán)重、路由器router、共享專家、輸出頭、MTP 草稿層、KV cache長上下文時部分從 RAM 流式讀取以及一個自適應(yīng)專家緩存剩余顯存全部用來裝最常用專家每多 1GB 顯存約多放 ~700 個專家 3系統(tǒng) RAMpin 住全部 24,576 個專家。當路由選中了不在 GPU 緩存中的專家時CPU 用 AVX-512/AVX2 內(nèi)核就地計算與 GPU 并行互不等待。低內(nèi)存模式下可只保留 GPU 放不下的那部分專家SSD存放 28.8GB 的 n-gram 查找表每 token 只讀幾行走 OS 頁緩存同一套引擎既編譯為 NVIDIA CUDA 也可編譯為 AMD HIP專家放置與取回路徑ExpertCache維護(layer, expert)→ VRAM 槽位的駐留表并按每層配額分配槽位防止靠前的層壟斷顯存緩存未命中時走ExpertSource/FileExpertSourceRAM 駐留專家由PinnedArena管理可用大頁、可部分注冊給 CUDA 做 DMA非駐留的從 SSD 按區(qū)間加載resident_stage_swaps負責 GPU 緩存與 RAM 之間的專家換入換出執(zhí)行流程重疊執(zhí)行與 CUDA Graphsession_token()串行調(diào)度 48 層的前向傳播由于殘差鏈嚴格串行CPU 專家計算通過解耦的 host 線程與 GPU 的非 MoE 塊attention 等重疊用 doorbell 異步協(xié)議隱藏 CPU 延遲SessionState預(yù)先分配 KV cache、GDN 循環(huán)狀態(tài)、激活緩沖和 PLE 狀態(tài)session_bytes/session_inittoken 路徑上零分配SessionGraphs為每層捕獲 CUDA graph消除 kernel launch 開銷每層 kernel 很小launch 開銷是主要瓶頸投機解碼先猜后驗?zāi)P妥詭У腗TP 層每次最多起草 3 個 token一次 48 層前向即可驗證全部草稿平均每次接受 2.4–3.2 個 token加速 1.6–1.8×Prompt lookup當回復(fù)與上下文重復(fù)代碼編輯、引用文本時SuffixDrafter從前文中起草最多 5 個 tokenDraftPolicy只在實測接受率和成本劃算時啟用代碼編輯快 6–11%其他場景不變關(guān)鍵性質(zhì)草稿只是猜測大模型驗證決定每個詞輸出質(zhì)量完全不變。長上下文預(yù)填充以最多 8,192 token 的大塊做 prefill吞吐超 1,000 tok/s下一層專家在 attention 運行的同時經(jīng) PCIe 流式傳輸?shù)?GPU會話有緩存conversation cache后續(xù)消息只讀新增部分秒級開始