工作流與提速全攻略)
臥室里的雷神、客廳里的別克AI畫圖的盡頭是用起來不卡。這幾天我在一臺(tái)只有6G顯存的舊筆記本上把MiniMax H3硬生生跑通了當(dāng)時(shí)第一反應(yīng)是這玩意兒不是號(hào)稱要16G顯存起步的20B大模型嗎結(jié)果不但跑通了還把常見的畫面模糊問題一起解決掉換來的是一套ComfyUI極簡(jiǎn)短劇工作流。整個(gè)過程踩了不少坑但最后的方案足夠傻瓜式新手上手大概十來分鐘完事。這篇文章就是寫給和我一樣低顯存、沒服務(wù)器、又不肯換顯卡的玩家。我會(huì)把部署條件、模型怎么放、工作流怎么接線、采樣參數(shù)怎么調(diào)、模糊問題怎么查、速度怎么提全部按實(shí)測(cè)復(fù)盤一遍。文章里提到的每個(gè)參數(shù)你都能直接搬過去用不會(huì)有那種“看完還是不會(huì)做”的懸空感。1. 6G顯存跑MiniMax H3先搞懂“為什么能跑”1.1 一個(gè)20B的模型6G顯存怎么塞下去先說結(jié)論6G顯存能跑MiniMax H3靠的不是玄學(xué)是ComfyUI一貫的“顯存不夠、內(nèi)存來湊”策略。理解這件事比抄工作流重要得多。MiniMax H3的參數(shù)規(guī)模大致在20B級(jí)別哪怕用FP8量化模型文件也要20GB開外。很多人一聽20G就以為必須20G顯卡這是完全錯(cuò)誤的直觀印象。顯卡在做AI推理時(shí)真正決定能不能跑的指標(biāo)并不是模型文件總大小而是計(jì)算一瞬間的顯存峰值。只要峰值不超過6G你的顯存規(guī)模就是可行的。ComfyUI在默認(rèn)低顯存模式下干的事是把模型權(quán)重切塊哪個(gè)模塊要用就臨時(shí)搬到顯存里算算完馬上放回系統(tǒng)內(nèi)存騰出空間給下一個(gè)模塊。所以6G顯存 至少32G系統(tǒng)內(nèi)存是這臺(tái)“局域超算”的最低配置。如果你內(nèi)存只有16G那建議趁早加一條不然權(quán)重反復(fù)換頁會(huì)卡到懷疑人生。我在實(shí)測(cè)中發(fā)現(xiàn)真正吃顯存的不是采樣本身而是兩個(gè)隱藏大戶一是VAE解碼二是幀序列疊加。視頻模型和文生圖不一樣它需要同時(shí)處理8到16幀的特征張量顯存峰值會(huì)隨著幀數(shù)線性增長(zhǎng)。所以低顯存跑H3的第一原則是控制幀數(shù)我后面會(huì)給具體參數(shù)。1.2 部署前必須確認(rèn)的三項(xiàng)硬件底線我不喜歡上來就讓人裝一堆軟件AI工具鏈最怕的就是裝了半天最后一步告訴你“你的卡不支持”。所以先把底線參數(shù)列清楚對(duì)照一下再動(dòng)手。顯卡6G顯存起步NVIDIA顯卡優(yōu)先老架構(gòu)也沒關(guān)系只要支持CUDA 11.8以上都行。A卡雖然ComfyUI也能跑但低顯存環(huán)境我建議直接回避省得給自己找罪受。系統(tǒng)內(nèi)存實(shí)測(cè)推薦32G16G能跑但很勉強(qiáng)。H3在FP8量化后權(quán)重約20G跑起來系統(tǒng)內(nèi)存占用長(zhǎng)期在16G以上低于16G會(huì)直接導(dǎo)致Windows內(nèi)存頁面瘋狂交換那就不叫跑模型了叫看幻燈片。硬盤空間模型文件20G左右加上工作流、放大模型和屯的素材C盤以外最好留出60G。這一步別省清理磁盤可比裝模型痛苦多了。如果上面三條都滿足恭喜你可以直接進(jìn)入下一步。如果你的顯存是4G理論上也能試但采樣速度會(huì)讓人崩潰說句實(shí)話不如用在線服務(wù)。6G是目前低顯存的甜點(diǎn)區(qū)也是我這套工作流的下限。2. ComfyUI環(huán)境部署整合包、模型目錄、加載器一次到位2.1 整合包選擇新人別自己造輪子關(guān)于ComfyUI安裝我真心建議新人別走源碼編譯的路線。ComfyUI本身是Python項(xiàng)目依賴庫幾十個(gè)一遇到網(wǎng)絡(luò)問題和版本沖突基本勸退。國內(nèi)社區(qū)做得比較成熟的整合包是秋葉整合包一鍵裝好、自帶ComfyUI Manager、常用插件預(yù)置、還幫你配好了國內(nèi)鏡像源。這套東西對(duì)新人來說是最大的善意。下載整合包后解壓到無中文路徑的目錄比如D:\ComfyUI_aki這個(gè)習(xí)慣能避免很多和Python路徑解析相關(guān)的詭異報(bào)錯(cuò)。啟動(dòng)方式分兩檔顯存緊張的直接點(diǎn)啟動(dòng)器.exe顯存6G的話我推薦在啟動(dòng)器的配置頁里打開“低顯存模式”——這會(huì)自動(dòng)給啟動(dòng)參數(shù)加上--lowvram和--cache-latent的等價(jià)配置。其中--lowvram是保命開關(guān)模型卸載會(huì)更激進(jìn)但采樣速度會(huì)略降不過這對(duì)6G卡來說完全值得。如果你用的是官方ComfyUI安裝包而不是整合包也完全沒關(guān)系核心只有兩件事裝好插件管理器再確認(rèn)Python包版本和CUDA匹配。這一步麻煩一點(diǎn)但能跑通的東西是通用的。2.2 模型下載與目錄放置的隱藏規(guī)則MiniMax H3的模型文件在玩家里通稱是“mm_h3_fp8.safetensors”具體文件名不重要重要的是放的目錄。很多新人栽在搜索教程后素材下載下來了但加載器報(bào)“找不到模型”最后查來查去只是路徑錯(cuò)了。ComfyUI對(duì)模型文件有嚴(yán)格的位置約定。MiniMax H3這個(gè)模型的社區(qū)節(jié)點(diǎn)默認(rèn)讀取路徑一般是ComfyUI/models/minimax_h3/mm_h3_fp8.safetensors或者ComfyUI/models/diffusion_models/目錄兩個(gè)路徑到底用哪個(gè)取決于你裝的加載器是誰家做的。最穩(wěn)妥的辦法是先安裝好節(jié)點(diǎn)然后在節(jié)點(diǎn)參數(shù)框里直接點(diǎn)文件夾圖標(biāo)看它默認(rèn)打開的目錄是哪個(gè)把模型丟進(jìn)去就行。別急著背路徑先認(rèn)節(jié)點(diǎn)再認(rèn)目錄百分之百不會(huì)錯(cuò)。另外吐槽一句有些教程把模型掛在網(wǎng)盤里但實(shí)際下載下來的是“fp16原版”體積40多G。6G顯存用戶千萬別直接下原版一定要找?guī)p8字樣的版本。FP8量化在這里不是可選項(xiàng)是低顯存運(yùn)行的前提條件。2.3 加載器ComfyUI新版還是社區(qū)節(jié)點(diǎn)MiniMax H3和ComfyUI的適配上市面現(xiàn)在有兩種做法。一種是ComfyUI較新版本原生支持的MiniMax加載器你只需要在畫布空白處搜索MMVideo或MiniMax相關(guān)字樣如果搜得出來直接用原生加載器即可。原生加載器的好處是升級(jí)會(huì)跟著官方走出問題概率小。另一種是社區(qū)節(jié)點(diǎn)你在ComfyUI Manager里搜“MiniMax”基本能找到專門針對(duì)H3做優(yōu)化的節(jié)點(diǎn)包。社區(qū)節(jié)點(diǎn)通常多了“省顯存開關(guān)”“TeaCache加速開關(guān)”之類的魔改選項(xiàng)反而更適合低顯存用戶。我實(shí)測(cè)下來建議優(yōu)先裝社區(qū)節(jié)點(diǎn)因?yàn)槎喑龅娘@存控制選項(xiàng)對(duì)6G卡非常有價(jià)值。裝上之后在節(jié)點(diǎn)里選中模型路徑工作流第一行就算通了。下面的重頭戲是搭工作流。3. 極簡(jiǎn)H3短劇工作流加載、采樣、解碼三段式優(yōu)化3.1 工作流里只需要六類節(jié)點(diǎn)很多H3工作流分享把節(jié)點(diǎn)畫得密如蛛網(wǎng)新人復(fù)制進(jìn)去一臉懵開頭就勸退。其實(shí)跑通一個(gè)短劇片段只需要六類節(jié)點(diǎn)一個(gè)不多一個(gè)不少還記得標(biāo)題里“三采工作流”嗎我理解“三采”就是三段采樣優(yōu)化的意思加載段、采樣段、解碼段三段分別壓縮顯存占用。這套工作流本質(zhì)上是兩步一問句的事。六類節(jié)點(diǎn)分別是加載節(jié)點(diǎn)讀取H3模型選擇FP8權(quán)重文件文本輸入節(jié)點(diǎn)正向提示詞和負(fù)向提示詞就是寫劇本臺(tái)詞的地方采樣設(shè)置節(jié)點(diǎn)把步數(shù)、CFG、調(diào)度器這些參數(shù)塞進(jìn)去KSampler核心采樣節(jié)點(diǎn)真正算視頻幀的引擎智能解碼節(jié)點(diǎn)VAE解碼時(shí)自動(dòng)分塊防止顯存爆掉保存節(jié)點(diǎn)預(yù)覽或輸出為視頻文件我見過很多人非要給工作流塞一堆“自學(xué)習(xí)節(jié)點(diǎn)”“動(dòng)態(tài)縮放節(jié)點(diǎn)”對(duì)6G顯存來說這些額外節(jié)點(diǎn)往往才是爆顯存的元兇。原則很簡(jiǎn)單能刪的節(jié)點(diǎn)全刪掉保持極簡(jiǎn)。3.2 第一段優(yōu)化模型加載階段怎么省加載階段的顯存峰值出現(xiàn)在模型剛進(jìn)顯存那一刻。社區(qū)節(jié)點(diǎn)的默認(rèn)配置往往是把整個(gè)模型全部搬進(jìn)顯存6G卡當(dāng)場(chǎng)陣亡。需要手動(dòng)改的設(shè)置有三個(gè)第一個(gè)是權(quán)重精度選FP8不選FP16這一點(diǎn)差出來的就是一半顯存占用。第二個(gè)是模型卸載策略很多優(yōu)化節(jié)點(diǎn)里有block_swap模塊級(jí)交換或者low_vram開關(guān)打開它ComfyUI會(huì)在每個(gè)計(jì)算步驟之前只往顯存塞當(dāng)前正在計(jì)算的Transformer模塊。原理就像圖書館不會(huì)把全部藏書堆到你桌上而是你要哪本給你哪本。這一步是6G卡能不能跑的核心關(guān)鍵。第三個(gè)是組件分離把文本編碼器、主模型、VAE的卸載級(jí)別分開設(shè)置。短劇工作流比較合理的策略是文本編碼器一次性加載馬上卸載主模型常駐內(nèi)存、算一步換一次VAE用完就釋放。這里的順序如果搞反比如VAE和主模型同時(shí)駐留馬上爆顯存。3.3 第二段優(yōu)化采樣階段到底哪些參數(shù)在吃顯存采樣階段是視頻模型顯存消耗最重的環(huán)節(jié)。原因在于視頻不是一張圖而是一疊圖同時(shí)算的。模型在內(nèi)部把8幀折疊成一個(gè)5D張量每個(gè)中間狀態(tài)都會(huì)在顯存里同時(shí)存在多份拷貝。這里面最耗顯存的設(shè)置其實(shí)是這兩個(gè)幀數(shù)每加一幀顯存增長(zhǎng)大概幾百M(fèi)。6G卡建議幀數(shù)設(shè)置在10幀以內(nèi)我實(shí)測(cè)8幀是最舒服的平衡點(diǎn)。分辨率1280x720和736x416的顯存差異是幾何級(jí)別不是線性級(jí)別。低顯存環(huán)境下別貪高清先保證能出片畫質(zhì)靠后面放大補(bǔ)救。還有一個(gè)很多人不知道的技巧采樣設(shè)置里的batch_size必須保持為1同時(shí)開啟tiled_vae分塊VAE。分塊VAE解碼會(huì)把一個(gè)大圖的解碼過程切成小塊輪流處理顯存峰值驟降雖然會(huì)有一點(diǎn)點(diǎn)性能損失但和爆顯存比起來完全值得。這個(gè)選項(xiàng)在加載節(jié)點(diǎn)里通常叫VAE_Tiling默認(rèn)是關(guān)閉的一定要手動(dòng)打開。3.4 第三段優(yōu)化解碼與預(yù)覽的收尾省顯存技巧模型采樣十幾步總算跑完了結(jié)果一按輸出按鈕直接OUT OF MEMORY這種事我至少遇到過三次。原因是采樣完成后計(jì)算圖還在顯存里沒釋放VAE解碼又要吃一大塊空間兩件事疊起來就爆了。解決辦法是在采樣器和VAE之間加一個(gè)“延遲”節(jié)點(diǎn)或者在工作流順序上讓采樣器的模型輸出先釋放掉。更簡(jiǎn)單的方案是使用整合包里自帶的“輕量化預(yù)覽”節(jié)點(diǎn)它會(huì)主動(dòng)把計(jì)算圖歷史清空再做解碼峰值直接降一截。另一個(gè)非常實(shí)用的小技巧在保存視頻節(jié)點(diǎn)里把fw_encoder編碼器設(shè)置為imageio_mpeg而不是ffmpeg。這個(gè)細(xì)節(jié)把編碼的CPU占用和臨時(shí)內(nèi)存占用都?jí)合氯チ藢?duì)低顯存本子友好很多。我實(shí)測(cè)同一個(gè)視頻編碼階段的時(shí)間能少一半誰也說不清為什么整合包默認(rèn)不這么設(shè)。4. 解決畫面模糊問題不是靠堆步數(shù)而是系統(tǒng)性排查4.1 模糊出現(xiàn)的三類原因畫面模糊是最多人反饋的問題也是我調(diào)試最久的一塊。很多人思路是“模糊就加步數(shù)”結(jié)果從12步加到30步速度慢了一倍畫面還是糊甚至更糊了。實(shí)際上MiniMax H3的模糊問題絕大多數(shù)時(shí)候不是步數(shù)少造成的而是下面這三種情況。第一種是采樣步數(shù)與調(diào)度器不匹配。視頻模型里DPM 2M這類加速調(diào)度器對(duì)步數(shù)敏感超過某個(gè)區(qū)間以后細(xì)節(jié)不增反降。我給你一個(gè)審計(jì)結(jié)論H3在12到16步之間是最佳甜蜜區(qū)超過20步以后畫面反而容易出現(xiàn)過度平滑的橡膠感那也是一種糊。第二種是分辨率過高導(dǎo)致的壓縮失真。小顯存玩家如果強(qiáng)行在768x1344分辨率下采樣模型為了擬合高分辨率會(huì)自動(dòng)丟失高頻細(xì)節(jié)。反直覺的是在低分辨率下采樣然后外部放大畫面細(xì)節(jié)往往更銳利。原因本質(zhì)上還是模型訓(xùn)練的主力分辨率就那么高你硬塞給它大圖它只能“憑感覺畫”畫不出來就糊。第三種是VAE解碼精度損失。FP8模型如果用FP16或FP32的VAE解碼精度本來不匹配畫面色彩斷層和模糊就出現(xiàn)了。穩(wěn)妥做法是VAE也保持FP8或者用模型自帶VAE別自己另接一套。4.2 采樣參數(shù)推薦直接抄這套配置我把自己在6G卡上反復(fù)試下來最穩(wěn)的參數(shù)組合列成表格你直接照著填就行。參數(shù)推薦值備注采樣步數(shù)14步8到16可調(diào)14是速度和畫質(zhì)的平衡點(diǎn)CFG5.04.5-6之間都行低于3.5畫面發(fā)灰高于7容易過曝調(diào)度器DPM 2M Karras也可以用Euler但Karras的細(xì)節(jié)更好分辨率736x416低分辨率采樣輸出后再放大幀數(shù)8幀極限可以上到10但不建議超過幀率24FPS8幀約等于0.33秒的鏡頭短劇夠了負(fù)向提示詞模糊, 變形, 水印, 低質(zhì)量直接英譯中寫中文也行這套配置在6G卡上一鏡頭的總耗時(shí)大概在5到10分鐘屬于能等的范圍。如果你想畫面更銳一點(diǎn)可以把CFG提高到5.5再把步數(shù)加到16但每加一步時(shí)間成本都是線性上升的。4.3 分鏡提示詞層面的畫質(zhì)改善模糊問題還有一種隱蔽的根源出在提示詞本身。MiniMax H3對(duì)文字的語義理解比很多視頻模型強(qiáng)但如果你給它的提示詞全是氛圍描寫沒有鏡頭和主體描寫它會(huì)自動(dòng)“腦補(bǔ)”一個(gè)平滑低細(xì)節(jié)的畫面。我在跑短劇工作流時(shí)會(huì)固定使用一個(gè)提示詞模板鏡頭描述近景/特寫 主體是誰 動(dòng)作 環(huán)境光 情緒 畫質(zhì)詞如:highly detailed, sharp focus, cinematic lighting注意畫質(zhì)詞不是越多越好寫兩三個(gè)就夠。我見過有人把“8k, ultra hd, masterpiece”刷了一整排結(jié)果畫面油膩得像磨皮過度這也是糊的一種形態(tài)。所以畫質(zhì)詞的優(yōu)先級(jí)應(yīng)該是sharp focus和高清細(xì)節(jié)詞放在前面風(fēng)格詞放后面。另外強(qiáng)烈建議給負(fù)向提示詞里加上“text, watermark, logo”視頻模型經(jīng)常在衣服、背景里突然長(zhǎng)出一段亂碼文字這些文字區(qū)域會(huì)占用大量采樣資源導(dǎo)致其他地方細(xì)節(jié)變模糊。加進(jìn)去之后畫面純凈度立竿見影。5. 提速實(shí)測(cè)記錄三采工作流真的把速度拉起來了5.1 不同配置組合的實(shí)測(cè)速度對(duì)比下面是我在同一臺(tái)機(jī)器上6G顯卡 32G內(nèi)存分別測(cè)試的速度數(shù)據(jù)全部以8幀、736x416分辨率、14步采樣為標(biāo)準(zhǔn)場(chǎng)景。數(shù)據(jù)只做參考你的機(jī)器可能略有出入但趨勢(shì)是可以借鑒的。配置組合總耗時(shí)長(zhǎng)顯存峰值備注默認(rèn)配置FP16、無塊交換直接爆顯存6G溢出根本跑不完FP8 低顯存模式約18分鐘5.8G能跑但很慢FP8 塊交換 分塊VAE約14分鐘5.2G速度明顯提升FP8 塊交換 分塊VAE TeaCache約9分鐘5.4G推薦方案上面全部 12步采樣約7分鐘5.3G速度優(yōu)先用這套TeaCache是最近視頻模型里非常實(shí)用的加速機(jī)制原理是檢測(cè)Transformer計(jì)算中那些“變化不大”的中間緩存直接復(fù)用上一輪結(jié)果而不用重算。對(duì)短劇這種畫面相對(duì)穩(wěn)定的場(chǎng)景效果格外好相當(dāng)于白撿30%到40%的性能。如果你的社區(qū)節(jié)點(diǎn)里沒有這個(gè)選項(xiàng)可以在ComfyUI Manager里搜索“TeaCache”單獨(dú)裝接入方式也很簡(jiǎn)單大致在采樣器前加一個(gè)緩存策略節(jié)點(diǎn)就行。5.2 真正有用的提速三板斧提速這件事我試過的坑不少比如改啟動(dòng)參數(shù)加上--cpu強(qiáng)制CPU算結(jié)果慢到人生重啟完全不推薦。我最終留下來的提速方案就三板斧。第一板斧是量化加載權(quán)重FP8模型配合塊交換這是基數(shù)不做這個(gè)其他全白搭。第二板斧是TeaCache提速前面說過了這是最近視頻擴(kuò)散模型社區(qū)里面效率提升幅度最大的技巧較大的20B模型跑起來收益尤其明顯。如果你配置能力差點(diǎn)嫌麻煩可以直接在社區(qū)節(jié)點(diǎn)生成的工作流里找教你勾選use_teacache的位置。第三板斧是串行執(zhí)行關(guān)掉預(yù)覽。很多人不知道ComfyUI在采樣過程中默認(rèn)會(huì)實(shí)時(shí)渲染預(yù)覽畫面為了渲染這些預(yù)覽幀顯存和顯卡算力都在被分走。在極簡(jiǎn)工作流里把預(yù)覽刷新頻率調(diào)低到每一輪刷新一次或者直接關(guān)掉預(yù)覽在采樣完成后一次性看結(jié)果。這一點(diǎn)相當(dāng)反直覺我一開始也覺得預(yù)覽不影響速度實(shí)際測(cè)下來差了一分多鐘。5.3 常用的小技巧種子鎖定與批量預(yù)覽短劇工作流中你大概率會(huì)不停微調(diào)提示詞來生成同一個(gè)分鏡的不同版本。如果不鎖定種子每次生成都是抽卡你根本不知道畫面變模糊是提示詞改壞了還是僅僅是隨機(jī)拉胯。所以在文本輸入節(jié)點(diǎn)或采樣器的seed參數(shù)里固定一個(gè)種子只調(diào)整提示詞內(nèi)容這樣對(duì)比結(jié)果才有意義。預(yù)覽階段還有一個(gè)省時(shí)間的小技巧采樣完成后先用工作流里自帶的“低分辨率預(yù)覽節(jié)點(diǎn)”快速看一眼構(gòu)圖確認(rèn)構(gòu)圖沒啥問題后再跑視頻超分放大。很多小白上來直接全流程跑完等到視頻輸出完才發(fā)現(xiàn)構(gòu)圖不對(duì)白白浪費(fèi)十幾分鐘。6. 常見問題與排查實(shí)錄兩天里我踩過的坑6.1 常見報(bào)錯(cuò)速查表我根據(jù)測(cè)試過程中遇到的報(bào)錯(cuò)整理了一張速查表任何一條都可以直接對(duì)著解決。報(bào)錯(cuò)信息或表現(xiàn)根本原因解決方案CUDA out of memory顯存峰值超限打開低顯存模式、降幀數(shù)到8、開啟分塊VAE找不到模型文件模型目錄不對(duì)看加載器默認(rèn)目錄重新放模型RuntimeError: expected dtype權(quán)重精度和加載器不匹配統(tǒng)一FP8精度別混用FP16模型加載到99%卡死內(nèi)存不足系統(tǒng)交換嚴(yán)重系統(tǒng)內(nèi)存至少加到32G關(guān)閉后臺(tái)軟件采樣極慢半小時(shí)以上/鏡頭沒開TeaCache或沒開塊交換按第5.2節(jié)的三板斧排查視頻馬賽克色塊VAE解碼精度問題換回模型自帶VAE或打開VAE_Tiling輸出視頻只有幾KB幀率或編碼器設(shè)置異常保存節(jié)點(diǎn)里換imageio_mpeg編碼器這里我特別想提醒的是最后一條輸出視頻幾KB這個(gè)問題會(huì)把新手繞暈很久實(shí)際上不是生成失敗而是編碼器生成的視頻幾乎全是黑幀系統(tǒng)算下來覺得沒內(nèi)容就壓縮成空氣。檢查方法很簡(jiǎn)單用播放器逐幀跳一下如果全是黑的就是編碼器選錯(cuò)了。6.2 關(guān)于顯存占用的兩個(gè)常見誤區(qū)誤區(qū)一認(rèn)為顯存占用是在整個(gè)生成過程中恒定的。事實(shí)上視頻生成的顯存占用曲線是鋸齒狀采樣步驟切換時(shí)舊模塊釋放、新模塊進(jìn)入峰值出現(xiàn)在某幾步的疊加瞬間。所以你在任務(wù)管理器里看到顯存占用才4G結(jié)果下一秒直接爆掉就是這個(gè)原因。解決思路不是去猜峰值而是把幀數(shù)、分塊、模型交換這些參數(shù)都留出余量。誤區(qū)二認(rèn)為系統(tǒng)內(nèi)存越大顯存就能無限“借”過來。這個(gè)理解不全對(duì)CPU與GPU之間的傳輸帶寬才是真正的瓶頸。DDR4內(nèi)存的傳輸帶寬大約幾十GB/sGPU內(nèi)部顯存帶寬是幾百GB/s差距有十倍以上。所以“內(nèi)存換顯存”的技能本質(zhì)是用時(shí)間換空間它只能保證你能跑不能保證你快。這也是為什么我說6G卡跑H3“能跑但不會(huì)快”這句話就是物理邊界別指望純軟件能突破它。6.3 低顯存環(huán)境下最不應(yīng)該做的事別在采樣過程中開著瀏覽器直播畫面GPU的顯存會(huì)被瀏覽器窗口搶占。別把所有幀數(shù)拉到16視頻模型的16幀和文生圖的16張完全不是一個(gè)概念顯存線性增長(zhǎng)一步到位制霸是不可能的。別在采樣過程中用鼠標(biāo)亂拖工作流畫布ComfyUI會(huì)為每次操作重新排隊(duì)計(jì)算一個(gè)誤操作可能毀掉已經(jīng)跑了一半的進(jìn)度。別用Windows自帶的GPU加速截圖軟件錄屏它會(huì)常駐顯存把6G卡的最后一點(diǎn)余量吃掉。7. 結(jié)語我自己的一點(diǎn)經(jīng)驗(yàn)和想法折騰完這套方案我的直接感受是MiniMax H3并沒有想象中那么高不可攀它的門檻更多來自“不知道哪個(gè)環(huán)節(jié)在卡脖子”。20B模型 6G顯存本質(zhì)上是把顯卡和內(nèi)存的界限模糊掉讓工具箱多了一個(gè)選擇。6G卡跑H3不是最舒服的組合但它確實(shí)已經(jīng)進(jìn)入了“個(gè)人也能玩”的范圍這比半年前強(qiáng)太多了。最后再分享一個(gè)我自己一直在用的小技巧跑短劇工作流時(shí)每次生成前先存一份當(dāng)前種子和提示詞的組合記錄。AI生成這件事看起來是隨機(jī)但種子和提示詞的組合一旦鎖定結(jié)果就是可復(fù)現(xiàn)的。把好用的分鏡參數(shù)存成一個(gè)自己的參數(shù)檔案下次直接調(diào)用比你到時(shí)候翻聊天記錄、翻工作流備份要高效得多。這套工作流后續(xù)也很適合擴(kuò)展——它可以作為基底無縫握接進(jìn)角色一致性生成、真人翻拍、文案配音等等很多玩法。只要顯存優(yōu)化這一關(guān)過了后面的事情都會(huì)順暢起來。