戰(zhàn))
1. 先坦白我為什么放著云端 AI 不用非要本地跑1.1 一次緊急任務(wù)讓我意識(shí)到數(shù)據(jù)主權(quán)不是玄學(xué)我最早對(duì)自托管 AI 動(dòng)心不是因?yàn)橛X(jué)得云端 AI 不好用而是有次趕項(xiàng)目需要把一批內(nèi)部合同和代碼片段交給 AI 處理。合同里全是客戶信息、價(jià)格條款和未公開(kāi)的技術(shù)細(xì)節(jié)點(diǎn)下發(fā)送之前我猶豫了十分鐘。那批數(shù)據(jù)一旦進(jìn)了別人的服務(wù)后續(xù)怎么流轉(zhuǎn)、存多久、拿來(lái)訓(xùn)練什么我都控制不了。也就是從那次之后我開(kāi)始認(rèn)真研究自托管 AI——把大模型部署在自己能掌控的機(jī)器上數(shù)據(jù)不出內(nèi)網(wǎng)模型行為自己定義離線也能繼續(xù)干活??赡苡腥擞X(jué)得這是多慮現(xiàn)在主流服務(wù)商都有企業(yè)版協(xié)議出了事可以追責(zé)。但協(xié)議解決的是事后責(zé)任問(wèn)題解決不了事前控制問(wèn)題。在醫(yī)療、法律、金融這類對(duì)保密要求極高的行業(yè)數(shù)據(jù)外發(fā)的審批流程本身就足以讓一個(gè)內(nèi)部工具項(xiàng)目黃掉。我認(rèn)識(shí)的一位朋友做合同審查工具方案評(píng)審會(huì)上被問(wèn)了一句數(shù)據(jù)放哪、誰(shuí)來(lái)管密鑰當(dāng)場(chǎng)就沒(méi)下文了。自托管 AI 之所以值得試第一理由不是性能而是它把數(shù)據(jù)安全這件事從信任問(wèn)題變成了技術(shù)問(wèn)題。1.2 自托管 AI 到底托管了什么很多人以為自托管就是把模型下載下來(lái)跑個(gè)對(duì)話窗口其實(shí)它的含義比這廣得多。完整地看一套自托管 AI 方案至少包含四層模型權(quán)重跑的是開(kāi)源模型如 Llama、Qwen、Mistral 系列而不是某個(gè)服務(wù)商封裝好的黑盒。推理算力生成回答的 GPU/CPU 計(jì)算發(fā)生在你自己的機(jī)器上每一次請(qǐng)求都不需要發(fā)到外部服務(wù)器。數(shù)據(jù)存儲(chǔ)對(duì)話記錄、知識(shí)庫(kù)文檔、向量數(shù)據(jù)庫(kù)全部落在本地磁盤(pán)或內(nèi)網(wǎng)存儲(chǔ)里。工具與配置提示詞、系統(tǒng)角色、插件、API 接口都由你維護(hù)改一條 prompt 不用等任何人審批。云端 AI 的本質(zhì)是租賃你付錢(qián)換使用權(quán)但數(shù)據(jù)入口、模型版本、服務(wù)策略全在對(duì)方手里。自托管的本質(zhì)是擁有哪怕斷網(wǎng)、哪怕服務(wù)商調(diào)整條款你手上的這套東西依然能跑。我后來(lái)在一次出差途中體會(huì)很深——高鐵上信號(hào)斷斷續(xù)續(xù)云端對(duì)話隔幾秒就轉(zhuǎn)圈但本地部署的模型一點(diǎn)不受影響照樣幫我改方案。那種踏實(shí)感是用過(guò)就回不去的。1.3 適合誰(shuí)、不適合誰(shuí)先說(shuō)結(jié)論為了避免大家看完文章才發(fā)現(xiàn)方向不對(duì)我把適用人群擺前面。適合自托管不太適合開(kāi)發(fā)者愿意折騰命令行和配置完全不想碰硬件和終端的人處理敏感數(shù)據(jù)代碼、合同、病歷等核心訴求是要最強(qiáng)模型的用戶有離線或內(nèi)網(wǎng)部署需求需要大規(guī)模并發(fā)生產(chǎn)環(huán)境高頻重度用戶想省訂閱費(fèi)預(yù)算緊張且只偶爾用 AI想深入理解 LLM 機(jī)制的人無(wú)法接受模型能力與云端旗艦有差距的人后面所有內(nèi)容都是圍繞適合這一欄展開(kāi)的。如果你的畫(huà)像更接近右邊建議直接劃走省下時(shí)間。2. 算一筆明白賬自托管的成本到底高不高2.1 訂閱制 vs 一次性硬件投入網(wǎng)上聊自托管必提省錢(qián)但省錢(qián)這件事得算細(xì)賬。先看云端成本訂閱制主流 AI 聊天服務(wù)大約每月 20 美元按人民幣算一年約 1700 元左右三年約 5000 元。API 按量付費(fèi)如果每天都高強(qiáng)度使用比如寫(xiě)代碼、處理長(zhǎng)文檔、跑批量任務(wù)一個(gè)月燒掉幾百塊很正常重度用戶年開(kāi)銷可能上萬(wàn)。企業(yè)級(jí)版本更貴費(fèi)用通常是個(gè)人版的數(shù)倍。再看自托管的一次性投入。以 2025 年初的市場(chǎng)行情為例價(jià)格波動(dòng)大僅供參考方案大致預(yù)算能跑什么二手 RTX 3090 24GB 現(xiàn)有主機(jī)5000~7000 元7B~14B 量化模型流暢跑32B 勉強(qiáng)中等配置主機(jī) 64GB 內(nèi)存純 CPU4000~6000 元7B 量化模型能跑速度較慢Apple Silicon Mac16~32GB 統(tǒng)一內(nèi)存6000~10000 元7B~14B 量化模型體驗(yàn)很好租云 GPU 按小時(shí)1~3 元/小時(shí)彈性使用長(zhǎng)期成本高核心結(jié)論是只要你屬于高頻用戶自托管的硬件成本通常在一年左右就能被訂閱費(fèi)攤平。更重要的是這筆錢(qián)花完?yáng)|西是你的不像訂閱費(fèi)是純消耗。我自己的情況是重度使用半年回本。2.2 電費(fèi)和損耗隱藏支出別忽略但別只盯著硬件價(jià)格電費(fèi)是很多人忽略的隱藏項(xiàng)。一臺(tái) RTX 3090 滿載功耗約 350W整機(jī)算 450W。假設(shè)每天高強(qiáng)度推理 4 小時(shí)一年下來(lái)大約 650 度電按 0.6~1 元/度算就是 400~650 元。如果機(jī)器 7x24 小時(shí)掛機(jī)跑服務(wù)電費(fèi)翻倍是大概率事件。損耗也要算進(jìn)去GPU 風(fēng)扇、電源、固態(tài)硬盤(pán)都有壽命二手卡尤其要做好可能用兩年就得換的心理準(zhǔn)備。我把這些寫(xiě)出來(lái)不是勸退而是想說(shuō)自托管的成本不是買塊顯卡就完了它是一次性投入 持續(xù)電費(fèi) 偶爾維修的組合。做預(yù)算時(shí)按三年周期算才不會(huì)被第一眼的便宜誤導(dǎo)。2.3 什么時(shí)候成本賬真的劃算我的體感是下面三種情況最劃算每天使用時(shí)間超過(guò) 2 小時(shí)訂閱費(fèi)按時(shí)間攤已經(jīng)很貴本地跑邊際成本幾乎為零。數(shù)據(jù)敏感導(dǎo)致云端工具根本不能用這種情況不是省錢(qián)是能不能做的問(wèn)題成本賬反而不重要。業(yè)務(wù)需要定制模型行為云端改一個(gè)系統(tǒng)提示詞都要考慮合規(guī)、審核本地想怎么調(diào)就怎么調(diào)。反過(guò)來(lái)說(shuō)如果你一個(gè)月就用十次每次問(wèn)幾個(gè)問(wèn)題那訂閱制顯然是更理性的選擇。自托管不該是信仰它是工具工具就要講性價(jià)比。3. 硬件與模型選型別腦子一熱就買四塊顯卡3.1 顯存、內(nèi)存帶寬與模型體積的關(guān)系新手最容易犯的錯(cuò)是以為顯卡越多越快、顯存越大越能跑大模型。實(shí)際搞 LLM 推理有兩條鐵律鐵律一模型要裝進(jìn)內(nèi)存或顯存里。模型文件多大就需要多大的內(nèi)存。以 7B 參數(shù)模型為例FP16 精度下權(quán)重約占 14GB換算方式是參數(shù)量 × 2 字節(jié)。跑模型時(shí)除了權(quán)重還要留出上下文KV cache和運(yùn)行開(kāi)銷所以單卡 8GB 顯存跑 7B 模型會(huì)非常緊張。鐵律二推理速度受內(nèi)存帶寬限制不是受算力限制。生成每個(gè) token 都要把全部權(quán)重讀一遍讀取速度直接決定生成速度。同樣是 7B 量化模型在 DDR4 內(nèi)存的 CPU 機(jī)器上可能只有 5~8 token/秒在 RTX 3090 上能跑到 100 token/秒。差距不在顯卡會(huì)算而在顯存帶寬比內(nèi)存帶寬高一個(gè)數(shù)量級(jí)。硬件內(nèi)存帶寬約7B Q4 模型體驗(yàn)雙通道 DDR450 GB/s龜速只適合測(cè)試Apple M1/M2100~200 GB/s能接受約 20~40 token/秒RTX 3060 12GB360 GB/s流暢RTX 3090 24GB936 GB/s很快100 token/秒選硬件的邏輯就兩條先保證內(nèi)存/顯存夠大再追求高帶寬。Apple Silicon 的統(tǒng)一內(nèi)存架構(gòu)在跑中等模型時(shí)性價(jià)比很高這也是為什么很多搞本地 AI 的人首選 Mac。3.2 主流通用模型與中文場(chǎng)景的選擇模型選型上我建議從這幾條線入手Qwen 2.5 系列7B / 14B中文能力強(qiáng)指令跟隨穩(wěn)是目前中文自托管的首選。7B 量化后約 5GB14B 約 9GB。Llama 3.1 8B英文和代碼表現(xiàn)均衡生態(tài)最豐富社區(qū)資料多。DeepSeek-R1-Distill-Qwen-14B推理型模型適合數(shù)學(xué)、邏輯、復(fù)雜分析速度比同尺寸通用模型慢一些。GLM-4-9B-chat中文場(chǎng)景可用亮點(diǎn)是對(duì)話風(fēng)格自然。新手第一臺(tái)機(jī)器我推薦直接上qwen2.5:7b理由很實(shí)際內(nèi)存壓力小、中文效果好、后續(xù)換 14B 也不浪費(fèi)現(xiàn)有架構(gòu)。顯存有 24GB 再考慮 14B 或 32B別一上來(lái)就挑戰(zhàn) 70B那不是入門(mén)該干的事。3.3 量化是怎么把模型塞進(jìn)普通電腦的很多人好奇為什么 7B 模型 FP16 要 14GB網(wǎng)上卻說(shuō) 4GB 顯存也能跑。答案就是量化。模型權(quán)重本質(zhì)是浮點(diǎn)數(shù)。FP16 用 16 位表示一個(gè)數(shù)INT4 用 4 位量化就是把這些數(shù)從高精度壓縮到低精度。效果是體積縮小到原來(lái)的 1/3~1/4速度反而更快因?yàn)橐x取的數(shù)據(jù)變少了但會(huì)有輕微的精度損失。日常對(duì)話基本感覺(jué)不到復(fù)雜推理偶爾能看出區(qū)別。當(dāng)前最主流的格式是 GGUF常見(jiàn)的量化等級(jí)有Q4_K_M體積小、速度快綜合性價(jià)比最高入門(mén)首選。Q5_K_M質(zhì)量略好體積略大顯存夠就選它。Q8_0接近原始精度體積約比 Q4 大一倍。F16 原始精度顯存大戶才玩得起。實(shí)操建議先用 Q4_K_M 跑通流程再根據(jù)顯存余量逐步升檔。我見(jiàn)過(guò)太多人一上來(lái)就下 F16結(jié)果爆顯存走了一晚上彎路。4. 從零搭一套自托管 AI我復(fù)現(xiàn)過(guò)很多次的流程4.1 工具鏈選擇Ollama、llama.cpp、vLLM 各管哪一段自托管 AI 工具鏈有三個(gè)層次搞清楚分層就不會(huì)亂推理引擎真正加載模型、生成 token 的底層組件。前端界面給你提供聊天框、歷史記錄、參數(shù)調(diào)節(jié)的界面。對(duì)接層把本地推理服務(wù)包裝成標(biāo)準(zhǔn) API讓其他軟件能調(diào)用。主流選擇里Ollama是最容易上手的推理引擎自帶 OpenAI 兼容 API還能管理模型下載適合個(gè)人和小團(tuán)隊(duì)。llama.cpp是許多引擎底層的庫(kù)跨平臺(tái)、支持 CPU/GPU 混合推理適合想深入控制的人。vLLM面向生產(chǎn)環(huán)境吞吐量高但需要足夠顯存?zhèn)€人玩家一般用不上。前端界面我最常用的是Open WebUI它把聊天、文件上傳、聯(lián)網(wǎng)搜索、多用戶管理都做了幾秒鐘就能起一個(gè)帶界面的服務(wù)。如果不想用 Docker也可以用 LM Studio 這類圖形化工具連命令都不用敲。4.2 用 Ollama Open WebUI 跑通第一個(gè)對(duì)話以 Linux 或 macOS 為例完整的入門(mén)鏈路如下。先裝 Ollama# 安裝 OllamaWindows 用戶直接去官網(wǎng)下安裝包 curl -fsSL https://ollama.com/install.sh | sh # 拉取一個(gè)適合入門(mén)的中文模型 ollama pull qwen2.5:7b # 啟動(dòng)對(duì)話測(cè)試 ollama run qwen2.5:7b看到模型輸出正常的回復(fù)推理引擎就通了。這時(shí)候你只有一個(gè)命令行窗口想要網(wǎng)頁(yè)界面就加 Open WebUI推薦用 Docker 部署docker run -d \ -p 3000:8080 \ -v open-webui:/app/backend/data \ --name open-webui \ --add-hosthost.docker.internal:host-gateway \ ghcr.io/open-webui/open-webui:main用 Linux 且想讓容器里的 WebUI 調(diào)用宿主機(jī)的 GPU啟動(dòng)命令里加上--gpus all。裝好后瀏覽器訪問(wèn)http://localhost:3000注冊(cè)第一個(gè)管理員賬號(hào)在設(shè)置里選擇qwen2.5:7b就可以開(kāi)始對(duì)話了。跑通這一步你已經(jīng)有了一套完整可用的本地 AI 服務(wù)全程大概二十分鐘。提示如果不想用 Docker也可以直接pip install open-webui然后運(yùn)行open-webui serve效果一樣只是環(huán)境依賴需要自己處理。4.3 接入既有服務(wù)的 OpenAI 兼容接口自托管跑通之后真正的爆發(fā)點(diǎn)是 OpenAI 兼容 API?,F(xiàn)在幾乎所有 AI 工具——Dify、Continue.dev、n8n、LangChain、各種客戶端——都支持自定義 API 地址。你只要把 Base URL 指到http://localhost:11434/v1就能讓它們用上本地模型。以 Python 代碼為例之前寫(xiě)好的云端調(diào)用代碼幾乎不用改from openai import OpenAI client OpenAI( base_urlhttp://localhost:11434/v1, # 本地服務(wù)地址 api_keyollama, # 本地網(wǎng)關(guān)不校驗(yàn)填什么都可以 ) resp client.chat.completions.create( modelqwen2.5:7b, messages[{role: user, content: 用一個(gè)比喻解釋 KV cache}], ) print(resp.choices[0].message.content)這一步的價(jià)值是你日常在用的所有云端 AI 腳本、配置、工作流全部可以無(wú)縫切到本地。我就靠這個(gè)接口把原來(lái)掛在云端 API 上的自動(dòng)化腳本一次性遷移到了內(nèi)網(wǎng)數(shù)據(jù)從此不再出內(nèi)網(wǎng)而調(diào)用方式毫無(wú)感知。5. 讓它真正干活編程、知識(shí)庫(kù)與輕量 Agent5.1 本地代碼助手的搭配思路搭好基礎(chǔ)服務(wù)之后第一件值得干的事是接編程助手。我用的是Continue.dev Ollama 的組合在 VS Code 里裝好 Continue 插件配置文件寫(xiě)成本地模型models: - name: Local Coder provider: ollama model: qwen2.5-coder:7b配置完就能在 IDE 內(nèi)獲得代碼補(bǔ)全、解釋、重構(gòu)建議。實(shí)測(cè)下來(lái)qwen2.5-coder:7b這類專用模型在補(bǔ)全和中型函數(shù)修改上表現(xiàn)不錯(cuò)足夠應(yīng)付大部分日常編碼。要誠(chéng)實(shí)地說(shuō)復(fù)雜跨文件重構(gòu)、框架級(jí)架構(gòu)設(shè)計(jì)本地模型和云端頂級(jí)模型的差距仍然明顯。我的用法是簡(jiǎn)單任務(wù)直接本地做復(fù)雜任務(wù)本地先給思路再?zèng)Q定是否上云端。安全性是這套方案的隱藏收益。公司代碼倉(cāng)庫(kù)里有密鑰、內(nèi)部注釋、未發(fā)布的功能分支這些內(nèi)容丟到云端 IDE 插件里是有風(fēng)險(xiǎn)的本地模型完全沒(méi)有這個(gè)問(wèn)題。5.2 RAG 知識(shí)庫(kù)問(wèn)答的搭建要點(diǎn)想讓本地 AI 回答我們公司的報(bào)銷流程是什么這種問(wèn)題靠模型本身的知識(shí)是不夠的需要引入 RAG檢索增強(qiáng)生成。流程不復(fù)雜把文檔切塊、向量化、存進(jìn)向量庫(kù)、提問(wèn)時(shí)檢索相關(guān)片段拼進(jìn)提示詞。本地搭建我推薦AnythingLLM或Dify兩者都內(nèi)置了 RAG 全流程不需要自己寫(xiě)代碼。文檔處理階段的幾個(gè)參數(shù)直接影響效果場(chǎng)景推薦分塊大小重疊比例代碼倉(cāng)庫(kù)200~400 token10%合同/制度文檔500 token15%長(zhǎng)論文/書(shū)籍800 token10%分塊太小檢索碎片化太大則浪費(fèi)上下文窗口且命中不精準(zhǔn)。嵌入模型可以選本地的bge-m3中文效果好完全離線運(yùn)行。做知識(shí)庫(kù)最容易翻車的地方是文檔格式混亂PDF 里帶掃描圖片必須先 OCR否則檢索質(zhì)量慘不忍睹——這一步偷懶的話后面全白干。5.3 多模型協(xié)作與輕量 Agent 的嘗試自托管的好處之一是你可以同時(shí)跑多個(gè)模型讓它們各司其職。我目前搭了一個(gè)很輕的協(xié)作流一個(gè)模型負(fù)責(zé)意圖識(shí)別把請(qǐng)求路由到具體任務(wù)一個(gè) 7B 參數(shù)模型負(fù)責(zé)格式化與總結(jié)再用一個(gè)小模型做關(guān)鍵詞提取喂給搜索引擎或數(shù)據(jù)庫(kù)。整體效果接近一個(gè)迷你 Agent 組但每個(gè)環(huán)節(jié)都很便宜因?yàn)槎际潜镜赝评怼H绻阆氚?Agent 做得更完整可以研究一下 Model Context ProtocolMCP。它是讓模型連接外部工具的統(tǒng)一協(xié)議配置好之后本地模型可以調(diào)用文件系統(tǒng)、數(shù)據(jù)庫(kù)、甚至專業(yè)軟件的接口。我從熱詞里看到不少朋友在關(guān)注AI agent 搭建和MCP server我的建議是別一上來(lái)就上復(fù)雜框架先用一條最簡(jiǎn)單的鏈路模型收到指令 — 調(diào)用 MCP 工具 — 返回結(jié)果 — 模型匯總輸出。這套鏈路跑通之后再逐步疊加工具面比直接套大廠框架容易落地得多。6. 踩坑清單這些坑我基本都踩過(guò)一遍6.1 模型能加載但速度慢問(wèn)題多半在內(nèi)存帶寬我第一次跑本地模型用的是一臺(tái) 64GB 內(nèi)存的普通臺(tái)式機(jī)純 CPU 推理7B 量化模型只有每秒 6~8 個(gè) token。打一句話要等十幾秒體驗(yàn)極差。當(dāng)時(shí)我以為是 CPU 核心數(shù)不夠折騰了半天后來(lái)才明白瓶頸在內(nèi)存帶寬——DDR4 雙通道的帶寬只有 50GB/s 左右而模型每生成一個(gè) token 就要把幾個(gè) GB 的權(quán)重從頭讀一遍物理上限就擺在那。解決辦法三條路換高帶寬硬件GPU 或 Apple Silicon、換更小的量化模型、縮短上下文長(zhǎng)度上下文越長(zhǎng)每次生成要處理的 KV cache 越大。先看每秒 token 數(shù)是不是低于 10再?zèng)Q定走哪條路。別盲目加 CPU 核心那是在錯(cuò)誤的方向上燒錢(qián)。6.2 上下文一長(zhǎng)就爆顯存很多人都盯著模型權(quán)重大小卻漏了 KV cache。隨著對(duì)話變長(zhǎng)模型要把歷史 token 的鍵值緩存記在內(nèi)存里這部分開(kāi)銷隨上下文長(zhǎng)度線性增長(zhǎng)。顯存 8GB 的卡跑 7B 模型默認(rèn) 8K 上下文都未必穩(wěn)一旦窗口拉滿很容易 OOM。在 Ollama 里可以通過(guò)參數(shù)控制/set parameter num_ctx 4096我的經(jīng)驗(yàn)是個(gè)人日常對(duì)話 4K 就夠知識(shí)庫(kù)問(wèn)答看文檔長(zhǎng)度酌情設(shè) 8K~16K但設(shè)得越高內(nèi)存余量越要留足。別被模型標(biāo)稱的128K 上下文騙了那是理想配置下的紙面數(shù)據(jù)。6.3 溫度、提示詞與模板的影響本地模型對(duì)參數(shù)和提示詞的敏感度比想象中高。做代碼任務(wù)時(shí)溫度設(shè) 0.1~0.3輸出更穩(wěn)定、更少幻覺(jué)做創(chuàng)意寫(xiě)作再調(diào)到 0.7~0.9。很多人直接默認(rèn)溫度結(jié)果代碼生成經(jīng)常發(fā)揮過(guò)頭以為是模型不行其實(shí)是參數(shù)沒(méi)調(diào)。提示詞模板也值得固化。Ollama 支持用 Modelfile 定制系統(tǒng)提示詞FROM qwen2.5:7b SYSTEM 你是一個(gè)熟悉 Linux 運(yùn)維的技術(shù)助手回答盡量簡(jiǎn)潔步驟必須可執(zhí)行。 PARAMETER temperature 0.3ollama create my-ops-assistant -f Modelfile以后啟動(dòng)ollama run my-ops-assistant就自動(dòng)帶上這套角色和參數(shù)。這個(gè)習(xí)慣幫我省了大量重復(fù)調(diào)教的時(shí)間本質(zhì)上是在把調(diào)模型變成配配置。6.4 并發(fā)瓶頸本地模型不是生產(chǎn)服務(wù)器最后潑盆冷水本地模型在并發(fā)能力上遠(yuǎn)不能和云端服務(wù)比。一塊 24GB 顯卡跑 7B 模型兩三個(gè)人同時(shí)用可能還行五六個(gè)人同時(shí)提問(wèn)就開(kāi)始排隊(duì)響應(yīng)時(shí)間肉眼可見(jiàn)地變長(zhǎng)。我就犯過(guò)這個(gè)錯(cuò)興沖沖給團(tuán)隊(duì)搭了個(gè)內(nèi)網(wǎng) AI 工具結(jié)果第一天下午就卡到?jīng)]法用。如果真的要支撐幾十人規(guī)模方案是換 vLLM 這類高吞吐引擎、上多卡或干脆用混合架構(gòu)。關(guān)于混合架構(gòu)多說(shuō)一句不需要在全本地和全云端之間二選一。敏感數(shù)據(jù)走本地模型大規(guī)模高難任務(wù)按需走云端 API既保安全又保體驗(yàn)這是我目前最推薦的狀態(tài)。踩過(guò)這些坑之后我反而更確信自托管 AI 值得一試。它不是那個(gè)什么都能干的最強(qiáng) AI但它是那個(gè)完全屬于你、隨時(shí)能改、離線也能用的 AI。這半年下來(lái)我最大的收獲不是省了多少錢(qián)而是真正理解了模型是怎么被加載、量化、調(diào)優(yōu)的——這種理解讓我回頭用任何云端 AI 時(shí)都清醒得多。如果你想動(dòng)手從一臺(tái)內(nèi)存不低于 16GB、最好 32GB 的機(jī)器開(kāi)始拉一個(gè) 7B 量化模型先把第一個(gè)對(duì)話跑通。后面的路會(huì)越走越順。