據(jù)中心光互連崛起:從銅纜到硅光的AI算力變革)
數(shù)據(jù)中心正在迎來(lái)一個(gè)容易被忽視、但影響深遠(yuǎn)的轉(zhuǎn)折互聯(lián)介質(zhì)正在從銅線切換到光。過(guò)去十年交換機(jī)端口的速率從 40G 走到 800G但線纜的物理極限卻越來(lái)越明顯——距離一長(zhǎng)、速率一高銅纜的功耗和成本會(huì)指數(shù)上升。就在這個(gè)窗口期Lumilens 以 700M 美元的融資規(guī)模進(jìn)入大眾視野主打的正是“用光替代數(shù)據(jù)中心內(nèi)部的線纜”。這件事不只是融資新聞它背后是整個(gè) AI 算力集群對(duì)互聯(lián)帶寬的極端需求以及硅光技術(shù)從實(shí)驗(yàn)室走向大規(guī)模量產(chǎn)的開(kāi)端。這篇文章從技術(shù)角度拆解三件事第一數(shù)據(jù)中心內(nèi)部互聯(lián)為什么會(huì)從銅轉(zhuǎn)向光第二Lumilens 這類(lèi)公司做的光互連到底改變了什么第三作為開(kāi)發(fā)者、算法工程師或運(yùn)維人員你要關(guān)注哪些技術(shù)變量。1. 為什么數(shù)據(jù)中心互聯(lián)會(huì)成為千億美元賽道先說(shuō)結(jié)論GPU 集群的擴(kuò)展速度已經(jīng)超過(guò)了傳統(tǒng)銅纜互聯(lián)能承載的物理極限。大模型訓(xùn)練本質(zhì)上是一個(gè)大規(guī)模并行計(jì)算問(wèn)題。以萬(wàn)卡集群為例數(shù)千張 GPU 在訓(xùn)練同一個(gè)模型時(shí)需要頻繁同步梯度。每一次梯度同步都意味著節(jié)點(diǎn)之間要傳輸大量數(shù)據(jù)。GPU 算力提升可以靠芯片設(shè)計(jì)、先進(jìn)工藝但卡與卡之間的數(shù)據(jù)搬運(yùn)必須靠網(wǎng)絡(luò)和線纜完成。傳統(tǒng)數(shù)據(jù)中心內(nèi)部大量使用 DACDirect Attach Cable銅纜也就是我們常說(shuō)的無(wú)源高速銅纜。它的優(yōu)勢(shì)很明顯成本低、功耗低、即插即用。但它有一個(gè)硬傷隨著速率提升銅纜的有效傳輸距離急劇縮短。400G 時(shí)代DAC 的有效傳輸距離通常只有 2 到 3 米。800G 時(shí)代這個(gè)距離還會(huì)繼續(xù)收縮。一旦超過(guò)有效距離信號(hào)完整性會(huì)嚴(yán)重劣化誤碼率上升只能改用 AEC有源電纜或光模塊。大模型集群的物理規(guī)模決定了GPU 和 GPU 之間、GPU 和交換機(jī)之間的距離不可能都很短。一個(gè)標(biāo)準(zhǔn)的智算中心機(jī)房機(jī)柜到 Leaf 交換機(jī)的距離往往超過(guò) 5 米跨機(jī)柜和跨列的距離可能是幾十米到上百米。在這個(gè)尺度下銅纜已經(jīng)無(wú)能為力。更關(guān)鍵的是功耗。速率越高銅纜上的信號(hào)損耗越大。為了維持信號(hào)質(zhì)量就需要更強(qiáng)的驅(qū)動(dòng)電路和均衡算法。這會(huì)導(dǎo)致 SerDes 功耗、線纜自身發(fā)熱都快速上升。800G 銅纜鏈路的功耗預(yù)算非常緊張光模塊雖然也有功耗但在長(zhǎng)距離和高速率場(chǎng)景下單位比特傳輸功耗反而優(yōu)于銅纜。所以 Lumilens 拿到的這 700M 美元本質(zhì)上不是給一家初創(chuàng)公司的“估值獎(jiǎng)勵(lì)”而是資本市場(chǎng)對(duì)“數(shù)據(jù)中心互聯(lián)介質(zhì)換代”這個(gè)確定性趨勢(shì)的押注。2. 從“銅線”到“光線”變化發(fā)生在哪一層要理解光互連替代銅纜先要分清數(shù)據(jù)中心里有哪幾種互聯(lián)需求。按照通信距離和層次可以簡(jiǎn)單分成四類(lèi)互聯(lián)層級(jí)典型距離傳統(tǒng)方案光互連方案芯片內(nèi)部 / 封裝級(jí)毫米級(jí)金屬走線共封裝光學(xué)CPO光 I/O 到封裝邊緣機(jī)柜內(nèi) / GPU 到交換機(jī)2-10 米DAC 銅纜、AEC近封裝光學(xué)NPO、可插拔光模塊列間 / 交換機(jī)之間10-100 米AOC 有源光纜可插拔光模塊QSFP-DD、OSFP樓宇間 / 數(shù)據(jù)中心互聯(lián) DCI數(shù)百米到數(shù)十公里長(zhǎng)距離光模塊相干光模塊、硅光集成Lumilens 這種公司的核心產(chǎn)品方向主要集中在數(shù)據(jù)中心內(nèi)部的中短距離光互連也就是機(jī)柜內(nèi)、機(jī)柜到交換機(jī)、交換機(jī)到交換機(jī)這一段。這段距離過(guò)去大量使用 DAC 和 AOC現(xiàn)在正在被更高速率、更低功耗的光模塊替代。很多人會(huì)誤以為“光進(jìn)銅退”只是把線換一下。實(shí)際上這個(gè)替換發(fā)生在三個(gè)層面第一層是物理介質(zhì)。這條線從銅纜換成光纖信號(hào)載體從電脈沖變成光脈沖。這是最直觀的變化。第二層是信號(hào)調(diào)制與編碼。電信號(hào)需要經(jīng)過(guò) DSP數(shù)字信號(hào)處理器調(diào)制到光載波上到達(dá)另一端后再解調(diào)回電信號(hào)。DSP 的算法直接決定誤碼率、功耗和成本。第三層是系統(tǒng)架構(gòu)。當(dāng)光模塊足夠小、功耗足夠低交換機(jī)廠商、GPU 廠商就會(huì)考慮要不要把光引擎做到交換芯片旁邊甚至做到 GPU 封裝旁邊。這就是 CPOCo-Packaged Optics路線架構(gòu)一旦變化整個(gè)散熱、維護(hù)、故障隔離方式都要跟著改。所以光互連替代銅纜不只是組件替換而是從傳輸介質(zhì)到系統(tǒng)架構(gòu)的整體遷移。這也是為什么頭部云廠商會(huì)深度參與這類(lèi)創(chuàng)業(yè)公司的融資——它關(guān)系到未來(lái)十萬(wàn)卡集群的物理可行性。3. Lumilens 到底是什么類(lèi)型的公司由于公開(kāi)信息有限我們可以先看標(biāo)題里的幾個(gè)關(guān)鍵詞Startup、Raise、$700M、Replace Data-Center Wires with Light。這是一個(gè)典型的硅光互聯(lián)創(chuàng)業(yè)公司畫(huà)像。從行業(yè)邏輯推斷它大概率做的事情是把傳統(tǒng)的光模塊和光引擎通過(guò)硅光工藝和先進(jìn)封裝集成在一起做成更高密度、更低功耗、更低成本的光互連產(chǎn)品。這里需要理解硅光Silicon Photonics到底是什么。傳統(tǒng)的分立光模塊是用幾顆獨(dú)立的芯片實(shí)現(xiàn)的激光器芯片負(fù)責(zé)發(fā)光調(diào)制器芯片負(fù)責(zé)把電信號(hào)加載到光上探測(cè)器芯片負(fù)責(zé)接收。每一顆芯片用不同的材料體系比如磷化銦InP、砷化鎵GaAs封裝時(shí)要把它們精密對(duì)準(zhǔn)、耦合、打線工藝復(fù)雜、成本高。硅光則是用 CMOS 工藝來(lái)做光學(xué)器件。把波導(dǎo)、調(diào)制器、探測(cè)器、耦合器全部集成到硅片上再用半導(dǎo)體工藝批量制造。好處是成本可以攤薄、集成度可以提升、功耗可以降低。Lumilens 要做的事情從技術(shù)方向看大概率屬于這個(gè)范疇用硅光把數(shù)據(jù)中心內(nèi)部的光互連做得更便宜、更可靠、更容易大規(guī)模部署。但這不意味著它可以繞開(kāi)光模塊行業(yè)積累的工程難題。硅光雖然集成度高但激光器仍然需要外部光源或混合集成光纖到芯片的耦合效率仍然是個(gè)老大難大功率下的熱管理也遠(yuǎn)比電芯片復(fù)雜。這也是為什么 Lumilens 拿到的錢(qián)不是幾千萬(wàn)而是 700M 美元——因?yàn)楣韫獾难邪l(fā)和量產(chǎn)需要同時(shí)攻克芯片設(shè)計(jì)、封裝工藝、可靠性驗(yàn)證和客戶(hù)導(dǎo)入四個(gè)環(huán)節(jié)任何一個(gè)環(huán)節(jié)掉鏈子產(chǎn)品都上不了量。4. 光互連技術(shù)棧的核心組件拆解為了給后面實(shí)踐部分做鋪墊這里先梳理光互連中最常接觸的六個(gè)技術(shù)概念。做網(wǎng)絡(luò)、系統(tǒng)或算法優(yōu)化的工程師理解這些詞以后才能看懂設(shè)備廠商的產(chǎn)品參數(shù)。光模塊Optical Transceiver把電信號(hào)轉(zhuǎn)成光信號(hào)、再把光信號(hào)轉(zhuǎn)回電信號(hào)的器件。常見(jiàn)封裝有 QSFP-DD、OSFP。數(shù)據(jù)中心內(nèi)部主流是 400G、800G 這類(lèi)可插拔模塊。DSPDigital Signal Processor光模塊內(nèi)部負(fù)責(zé)信號(hào)修復(fù)、均衡和編碼的芯片。它決定一個(gè) 800G 模塊要用多高功耗的電芯片去補(bǔ)償信號(hào)損傷也直接影響模塊價(jià)格。DSP 是光模塊功耗的主要來(lái)源之一。硅光芯片Silicon Photonics用 CMOS 工藝制造的光學(xué)集成電路包含調(diào)制器、探測(cè)器、波導(dǎo)等結(jié)構(gòu)。CPOCo-Packaged Optics把光引擎和交換芯片封裝在同一個(gè)基板上縮短電信號(hào)走線距離降低功耗提高整機(jī)端口密度。CPO 是比可插拔光模塊更激進(jìn)的架構(gòu)。LPOLinear-drive Pluggable Optics去掉模塊內(nèi)部的 DSP 重定時(shí)功能讓交換芯片的 SerDes 直接驅(qū)動(dòng)光引擎。功耗更低但犧牲了信號(hào)恢復(fù)能力對(duì)鏈路質(zhì)量要求更高。AOC / DAC / AEC分別是有源光纜、無(wú)源銅纜、有源電纜。AOC 適合中短距離DAC 適合短距離AEC 在銅纜基礎(chǔ)上加入信號(hào)放大延長(zhǎng)銅纜可用距離。這些概念之間不是互斥的而是針對(duì)“密度、功耗、成本、距離”四個(gè)維度的不同取舍。理解取舍關(guān)系比記住概念本身更重要。5. 為什么 AI 大模型集群最需要光互連前面講的是傳輸介質(zhì)和產(chǎn)品形態(tài)這一節(jié)聚焦一個(gè)實(shí)際問(wèn)題大模型訓(xùn)練集群為什么是最先被光互連改變的場(chǎng)景。大模型訓(xùn)練的通信模式大體可以分為三類(lèi)。第一類(lèi)是集合通信Collective Communication。AllReduce、AllGather 這類(lèi)操作要求在短時(shí)間內(nèi)完成跨節(jié)點(diǎn)數(shù)據(jù)聚合。萬(wàn)卡訓(xùn)練時(shí)每完成一個(gè)迭代都要做一次全集群的梯度同步。通信時(shí)間直接變成訓(xùn)練等待時(shí)間通信效率就是訓(xùn)練效率。第二類(lèi)是流水線并行通信。在流水線并行中不同層的計(jì)算分布在不同 GPU 上前向和反向傳播需要在層與層之間傳輸激活值和梯度。這種通信對(duì)延遲敏感距離越短越好。第三類(lèi)是專(zhuān)家并行和 MoE 通信?;旌蠈?zhuān)家模型會(huì)把不同專(zhuān)家放在不同節(jié)點(diǎn)Token 需要路由到對(duì)應(yīng)專(zhuān)家所在的 GPU 上通信模式更碎片化、更動(dòng)態(tài)對(duì)網(wǎng)絡(luò)帶寬和網(wǎng)絡(luò)拓?fù)涞倪m應(yīng)能力要求更高。這三種模式都指向同一個(gè)結(jié)論集群規(guī)模越大通信質(zhì)量和網(wǎng)絡(luò)帶寬就越成為訓(xùn)練吞吐量的瓶頸。英偉達(dá)在系統(tǒng)設(shè)計(jì)里提出過(guò)“等效帶寬”的概念。簡(jiǎn)單理解GPU 計(jì)算數(shù)據(jù)的速度和網(wǎng)絡(luò)搬運(yùn)數(shù)據(jù)的速度必須匹配。如果計(jì)算速度是每秒 1000 個(gè) Token但網(wǎng)絡(luò)搬運(yùn)只能支撐每秒 500 個(gè) Token那 GPU 有一半時(shí)間在空轉(zhuǎn)。光互連接入后對(duì)集群的直接改變有三個(gè)單鏈路帶寬更高。單根光纖可以承載 800G、1.6T而銅纜做到 800G 已經(jīng)非常吃力。傳輸距離更長(zhǎng)。光信噪比在幾十米到幾百米內(nèi)幾乎不衰減不限制機(jī)柜和機(jī)柜之間的距離。功耗更低。單位比特傳輸功耗更低對(duì)大規(guī)模集群的供電和散熱壓力是重大緩解。所以 Lumilens 拿到 700M 美元的核心邏輯不是“搞一個(gè)新產(chǎn)業(yè)鏈”而是“AI 算力集群的擴(kuò)展速度和規(guī)模已經(jīng)超出了傳統(tǒng)銅纜互聯(lián)的支撐上限”。6. 從成本模型看銅纜和光纜的真實(shí)差距這一節(jié)聊一個(gè)更實(shí)際的問(wèn)題光互連這么強(qiáng)為什么沒(méi)有在五年前徹底替代銅纜答案很簡(jiǎn)單成本。銅纜的物料成本遠(yuǎn)低于光模塊這是它至今仍大量存在的原因。一個(gè) 400G DAC 可能只要幾百到一千元人民幣而一個(gè) 400G 光模塊可能要到兩三千元甚至更高。帶寬需求沒(méi)有達(dá)到某個(gè)臨界點(diǎn)時(shí)算總賬銅纜更劃算。但是當(dāng)集群規(guī)模變大總成本的計(jì)算方式會(huì)改變。第一功耗成本。假設(shè)一個(gè) 10 萬(wàn)卡集群每張卡對(duì)應(yīng)的網(wǎng)絡(luò)端口功耗相差 5 瓦10 萬(wàn)卡就是 500 千瓦的差距。這還沒(méi)算制冷。按電費(fèi)折算一年的差額就在千萬(wàn)元級(jí)別。第二故障和維護(hù)成本。銅纜在長(zhǎng)距離高速率下更容易出現(xiàn)誤碼和鏈路不穩(wěn)定排障時(shí)間、鏈路重新訓(xùn)練時(shí)間都會(huì)拉高集群的無(wú)效工作時(shí)間。光鏈路雖然也會(huì)故障但可監(jiān)控性更強(qiáng)光纖鏈路診斷也更成熟。第三布線空間和端口密度。同樣一個(gè)交換機(jī)面板光模塊能做到 QSFP-DD、OSFP 這樣的高密度封裝端口數(shù)量更多布線更靈活。銅纜直徑大、重量大機(jī)柜內(nèi)走線空間很容易被占滿。所以這不是“光一定優(yōu)于銅”的絕對(duì)判斷而是“在高速率、大規(guī)模、長(zhǎng)距離場(chǎng)景下光的整體擁有成本TCO更低”。這正是 700M 美元融資背后的成本計(jì)算模型。7. 開(kāi)發(fā)者如何評(píng)估光互連帶來(lái)的集群變化前面講了產(chǎn)業(yè)邏輯和技術(shù)概念這一節(jié)落到實(shí)操分三個(gè)角色來(lái)聊。如果你是算法工程師或大模型訓(xùn)練工程師最直接的感受是訓(xùn)練穩(wěn)定性和吞吐量變化。光互連帶寬更高、誤碼率更低AllReduce 時(shí)間會(huì)更短訓(xùn)練迭代時(shí)間會(huì)更穩(wěn)定。你應(yīng)該關(guān)注的是監(jiān)控指標(biāo)里是否出現(xiàn)網(wǎng)絡(luò)等待、鏈路重傳、AllReduce 耗時(shí)波動(dòng)。如果你是網(wǎng)絡(luò)或系統(tǒng)運(yùn)維工程師你需要關(guān)注的是光模塊的數(shù)字化診斷監(jiān)控DDM信息包括光功率、溫度、電壓、偏置電流。光鏈路比銅纜多出光功率這個(gè)核心監(jiān)控維度。鏈路劣化通常先表現(xiàn)為光功率下降而不是突然中斷。提前預(yù)警比事后排查更能保證集群穩(wěn)定。如果你是平臺(tái)研發(fā)工程師你可能要關(guān)注調(diào)度器是否感知網(wǎng)絡(luò)拓?fù)?。大模型?xùn)練的最佳實(shí)踐是把頻繁通信的 Worker 調(diào)度到同一個(gè) ToR 交換機(jī)下減少跨交換機(jī)流量。光互連雖然提高了帶寬但跨交換機(jī)通信的延遲仍然高于同交換機(jī)內(nèi)通信。拓?fù)涓兄{(diào)度依然重要。8. 光互連集群的帶寬需求估算示例為了更直觀地理解光互連的驅(qū)動(dòng)力這里用一個(gè)最小估算腳本演示一個(gè)訓(xùn)練集群到底需要多大的網(wǎng)絡(luò)帶寬。假設(shè)使用 1000 張 H 系列 GPU 訓(xùn)練一個(gè)大模型每張卡的模型并行度、每輪需要傳輸?shù)奶荻葦?shù)據(jù)量設(shè)為變量。這里不執(zhí)著于具體數(shù)值重點(diǎn)展示估算思路。# 文件路徑estimate_bandwidth.py # 功能粗略估算大模型訓(xùn)練集群的總線帶寬需求 def estimate_training_bandwidth( gpu_count: int, bytes_per_gpu_per_step: float, sync_seconds: float, utilization: float 0.8, ) - float: 估算給定 GPU 數(shù)量和同步時(shí)間內(nèi)所需的總互聯(lián)帶寬。 參數(shù)說(shuō)明 - gpu_count: GPU 卡數(shù) - bytes_per_gpu_per_step: 每張卡每個(gè)訓(xùn)練步驟平均需要發(fā)送的字節(jié)數(shù)單位 Byte - sync_seconds: 期望的梯度同步耗時(shí)上限單位 秒 - utilization: 網(wǎng)絡(luò)可用利用率一般取 0.7-0.9 total_bytes gpu_count * bytes_per_gpu_per_step bandwidth_bps total_bytes / sync_seconds / utilization bandwidth_gbps bandwidth_bps / 1e9 return bandwidth_gbps if __name__ __main__: # 示例1000 卡每卡每步同步 1GB 梯度希望 5 秒內(nèi)完成同步 gbps estimate_training_bandwidth( gpu_count1000, bytes_per_gpu_per_step1 * 1024 * 1024 * 1024, sync_seconds5.0, utilization0.8, ) print(f估算所需總互聯(lián)帶寬: {gbps:.0f} Gbps) print(f折合 800G 光模塊鏈路數(shù): {gbps / 800:.1f} 條)運(yùn)行方式python estimate_bandwidth.py這個(gè)模型的結(jié)論是千卡集群已經(jīng)需要數(shù)百 Gbps 到 Tbps 級(jí)別的互連帶寬這遠(yuǎn)超傳統(tǒng)銅纜在幾米以上的承載能力。所以光互連不是“錦上添花”而是規(guī)模擴(kuò)展的必選項(xiàng)。9. 光鏈路健康檢查的常用命令與監(jiān)控思路光模塊的運(yùn)維和銅纜有一個(gè)明顯差異你可以直接讀到模塊內(nèi)部的光功率數(shù)值判斷鏈路質(zhì)量是否在安全范圍內(nèi)。這里給出一個(gè)通用的健康檢查思路不綁定具體廠商。以 Linux 環(huán)境下使用 ethtool 查詢(xún)光模塊 DDM 信息為例# 查看所有網(wǎng)絡(luò)接口 ip link show # 查看指定接口的鏈路狀態(tài) ethtool eth0 # 查詢(xún)光模塊 DDM 信息光功率、溫度、電壓、偏置電流 ethtool -m eth0ethtool -m輸出中需要重點(diǎn)關(guān)注幾個(gè)字段Laser output power發(fā)送光功率。如果低于閾值下限可能是模塊發(fā)射端老化。Receiver signal average optical power接收光功率。如果過(guò)低可能是光纖衰減過(guò)大、連接器污染或鏈路距離超標(biāo)。Module temperature模塊溫度。光模塊對(duì)高溫敏感超過(guò)工作溫度范圍會(huì)導(dǎo)致誤碼率上升。光功率不是“越低越省電”而是必須落在廠商規(guī)定的范圍內(nèi)。過(guò)高會(huì)導(dǎo)致光接收器飽和過(guò)低會(huì)導(dǎo)致信號(hào)無(wú)法正確恢復(fù)。日常運(yùn)維中如果發(fā)現(xiàn)誤碼率上升第一步不是換模塊而是先用儀器檢測(cè)光纖端面是否被污染、光功率是否漂移。下面是采集多個(gè)端口光功率并報(bào)警的示例腳本這里使用ethtool作為演示工具#!/bin/bash # 文件路徑check_optics.sh # 功能檢查多個(gè)網(wǎng)口的光模塊接收功率輸出低于閾值的端口 THRESHOLD_DBM-12 for intf in eth0 eth1 eth2 eth3; do rx_power$(ethtool -m $intf 2/dev/null | grep Receiver signal average optical power | awk -F : {print $2} | awk {print $1}) if [ -z $rx_power ]; then echo $intf: 無(wú)法獲取光功率信息 continue fi echo $intf: RX power ${rx_power} dBm # 使用 awk 做浮點(diǎn)數(shù)比較 awk -v intf$intf -v p$rx_power -v t$THRESHOLD_DBM \ BEGIN { if (p t) print intf : 接收光功率低于閾值請(qǐng)檢查光纖鏈路 } done運(yùn)行方式chmod x check_optics.sh ./check_optics.sh這里的-12 dBm只是一個(gè)示例閾值真實(shí)環(huán)境中必須參考你的光模塊規(guī)格書(shū)。不同速率、不同距離的光模塊接收靈敏度和告警閾值差別很大。10. 生產(chǎn)環(huán)境接入光互連時(shí)的調(diào)度配置示例光互連改造完成后集群軟件層也需要做配合。一個(gè)典型工作是讓調(diào)度器感知網(wǎng)絡(luò)拓?fù)浔M量把通信量大的任務(wù)放到同一個(gè)交換域內(nèi)。這里以一個(gè)簡(jiǎn)化的調(diào)度策略配置文件為例展示拓?fù)涓兄{(diào)度的配置思路。實(shí)際場(chǎng)景中具體字段和參數(shù)以你的調(diào)度系統(tǒng)為準(zhǔn)。# 文件路徑topology-aware-scheduling.yaml # 功能示意一個(gè)感知網(wǎng)絡(luò)拓?fù)涞娜蝿?wù)調(diào)度配置 apiVersion: scheduling.example.io/v1 kind: TopologyAwarePolicy metadata: name: gpu-training-policy spec: # 允許的跨交換機(jī)通信比例。比例越低調(diào)度器越傾向于把任務(wù)放到同一交換域內(nèi)。 maxCrossSwitchTrafficRatio: 0.15 # 訓(xùn)練任務(wù)關(guān)鍵通信模式 preferredCommunicationPattern: allreduce # 鏈路質(zhì)量篩選調(diào)度 Worker 時(shí)排除光功率接近告警閾值的節(jié)點(diǎn) linkHealthFilter: enabled: true metric: rx_power_dbm minThreshold: -12 # 親和規(guī)則優(yōu)先將同一任務(wù)的 Worker 調(diào)度到同一機(jī)柜 affinity: sameRackPreferred: true sameTorSwitchPreferred: true # 拓?fù)涓兄s減光互連故障時(shí)優(yōu)先縮減跨交換機(jī)副本 failureHandling: shrinkCrossSwitchReplicasFirst: true這個(gè)文件的關(guān)鍵在于三點(diǎn)限制跨交換機(jī)流量比例避免光鏈路成為熱點(diǎn)。過(guò)濾健康狀態(tài)差的節(jié)點(diǎn)減少訓(xùn)練中途的鏈路故障。故障時(shí)優(yōu)先縮減跨交換機(jī)副本保留機(jī)柜內(nèi)的高帶寬低延遲鏈路。在實(shí)際生產(chǎn)環(huán)境這類(lèi)配置通常要和集群管理平臺(tái)、任務(wù)編排系統(tǒng)聯(lián)動(dòng)。光互連只是提供了更寬的管道真正讓管道高效運(yùn)轉(zhuǎn)的仍然是軟件層的調(diào)度、監(jiān)控和容錯(cuò)。11. 常見(jiàn)誤區(qū)與問(wèn)題排查誤區(qū)一光互連就等于“距離無(wú)限遠(yuǎn)”光模塊按傳輸距離分成 SR短距、DR/FR/LR中長(zhǎng)距等不同規(guī)格。數(shù)據(jù)中心內(nèi)部用的 SR 和 DR 模塊傳輸距離通常只有 100 米到 500 米超過(guò)距離同樣會(huì)出現(xiàn)信號(hào)衰減。不要因?yàn)榭吹健肮狻弊志鸵詾榭梢钥绯莻鬏?。誤區(qū)二光模塊耗電一定比銅纜低在短距離3 米以?xún)?nèi)、低速率的場(chǎng)景下銅纜仍然更省電。光模塊的功耗優(yōu)勢(shì)主要體現(xiàn)在 800G 及以上速率、幾十米距離的場(chǎng)景。光互連是“在特定范圍內(nèi)更優(yōu)”不是“全場(chǎng)景更優(yōu)”。誤區(qū)三光模塊故障就是模塊本身壞了實(shí)際運(yùn)維中光功率異常往往不是模塊損壞而是光纖端面污染、連接器松動(dòng)、彎曲半徑過(guò)小、跳線衰減過(guò)大。排查鏈路故障時(shí)先用光功率計(jì)測(cè)試再檢查光纖最后才考慮更換模塊。常見(jiàn)問(wèn)題排查表問(wèn)題現(xiàn)象可能原因排查方式解決方案鏈路頻繁 down光功率低于接收靈敏度查看 DDM 接收光功率閾值清潔光纖端面或更換跳線誤碼率上升激光器偏置電流異常檢查模塊溫度與偏置電流歷史改善散熱或更換模塊光模塊溫度過(guò)高機(jī)柜風(fēng)道設(shè)計(jì)不合理檢查氣流方向和相鄰模塊溫度調(diào)整風(fēng)扇策略或增加散熱訓(xùn)練 AllReduce 時(shí)間波動(dòng)大跨交換機(jī)鏈路擁塞查看網(wǎng)絡(luò)吞吐和光端口丟包統(tǒng)計(jì)調(diào)整拓?fù)涓兄{(diào)度降低跨交換機(jī)流量12. 對(duì)開(kāi)發(fā)者的實(shí)際建議光互連的趨勢(shì)很明確但這篇文章最后想說(shuō)的是不必急著追新硬件先把你知道的鏈路評(píng)估方法用起來(lái)。第一步看你的訓(xùn)練腳本里是否有網(wǎng)絡(luò)等待。用nvidia-smi查看 GPU 利用率如果利用率持續(xù)低于 90%并且多個(gè)進(jìn)程的通信階段占比很高網(wǎng)絡(luò)就是瓶頸。# 每隔 1 秒刷新一次 GPU 利用率和顯存使用 watch -n 1 nvidia-smi第二步看網(wǎng)絡(luò)是否存在重傳和丟包。光模塊和交換機(jī)端口都會(huì)上報(bào) CRC 錯(cuò)誤、丟包計(jì)數(shù)。如果發(fā)現(xiàn)端口錯(cuò)誤在持續(xù)增長(zhǎng)鏈路健康狀態(tài)已經(jīng)亮紅燈。第三步評(píng)估集群規(guī)模到底在什么速率下需要換光。用前面給的帶寬估算腳本帶入自己集群的 GPU 數(shù)量、模型大小、同步時(shí)間目標(biāo)算完之后再?zèng)Q定是繼續(xù)優(yōu)化拓?fù)溥€是升級(jí)光互連設(shè)備。13. 這輪融資真正值得關(guān)注的技術(shù)信號(hào)最后做一個(gè)技術(shù)信號(hào)層面的總結(jié)。Lumilens 拿到 700M 美元對(duì)這個(gè)行業(yè)的真正影響有兩個(gè)。第一資本開(kāi)始認(rèn)可硅光互連作為 AI 基礎(chǔ)設(shè)施的關(guān)鍵組件。過(guò)去硅光更多被當(dāng)作“未來(lái)技術(shù)”在討論現(xiàn)在它已經(jīng)進(jìn)入“必須重資產(chǎn)投入、必須規(guī)?;慨a(chǎn)”的階段。數(shù)據(jù)中心光互連不再是一個(gè)配套產(chǎn)業(yè)而是決定集群規(guī)模上限的核心產(chǎn)業(yè)。第二光互連的競(jìng)爭(zhēng)從“光模塊廠商之間的競(jìng)爭(zhēng)”擴(kuò)展到“光模塊廠商、交換芯片廠商、GPU 廠商、云廠商共同參與的生態(tài)競(jìng)爭(zhēng)”。不同公司從不同角度切入同一個(gè)問(wèn)題如何在十萬(wàn)卡甚至百萬(wàn)卡集群里實(shí)現(xiàn)極低功耗、極高密度、極高可靠性的數(shù)據(jù)互聯(lián)。對(duì)于普通開(kāi)發(fā)者這輪融資的啟示是未來(lái)的大模型訓(xùn)練、推理集群網(wǎng)絡(luò)會(huì)越來(lái)越像“光網(wǎng)絡(luò)”而不是“電網(wǎng)絡(luò)”。這會(huì)導(dǎo)致崗位技能隨之變化——懂光模塊運(yùn)維、懂網(wǎng)絡(luò)拓?fù)?、懂帶寬成本模型的人?huì)比只懂單一環(huán)節(jié)的人更有競(jìng)爭(zhēng)優(yōu)勢(shì)。這就是接下來(lái)值得投入的方向。