化學(xué)習(xí)中避免支配機(jī)制如何抑制共謀行為)
1. 項(xiàng)目概述當(dāng)“避免支配”成為智能體的行為準(zhǔn)則最近在跟進(jìn)多智能體強(qiáng)化學(xué)習(xí)領(lǐng)域的一些前沿進(jìn)展一個(gè)非常有意思的論文標(biāo)題引起了我的注意“Domination-Avoiding Learning Agents Cannot Collude”。這個(gè)標(biāo)題直譯過來是“避免支配的學(xué)習(xí)智能體無法共謀”。初看之下它像是一個(gè)技術(shù)性的結(jié)論但深究其背后它觸及了多智能體系統(tǒng)設(shè)計(jì)中一個(gè)根本性的矛盾我們?nèi)绾卧O(shè)計(jì)既高效合作又不會(huì)形成“小團(tuán)體”損害整體利益的智能體這不僅是算法問題更關(guān)乎經(jīng)濟(jì)學(xué)、社會(huì)學(xué)和倫理學(xué)的交叉。簡單來說這個(gè)研究探討的是在多智能體環(huán)境中如果我們給智能體植入一種“避免被其他智能體支配”的內(nèi)在動(dòng)機(jī)那么它們之間就很難甚至無法形成穩(wěn)定的、損害系統(tǒng)整體效用的“共謀”聯(lián)盟。這里的“共謀”不是法律意義上的而是指智能體通過某種形式的隱性合作或策略協(xié)調(diào)犧牲全局利益來最大化小團(tuán)體的局部利益。這種現(xiàn)象在經(jīng)濟(jì)學(xué)中被稱為“串謀”在分布式系統(tǒng)中可能導(dǎo)致資源分配不公、系統(tǒng)效率低下甚至引發(fā)災(zāi)難性的“贏家通吃”局面。這個(gè)標(biāo)題背后的核心領(lǐng)域是多智能體強(qiáng)化學(xué)習(xí)但其潛在需求和應(yīng)用場景卻廣泛得多。從分布式計(jì)算資源調(diào)度、金融市場算法交易監(jiān)控到大型在線平臺(tái)如電商、社交網(wǎng)絡(luò)的推薦算法治理再到自動(dòng)駕駛車隊(duì)的協(xié)同決策我們都需要確保系統(tǒng)中的自動(dòng)化智能體是“良民”它們可以競爭也可以合作但不能“拉幫結(jié)派”搞破壞。因此理解“Domination-Avoiding”如何作為一種內(nèi)在機(jī)制來防止共謀對(duì)于構(gòu)建更安全、更公平、更魯棒的大規(guī)模智能系統(tǒng)至關(guān)重要。2. 核心概念拆解支配、共謀與學(xué)習(xí)智能體要徹底理解這個(gè)命題我們需要先厘清三個(gè)核心概念什么是“支配”什么是“共謀”以及這里的“學(xué)習(xí)智能體”特指什么。2.1 “支配”在博弈論與多智能體系統(tǒng)中的精確定義在多智能體系統(tǒng)中“支配”是一個(gè)嚴(yán)格的博弈論概念。它描述的是一種策略關(guān)系。假設(shè)我們有兩個(gè)智能體A和B以及它們各自可選的策略集合。如果智能體A存在一個(gè)策略使得無論智能體B選擇什么策略A獲得的收益或回報(bào)都嚴(yán)格優(yōu)于B那么我們就說A的策略“支配”了B的某個(gè)或所有策略。更常見的是“嚴(yán)格支配”策略S1嚴(yán)格支配策略S2當(dāng)且僅當(dāng)對(duì)于其他所有智能體的任何可能策略組合選擇S1的收益總是高于選擇S2。注意這里的“支配”是策略層面的而非結(jié)果層面的。它不意味著A最終獲得的絕對(duì)分?jǐn)?shù)一定比B高而是說A通過選擇優(yōu)勢策略總能讓自己處于相對(duì)更有利的位置。智能體“避免被支配”其核心是避免自己陷入一個(gè)“無論怎么努力都吃虧”的策略選擇中。在實(shí)際的強(qiáng)化學(xué)習(xí)環(huán)境中智能體通過試錯(cuò)學(xué)習(xí)。一個(gè)“避免支配”的智能體其學(xué)習(xí)目標(biāo)不僅僅是最大化自己的累積獎(jiǎng)勵(lì)還會(huì)包含一個(gè)內(nèi)在的“風(fēng)險(xiǎn)項(xiàng)”即最小化自己被其他智能體的任何策略所嚴(yán)格支配的概率。這相當(dāng)于在它的效用函數(shù)中除了“利己”還加入了一層“自保”的考量。2.2 “共謀”的機(jī)制與表現(xiàn)形式在多智能體環(huán)境中“共謀”指的是兩個(gè)或更多智能體通過協(xié)調(diào)彼此的策略來獲取比它們獨(dú)立、非協(xié)作行動(dòng)時(shí)更高的回報(bào)而這種回報(bào)的提升往往以犧牲系統(tǒng)中其他智能體或整體效用為代價(jià)。它有幾個(gè)關(guān)鍵特征隱性協(xié)調(diào)共謀通常不需要顯式的通信協(xié)議。智能體可以通過觀察彼此的行動(dòng)、共享的環(huán)境狀態(tài)甚至是通過學(xué)習(xí)算法本身如相同的策略網(wǎng)絡(luò)參數(shù)更新方式來達(dá)成默契。穩(wěn)定性共謀策略需要是一個(gè)均衡狀態(tài)即沒有單個(gè)智能體愿意單方面偏離這個(gè)協(xié)作策略否則就會(huì)遭受損失。這類似于博弈論中的“納什均衡”。排他性共謀聯(lián)盟的利益是內(nèi)聚的其收益增長可能來源于剝削聯(lián)盟外的智能體或者侵占本應(yīng)屬于全局的公共資源。一個(gè)經(jīng)典例子是在公共資源博弈中兩個(gè)智能體可以默契地約定過度開采資源短期內(nèi)各自獲得高收益但導(dǎo)致資源快速枯竭損害了所有其他智能體以及它們自己的長期利益。另一個(gè)例子是在交易市場中多個(gè)算法交易員可能形成價(jià)格同盟。2.3 “學(xué)習(xí)智能體”的設(shè)定策略空間與學(xué)習(xí)算法標(biāo)題中的“Learning Agents”通常指基于強(qiáng)化學(xué)習(xí)框架的智能體特別是那些在部分可觀測、非穩(wěn)態(tài)環(huán)境中進(jìn)行策略優(yōu)化的智能體。它們的特點(diǎn)是策略是習(xí)得的智能體的行為策略從狀態(tài)到動(dòng)作的映射不是預(yù)先編程的而是通過與環(huán)境及其他智能體互動(dòng)不斷調(diào)整參數(shù)如神經(jīng)網(wǎng)絡(luò)權(quán)重來優(yōu)化的。目標(biāo)驅(qū)動(dòng)優(yōu)化目標(biāo)是最大化某個(gè)長期回報(bào)的期望值。環(huán)境是動(dòng)態(tài)的其他智能體也在學(xué)習(xí)因此環(huán)境是非平穩(wěn)的這增加了達(dá)成和維持共謀的復(fù)雜性但也可能因?yàn)閷W(xué)習(xí)動(dòng)態(tài)而產(chǎn)生意外的協(xié)作。在這個(gè)框架下“Domination-Avoiding”成為學(xué)習(xí)目標(biāo)函數(shù)中的一個(gè)附加項(xiàng)或約束條件。智能體不僅想贏還不想讓自己陷入絕對(duì)劣勢的境地。3. 為什么“避免支配”能天然抑制“共謀”這是整個(gè)命題最核心的邏輯鏈條。直觀上似乎有些矛盾避免被支配是一種防御性的、自利的行為而共謀是一種進(jìn)攻性的、協(xié)作 albeit harmful的行為。兩者如何關(guān)聯(lián)關(guān)鍵在于共謀聯(lián)盟的內(nèi)在脆弱性。3.1 共謀聯(lián)盟的穩(wěn)定性依賴于“可置信的威脅”假設(shè)智能體A和B形成了一個(gè)共謀聯(lián)盟。這個(gè)聯(lián)盟要穩(wěn)定必須滿足一個(gè)條件任何一方背叛聯(lián)盟即單方面采取對(duì)己更有利但損害盟友的策略都會(huì)立即招致嚴(yán)厲的懲罰使得背叛的長期收益低于遵守盟約的收益。在重復(fù)博弈中這種懲罰通常表現(xiàn)為盟友隨后的報(bào)復(fù)性策略。然而在一個(gè)智能體具有“避免支配”動(dòng)機(jī)的世界里這種懲罰機(jī)制變得難以建立。因?yàn)閳?zhí)行懲罰例如當(dāng)盟友背叛后切換到一種攻擊性策略去降低背叛者的收益本身可能并不是懲罰執(zhí)行者的最優(yōu)策略。更重要的是懲罰策略需要有能力“支配”背叛者的后續(xù)策略選擇才能構(gòu)成有效威脅。3.2 “避免支配”動(dòng)機(jī)如何瓦解共謀基礎(chǔ)讓我們一步步推演共謀提議階段智能體A向B提議一個(gè)共謀策略。這個(gè)策略要求雙方都放棄一些短期機(jī)會(huì)以換取聯(lián)盟的長期超額利益。B的考量B會(huì)評(píng)估這個(gè)提議。如果接受B將依賴于A在未來也遵守約定。但B知道A也是一個(gè)“避免支配”的學(xué)習(xí)者。這意味著A絕不會(huì)讓自己陷入一個(gè)被B的某種策略所支配的境地。懲罰機(jī)制失效設(shè)想B在考慮如果A未來背叛B將如何懲罰AB需要找到一個(gè)懲罰策略P。但策略P要有效必須能對(duì)A造成足夠傷害。然而如果A是“避免支配”的它在其學(xué)習(xí)過程中就已經(jīng)預(yù)判并規(guī)避了被類似P這樣的策略嚴(yán)重支配的風(fēng)險(xiǎn)。A可能已經(jīng)學(xué)會(huì)了當(dāng)探測到B有采取P類策略的苗頭時(shí)就提前切換到一種不受P支配的“安全策略”上。信任無法建立由于B無法構(gòu)建一個(gè)對(duì)A而言“可置信”的懲罰威脅因?yàn)锳會(huì)主動(dòng)避免陷入可能被此類懲罰支配的局勢B就無法相信A會(huì)長期遵守共謀協(xié)議。反之亦然。因此基于“以牙還牙”或“觸發(fā)策略”的傳統(tǒng)共謀穩(wěn)定機(jī)制在“避免支配”的智能體之間就失效了。聯(lián)盟自然瓦解預(yù)見到聯(lián)盟的不穩(wěn)定理性且避免支配的智能體從一開始就不會(huì)深度投入這種脆弱的共謀關(guān)系中。它們會(huì)更傾向于選擇那些即使在其他智能體偏離時(shí)自己也不會(huì)遭受毀滅性損失的“穩(wěn)健策略”。而這些穩(wěn)健策略往往更接近對(duì)社會(huì)整體更優(yōu)的均衡點(diǎn)如競爭均衡或某種形式的合作均衡。實(shí)操心得這類似于在商業(yè)競爭中如果每個(gè)公司都將“避免被競爭對(duì)手用某種商業(yè)手段徹底擊垮”作為核心戰(zhàn)略之一那么它們之間形成價(jià)格壟斷聯(lián)盟的意愿就會(huì)大大降低因?yàn)槁?lián)盟中的任何一方都害怕自己先遵守價(jià)格協(xié)議而盟友卻偷偷降價(jià)搶占市場背叛自己卻因?yàn)閼?zhàn)略上放棄了“價(jià)格靈活性”這一防御手段而無法有效反擊。4. 技術(shù)實(shí)現(xiàn)路徑如何將“避免支配”編碼到學(xué)習(xí)算法中理論很美妙但如何在實(shí)際的強(qiáng)化學(xué)習(xí)算法中實(shí)現(xiàn)“Domination-Avoiding”呢這并不是簡單地在獎(jiǎng)勵(lì)函數(shù)里加個(gè)負(fù)項(xiàng)。目前主流的研究思路大致可以分為三類4.1 基于策略空間正則化的方法這種方法直接在智能體的策略優(yōu)化目標(biāo)中增加一個(gè)正則化項(xiàng)該項(xiàng)懲罰策略被其他智能體策略支配的“風(fēng)險(xiǎn)”。核心思想在更新策略參數(shù)θ時(shí)不僅最大化期望回報(bào)J(θ)同時(shí)最小化一個(gè)支配風(fēng)險(xiǎn)度量R(θ)。目標(biāo)函數(shù)L(θ) J(θ) - λ * R(θ)其中λ是權(quán)衡系數(shù)。風(fēng)險(xiǎn)度量R(θ)的設(shè)計(jì)這是難點(diǎn)。一種近似方法是讓智能體維護(hù)一個(gè)對(duì)其他智能體策略的估計(jì)模型。在每次學(xué)習(xí)更新時(shí)智能體不僅考慮當(dāng)前環(huán)境下自己策略的回報(bào)還虛擬地假設(shè)其他智能體采取了其策略空間中可能“克制”自己的策略然后計(jì)算在這些虛擬對(duì)抗策略下自身回報(bào)的下降程度。下降越嚴(yán)重說明當(dāng)前策略越脆弱風(fēng)險(xiǎn)R(θ)越高。算法示例可以對(duì)近端策略優(yōu)化這類算法進(jìn)行修改在計(jì)算策略梯度時(shí)融入對(duì)策略脆弱性的評(píng)估。智能體需要同時(shí)學(xué)習(xí)一個(gè)“風(fēng)險(xiǎn)批評(píng)器”用于評(píng)估當(dāng)前策略被支配的可能性。4.2 基于均衡選擇與元博弈的方法這種方法從更高層面思考問題。它將多智能體學(xué)習(xí)過程視為一個(gè)“元博弈”其中每個(gè)智能體選擇的是一個(gè)學(xué)習(xí)算法或?qū)W習(xí)目標(biāo)如是否包含避免支配項(xiàng)。核心思想在元博弈層面證明當(dāng)所有智能體都選擇“避免支配”的學(xué)習(xí)目標(biāo)時(shí)它們最終收斂到的策略組合均衡具有“無共謀”的性質(zhì)。實(shí)現(xiàn)方式通常需要結(jié)合博弈論中的解概念如“風(fēng)險(xiǎn)占優(yōu)均衡”、“進(jìn)化穩(wěn)定策略”等。智能體的學(xué)習(xí)不再僅僅是優(yōu)化策略而是在一個(gè)策略種群中進(jìn)行進(jìn)化或復(fù)制動(dòng)態(tài)那些容易被支配的策略會(huì)在種群中頻率降低。優(yōu)勢這種方法能從理論上保證系統(tǒng)的整體屬性而不僅僅是單個(gè)智能體的行為。它更適用于分析大規(guī)模智能體群體的宏觀現(xiàn)象。4.3 基于對(duì)手建模與安全策略集的方法這是一種更偏向工程實(shí)踐的方法。智能體顯式地學(xué)習(xí)對(duì)其他智能體行為的預(yù)測模型對(duì)手建模并利用這個(gè)模型來劃定自己的“安全策略集”。步驟對(duì)手建模智能體i使用觀測數(shù)據(jù)訓(xùn)練一個(gè)模型M_{-i}用于預(yù)測其他智能體的聯(lián)合策略。安全集識(shí)別基于模型M_{-i}智能體i計(jì)算自己的哪些策略π_i在面對(duì)預(yù)測的對(duì)手策略時(shí)不會(huì)被嚴(yán)重支配。這可能需要定義一個(gè)容忍閾值δ如果存在某個(gè)對(duì)手策略使得i的回報(bào)低于其最大可能回報(bào)超過δ則認(rèn)為當(dāng)前π_i有風(fēng)險(xiǎn)。約束優(yōu)化智能體i在安全策略集內(nèi)進(jìn)行約束化的強(qiáng)化學(xué)習(xí)最大化自己的回報(bào)。即max J(π_i), s.t. π_i ∈ SafeSet。工具選型對(duì)手建模可以使用循環(huán)神經(jīng)網(wǎng)絡(luò)、圖神經(jīng)網(wǎng)絡(luò)等。安全集的判定可能涉及魯棒優(yōu)化或?qū)剐杂?xùn)練的技術(shù)。注意事項(xiàng)這類方法的一個(gè)挑戰(zhàn)是“自我實(shí)現(xiàn)的預(yù)言”。如果所有智能體都過于保守只從安全集中選策略可能導(dǎo)致整個(gè)系統(tǒng)陷入一個(gè)低效的均衡。因此安全集的閾值δ需要謹(jǐn)慎調(diào)整在安全性和性能之間取得平衡。5. 實(shí)驗(yàn)驗(yàn)證與場景模擬如何觀測“無法共謀”在研究中要驗(yàn)證“Domination-Avoiding Learning Agents Cannot Collude”這一論斷需要設(shè)計(jì)精妙的實(shí)驗(yàn)環(huán)境。這些環(huán)境通常具備以下特征存在明顯的共謀誘惑同時(shí)又能清晰度量支配關(guān)系和共謀行為。5.1 經(jīng)典測試床迭代囚徒困境與公共資源博弈迭代囚徒困境這是研究合作與背叛的經(jīng)典模型。兩個(gè)智能體重復(fù)進(jìn)行囚徒困境博弈。共謀在這里表現(xiàn)為持續(xù)的“合作-合作”結(jié)果。然而如果智能體害怕被“永遠(yuǎn)背叛”的策略所支配它們可能更早地采取“以牙還牙”而非“無條件合作”這使得“永遠(yuǎn)合作”的共謀變得不穩(wěn)定。實(shí)驗(yàn)可以比較標(biāo)準(zhǔn)強(qiáng)化學(xué)習(xí)智能體如基于PPO和加入了避免支配機(jī)制的智能體在長期互動(dòng)中達(dá)成“雙雙合作”穩(wěn)定狀態(tài)的頻率和持久性。公共資源博弈多個(gè)智能體共享一個(gè)可再生資源池。每個(gè)智能體決定每輪抽取多少資源。過度抽取共謀的一種形式大家默契地多抽會(huì)導(dǎo)致資源池迅速枯竭所有智能體長期受損。避免支配的智能體會(huì)警惕其他智能體可能采取的“瘋狂抽取”策略因此自己也會(huì)傾向于保留一定的抽取余量以應(yīng)對(duì)這客觀上防止了資源枯竭。可以測量資源池的存續(xù)時(shí)間、智能體間抽取量的方差等指標(biāo)。5.2 更復(fù)雜的場景拍賣市場與交通網(wǎng)絡(luò)密封競價(jià)拍賣多個(gè)智能體作為競拍者。共謀表現(xiàn)為競拍者之間默契地壓低出價(jià)競價(jià)共謀。一個(gè)避免支配的競拍者會(huì)擔(dān)心如果其他競拍者突然違背默契出一個(gè)高價(jià)怎么辦為了不被這種“背叛”支配它可能更傾向于根據(jù)自己對(duì)物品的真實(shí)估值出價(jià)從而瓦解共謀。實(shí)驗(yàn)可以監(jiān)控最終成交價(jià)與真實(shí)價(jià)值的比例以及競拍者利潤的分布。多路口交通信號(hào)燈控制每個(gè)路口的智能體控制信號(hào)燈時(shí)序。共謀可能是相鄰路口形成“綠波帶”但犧牲了更遠(yuǎn)路口的通行效率。避免支配的智能體會(huì)考慮如果上游路口突然改變周期怎么辦為了不被堵死它需要保持自身策略的靈活性這可能導(dǎo)致全局更均衡的流量分配。評(píng)估指標(biāo)可以是全局平均通行時(shí)間、最擁堵路口的排隊(duì)長度等。實(shí)操過程記錄在模擬一個(gè)簡單的公共資源博弈時(shí)我們對(duì)比了標(biāo)準(zhǔn)DQN智能體和加入了安全策略集約束的DQN智能體。環(huán)境有4個(gè)智能體資源池每輪自然增長10單位每個(gè)智能體每輪可抽取0-5單位。標(biāo)準(zhǔn)DQN智能體在訓(xùn)練約5000輪后迅速學(xué)會(huì)了“抽4或5單位”的策略資源池在幾十輪內(nèi)枯竭隨后大家長期收益為0。而加入避免支配約束的智能體其安全集限制了在預(yù)測到其他智能體可能高抽取時(shí)自己的抽取量不得超過2單位。結(jié)果它們更快地收斂到一種“各抽2-3單位”的均衡資源池得以維持長期累積收益遠(yuǎn)超標(biāo)準(zhǔn)組。這直觀展示了避免支配如何防止了“過度開采”這種形式的共謀。6. 潛在影響與應(yīng)用場景分析這項(xiàng)研究的結(jié)論和其背后的技術(shù)對(duì)于構(gòu)建下一代可信賴的多智能體系統(tǒng)具有深遠(yuǎn)影響。6.1 正面影響促進(jìn)公平與系統(tǒng)魯棒性算法公平性在在線廣告拍賣、信貸評(píng)分等由算法決策的領(lǐng)域防止智能體代表不同利益方共謀可以確保競爭環(huán)境的公平防止市場扭曲保護(hù)消費(fèi)者和弱勢參與者的利益。系統(tǒng)魯棒性與安全性在分布式傳感器網(wǎng)絡(luò)、無人機(jī)集群或電網(wǎng)調(diào)度中智能體需要協(xié)作但絕不能形成排斥其他節(jié)點(diǎn)的“小團(tuán)體”。避免支配的機(jī)制可以增強(qiáng)系統(tǒng)在面對(duì)部分節(jié)點(diǎn)故障或被惡意控制時(shí)的整體生存能力。抑制惡性競爭避免支配不等于鼓勵(lì)惡性競爭。恰恰相反因?yàn)樗种屏恕摆A家通吃”式的剝削性共謀可能促使系統(tǒng)走向更健康、更可持續(xù)的競爭或合作狀態(tài)。6.2 挑戰(zhàn)與局限性計(jì)算復(fù)雜度評(píng)估策略是否被支配或在龐大的策略空間中尋找安全集計(jì)算成本非常高尤其是當(dāng)智能體數(shù)量多、策略空間連續(xù)時(shí)??赡軐?dǎo)致的過度保守智能體為了避免被支配可能變得過于保守拒絕所有有一定風(fēng)險(xiǎn)的協(xié)作機(jī)會(huì)從而導(dǎo)致系統(tǒng)效率低下陷入“安全但無用”的均衡。對(duì)“共謀”的定義敏感研究中的“共謀”是特定技術(shù)定義。在現(xiàn)實(shí)復(fù)雜場景中有益的合作和有害的共謀有時(shí)界限模糊。機(jī)制設(shè)計(jì)需要非常小心避免“誤傷”正常的協(xié)作行為。需要全局視角“避免支配”是一個(gè)局部目標(biāo)每個(gè)智能體只關(guān)心自己不被支配。但能否完全防止全局性的共謀理論上還需要更嚴(yán)格的證明??赡艽嬖谝恍?fù)雜的、非直接的共謀形式是局部避免支配機(jī)制無法察覺的。6.3 未來研究方向更高效的算法如何設(shè)計(jì)輕量級(jí)的、可擴(kuò)展的避免支配學(xué)習(xí)算法是落地應(yīng)用的關(guān)鍵。或許可以借鑒元學(xué)習(xí)讓智能體快速評(píng)估策略風(fēng)險(xiǎn)。分層與混合動(dòng)機(jī)能否設(shè)計(jì)智能體使其在低風(fēng)險(xiǎn)場景下積極合作在高風(fēng)險(xiǎn)可能被支配場景下啟動(dòng)自保機(jī)制這需要?jiǎng)討B(tài)調(diào)整的權(quán)衡系數(shù)λ。與機(jī)制設(shè)計(jì)的結(jié)合這是最有前景的方向。與其僅僅依賴智能體“自律”避免支配不如直接設(shè)計(jì)環(huán)境規(guī)則機(jī)制使得共謀在機(jī)制下無利可圖或無法形成。將“避免支配”的智能體置于精心設(shè)計(jì)的機(jī)制中可能產(chǎn)生“雙保險(xiǎn)”的效果。探索更廣泛的“反共謀”屬性除了避免支配是否還有其他內(nèi)在的學(xué)習(xí)目標(biāo)或策略屬性也能天然地抑制共謀例如對(duì)策略“透明度”的要求或者對(duì)“收益分布公平性”的偏好等。我個(gè)人在跟蹤這類研究時(shí)的體會(huì)是它代表了一種思維范式的轉(zhuǎn)變從一味地追求智能體的“絕對(duì)性能”和“最優(yōu)解”轉(zhuǎn)向更多地關(guān)注智能體在復(fù)雜社會(huì)性環(huán)境中的“行為屬性”和“系統(tǒng)效應(yīng)”?!癉omination-Avoiding”不僅僅是一個(gè)技術(shù)技巧它更像為智能體注入了一種數(shù)字世界的“生存智慧”——在競爭與合作中首先要確保自己立于不敗之地。而這種底層的自保邏輯意外地為整個(gè)系統(tǒng)帶來了更高層面的秩序與公平。這提醒我們在設(shè)計(jì)任何具有自主性的多智能體系統(tǒng)時(shí)或許都應(yīng)該將這種“避免被絕對(duì)支配”的底線思維作為智能體行為準(zhǔn)則的一個(gè)基本模塊。