變局)
天貓請AI虛擬人段宴拍廣告這件事這兩天在內(nèi)容圈里討論度很高。真正有意思的不是“AI頂流”這個新包裝而是消息擴散后最先反應的群體居然是配音演員。一個廣告代言為什么先觸動的是聲音行業(yè)因為大眾對AI虛擬人的預期已經(jīng)變了不再關(guān)心它像不像真人而是關(guān)心它會不會直接替代某些工作。這個話題很容易被情緒帶偏。我更建議把整條產(chǎn)業(yè)鏈拆開看一遍虛擬人怎么被做出來、聲音從哪里來、配音演員在擔心什么、品牌方到底在賭什么。這篇就按這個順序?qū)懸矔盐以贏I內(nèi)容生產(chǎn)里遇到過的邊界問題一并放進來。1. 一場廣告代言為什么先急的是配音演員1.1 先看清這件事的結(jié)構(gòu)先把這個事件拆開看。它是一個典型的AI虛擬人商業(yè)落地案例平臺方是天貓代言對象是一個叫段宴的AI虛擬人落地場景是廣告拍攝。廣告行業(yè)用虛擬偶像早就不是新鮮事初音未來、虛擬主播、虛擬KOL都是前例。但這次能被討論起來有幾個不一樣的地方。第一這是主流電商平臺直接下場讓AI虛擬人承擔“頂流”角色。平臺想把它當作可以長期運營的商業(yè)資產(chǎn)而不是一次性的技術(shù)演示。第二大眾注意力集中在配音演員的焦慮上說明話題已經(jīng)從“技術(shù)能不能做”過渡到“做了之后誰受影響”。第三這個案例的鏈路足夠長角色形象、聲音、視頻、投放、商業(yè)變現(xiàn)每一環(huán)都有從業(yè)者會關(guān)心的問題。所以這篇不是在給“AI會不會取代配音演員”下結(jié)論。我更想說的是在這個事件里哪些是真實存在的變量哪些只是被情緒放大的想象。如果你只在熱搜上看熱鬧很容易得出“AI已經(jīng)全面搶工作”的結(jié)論如果你真的上手做過AI內(nèi)容生產(chǎn)就會知道中間還有大量工程細節(jié)需要處理。1.2 為什么率先被看到的是聲音而不是臉虛擬人的“臉”是數(shù)字生成的從一開始就不存在真人形象權(quán)問題。真人演員看到虛擬人更多是“多了一個競爭對手”而不是“我的臉被用了”。但聲音不一樣。虛擬人雖然沒有真實身體卻必須有一個聲音而好的AI合成音聽起來幾乎和真人沒有區(qū)別。對大眾來說看到一張CG臉不會立刻產(chǎn)生“我可能失業(yè)了”的感覺但聽到一段接近真人的AI配音會直接聯(lián)想到“這個工作我可能做不了”。這就是配音演員反應強烈的原因聲音的接近度把替代感變得非常具體。還有一個更現(xiàn)實的原因聲音的生產(chǎn)成本很低。一個成熟的AI聲音合成系統(tǒng)只需要一段授權(quán)錄音就能生成可用音色后續(xù)每生成一條語音的成本趨近于零。而廣告拍攝、3D渲染、視頻后期這些環(huán)節(jié)仍然有設備、渲染、人力等固定成本。內(nèi)容行業(yè)里最先被AI滲透的通常是“邊際成本最低”的環(huán)節(jié)配音正好具備這個特征。1.3 先別急著站隊問題比“取代”復雜我看到網(wǎng)上不少討論直接把這件事當成“AI開始搶工作”的信號。但如果你真的做過AI內(nèi)容生產(chǎn)就會知道“能生成聲音”和“能穩(wěn)定交付廣告級成片”之間隔著一大段工程距離。虛擬人廣告要落地至少要解決三件事角色形象能不能在多個鏡頭里保持一致語音情緒能不能匹配品牌調(diào)性以及整條片子的質(zhì)量能不能達到投放標準。這三件事每一項都需要人工參與和多次迭代。所以更準確的說法是AI并沒有直接“取代”誰而是把一個原本需要多人協(xié)作的流程壓縮成一個人加一套工具就能啟動的流程。省下來的不是“人”而是“溝通和等待的時間”。這個判斷后面幾個章節(jié)會展開講。2. 從“畫一張臉”到“拍一條成片”AI虛擬人廣告的生產(chǎn)鏈路2.1 角色設計最難的不是好看而是穩(wěn)定AI虛擬人的第一步是定形象?,F(xiàn)在用AI繪畫工具生成一張好看的臉并不難難的是讓這張臉在三十秒廣告的每一個鏡頭里都長得一樣。發(fā)型、臉型、衣服、光線、角度稍微一偏觀眾立刻會覺得“這不是同一個人”。我的建議是先做角色設定集。用一段描述詞生成正面、側(cè)面、半身、全身、不同光線下的參考圖選出最穩(wěn)定的幾張作為統(tǒng)一基準。之后每個鏡頭都圍繞同一基準來生成而不是每張圖單獨描述。生成時盡量固定隨機種子和模型版本否則同一句話在不同版本下會跑出完全不同的臉。如果你要做3D虛擬人還需要建模、綁定骨骼、驅(qū)動表情。這條路對設備要求高流程長但好處是動作可控適合廣告里需要固定走位和產(chǎn)品展示的場景。如果你只是做短視頻和營銷圖2D生成路線更輕先用低分辨率驗證分鏡確認導演意圖后再出高清圖能省掉大量無效渲染。2.2 聲音生成配音演員的焦慮點就在這里虛擬人定完形象接下來就是聲音。這也是配音演員最敏感的環(huán)節(jié)。目前的AI語音生成主要有兩條路線。一條是標準TTS也就是把文案輸入大模型選擇預設音色直接輸出語音。適合產(chǎn)品介紹、電商口播、短視頻旁白這類標準化內(nèi)容。調(diào)參重點包括語速、音調(diào)、停頓和情緒標記。不同模型情緒標記的寫法不一樣有的用標簽有的用標點控制落地前一定要先看模型的說明文檔。另一條是聲音克隆。這里必須強調(diào)克隆一個人的聲音前必須取得本人明確授權(quán)并且合同里要寫明使用范圍。合法合規(guī)的做法是讓配音演員錄制一批專用語料明確這筆錄音用于AI聲音模型的訓練再約定AI生成內(nèi)容的歸屬和收益。千萬不要在未經(jīng)授權(quán)的情況下使用網(wǎng)上扒下來的音頻做訓練數(shù)據(jù)這條線一旦突破項目再漂亮也會變成侵權(quán)事故。交付質(zhì)量上廣告級成片對音頻有硬性要求。采樣率建議不低于44.1kHz響度要符合投放平臺的統(tǒng)一標準。如果AI直接輸出的聲音忽大忽小合成前就要先做響度歸一化而不是推到后期去補救。這里最容易踩的坑是聽感上覺得“還行”但在手機外放和專業(yè)設備上一對比齒音、氣息、低頻完全不同所以驗收時一定要換至少兩種設備試聽。2.3 視頻合成從生成片段到控制分鏡形象和聲音都定了接下來是把它們合成到視頻里。大體上分兩條路線。一條是端到端的AI視頻生成輸入腳本和參考圖直接輸出動態(tài)片段。這類工具現(xiàn)在做“氛圍感鏡頭”很好用比如產(chǎn)品在光影中旋轉(zhuǎn)、人物背影走在街道上。但它的缺點是分鏡控制弱很難讓角色在指定時間做出指定動作廣告里需要精準展示產(chǎn)品的場景就不太適合。另一條是虛擬人驅(qū)動方案用真人演員的動作捕捉或者面部捕捉去驅(qū)動3D角色??煽匦詮娊巧梢哉f指定臺詞、做指定動作適合商業(yè)廣告。缺點是制作周期長、硬件要求高。實際項目里很多團隊是兩條路線混用大場景用AI視頻生成產(chǎn)品特寫和人物對話用驅(qū)動方案最后在剪輯軟件里統(tǒng)一合成。不要一上來就出4K全片。正確的流程是先做低分辨率草稿把所有分鏡的節(jié)奏、字幕、旁白、產(chǎn)品位置定下來確認導演和品牌方都滿意后再進入最終渲染。一條30秒的廣告分鏡往往有幾十個如果每個鏡頭都在4K下反復重渲靠一臺機器根本做不完必須按鏡頭編號分批渲染并保留每個鏡頭的版本記錄。2.4 本地部署和云工具怎么選工具選擇上要看項目對隱私和數(shù)據(jù)安全的要求。涉及未公開新品、品牌素材或者真實人物授權(quán)的語音數(shù)據(jù)建議優(yōu)先考慮本地部署方案數(shù)據(jù)不出內(nèi)網(wǎng)風險更可控。本地跑AI模型先看硬件條件。通常來說顯存8G左右可以跑中等規(guī)模的生成模型16G以上跑大模型會更從容要是顯存不夠就得靠模型量化、降低分辨率、分批任務來湊。這里給的是通用判斷具體要以你手里的模型和機器為準。部署前還要確認Python、CUDA、模型依賴庫的版本很多啟動失敗不是模型問題而是依賴版本沖突。如果只是做一次營銷活動或者團隊里沒有專門做部署的人云端工具更省心。按量付費、界面化操作適合快速出片。缺點是數(shù)據(jù)要經(jīng)過第三方授權(quán)鏈路和隱私條款要看仔細。另外不管本地還是云端都要保留生成過程的日志和參數(shù)記錄。以后一旦出現(xiàn)授權(quán)爭議這些記錄就是最直接的證據(jù)。3. 配音演員在擔心什么不是“聲音沒了”是定價體系被重排3.1 聲音使用權(quán)合同里最容易被忽略的部分配音演員的焦慮表面上是“AI會模仿我的聲音”本質(zhì)上是“聲音的使用規(guī)則沒有跟上技術(shù)”。傳統(tǒng)配音的合作方式很簡單一個項目簽一份合同約定時長、用途、費用。甲方用完即止演員的聲音只出現(xiàn)在合同規(guī)定的作品里。AI出現(xiàn)后情況變了。如果配音演員在不知情的情況下自己的聲音被用于訓練模型那這個模型可以無限次生成近似自己音色的內(nèi)容覆蓋到廣告、短劇、直播甚至不了解的領(lǐng)域。這不是“搶單”問題而是“人格聲音”的授權(quán)邊界問題。所以現(xiàn)在行業(yè)里比較一致的呼吁是來源授權(quán)必須前置。使用真人聲音做AI訓練必須單獨簽一份AI授權(quán)協(xié)議明確三點語料來源、訓練后的模型歸屬、生成內(nèi)容的使用范圍。范圍要寫具體不能只寫“用于AI相關(guān)項目”要落到平臺、地區(qū)、期限、是否可商用、是否可再授權(quán)。3.2 哪些配音工作最先被替代哪些反而更值錢講完風險再講一個更實際的問題配音行業(yè)內(nèi)部也會分化。標準化程度越高的內(nèi)容越容易被AI替代。電商短視頻口播、產(chǎn)品功能介紹、游戲NPC的固定臺詞、智能語音提示這些內(nèi)容重復度高、情緒跨度小AI語音已經(jīng)能穩(wěn)定覆蓋。在這些細分領(lǐng)域甲方的考量會越來越偏向“成本低、出片快”真人配音的份額可能被壓縮。但另一端反而會更值錢需要角色塑造的影視劇配音、需要即興反應的綜藝和直播、需要方言和年齡跨度表現(xiàn)的有聲書、需要臨場調(diào)整情緒的商業(yè)大片這些高度依賴人味和判斷力的工作AI暫時還接不住。我個人的判斷標準很簡單如果一個配音項目甲方能給出通稿文案要求“照著念就行”那它大概率會被AI分走一部分如果項目需要配音演員參與創(chuàng)作比如改臺詞、調(diào)情緒、設計角色性格那這個工作的價值反而上升。配音演員真正要守的不是“讀稿子”的環(huán)節(jié)而是“怎么讀、為什么這么讀”的創(chuàng)作環(huán)節(jié)。3.3 為什么AI配音聽著還行卻經(jīng)不起長時間考驗很多人在短視頻里聽AI配音覺得已經(jīng)跟真人差不多了。但廣告和影視里的配音跟短視頻旁白不是一個量級。短視頻旁白往往只有幾十秒情緒單一AI處理起來很輕松。但一條3分鐘的廣告、一集20分鐘的短劇、一部有聲書需要在長時間里保持穩(wěn)定的角色感、呼吸節(jié)奏和情緒遞進。AI語音在長時間任務里容易出現(xiàn)幾個問題語句之間的情緒斷層、重音位置不合理、句子一長就開始“念課文”。這些問題第一次聽不明顯多聽幾遍就露餡。遇到這種情況排查順序是先看文本斷句和標點再看情緒標簽參數(shù)然后換一個更合適的聲音模型最后檢查是不是采樣率和響度被二次壓縮導致失真。大部分“AI配音不自然”的問題不是模型能力不夠而是前期的文案標注和參數(shù)沒有按廣告級標準走。4. 品牌方和內(nèi)容團隊要用AI虛擬人先把這幾個問題處理好4.1 先判斷品牌適不適合虛擬人品牌方看到“AI頂流”案例第一反應可能是“這個風口我也要追”。但虛擬人不是萬能的先做一道篩選。如果你的品牌核心是“真實、親切、有煙火氣”比如生活服務、社區(qū)平臺、線下門店一個AI虛擬人可能反而帶來距離感。如果你的內(nèi)容更新頻率很高比如每天要出幾十條電商短視頻虛擬人的生產(chǎn)成本優(yōu)勢就會非常明顯。如果你的產(chǎn)品需要展示復雜細節(jié)虛擬人反而不如真人演示直觀。還有一個現(xiàn)實維度成本結(jié)構(gòu)。虛擬人初期要投入角色設計、聲音授權(quán)、模型部署和成片流程搭建這些不便宜。但如果內(nèi)容量大、更新頻次高固定資產(chǎn)攤薄后單條成本會低于持續(xù)雇人。算賬的時候別只看“能不能做”要看“做了多少條之后能回本”。如果連30條都做不滿那這個虛擬人大概率是虧的。4.2 合同和授權(quán)必須寫清楚的條目這是整個項目里最不能省的部分。AI虛擬人涉及至少三方品牌方、虛擬人IP運營方、聲音和形象素材的授權(quán)方。三方之間如果沒有清晰的合同條款一旦開始投放任何一方想調(diào)整使用范圍都會變成扯皮。授權(quán)事項建議寫清楚的內(nèi)容為什么必須寫形象授權(quán)虛擬人形象是否可以二次修改、是否可以跨平臺使用防止形象被改動后偏離品牌定位聲音授權(quán)用于AI訓練的語料來源、訓練后模型歸屬、生成內(nèi)容的使用范圍防止聲音被用到合同之外的項目使用期限授權(quán)期限、續(xù)約條件、到期后存量內(nèi)容如何處理防止合作結(jié)束后素材仍在持續(xù)使用區(qū)域和平臺投放國家或地區(qū)、媒體平臺列表防止跨區(qū)域跨平臺使用引發(fā)糾紛收益分配虛擬人商業(yè)收益的分成方式、結(jié)算周期防止合作關(guān)系因利益結(jié)構(gòu)不明而破裂責任承擔AI生成內(nèi)容侵權(quán)時由哪一方負責處理防止出事后互相推諉審計權(quán)是否允許授權(quán)方檢查使用日志和生成記錄防止超范圍使用這些條款看起來瑣碎但任何一個遺漏在項目跑起來后都可能變成成本。合同不是用來約束合作的是用來在合作出現(xiàn)分歧時快速確定邊界的。4.3 加一道人工審核不要讓AI直接發(fā)布無論AI生成的廣告素材多接近完美都建議在發(fā)布前保留一道人工審核。審核的重點不是“這個片子好不好看”而是三個問題內(nèi)容是否合規(guī)、產(chǎn)品信息是否準確、品牌口吻是否一致。AI生成內(nèi)容容易出現(xiàn)看似合理但實際錯誤的細節(jié)比如產(chǎn)品參數(shù)念錯、專有名詞張冠李戴、廣告語在特定語境下產(chǎn)生歧義。這些錯誤在生成階段很難發(fā)現(xiàn)只有人帶著品牌語境去審才能攔住。另外還要保留一條回滾機制。如果某條AI生成的廣告投放后出現(xiàn)負面反饋要能快速定位是哪一批參數(shù)、哪一次生成、哪一個環(huán)節(jié)出了問題而不是把整條片子重做。我見過不少團隊把“AI快速出片”做成了“AI快速出事故”根源就是沒有記錄生成過程出了事只能全部推翻重來。5. 回到事件本身AI虛擬人廣告不是終點而是分工重組5.1 產(chǎn)業(yè)鏈上的角色會怎么變AI虛擬人廣告這個事最值得關(guān)注的不是某一條廣告本身而是它代表的產(chǎn)業(yè)分工變化。過去品牌方請代言人買的是“人”的知名度和形象使用權(quán)。現(xiàn)在品牌方做一個虛擬IP買的是一套“資產(chǎn)”形象資產(chǎn)、聲音資產(chǎn)、內(nèi)容生產(chǎn)能力。這個區(qū)別很關(guān)鍵。真人代言人有自己的檔期、團隊和輿論風險虛擬IP作為一個長期數(shù)字資產(chǎn)可以被持續(xù)開發(fā)、分授權(quán)、跨場景使用。品牌方從“租人”變成“養(yǎng)資產(chǎn)”整個商業(yè)邏輯不一樣了。對內(nèi)容工作者來說這意味著工作方式也在變。以前一個廣告項目需要對接導演、攝影、演員、配音、剪輯、調(diào)色現(xiàn)在很多環(huán)節(jié)被壓縮成“AI生成 人工審核 導演把關(guān)”。AI Agent在中間扮演流程調(diào)度者的角色把腳本、配音、畫面、字幕、審核串聯(lián)起來。這不是崗位消失而是崗位形態(tài)變化原來負責單點執(zhí)行的人可能要變成會操作AI工具、能判斷輸出質(zhì)量、能處理授權(quán)問題的復合角色。5.2 給三類從業(yè)者的落地建議第一給配音演員。不必急著把AI當成敵人但要開始管理自己的聲音資產(chǎn)。錄制樣音時注意保留版權(quán)聲明簽合同時把AI訓練授權(quán)單獨拎