視頻會(huì)議:從工具到智能辦公中臺(tái)的架構(gòu)與實(shí)踐)
1. 從“開會(huì)工具”到“辦公中臺(tái)”這個(gè)轉(zhuǎn)變到底在轉(zhuǎn)什么視頻會(huì)議這個(gè)品類過去十年基本被定義為“開會(huì)的工具”。你約一個(gè)會(huì)議發(fā)一個(gè)鏈接大家點(diǎn)進(jìn)來開完會(huì)關(guān)掉完事。產(chǎn)品經(jīng)理們比拼的是誰的通話更穩(wěn)、誰的美顏更自然、誰共享屏幕不卡。但最近兩年我觀察到一批團(tuán)隊(duì)在重新思考這件事會(huì)議本身不是目的會(huì)議只是辦公流程中的一個(gè)節(jié)點(diǎn)。真正有價(jià)值的東西是會(huì)議前后那些散落的信息、決策和任務(wù)。這個(gè)判斷背后有一個(gè)很樸素的觀察一場(chǎng)一小時(shí)的會(huì)真正產(chǎn)生有效決策的時(shí)間可能只有十分鐘剩下的五十分鐘在同步背景、對(duì)齊認(rèn)知、確認(rèn)細(xì)節(jié)。而會(huì)議結(jié)束后這些信息又以錄音、聊天記錄、共享文檔的形式散落在不同地方?jīng)]有人真正去整理。等到下次開會(huì)又要重新同步一遍。這個(gè)循環(huán)消耗了大量組織效率。所以“AI重構(gòu)視頻會(huì)議產(chǎn)品體驗(yàn)”這件事核心不是給會(huì)議加一個(gè)AI字幕或者AI紀(jì)要而是把會(huì)議從一個(gè)孤立的工具變成一個(gè)智能辦公中臺(tái)的入口。什么叫中臺(tái)就是它不再是終點(diǎn)而是起點(diǎn)。會(huì)議中產(chǎn)生的討論、決策、待辦能夠自動(dòng)流轉(zhuǎn)到項(xiàng)目管理、文檔協(xié)作、任務(wù)分配等下游環(huán)節(jié)。AI在這里扮演的角色不是錦上添花的功能而是打通整個(gè)鏈路的粘合劑。我見過不少團(tuán)隊(duì)做AI會(huì)議功能最常見的做法是接一個(gè)語音轉(zhuǎn)文字API生成一份會(huì)議紀(jì)要然后讓用戶自己去復(fù)制粘貼。這個(gè)做法的問題在于它只解決了“記錄”的問題沒有解決“流轉(zhuǎn)”的問題。紀(jì)要生成了然后呢誰來看誰來跟進(jìn)任務(wù)怎么分配截止時(shí)間怎么定這些才是真正影響辦公效率的關(guān)鍵節(jié)點(diǎn)。從技術(shù)架構(gòu)上看這個(gè)轉(zhuǎn)變意味著產(chǎn)品需要從“實(shí)時(shí)音視頻處理”為核心轉(zhuǎn)向“實(shí)時(shí)音視頻AI理解工作流引擎”的三層架構(gòu)。實(shí)時(shí)音視頻層負(fù)責(zé)采集和傳輸AI理解層負(fù)責(zé)把非結(jié)構(gòu)化的語音和文本轉(zhuǎn)化為結(jié)構(gòu)化的信息工作流引擎負(fù)責(zé)把這些信息路由到正確的人和系統(tǒng)。這三層缺一不可而且每一層的技術(shù)選型和工程實(shí)現(xiàn)都有不少坑。我個(gè)人的判斷是未來兩年內(nèi)單純的視頻會(huì)議產(chǎn)品會(huì)越來越難獨(dú)立生存因?yàn)樗峁┑膬r(jià)值太單薄了。而能夠把會(huì)議能力嵌入到辦公流程中的產(chǎn)品會(huì)逐漸吃掉這個(gè)市場(chǎng)。這不是功能層面的競(jìng)爭(zhēng)而是產(chǎn)品定位層面的競(jìng)爭(zhēng)。誰先完成從“工具”到“中臺(tái)”的認(rèn)知轉(zhuǎn)變誰就能在下一輪競(jìng)爭(zhēng)中占據(jù)有利位置。2. 會(huì)議場(chǎng)景下AI能力的真實(shí)邊界在哪里2.1 語音轉(zhuǎn)寫的準(zhǔn)確率陷阱幾乎所有做AI會(huì)議產(chǎn)品的團(tuán)隊(duì)第一個(gè)要面對(duì)的就是語音轉(zhuǎn)寫。很多團(tuán)隊(duì)覺得這個(gè)事情很簡(jiǎn)單接一個(gè)成熟的ASR服務(wù)就行了。但實(shí)際跑下來會(huì)發(fā)現(xiàn)通用ASR在會(huì)議場(chǎng)景下的準(zhǔn)確率遠(yuǎn)低于預(yù)期。原因有幾個(gè)會(huì)議場(chǎng)景存在大量專業(yè)術(shù)語和內(nèi)部縮寫通用模型沒有這些詞匯多人交替發(fā)言時(shí)說話人分離的準(zhǔn)確率會(huì)顯著下降遠(yuǎn)場(chǎng)拾音帶來的混響和噪聲會(huì)進(jìn)一步降低識(shí)別質(zhì)量。我實(shí)測(cè)過幾個(gè)主流ASR服務(wù)在真實(shí)會(huì)議錄音上的表現(xiàn)在安靜環(huán)境、單人發(fā)言的情況下字準(zhǔn)確率可以到95%以上。但一旦切換到多人討論、有交叉發(fā)言的場(chǎng)景字準(zhǔn)確率會(huì)掉到80%左右而說話人歸屬的準(zhǔn)確率可能只有70%。這意味著生成的紀(jì)要里有相當(dāng)一部分內(nèi)容是張冠李戴的。解決這個(gè)問題的思路不是去追求一個(gè)完美的ASR模型而是在工程層面做補(bǔ)償。常見的做法包括在會(huì)前讓用戶上傳參會(huì)人名單和議題關(guān)鍵詞用這些信息去熱更新ASR的詞匯表在會(huì)中通過聲紋識(shí)別輔助說話人分離在會(huì)后用大模型對(duì)轉(zhuǎn)寫結(jié)果做一次語義校正把明顯不合邏輯的句子修正過來。這些補(bǔ)償手段疊加起來可以把最終紀(jì)要的可用性提升到一個(gè)可接受的水平。注意不要向用戶承諾“100%準(zhǔn)確”的轉(zhuǎn)寫。會(huì)議場(chǎng)景的復(fù)雜性決定了這不可能做到。更務(wù)實(shí)的做法是提供一個(gè)“置信度”指標(biāo)讓用戶知道哪些段落可能需要人工復(fù)核。2.2 會(huì)議紀(jì)要生成從“摘要”到“結(jié)構(gòu)化輸出”轉(zhuǎn)寫只是第一步真正體現(xiàn)AI價(jià)值的是從轉(zhuǎn)寫文本中提取結(jié)構(gòu)化信息。很多產(chǎn)品做的“AI紀(jì)要”其實(shí)就是把轉(zhuǎn)寫文本丟給大模型讓它生成一段摘要。這個(gè)做法的問題在于摘要丟失了大量細(xì)節(jié)而且沒有結(jié)構(gòu)用戶看完之后還是不知道要做什么。我在實(shí)際項(xiàng)目中總結(jié)出一個(gè)更有效的做法把會(huì)議紀(jì)要拆成幾個(gè)固定的模塊讓AI分別填充。這些模塊包括議題回顧這次會(huì)議討論了哪幾個(gè)話題、關(guān)鍵決策達(dá)成了哪些共識(shí)、待辦事項(xiàng)誰在什么時(shí)間之前要完成什么、遺留問題哪些話題沒有結(jié)論需要下次繼續(xù)。每個(gè)模塊的prompt設(shè)計(jì)都不一樣需要針對(duì)性地調(diào)優(yōu)。以“待辦事項(xiàng)”為例prompt里需要明確要求AI識(shí)別出“動(dòng)作主體”、“動(dòng)作內(nèi)容”、“時(shí)間約束”三個(gè)要素。如果原文中沒有明確的時(shí)間約束AI應(yīng)該標(biāo)注“未指定”而不是自己編一個(gè)。這個(gè)細(xì)節(jié)很重要因?yàn)榫幵斓臅r(shí)間約束會(huì)導(dǎo)致后續(xù)任務(wù)管理出現(xiàn)混亂。2.3 實(shí)時(shí)輔助AI在會(huì)議進(jìn)行中能做什么除了會(huì)后的紀(jì)要生成AI在會(huì)議進(jìn)行中也有不少可做的事情。我見過比較實(shí)用的功能包括實(shí)時(shí)字幕幫助聽力障礙人士或非母語參會(huì)者、發(fā)言計(jì)時(shí)提醒超時(shí)發(fā)言、話題偏離提醒當(dāng)討論偏離議程時(shí)給出提示、實(shí)時(shí)投票快速收集意見。但這些功能有一個(gè)共同的挑戰(zhàn)延遲。會(huì)議是實(shí)時(shí)進(jìn)行的如果AI的響應(yīng)延遲超過兩三秒用戶體驗(yàn)就會(huì)很差。實(shí)時(shí)字幕的延遲需要控制在500毫秒以內(nèi)話題偏離提醒可以稍微寬松一些但也不能超過五秒。這對(duì)系統(tǒng)的推理性能提出了很高的要求。我目前的經(jīng)驗(yàn)是實(shí)時(shí)字幕可以用流式ASR來解決邊轉(zhuǎn)邊出延遲可以做到比較低。但話題偏離檢測(cè)需要理解上下文必須等一段話說完才能判斷所以延遲天然會(huì)高一些。一個(gè)折中的方案是用輕量級(jí)模型做實(shí)時(shí)檢測(cè)只判斷當(dāng)前發(fā)言和議程關(guān)鍵詞的匹配度不做深度語義理解。這樣可以把延遲壓下來代價(jià)是準(zhǔn)確率會(huì)打一些折扣。3. 把會(huì)議變成中臺(tái)入口工作流打通的具體做法3.1 會(huì)議與任務(wù)系統(tǒng)的對(duì)接邏輯會(huì)議中產(chǎn)生的待辦事項(xiàng)如果不能自動(dòng)流轉(zhuǎn)到任務(wù)系統(tǒng)那AI紀(jì)要的價(jià)值就少了一半。我見過很多團(tuán)隊(duì)的做法是在紀(jì)要頁面提供一個(gè)“導(dǎo)出到任務(wù)系統(tǒng)”的按鈕用戶手動(dòng)點(diǎn)擊后把待辦事項(xiàng)同步過去。這個(gè)做法雖然能用但多了一步操作實(shí)際使用率并不高。更好的做法是自動(dòng)同步。會(huì)議結(jié)束后AI提取的待辦事項(xiàng)自動(dòng)在任務(wù)系統(tǒng)中創(chuàng)建對(duì)應(yīng)的任務(wù)卡片并分配給相應(yīng)的負(fù)責(zé)人。負(fù)責(zé)人會(huì)收到通知任務(wù)卡片里包含會(huì)議上下文鏈接點(diǎn)擊可以跳回會(huì)議紀(jì)要查看詳情。這個(gè)鏈路的打通需要產(chǎn)品在任務(wù)系統(tǒng)和會(huì)議系統(tǒng)之間建立一套映射關(guān)系會(huì)議中的參會(huì)人對(duì)應(yīng)任務(wù)系統(tǒng)中的用戶會(huì)議中的議題對(duì)應(yīng)任務(wù)系統(tǒng)中的項(xiàng)目或標(biāo)簽。這里有一個(gè)工程上的細(xì)節(jié)需要注意去重。如果同一場(chǎng)會(huì)議被多次處理比如用戶手動(dòng)觸發(fā)了一次重新生成紀(jì)要待辦事項(xiàng)可能會(huì)被重復(fù)創(chuàng)建。解決方案是在任務(wù)卡片上記錄來源會(huì)議ID和來源時(shí)間戳創(chuàng)建前先做一次查詢?nèi)绻呀?jīng)存在則更新而不是新建。3.2 會(huì)議知識(shí)的沉淀與檢索會(huì)議中討論的內(nèi)容其實(shí)是非常寶貴的組織知識(shí)。但傳統(tǒng)模式下這些知識(shí)隨著會(huì)議結(jié)束就消失了下次有人問起同樣的問題又要重新開會(huì)討論。把會(huì)議內(nèi)容沉淀為可檢索的知識(shí)庫是智能辦公中臺(tái)的一個(gè)重要能力。具體做法是把每次會(huì)議的轉(zhuǎn)寫文本、紀(jì)要、決策記錄都存入一個(gè)向量數(shù)據(jù)庫同時(shí)保留結(jié)構(gòu)化的元數(shù)據(jù)參會(huì)人、時(shí)間、議題標(biāo)簽。當(dāng)用戶搜索某個(gè)關(guān)鍵詞時(shí)系統(tǒng)不僅返回相關(guān)的會(huì)議片段還能顯示這個(gè)議題在歷次會(huì)議中的討論脈絡(luò)。這個(gè)能力對(duì)于新員工入職、項(xiàng)目復(fù)盤、決策追溯等場(chǎng)景非常有價(jià)值。我實(shí)測(cè)下來向量檢索的效果很大程度上取決于切分策略。如果按固定長(zhǎng)度切分很容易把一個(gè)完整的決策拆成兩半檢索出來的是殘缺信息。更好的做法是按語義段落切分同時(shí)保留前后各一段的上下文。另外元數(shù)據(jù)的過濾也很重要比如用戶只想搜索某個(gè)項(xiàng)目相關(guān)的會(huì)議就需要在檢索時(shí)加上項(xiàng)目標(biāo)簽的過濾條件。3.3 跨會(huì)議的話題追蹤單次會(huì)議的信息提取相對(duì)容易難的是跨會(huì)議的話題追蹤。比如一個(gè)產(chǎn)品需求第一次會(huì)議討論了方案第二次會(huì)議評(píng)審了設(shè)計(jì)第三次會(huì)議確認(rèn)了排期。這三次會(huì)議分散在不同的時(shí)間點(diǎn)但邏輯上是連貫的。如果AI能夠自動(dòng)識(shí)別出這些會(huì)議之間的關(guān)聯(lián)把同一個(gè)話題的討論串聯(lián)起來就能形成一個(gè)完整的決策鏈路。實(shí)現(xiàn)這個(gè)功能的技術(shù)路徑是對(duì)每次會(huì)議的議題進(jìn)行向量化然后在歷史會(huì)議中檢索相似議題。如果相似度超過閾值就建立關(guān)聯(lián)。同時(shí)用大模型對(duì)關(guān)聯(lián)的會(huì)議片段做一次摘要生成一個(gè)“話題演進(jìn)”的視圖。這個(gè)視圖可以展示某個(gè)話題從提出到?jīng)Q策的完整過程對(duì)于項(xiàng)目管理和知識(shí)傳承都很有幫助。不過這個(gè)功能有一個(gè)前提議題的識(shí)別要準(zhǔn)確。如果AI把不相關(guān)的議題錯(cuò)誤地關(guān)聯(lián)在一起反而會(huì)造成困擾。我的經(jīng)驗(yàn)是閾值不要設(shè)得太低寧可漏掉一些關(guān)聯(lián)也不要產(chǎn)生錯(cuò)誤的關(guān)聯(lián)。另外可以提供一個(gè)手動(dòng)關(guān)聯(lián)的入口讓用戶自己來修正AI的判斷。4. 工程落地中的性能與成本平衡4.1 大模型推理的成本控制AI會(huì)議產(chǎn)品的成本大頭在推理。一場(chǎng)一小時(shí)的會(huì)議轉(zhuǎn)寫文本大概在一萬字左右如果用大模型做紀(jì)要生成和待辦提取一次推理的token消耗量不小。如果每天有幾百場(chǎng)會(huì)議成本會(huì)非??捎^??刂瞥杀镜乃悸酚袔讉€(gè)。第一是分級(jí)處理不是所有會(huì)議都需要用大模型做深度分析。內(nèi)部站會(huì)、閑聊性質(zhì)的會(huì)議可以用輕量級(jí)模型或者規(guī)則引擎處理。只有正式的決策會(huì)議、評(píng)審會(huì)議才值得用大模型。第二是緩存復(fù)用同一場(chǎng)會(huì)議如果被多次處理結(jié)果應(yīng)該緩存起來避免重復(fù)推理。第三是prompt優(yōu)化精簡(jiǎn)prompt去掉不必要的示例和說明可以顯著減少token消耗。我實(shí)測(cè)過一個(gè)優(yōu)化案例把紀(jì)要生成的prompt從800token壓縮到300token同時(shí)保持輸出質(zhì)量基本不變單次推理成本下降了約40%。這個(gè)優(yōu)化的關(guān)鍵是找到prompt中真正影響輸出的部分把那些“錦上添花”的說明去掉。4.2 實(shí)時(shí)處理的延遲優(yōu)化實(shí)時(shí)字幕和實(shí)時(shí)輔助功能對(duì)延遲非常敏感。如果用戶說話后兩秒才看到字幕體驗(yàn)會(huì)非常割裂。優(yōu)化延遲的手段包括使用流式ASR邊說話邊出字在客戶端做VAD語音活動(dòng)檢測(cè)只把有效語音片段上傳到服務(wù)端使用邊緣節(jié)點(diǎn)做推理減少網(wǎng)絡(luò)傳輸時(shí)間。但這里有一個(gè)權(quán)衡流式ASR的準(zhǔn)確率通常低于整段ASR因?yàn)槟P蜎]有看到完整的上下文。我的做法是實(shí)時(shí)字幕用流式ASR保證低延遲會(huì)議結(jié)束后再用整段ASR重新轉(zhuǎn)寫一遍用高質(zhì)量的結(jié)果替換實(shí)時(shí)字幕。這樣用戶在會(huì)中看到的是低延遲但可能有些誤差的字幕會(huì)后看到的是高準(zhǔn)確率的紀(jì)要。4.3 多模態(tài)信息的融合處理會(huì)議場(chǎng)景中除了語音還有共享屏幕的內(nèi)容、聊天區(qū)的文字、參會(huì)人的視頻畫面。這些多模態(tài)信息如果能夠融合處理可以產(chǎn)生更豐富的洞察。比如當(dāng)有人在共享屏幕上展示一份數(shù)據(jù)報(bào)表時(shí)AI可以自動(dòng)識(shí)別報(bào)表中的關(guān)鍵數(shù)字并和語音中提到的數(shù)字做交叉驗(yàn)證。但多模態(tài)融合的技術(shù)復(fù)雜度很高而且對(duì)算力的要求也更高。我目前的建議是優(yōu)先做好語音和文本的處理多模態(tài)能力可以作為進(jìn)階功能逐步引入。如果要做可以從最簡(jiǎn)單的場(chǎng)景開始比如只識(shí)別共享屏幕中的文字和語音轉(zhuǎn)寫做關(guān)鍵詞匹配暫時(shí)不做深度的語義融合。5. 產(chǎn)品設(shè)計(jì)中的幾個(gè)關(guān)鍵決策點(diǎn)5.1 用戶隱私與數(shù)據(jù)安全的邊界會(huì)議內(nèi)容往往涉及商業(yè)機(jī)密用戶對(duì)數(shù)據(jù)安全的敏感度很高。在做AI會(huì)議產(chǎn)品時(shí)必須明確數(shù)據(jù)的存儲(chǔ)位置、使用范圍和保留期限。我見過一些產(chǎn)品因?yàn)樵谶@方面處理不當(dāng)導(dǎo)致用戶信任度大幅下降。一個(gè)務(wù)實(shí)的做法是提供分級(jí)的數(shù)據(jù)策略用戶可以選擇“不留存”會(huì)議結(jié)束后立即刪除所有數(shù)據(jù)、“僅本地”數(shù)據(jù)只存在用戶設(shè)備上不上傳云端、“云端留存”數(shù)據(jù)存在云端用于后續(xù)檢索和分析。不同的策略對(duì)應(yīng)不同的功能集用戶根據(jù)自己的需求選擇。同時(shí)在AI處理環(huán)節(jié)要確保數(shù)據(jù)不被用于模型訓(xùn)練這一點(diǎn)需要在隱私政策中明確說明。5.2 人機(jī)協(xié)作的交互設(shè)計(jì)AI生成的紀(jì)要和待辦不應(yīng)該直接生效而應(yīng)該經(jīng)過人工確認(rèn)。這個(gè)確認(rèn)環(huán)節(jié)的設(shè)計(jì)很關(guān)鍵如果確認(rèn)流程太重用戶會(huì)覺得麻煩干脆不用如果太輕又容易漏掉AI的錯(cuò)誤。我的經(jīng)驗(yàn)是把確認(rèn)環(huán)節(jié)設(shè)計(jì)成“默認(rèn)采納一鍵修正”的模式。AI生成的結(jié)果默認(rèn)是采納狀態(tài)用戶如果發(fā)現(xiàn)錯(cuò)誤可以點(diǎn)擊修正。修正的操作要盡量簡(jiǎn)單比如直接在下拉菜單里換一個(gè)負(fù)責(zé)人或者拖動(dòng)時(shí)間選擇器改一下截止日期。同時(shí)提供一個(gè)“全部確認(rèn)”的按鈕讓用戶可以在快速瀏覽后一次性確認(rèn)所有內(nèi)容。5.3 與現(xiàn)有辦公工具的集成策略智能辦公中臺(tái)不可能孤立存在它需要和現(xiàn)有的辦公工具集成。但集成哪些工具、集成到什么程度是一個(gè)需要仔細(xì)考慮的問題。我的建議是優(yōu)先集成那些用戶使用頻率最高的工具比如即時(shí)通訊、日歷、任務(wù)管理。集成的深度上先做單向同步會(huì)議待辦同步到任務(wù)系統(tǒng)再做雙向同步任務(wù)系統(tǒng)的狀態(tài)更新回寫到會(huì)議紀(jì)要。集成的技術(shù)實(shí)現(xiàn)上優(yōu)先使用標(biāo)準(zhǔn)協(xié)議如CalDAV、WebDAV和開放API避免為每個(gè)工具單獨(dú)開發(fā)適配層。如果必須做定制適配也要把適配邏輯封裝成獨(dú)立的模塊方便后續(xù)維護(hù)和擴(kuò)展。6. 我踩過的幾個(gè)坑和對(duì)應(yīng)的解法6.1 說話人分離在交叉發(fā)言時(shí)的崩潰前面提到過說話人分離的問題這里展開說一下我踩過的具體坑。在一個(gè)多人圓桌討論的場(chǎng)景中兩個(gè)人同時(shí)說話的情況很常見。通用的聲紋分離模型在這種情況下會(huì)頻繁切換說話人標(biāo)簽導(dǎo)致紀(jì)要里出現(xiàn)大量“某人說……”但實(shí)際上這句話是另一個(gè)人說的。我試過的解法是在聲紋分離的基礎(chǔ)上加入一個(gè)“發(fā)言連續(xù)性”的后處理邏輯。如果兩個(gè)說話人標(biāo)簽在短時(shí)間內(nèi)頻繁交替就判定為交叉發(fā)言把這段時(shí)間的文本合并標(biāo)注為“多人討論”。雖然損失了一些精度但避免了錯(cuò)誤歸屬帶來的誤導(dǎo)。另外在會(huì)前讓參會(huì)人依次說一句話做聲紋注冊(cè)可以顯著提升分離準(zhǔn)確率。6.2 大模型幻覺在紀(jì)要生成中的表現(xiàn)大模型在生成紀(jì)要時(shí)有時(shí)會(huì)“腦補(bǔ)”一些原文中沒有的內(nèi)容。比如原文只是說“這個(gè)方案需要再討論”AI可能會(huì)生成“會(huì)議決定推遲該方案下次會(huì)議繼續(xù)討論”。后者看起來更完整但實(shí)際上是AI自己加的。解決這個(gè)問題的方法是在prompt中明確要求“只使用原文中出現(xiàn)的信息不要添加任何推斷”。同時(shí)在輸出格式上要求AI對(duì)每一條紀(jì)要標(biāo)注來源句的序號(hào)方便人工核對(duì)。如果某條紀(jì)要找不到對(duì)應(yīng)的來源句就應(yīng)該被標(biāo)記為“待確認(rèn)”。6.3 實(shí)時(shí)字幕的斷句問題實(shí)時(shí)字幕的斷句是一個(gè)容易被忽視但很影響體驗(yàn)的細(xì)節(jié)。如果斷句斷得不好用戶讀起來會(huì)很費(fèi)勁。比如“我們今天討論一下這個(gè)方案的可行性”被斷成“我們今天討論一下這/個(gè)方案的可行性”閱讀體驗(yàn)就很差。我的解法是在流式ASR的輸出上疊加一個(gè)輕量級(jí)的斷句模型根據(jù)語義和標(biāo)點(diǎn)來調(diào)整斷句位置。同時(shí)在客戶端做一個(gè)小優(yōu)化如果當(dāng)前識(shí)別的文本以“的”、“了”、“嗎”等虛詞結(jié)尾就暫不顯示等下一個(gè)詞出來再一起顯示。這個(gè)優(yōu)化雖然簡(jiǎn)單但對(duì)閱讀體驗(yàn)的提升很明顯。6.4 待辦事項(xiàng)的負(fù)責(zé)人識(shí)別錯(cuò)誤從會(huì)議對(duì)話中識(shí)別待辦事項(xiàng)的負(fù)責(zé)人是一個(gè)比想象中更難的問題。中文表達(dá)中負(fù)責(zé)人經(jīng)常是省略的。比如“這個(gè)事情下周搞定”沒有說誰搞定。AI需要根據(jù)上下文推斷可能是上一個(gè)發(fā)言的人也可能是某個(gè)被點(diǎn)名的人。我的做法是在prompt中要求AI在無法確定負(fù)責(zé)人時(shí)標(biāo)注為“待分配”而不是猜測(cè)一個(gè)。同時(shí)在界面上提供一個(gè)快速分配的功能讓用戶可以在確認(rèn)環(huán)節(jié)手動(dòng)指定負(fù)責(zé)人。這個(gè)“待分配”的狀態(tài)反而成了一個(gè)提醒促使用戶去明確責(zé)任歸屬。7. 對(duì)想入局這個(gè)方向的團(tuán)隊(duì)的一些建議如果你正在考慮做AI會(huì)議或者智能辦公中臺(tái)方向的產(chǎn)品我有幾個(gè)基于實(shí)際經(jīng)驗(yàn)的想法。第一不要試圖做一個(gè)大而全的產(chǎn)品從一個(gè)具體的場(chǎng)景切入比如“銷售團(tuán)隊(duì)的客戶會(huì)議紀(jì)要”或者“研發(fā)團(tuán)隊(duì)的技術(shù)評(píng)審記錄”把這一個(gè)場(chǎng)景做深做透比泛泛地做通用會(huì)議紀(jì)要更有價(jià)值。第二AI能力是手段不是目的用戶不會(huì)因?yàn)槟阌蠥I就買單用戶買單是因?yàn)槟憬鉀Q了他的問題。所以產(chǎn)品設(shè)計(jì)的出發(fā)點(diǎn)應(yīng)該是“用戶在會(huì)議場(chǎng)景中遇到了什么問題”而不是“我們有什么AI能力可以用”。第三數(shù)據(jù)閉環(huán)很重要。AI模型的效果依賴于數(shù)據(jù)而會(huì)議場(chǎng)景的數(shù)據(jù)又特別敏感。如何在保護(hù)用戶隱私的前提下建立起有效的數(shù)據(jù)反饋閉環(huán)是一個(gè)需要提前思考的問題。我的建議是通過用戶的修正行為來收集反饋比如用戶修改了AI生成的待辦負(fù)責(zé)人這個(gè)修正信號(hào)就可以用來優(yōu)化模型。這種方式不需要直接獲取用戶的原始數(shù)據(jù)也能達(dá)到優(yōu)化的目的。第四要有耐心。AI會(huì)議產(chǎn)品的成熟度曲線比想象中要長(zhǎng)。語音轉(zhuǎn)寫的準(zhǔn)確率、說話人分離的精度、大模型的理解能力這些都需要時(shí)間打磨。不要指望一上線就完美而是要在真實(shí)使用中持續(xù)迭代。我見過一些團(tuán)隊(duì)因?yàn)槌跗谛Ч焕硐刖头艞壛撕芸上?。?shí)際上只要方向是對(duì)的每一次迭代都會(huì)帶來可感知的提升。最后說一個(gè)我自己的體會(huì)這個(gè)方向最吸引人的地方不是技術(shù)本身有多難而是它真的能改變?nèi)藗兊墓ぷ鞣绞?。?dāng)我看到用戶因?yàn)锳I紀(jì)要而省下了整理會(huì)議記錄的時(shí)間因?yàn)榇k自動(dòng)同步而不再遺漏任務(wù)因?yàn)闀?huì)議知識(shí)庫而快速找到了半年前的決策依據(jù)我就覺得這個(gè)事情值得做。技術(shù)最終是要服務(wù)于人的而會(huì)議這個(gè)場(chǎng)景恰恰是技術(shù)和人的交匯點(diǎn)。