
文章主要內(nèi)容總結(jié)本文針對(duì)自然語(yǔ)言處理中自動(dòng)文本評(píng)估的挑戰(zhàn),尤其是多語(yǔ)言場(chǎng)景下基于大語(yǔ)言模型(LLM)的評(píng)估方法存在的依賴(lài)專(zhuān)有模型、需大量微調(diào)數(shù)據(jù)等問(wèn)題,提出了一種基于檢查表工程的LLM評(píng)估框架(CE-Judge)。該框架無(wú)需訓(xùn)練,基于開(kāi)源模型,支持點(diǎn)式(單個(gè)響應(yīng)評(píng)分)和成對(duì)(兩個(gè)響應(yīng)中選優(yōu))兩種評(píng)估模式,適用于多語(yǔ)言場(chǎng)景。CE-Judge的核心流程分為三階段:概念生成:從指令(或源文本)和響應(yīng)中提取抽象概念,作為評(píng)估的基礎(chǔ)骨架;檢查表生成:通過(guò)雙向生成(響應(yīng)到指令、指令到響應(yīng))構(gòu)建動(dòng)態(tài)檢查表,增強(qiáng)評(píng)估覆蓋度和描述性;判斷:結(jié)合原始指令/響應(yīng)和檢查表,由LLM生成評(píng)估結(jié)果,支持點(diǎn)式和成對(duì)評(píng)估。實(shí)驗(yàn)在多語(yǔ)言推理、對(duì)話(huà)和文學(xué)翻譯數(shù)據(jù)集上驗(yàn)證了CE-Judge的性能,結(jié)果顯示其優(yōu)于開(kāi)源基線模型,且與GPT-4o等專(zhuān)有模型性能相當(dāng)。創(chuàng)新點(diǎn)無(wú)需訓(xùn)練且基于開(kāi)源模型:擺脫了對(duì)專(zhuān)有模型或大量微調(diào)數(shù)據(jù)的依賴(lài),降低了成本和時(shí)間開(kāi)銷(xiāo);支持多語(yǔ)言與雙評(píng)估模式:首次將檢查表方法擴(kuò)展到多語(yǔ)言場(chǎng)景,同時(shí)支持點(diǎn)式和成對(duì)評(píng)估;動(dòng)態(tài)雙向檢查表:通過(guò)“響應(yīng)到指令”和“指令到響應(yīng)”雙向生成檢查表,提升評(píng)估覆蓋度和描述性,避免預(yù)定義標(biāo)準(zhǔn)的局限性;精細(xì)成對(duì)評(píng)估