
文章總結與翻譯一、主要內(nèi)容本文聚焦于利用大型語言模型(LLMs)自動化認知走查(CW)這一可用性測試方法,核心探索LLMs能否模擬人類在CW中的行為,以降低傳統(tǒng)測試的成本和資源消耗。研究設計雙角色LLM代理架構:設計了 facilitator(引導者)和 evaluator(評估者)兩個AI代理,分別模擬CW中的研究人員引導角色和用戶評估角色,通過迭代優(yōu)化的提示詞實現(xiàn)界面導航、思維外顯和流程推進。兩項對比研究:研究1:對比GPT-4、Gemini-2.5-pro與10名人類評估者在兩款移動應用(語言學習類、旅行預訂類)上的CW表現(xiàn),從任務完成率、導航路徑一致性、潛在失敗點識別三個維度展開分析。研究2:探索通過額外提示詞優(yōu)化LLM對人類潛在失敗點的預測能力,對比“有上下文”(LLM完整走查流程)和“無上下文”(僅單屏獨立評估)兩種模式的效果。核心發(fā)現(xiàn)LLM與人類的行為差異:LLM的任務完成率更高(GPT-4達100%,Gemini-2.5-pro達97.2%,人類為88.2%),導航路徑更接近最優(yōu)路徑,步驟更少;人類評估者在不確定下一步時更傾向于廣度優(yōu)先搜索(探索性行為),且易受記憶誤差影響;LLM則更理性,優(yōu)先選擇最可能的