隨著生成式人工智慧(AI)快速普及,網路上的假訊息與輿論操弄手法也變得更加隱蔽。英國研究團隊最新發現,許多爭議性貼文下的留言存在刻意離題、邏輯跳躍及人身攻擊等特徵,並進一步開發出利用AI偵測異常對話模式的方法,這項研究為網路資訊治理提供了新的方向。
英國卡迪夫大學(Cardiff University)語言學講師羅伯茨(Seán Roberts)與謝菲爾德大學(University of Sheffield)語言、藝術與社會學院研究助理克雷科紐克(Kateryna Krykoniuk)近日發表共同論文,探討AI如何讓假訊息更難識別,以及如何識別的方法。
作者發現,網路的爭議訊息中,有36%的留言存在刻意轉移話題的伎倆,65%存在邏輯跳躍(即「不合邏輯的推論」)的現象,還有20%會出現人身攻擊的語言。此外,這類爭議資訊的留言,也不願意提及與主題相關的評論,或者表達同理心。
研究團隊進一步測試,AI是否能自動辨識這類異常的討論模式,也就是利用AI來「偵測」AI操弄的痕跡。
首先,研究人員把每一則真實的網路留言放入資料庫,透過大型語言模型生成數個合理且符合脈絡的回應。例如,在一則談論英國外交大臣的貼文下,以AI產生「這個國家目前的局勢一定令人震驚」或「事情已經嚴重到這種程度了嗎?」等符合討論主題的回覆內容。
接著,系統會將網友實際留下的評論,與人工智慧預測的合理回應進行比較。如果某則留言與這些預期回覆存在明顯差距,就可能代表有人刻意將討論帶往其他方向。換句話說,這套系統並不是透過搜尋特定關鍵字來判斷內容是否可疑,而是觀察對話過程中,是否出現不尋常的轉折。
研究團隊的核心概念在於衡量「話語偏離程度」(discourse divergence),也就是「真人回應」與「AI預測的正常回應」之間的距離。當距離越大,代表該留言偏離原始討論脈絡的可能性越高。研究人員認為,這種偏離現象,可能成為辨識虛假資訊或輿論操弄的重要線索。
研究團隊利用人工標註的資料集進行測試。在第二項實驗中,這套系統辨識離題留言的準確率約達77%。雖然距離完美仍有一段差距,但考量到人類對話本身充滿複雜性與多樣性,且任何偵測系統都很難做到百分之百準確。值得注意的是,這種方法的表現約為傳統情緒分析模型的兩倍,且其判斷結果已接近不同人類研究人員之間的一致性水準。
研究人員表示,這套方法之所以有效,是因為大型語言模型能夠學習人們在特定情境下常見的回應模式。當有人突然改變討論方向,或刻意將話題導向其他議題時,系統便能察覺這種異常變化,進而發現過去技術難以辨識的操弄行為。
不過,研究團隊也強調,離題並不等於惡意操作或散播假訊息。現實中的對話本來就會自然延伸,人們經常因為聯想到其他議題而改變話題方向,這些情況未必具有任何不當意圖。
因此,這項技術較適合作為一種「預警工具」,而非直接取代人類判斷。它可以協助社群平台管理員或研究人員快速找出值得關注的討論串,但最終是否涉及資訊操弄,仍應由受過訓練的專家進一步評估。
此外,相關技術也面臨倫理與公平性的挑戰。人工智慧模型可能承襲訓練資料中的偏見,而它理解對話的方式與人類仍存在差異。如何讓人工智慧更準確地掌握人類溝通的語境與意圖,依然是未來研究的重要課題。
隨著生成式人工智慧快速發展,AI產製的內容越來越難與真人創作區分,辨識假訊息的方法也必須跟著進化。未來的重點不再只是搜尋特定關鍵字,而是理解對話如何展開、如何被操控,以及何時有人正試圖在不知不覺間改變討論方向,進而影響公眾認知與輿論走向。


loading...
